Bỏ qua để vào nội dung chính
Gọi thử Mistral Large 4 qua AI Gateway: chỉ đổi 1 dòng

Gọi thử Mistral Large 4 qua AI Gateway: chỉ đổi 1 dòng

Bởi Marcus Bennett
06 thg 10, 20267 phút đọc

Mistral Large 4 đã gọi được qua AI Gateway nhưng bản weights còn vài tuần nữa. Ba bước đo trên workload thật trước khi đưa model vào kế hoạch.

Bạn đang chạy một service gọi model đóng qua API, và tuần này sếp hỏi một câu khó chịu: nếu nhà cung cấp khoá quyền truy cập thì hệ thống còn chạy không? Câu trả lời thật là bạn chưa đo, vì chưa có model thay thế nào được benchmark trên chính workload của mình.

Mistral vừa phát hành Mistral Large 4 hôm thứ Ba, và bạn có thể gọi thử ngay hôm nay bằng cách đổi đúng một chuỗi model id. Bài này đi qua ba bước đo thực tế, kèm những chỗ dễ kết luận sai.

Có gì, và chưa có gì

Trước khi lên kế hoạch self-host, cần phân biệt rõ hai thứ: bản gọi được hôm nay và bản weights tải về được.

TechCrunch mô tả model này "nicknamed Le Chonk in reference to its 1 trillion parameters" và nói thẳng nó "is not an open-weight model yet". Theo TechCrunch, hiện tại "it can only be accessed via a public guardrail endpoint, but Mistral plans to make its weights available in just three weeks, after safety testing is complete".

WIRED mô tả cùng đợt phát hành theo hướng khác: model "can be used and customized by anyone" và "is currently available in preview, with a final version to follow by the end of the month".

Hai nguồn gặp nhau ở một điểm: bản cuối cùng, tải về được, tính bằng tuần chứ không phải bằng ngày. Nếu kế hoạch của bạn phụ thuộc vào việc giữ weights trong hạ tầng riêng — deploy air-gapped, workload có ràng buộc pháp lý, hay fine-tune — thì cuối tháng 10 là mốc sớm nhất đáng tin. Mọi thứ build trên bản preview phải build được lại.

Về hiệu năng, hiện chưa có gì để so. TechCrunch ghi "with benchmark results still pending", trong khi Mistral "hopes ML4 will be best in class among open-weight models, especially outside of China". WIRED dẫn phiên bản mạnh hơn của lời tuyên bố: Mistral trình bày model này "as by far the most capable open-weight model developed outside of China" và "very, very close" với một số model proprietary. Đây là tuyên bố của nhà sản xuất, chưa ai bên ngoài kiểm chứng.

Bước 1 — Đổi model id, không tạo tài khoản mới

Vercel đưa model lên AI Gateway cùng ngày phát hành. Theo changelog, bạn "can access the model through AI Gateway with one API key, without creating a separate Mistral account" — tức là không cần qua quy trình đăng ký và thanh toán riêng với Mistral chỉ để chạy một bài đo.

Model id là mistral/mistral-large-4. Vercel cho biết dùng được "with the AI SDK, OpenAI-compatible Chat Completions API, Responses API, or Anthropic Messages API", và cũng chọn được "in a coding agent connected to AI Gateway".

Đoạn code trong changelog của Vercel:

import { streamText } from 'ai';
const result = streamText({
  model: 'mistral/mistral-large-4',
  prompt: 'Fix the failing test and verify the change.',
});

Điểm đáng chú ý cho team đang chạy production: nếu service của bạn đã trỏ vào một endpoint OpenAI-compatible, đây là thay đổi ở chuỗi model, không phải một lần tích hợp mới. Không có SDK mới, không có schema response mới cần map lại.

Nếu hệ thống của bạn đã có sẵn một lớp gateway hoặc proxy nội bộ cho các lời gọi model, bài đo này chỉ tốn vài phút cấu hình, không tốn một sprint.

Bước 2 — Chọn workload nằm trong vùng model được tối ưu

Đây là chỗ dễ đo sai nhất: lấy prompt chat chung chung rồi kết luận model kém.

WIRED cho biết model được "optimized specifically for coding and cyberdefense, as well as tasks particular to manufacturing, finance, electrical engineering, and other niches". Đồng sáng lập kiêm chief scientist Guillaume Lample giải thích chiến lược: "There are a lot of areas where the other labs will not focus that much. There are so many domains in which you can improve models."

TechCrunch bổ sung chip design vào danh sách đó, và nối thẳng với cơ cấu cổ đông: các use case được tối ưu "include cybersecurity and finance, but also chip design, which is core to two of Mistral's main backers — Dutch giant ASML, which led its Series C, and Samsung, which led its Series D last month at a €21 billion valuation (about $24.39 billion)".

Nói cách khác, một model tối ưu quanh coding và cyberdefense không nhắm đánh bại model generalist trên bảng xếp hạng chat. Chấm nó bằng prompt chat là đo nhầm trục.

Bài đo đáng làm trong tuần này rất hẹp: lấy một task thật đang chạy — sinh patch cho test fail, triage log bảo mật, phân loại giao dịch — rồi chạy song song với model hiện tại. Giữ nguyên prompt, giữ nguyên bộ dữ liệu, chỉ đổi model id. Ghi lại tỉ lệ pass và độ trễ, không ghi cảm nhận.

Bước 3 — Đừng kết luận thay cho bản weights cuối

Kết quả bạn đo tuần này là của bản preview chạy sau guardrail endpoint, không phải của bản weights sẽ phát hành. Đó là hai build khác nhau.

Cách xử lý thực dụng: coi bài đo hiện tại là bộ lọc vòng một. Nếu model trượt ngay ở vòng này trên đúng workload mà nó được tối ưu, bạn tiết kiệm được thời gian đánh giá lại khi weights ra. Nếu nó qua, bạn đã có sẵn harness để chạy lại trong vài phút vào cuối tháng.

Giữ lại dataset, prompt và script chấm điểm trong repo. Phần đắt của việc đánh giá model không phải là lần chạy, mà là dựng lại bộ đo mỗi lần có model mới.

Khi nào open-weight thực sự đáng đổi

Lập luận thương mại của Mistral không nằm ở benchmark mà ở tính liên tục của nguồn cung.

WIRED ghi nhận "in June, the Trump administration placed temporary restrictions on the distribution of models from OpenAI and Anthropic, citing concerns they could be abused to launch sophisticated cyberattacks". Lample đóng khung vấn đề theo hướng không phụ thuộc địa lý: "what really matters is to own the model — even for US companies. If you use a closed model, there is no guarantee it will still be there tomorrow."

Về chi phí, WIRED nhận xét rằng chạy model open-weight "already considerably cheaper for businesses", vì chúng "cost only as much as the compute they consume". Lưu ý đây là phát biểu về cấu trúc chi phí, không phải một con số so sánh cụ thể — nguồn không đưa ra tỉ lệ nào.

Đánh giá tỉnh táo cho một team ở Việt Nam: lợi ích "sở hữu model" chỉ hiện thực hoá khi bạn thật sự có khả năng chạy nó. Một model 1 nghìn tỉ tham số không phải thứ chạy trên một con GPU thuê theo giờ. Nếu đường đi của bạn vẫn là gọi API của một bên thứ ba, thì bạn đang đổi nhà cung cấp chứ chưa đổi mô hình rủi ro.

Checklist trước khi đưa vào kế hoạch

  • Chốt mốc cuối tháng 10. Đó là nơi mốc ba tuần của TechCrunch và mốc cuối tháng của WIRED gặp nhau. Nếu trượt, lý do an toàn trở thành vấn đề cần hỏi lại.
  • Đọc kỹ điều khoản licence khi weights ra. VP Science Pierre Stock nói Mistral sẽ làm việc với đối tác và chính phủ để weights "can be used to defend, but not to [perform] malicious attacks" — cách diễn đạt đó hàm ý ràng buộc sử dụng.
  • Chờ benchmark của bên thứ ba. Mistral chưa công bố benchmark nào. Tuyên bố "best open-weight model outside China" chưa có ai ngoài công ty kiểm chứng.
  • Tính luôn chi phí hạ tầng nếu định self-host. TechCrunch dẫn lời Stock rằng model được train hoàn toàn trên compute của Mistral với "only 4,000 Nvidia GPUs". Đó là con số train, không phải con số inference, và cũng là con số do chính công ty đưa ra.

Không spam, hủy đăng ký bất kỳ lúc nào.

Bài viết liên quan