Bỏ qua để vào nội dung chính
4 công ty tự train model riêng: họ đánh đổi những gì

4 công ty tự train model riêng: họ đánh đổi những gì

Bởi Zoe Taylor
29 thg 9, 20264 phút đọc

Cursor, Intercom, Replit và Perplexity tự train model chuyên biệt trên dữ liệu production thật của họ. Ba điều kiện khiến hướng đi này hoàn vốn.

Bạn gọi API frontier cho mọi request trong sản phẩm, kể cả những task hẹp lặp lại hàng triệu lượt. Hoá đơn tăng theo volume, còn chất lượng thì không tăng thêm.

Bốn công ty tầng ứng dụng đã chọn hướng khác: tự train model chuyên biệt trên chính traffic production của mình. Không ai trong số họ cố xây model tổng quát để đấu với OpenAI.

Lưu ý nguồn: bản tổng hợp này do Overmind — một nền tảng train model — xuất bản, nên cách đóng khung có lợi cho họ. Các con số bên dưới đều dẫn từ công bố của chính các công ty hoặc báo chí, và tôi ghi rõ nguồn từng số.

Bốn ví dụ, và con số họ báo cáo

Cursor — Composer

Kiến trúc mixture-of-experts, train bằng online RL trên production agent traces, trong một harness mô phỏng đúng tool space thật của Cursor: sửa file, semantic search, lệnh terminal. Checkpoint mới lên production vài lần mỗi ngày. Theo báo cáo của Cursor, Composer sinh token nhanh gấp nhiều lần các model frontier tương đương, trong khi bám sát nhóm đầu trên benchmark coding nội bộ.

Intercom — Fin Apex 1.0

Post-train trên dữ liệu hội thoại hỗ trợ của chính công ty, quy mô hàng tỷ lượt tương tác. VentureBeat đưa tỷ lệ resolution trên benchmark của Apex là 73,1%, so với 71,1% của cả GPT-5.4 và Claude Opus 4.5. Theo số liệu Intercom tự công bố, một khách hàng doanh nghiệp lớn tăng resolution rate từ 68% lên 75% ngay sau khi chuyển sang Apex.

Replit — model sửa code 7B

Fine-tune từ DeepSeek-Coder-Instruct-v1.5, huấn luyện trên IDE telemetry, giới hạn trong khoảng 20 nhóm lỗi chẩn đoán. Replit cho biết checkpoint 7B này ngang hoặc vượt GPT-4 và Claude 3 trên các ca sửa lỗi thực tế trong đúng phạm vi đó.

Perplexity — Sonar

Fine-tune từ Llama 3.3 70B cho factual grounding, chất lượng trích dẫn và khả năng đọc, chạy trên phần cứng wafer-scale của Cerebras. Perplexity và Cerebras công bố throughput khoảng 1.200 token mỗi giây. Trong A/B test nội bộ của Perplexity, Sonar ngang hoặc vượt các model frontier lớn hơn về mức hài lòng người dùng trong ngữ cảnh search.

Ba điều kiện lặp lại ở cả bốn

Bài gốc rút ra ba điều kiện chung, và đây là phần đáng mang về team hơn cả các con số:

  • Task hẹp, không phải task tổng quát. Model nhỏ chuyên biệt giỏi một việc hẹp — đừng bắt nó thông minh toàn diện.
  • Dữ liệu production độc quyền. Không ai có trace của Cursor ngoài Cursor. Traffic production của bạn là tập dữ liệu duy nhất không ai mua được.
  • Đủ volume để chi phí mỗi token ảnh hưởng P&L. Fine-tune tốn tiền, chỉ hoàn vốn khi volume inference đủ lớn để phần tiết kiệm mỗi lượt cộng dồn lại.

Cách bài gốc diễn đạt vấn đề khá gọn: gọi model frontier cho mọi request đôi khi tương đương với việc vận hành một data center để nướng bánh mì.

Đọc lại trước khi áp dụng

Một chi tiết dễ bị bỏ qua: Intercom không bỏ model thuê ngoài. Apex nằm trên một pipeline gồm các thành phần retrieval và routing riêng, và công ty vẫn dùng model bên thứ ba ở chỗ khác. Fin ra mắt năm 2023 trên nền GPT-4, Fin 2 chuyển sang Claude cuối 2024, rồi mới tới Apex.

Nghĩa là mô hình đúng không phải "tự train thay cho API", mà là tách một task hẹp có volume cao ra khỏi phần còn lại. Nếu team bạn chưa đo được task nào chiếm phần lớn lượt gọi và chi phí, đó là việc cần làm trước — không phải chọn base model.

Không spam, hủy đăng ký bất kỳ lúc nào.

Bài viết liên quan