Bỏ qua để vào nội dung chính
Chia workload LLM hai tầng: benchmark Claude, deploy DeepSeek

Chia workload LLM hai tầng: benchmark Claude, deploy DeepSeek

Bởi Ethan Carter
26 thg 9, 20264 phút đọc

Polymarket định giá Anthropic 99% về chất lượng và DeepSeek 97% về lượng dùng. Cách chia workload hai tầng và ngưỡng để quyết định self-host.

Bạn chốt model cho production bằng bảng leaderboard, rồi cuối tháng ngồi giải trình hoá đơn token với sếp. Vấn đề thường không phải chọn sai model — mà là chỉ chọn một model cho mọi workload. Bài này chia workload thành hai tầng chi phí và đưa ra ngưỡng cụ thể để quyết định khi nào self-host.

Hai thị trường đang trả lời hai câu hỏi khác nhau

Theo bài phân tích của Max Quimby trên Dev.to, Polymarket đang định giá hai kết quả tưởng như mâu thuẫn: "Polymarket traders give Anthropic 99% odds of having the best AI model at the end of September 2026, backed by $1.3 million in liquidity", trong khi một market khác "gives DeepSeek 97% odds of holding the top spot on OpenRouter's weekly usage rankings".

Cùng nguồn, ở phía triển khai: tuần kết thúc 11/09, DeepSeek chiếm 34.9% tổng token volume trên OpenRouter. Cùng bài, thị phần token của các model gốc Mỹ trên OpenRouter rơi từ khoảng 70% (6/2025) xuống khoảng 30% (6/2026); riêng Anthropic giảm từ 29.1% xuống 13.3%.

Hai con số đó đo hai thứ khác nhau: cái bạn đánh giá là tốt nhất, và cái bạn thực sự chạy khi hoá đơn tới.

Con số làm CFO quyết định thay bạn

Cũng theo bài viết trên, Anthropic phát hành Opus 5.5 với giá $4/$20 mỗi triệu token (thấp hơn 20% so với trước), SWE-bench Pro đạt 89.9%, và prompt cache read giảm 60% còn $0.20/M. Ở đầu kia, tác giả ghi nhận DeepSeek V4-Flash có giá $0.14 mỗi triệu input token — theo ước tính của chính bài viết là "roughly 30x cheaper than Opus 5 and still 15x cheaper than the newly discounted Opus 5.5".

Bài viết cũng dẫn lại một thử nghiệm lan truyền trên Substack, trong đó tác giả bài đó chạy cùng một research agent task qua ba provider và báo cáo chi phí $0.32 (Claude Opus 5), $0.25 (Kimi K3) và $0.005 (DeepSeek V4-Flash). Đây là con số do tác giả nguồn tự đo, không phải benchmark độc lập — đọc nó như tín hiệu về độ lớn khoảng cách, đừng đưa thẳng vào slide dự toán.

Chia workload thành hai tầng trước khi chia ngân sách

Phân tích của chúng tôi: câu hỏi "model nào" nên được thay bằng "task nào thuộc tầng nào". Cách chia thực dụng:

TầngTask điển hìnhTiêu chí chọn
Chất lượngSinh code phải đúng lần đầu, agentic workflow nhiều bước, task chạm tiền/dữ liệu kháchSai một lần đắt hơn toàn bộ token đã tiêu
Khối lượngClassification, routing, tóm tắt, RAG retrieval, sub-task của agentChi phí mỗi triệu token là ràng buộc chính

Chưa gắn nhãn tầng cho từng endpoint gọi LLM thì bạn chưa có dữ liệu để tối ưu — chỉ đang đổi model và hy vọng.

Khi nào self-host mới thực sự rẻ

Bài phân tích lưu ý DeepSeek phát hành open weights giấy phép MIT, nên bạn có thể tự chạy và đẩy chi phí mỗi token về gần chi phí compute. Nhưng "gần zero" chỉ đúng sau điểm hoà vốn. Một hướng dẫn vận hành inference server trên Dev.to đặt ranh giới rõ hơn: "For low or spiky volume, API services win on cost and effort. For sustained high volume or strict data requirements, self-hosting wins. Calculate the crossover at your actual usage, including engineering time."

Hai ràng buộc từ cùng nguồn đáng tính trước khi thuê GPU: quy tắc ước lượng VRAM là "roughly 2x the model size in GB of VRAM for fp16 weights plus overhead for KV cache"; và về chi phí, dùng spot cho batch/non-critical, committed instance cho tải ổn định, scale to zero cho dev và staging.

Việc làm được ngay tuần này

  • Gắn nhãn tầng (chất lượng / khối lượng) cho từng đường gọi LLM trong service của bạn.
  • Đo token thực tế mỗi tầng trong 7 ngày trước khi đổi bất kỳ model nào.
  • Chỉ tính bài toán self-host cho tầng khối lượng, và cộng cả thời gian engineering vào điểm hoà vốn.
  • Theo dõi giá cache read — đợt giảm gần đây rơi vào cache, không phải giá base.

Không spam, hủy đăng ký bất kỳ lúc nào.

Bài viết liên quan