Bỏ qua để vào nội dung chính

Giảm chi phí LLM API: 3 đòn bẩy có số liệu cho dev Việt

Bởi Isabella Chen
09 thg 9, 20266 phút đọc

Output đắt hơn input 3–10 lần. Ba đòn bẩy có số liệu để cắt hóa đơn: định tuyến theo task, cache prefix, và dừng agent run sớm — kèm giới hạn.

Hóa đơn LLM tháng này của bạn tăng 40% nhưng traffic thì đứng yên. Bạn mở dashboard, thấy tổng token, và không biết cắt chỗ nào trước.

Phần lớn chi phí đó không đến từ việc dùng nhiều hơn. Nó đến từ vài giá trị mặc định không ai xem lại từ ngày dựng service. Bài này đi qua ba đòn bẩy có số liệu cụ thể — chọn tier model, cache prefix, và dừng agent sớm — kèm cách ước lượng tiết kiệm trước khi bạn đụng vào code production.

Trước tiên: output đắt hơn input 3–10 lần

Đây là điều kiện biên chi phối mọi quyết định phía sau. Bài phân tích của TokenPAPA nêu rõ: "output tokens cost 3–10x input on every single model" — dẫn chứng $0.42 so với $0.14 trên tier Flash, và $60.00 so với $13.50 trên tier flagship.

Hệ quả thực tế: một prompt dài thêm 500 token làm bạn tốn thêm một lần. Một response dài thêm 500 token làm bạn tốn thêm 3–10 lần. Nếu bạn chỉ có thời gian sửa một thứ hôm nay, hãy đặt max_tokens cho mọi endpoint đang chạy tự do.

Nguồn mô tả rủi ro cụ thể: một lần sinh chạy loạn — vòng lặp, reasoning trace dài, summarizer không dừng — có thể phát ra 10.000 token bạn không hề yêu cầu, và ở mức giá output đó, một call như vậy tốn hơn cả trăm call bình thường.

Đòn bẩy 1: định tuyến theo task, không theo thói quen

Bảng giá mà TokenPAPA công bố (đơn giá per-1M token trên gateway của họ, cập nhật tháng 9/2026) cho thấy khoảng cách giữa hai đầu bảng lớn đến mức nó không còn là chuyện tối ưu:

ModelInput /1MOutput /1MGhi chú của nguồn
Mimo V2.5$0.08$0.24Rẻ nhất bảng
DeepSeek V4 Flash$0.14$0.42"Cost-effectiveness king"
GPT-5.6 Luna$0.27$2.70Tier tiết kiệm của OpenAI
GPT-5.6 Sol$13.50$60.00Frontier flagship

Trên một workload mô phỏng 100.000 request/tháng, nguồn ước tính DeepSeek V4 Flash rơi vào khoảng $52/tháng, còn tier flagship khoảng $4.200/tháng. Đây là con số mô phỏng của chính tác giả, không phải hóa đơn thật của bạn — nhưng tỷ lệ giữa hai cột mới là thứ đáng mang về.

Về chất lượng, nguồn dẫn DeepSeek V4 Flash đạt 82.7 trên Terminal Bench 2.1 và time-to-first-token khoảng 0.4s. Cần đọc đây là số liệu do nhà cung cấp gateway đưa ra trong một bài có tính quảng bá sản phẩm, không phải kết quả benchmark độc lập. Cách xử lý đúng với số dạng này: coi nó là giả thuyết, rồi tự chạy lại trên 200 request thật của bạn trước khi chuyển tier.

Phân tích riêng: với đội ở Việt Nam, thứ tự thử nghiệm nên ngược với trực giác. Đừng bắt đầu bằng việc hạ tier cho phần khó nhất. Bắt đầu bằng các endpoint phân loại, trích xuất trường, và tóm tắt — nơi output ngắn, tiêu chí đúng/sai rõ ràng, và bạn có thể chấm điểm tự động trên tập cũ. Nếu tier rẻ giữ được kết quả ở đó, bạn đã lấy phần lớn khoản tiết kiệm mà chưa động tới đường sinh code.

Đòn bẩy 2: cache prefix, đừng trả tiền hai lần cho cùng một byte

System prompt, tool definition, lịch sử hội thoại — phần lớn API call gửi lại đúng những byte đó mỗi lần, và provider tính chúng như input mới. Nguồn mô tả context caching tự động của DeepSeek tính phần input lặp lại theo giá cache-hit, giảm chi phí cho các prefix lặp khoảng 90%.

Ví dụ tính toán trong bài: system prompt 5.000 token nhân 100.000 request/tháng là 500 triệu input token; ở mức $0.14/1M thì riêng phần lặp đó tốn khoảng $70/tháng, và với mức tiết kiệm ~90% nó còn khoảng $7/tháng.

Ba thói quen làm cache hoạt động, theo nguồn:

  • Giữ system prompt ổn định — cache khớp theo prefix, nên đừng chèn dữ liệu thay đổi vào đầu prompt.
  • Đưa phần thay đổi xuống cuối message: câu hỏi của user, tài liệu retrieve được, ngày hôm nay.
  • Không cần bật gì ở phía API — nguồn cho biết caching là tự động trên deepseek-v4-flashdeepseek-v4-pro.

Điểm này quan trọng với app RAG hơn app chat: cùng một bộ hướng dẫn đi kèm mọi query, nên prefix lặp thường là dòng chi phí lớn nhất cắt được.

Đòn bẩy 3: dừng agent run trước khi nó chạy hết

Hai đòn bẩy trên tác động lên giá mỗi call. Đòn bẩy thứ ba tác động lên số call — và nó là phần ít đội nào đụng tới.

EarlyEval là một framework dự đoán sớm kết quả của agent run: sau vài bước đầu, một classifier ước lượng run đó sẽ thành công hay thất bại, và nếu vượt ngưỡng tin cậy đã hiệu chỉnh thì dừng luôn. Theo mô tả của nghiên cứu, cách này cắt tới 44,1% input token và 29,4% output token, với độ chính xác dự đoán kết quả 89–97%, và loại bỏ trung bình 13–26% số bước agent trên ba benchmark.

Câu hỏi hiển nhiên là dừng sớm có làm hỏng chất lượng không. Nghiên cứu báo cáo Spearman ρ ≥ 0.959 trên SWE-bench Verified, TerminalBench và Toolathlon — tức thứ hạng giữa các agent gần như không đổi so với chạy đầy đủ. Cái giá là resolve rate của từng agent giảm khoảng 1–2 điểm phần trăm.

Giới hạn cần ghi nhớ trước khi mang vào production: chính nghiên cứu nói kỹ thuật này mới chỉ được kiểm chứng trên ba benchmark agentic. Việc mở rộng sang sinh nội dung mở, hội thoại nhiều lượt hay ngôn ngữ ít tài nguyên vẫn là câu hỏi ngỏ — và tiếng Việt nằm đúng trong nhóm cuối. Nếu bạn định thử, hãy đo lại ngưỡng tin cậy trên dữ liệu của mình thay vì mượn ngưỡng của paper.

Thứ tự nên làm trong tuần này

Ba việc, xếp theo tỷ lệ tiết kiệm trên công sức:

  1. Đặt max_tokens cho mọi endpoint chưa có. Mất một buổi chiều, và nó chặn kịch bản hóa đơn tệ nhất chứ không chỉ giảm trung bình.
  2. Kiểm tra cache hit rate. Nếu gần bằng 0, gần như chắc chắn system prompt của bạn đang đổi mỗi call — sửa cấu trúc prompt trước khi nghĩ tới đổi model.
  3. Đo phân bố model. Nếu một tỷ lệ đáng kể call đang chạy trên tier flagship, đó là nơi con số lớn nhất nằm, và cũng là thay đổi rủi ro nhất — nên nó đi sau hai việc trên.

Điều đáng theo dõi tiếp: các mức giá trong bài này là giá gateway của một nhà cung cấp tại thời điểm tháng 9/2026, không phải giá niêm yết chính thức của từng lab. Trước khi ký ngân sách quý, hãy đối chiếu lại với bảng giá gốc của provider bạn đang dùng.

Không spam, hủy đăng ký bất kỳ lúc nào.

Bài viết liên quan