
Đọc bảng giá API LLM: 6 cái bẫy khiến bạn chọn sai model
Input, output và cached input là ba giá khác nhau, tokenizer mỗi vendor một kiểu: checklist đọc bảng giá API LLM trước khi tin vào cột giá rẻ nhất.
Bạn copy một bảng "API LLM rẻ nhất" về rồi chọn model theo cột giá. Hai tuần sau hóa đơn không khớp, và bạn không biết sai ở đâu. Bài viết của FuturPulse trên Dev.to đưa ra checklist đọc bảng giá, và những điểm dưới đây là phần dùng được ngay.
Ghi lại URL và ngày, không chỉ con số
Chẩn đoán của tác giả: vấn đề không nằm ở chuyện ai nói dối giá, mà ở chỗ bảng so sánh ép một thứ vốn nhiều chiều thành một con số duy nhất.
Theo bài viết, giá không nguồn là tin đồn, còn giá có nguồn mà không có ngày là tin đồn kèm chú thích. Nhà cung cấp đổi bảng giá lặng lẽ: không changelog, không thông báo, chỉ là một con số khác trên cùng một trang.
Vì vậy đơn vị ghi nhận tối thiểu là ba trường chứ không phải một: model | price | source_url | observed_on. Tác giả nói rõ nếu bạn không điền được source_url bằng chính trang pricing của vendor — không phải một bài blog viết về trang đó — thì bạn chưa có giá, bạn chỉ có một lời tuyên bố.
Input, output và cached input là ba giá khác nhau
Token output gần như luôn đắt hơn token input, thường đắt hơn nhiều lần. Cached input, ở nơi có hỗ trợ, rẻ hơn input thường. Một bảng chỉ có một cột cho mỗi model đang âm thầm chọn một trong ba giá đó và hy vọng workload của bạn trùng khớp.
Bài viết nêu hai hình dạng tải thực tế. Tóm tắt hoặc trích xuất có input dài, output ngắn, nên giá input chi phối. Sinh nội dung hoặc chạy agent thì prompt ngắn, completion dài, nhiều lượt, nên giá output chi phối — và model "rẻ" ở trường hợp đầu trở thành model đắt ở trường hợp sau. Cùng hai model, hai kết luận ngược nhau, mà bảng giá không đổi một chữ nào.
Tính trên log của chính bạn
Cách tác giả đề xuất không cần benchmark, chỉ cần log của bạn: lấy một ngày request thật, tính median token input và output, rồi nhân với giá. Hàm minh họa trong bài nhận giá theo đơn vị USD trên một triệu token, cộng phần input đã tính tỉ lệ cache với phần output, chia cho một triệu để ra chi phí mỗi lời gọi, rồi nhân số lời gọi mỗi ngày với 30 để ra chi phí tháng.
Đoạn code minh họa trong bài dài khoảng mười dòng. Theo tác giả, thứ hạng nó tạo ra là của bạn, còn thứ hạng trong bảng là workload của người viết mang tên bạn.
Hai chỗ bảng so sánh gãy hẳn
Thứ nhất là tokenizer. "Trên một triệu token" là quy ước, nhưng token không phải đơn vị chung — mỗi vendor tách văn bản một kiểu. Với văn xuôi tiếng Anh, chênh lệch đủ nhỏ để bỏ qua; với code, JSON, chữ viết không phải Latin hoặc văn bản nhiều dấu câu thì không. Bài viết không nói riêng về tiếng Việt, nên cách an toàn là tự tokenize một mẫu payload thật bằng tokenizer của từng vendor trước khi so giá.
Thứ hai là multimodal. Ảnh và audio được quy đổi ra token theo tỉ lệ riêng của từng vendor, phụ thuộc độ phân giải, cách chia tile, và đôi khi phụ thuộc một cờ "detail" bạn gửi kèm request. Hai vendor có thể công bố cùng một giá trên triệu token mà tính tiền rất khác nhau cho cùng một tấm ảnh. Tác giả đề nghị cách duy nhất trung thực: gửi cùng mười input thật đến từng ứng viên rồi đọc trường usage trong response — một thí nghiệm mười lăm phút.
Việc làm ngay
Thêm cột source_url và observed_on vào bảng giá nội bộ của bạn hôm nay. Tách input, output và cached thành ba cột riêng. Và với mọi tuyên bố kiểu "dưới một đô", hãy đọc điều kiện đi kèm: bài viết lưu ý các tuyên bố đó thường đúng nhưng chỉ trong điều kiện cụ thể — một tier nhất định, một endpoint batch, một giả định về cached input, hoặc một đợt khuyến mãi.
Không spam, hủy đăng ký bất kỳ lúc nào.
Bài viết liên quan

Claude Opus 5.5: giá rẻ hơn 20% và 4 breaking change
22 thg 9, 2026
