Bỏ qua để vào nội dung chính
Claude Haiku 5.5 giá $0.10/$0.50: tính lại chi phí API cho dev

Claude Haiku 5.5 giá $0.10/$0.50: tính lại chi phí API cho dev

Bởi Benjamin Hayes
08 thg 10, 20266 phút đọc

Haiku 5.5 về $0.10/$0.50 dưới 100.000 token, nhưng tokenizer mới và reasoning mặc định làm hóa đơn lệch. Ba con số cần đo trước khi đổi model.

Bạn đang chạy một pipeline phân loại ticket trên Claude Haiku 4.5 và hóa đơn tháng trước tính theo mức $1/triệu token input. Từ ngày 7/10/2026, đúng workload đó có thể rẻ hơn khoảng 10 lần — hoặc đắt hơn, nếu prompt của bạn vượt 100.000 token. Bài này tính lại ba con số bạn phải kiểm tra trước khi đổi model: giá theo ngưỡng context, tokenizer mới, và mức reasoning mặc định.

Giá mới: $0.10/$0.50, nhưng chỉ dưới 100.000 token

Anthropic phát hành Claude Haiku 5.5 ngày 7/10/2026. Simon Willison mô tả bản Haiku cũ là "very much showing its age": 4.5 ra mắt gần một năm trước, giá $1/triệu token input và $5/triệu token output, mà theo ông là "relatively expensive even back then, and a full 10x the price of OpenAI's GPT-6 Luna".

Bản mới đảo ngược thế đó, nhưng có điều kiện. Theo Willison: "The new Haiku exactly matches the price of GPT-6 Luna—$0.10/$0.50—up to 100,000 tokens. Beyond 100,000 tokens the price increases 5x to $0.50/$2.50." Để so sánh, ông ghi nhận Luna cũng tăng giá nhưng ở mốc 272.000 token và chỉ lên $0.20/$0.75.

Đây là chi tiết quyết định việc bạn có nên đổi hay không. Nếu request của bạn gọn trong 100.000 token, Willison kết luận Haiku "is the same price as Luna and reports higher benchmark scores". Nếu vượt ngưỡng, ông viết thẳng: "Above 100,000 tokens, Luna looks like a much better deal."

Phần lớn workload backend ở Việt Nam — phân loại ticket, trích xuất dữ liệu đơn hàng, tóm tắt hội thoại — hiếm khi chạm ngưỡng này. Ba kiểu hay vượt: RAG nhồi cả chục chunk dài, agent chạy nhiều lượt không cắt history, và pipeline đọc nguyên file log. Hãy đo p95 độ dài prompt thay vì trung bình — p95 mới là phần hóa đơn nhảy 5 lần.

Bẫy thứ hai: tokenizer mới đếm nhiều token hơn

Giảm giá trên bảng niêm yết không đồng nghĩa giảm hóa đơn, vì đơn vị đếm đã đổi. Willison viết: "Haiku 5.5 also uses a new, less generous tokenizer. My Claude Token Counter tool shows that the same long prompt uses around 1.25x as many tokens with Haiku 5.5 compared to Haiku 4.5, so there's a hidden price increase there."

Hệ quả thực tế: cùng một prompt, số token tính tiền cao hơn bản cũ, và ngưỡng 100.000 token cũng đến sớm hơn tương ứng. Nếu bạn đang ở sát mép ngưỡng với Haiku 4.5, cơ sở để quyết định là phép đo lại bằng tokenizer mới, không phải con số cũ trong dashboard.

Reasoning bật mặc định: chênh lệch chi phí trong cùng một model

Haiku 5.5 có các mức reasoning effort low, medium, high, xhigh và max. Willison lưu ý một điểm dễ bị bỏ qua khi migrate: "The new Haiku doesn't let you disable reasoning, and defaults to medium."

Khoảng chi phí giữa các mức không nhỏ. Trên cùng một prompt sinh SVG, ông đo được: "The low effort pelican cost 0.0936 cents and took 7 seconds", còn bản max "took 5 minutes 9 seconds to generate, but still only cost me 3.3826 cents". Hai con số đó cách nhau hàng chục lần cả về tiền lẫn thời gian, trên cùng một request. Ông cũng ghi nhận Haiku 4.5 một năm trước tốn 0.7583 cent cho cùng bài test và không hỗ trợ reasoning level.

Phân tích: với workload throughput cao, mặc định medium là thứ cần xem lại đầu tiên sau khi đổi model, vì nó áp cho mọi request kể cả request không cần suy luận. Willison có nhận xét chất lượng cho bài test của ông — "I got a good bicycle frame for everything beyond low" — nhưng đó là một prompt vẽ hình, không thay cho phép đo trên tập request thật của bạn.

Cách thử nhanh bằng công cụ ông dùng:

llm install -U llm-anthropic
llm anthropic refresh
llm -m claude-haiku-5.5 "Generate an SVG of a pelican riding a bicycle" -o thinking_effort low

Đổi thinking_effort qua từng mức rồi ghi lại chi phí và latency cho 20-30 request đại diện. Đây là ví dụ minh họa, không phải cấu hình production.

Subscription hay API? Credit mới làm thay đổi phép tính

Cùng đợt phát hành, Anthropic đổi hai thứ khác về chi phí. Thứ nhất, theo Willison: "Anthropic announced today that they are halving the price of cache reads for Sonnet 5.5" — đáng chú ý nếu bạn đang chạy kiến trúc prompt caching với system prompt dài.

Thứ hai là credit API hàng tháng cho người dùng subscription. Thông báo được Willison trích: "Max 5x users will get $100 in credits per month, Max 20x users will get $200, and Team subscribers will receive up to $500, pooled across their users." Ông đánh giá đây là chính sách hào phóng vì credit khớp đúng giá gói thuê bao, nhưng kèm một cảnh báo: "the monthly credits do not roll over—use them or lose them."

Để biết gói nào đáng, cần giá thuê bao đã kiểm chứng. Một bản khảo giá đọc trực tiếp từ trang giá của nhà cung cấp ngày 7/10/2026 ghi nhận: Claude "Free $0 · Pro $17/month billed annually ($20 monthly, $200 up front) · Max from $100/month · Team $20/seat/month billed annually ($25 monthly)". Tác giả bản khảo giá đó nhấn mạnh chi tiết quan trọng với dev: "Claude Code is included with Pro and Max, not sold as a separate product", và Team "covers 2 to 150 people, with seats priced plus usage at API rates".

Ghép hai nguồn, phép tính cho một team nhỏ ở Việt Nam rõ hơn: người dùng Max 5x nhận $100 credit API mỗi tháng, trong khi gói Max bắt đầu từ $100/tháng — phần API nhẹ có thể đã nằm trong ngân sách đang trả. Vì credit không cộng dồn, nó chỉ có lợi cho workload chạy đều hằng tháng, không có lợi cho dự án chạy từng đợt.

Một chi tiết vận hành nên bật ngay: Anthropic cho phép tắt auto-reload, và Willison mô tả hệ quả đúng như mong đợi của người quản lý ngân sách — "API requests will stop when your balance runs out".

Checklist trước khi đổi sang Haiku 5.5

  • Đo lại p95 số token prompt bằng tokenizer mới, không dùng số cũ của Haiku 4.5.
  • Đếm tỷ lệ request vượt 100.000 token; nếu đáng kể, so sánh với lựa chọn khác trước khi migrate toàn bộ.
  • Đặt thinking_effort tường minh cho từng loại request thay vì để mặc định medium.
  • Nếu đang trả tiền gói Max hoặc Team, kiểm tra mục Settings → Billing để gán credit vào đúng tổ chức API.
  • Tắt auto-reload trên tài khoản dùng để thử nghiệm.

Theo dõi tiếp

Hai câu hỏi chưa có dữ liệu công khai: mức tăng ~1,25 lần số token áp dụng thế nào với tiếng Việt, và chất lượng ở mức low có đủ cho tác vụ phân loại hay không. Cả hai chỉ trả lời được bằng đo đạc trên chính tập dữ liệu của bạn, trước khi đổi mặc định cho toàn hệ thống.

Không spam, hủy đăng ký bất kỳ lúc nào.

Bài viết liên quan