
Claude Fable 5.1 giá $10/$50: khi nào đáng đổi từ Opus 5?
Fable 5.1 đắt gấp đôi Opus 5 nhưng chỉ hơn 3,5 điểm trên Terminal-Bench 4.0. Bảng giá, benchmark và các chỉ số cần đo trước khi bạn đổi model.
Bạn đang chạy Opus 5 cho phần việc nặng nhất và tự hỏi có nên nhảy lên Claude Fable 5.1 không. Câu trả lời nằm ở chênh lệch giá gấp đôi, và ở chỗ bạn có đo được thứ gì ngoài mã HTTP 200 hay chưa.
Thông số và giá
Theo bảng model overview mà bài phân tích dẫn lại, Fable 5.1 có model ID claude-fable-5-1, phát hành 1/9/2026, cửa sổ ngữ cảnh 1.000.000 token, output tối đa 128.000 token, knowledge cutoff tháng 6/2026. Thinking là "adaptive, always on", với năm mức effort: low, medium, high, xhigh, max. Mặc định là High trên API và Claude Code, Medium trên Claude Cowork và Claude.ai.
Giá niêm yết: $10 input / $50 output mỗi triệu token, cache read $0,25 mỗi triệu. Đặt cạnh hai model còn lại trong bảng định tuyến của tác giả:
| Model | Giá input/output (mỗi triệu token) | Vai trò tác giả đề xuất |
|---|---|---|
| Fable 5.1 | $10 / $50 | Capability escalation |
| Opus 5 | $5 / $25 | Default complex work |
| Sonnet 5 | $2 / $10 | High-volume baseline |
Cả ba đều có 1M context và 128K output, nên context không phải lý do để đổi. Chênh lệch nằm ở độ trễ và giá: tác giả xếp Fable là "slower", Opus "moderate", Sonnet "fast".
Bản thân Anthropic khuyên bắt đầu ở Opus
Đây là chi tiết dễ bị bỏ qua. Tác giả ghi lại hướng dẫn của Anthropic: bắt đầu phần lớn workload với Opus 5 và chỉ escalate khi "high-effort Opus evaluations still fall short". Nói cách khác, mặc định không phải là model đắt nhất — mặc định là model rẻ hơn, cộng một phép đo cho thấy nó hụt.
Benchmark nói gì, và không nói gì
Theo bảng benchmark của Anthropic mà bài dẫn lại, mức tăng lớn nhất giữa hai thế hệ nằm ở Terminal-Bench-Science 0.1: từ 24,7% lên 52,6%. AutomationBench đi từ 17,1% lên 31,4%. Trên Terminal-Bench 4.0, Fable 5.1 đạt 55,8% so với 52,3% của Opus 5 — khoảng cách hẹp hơn nhiều. CursorBench 3.2.0: 73,4% so với 70,0%.
Đọc hai nhóm số này khác nhau. Nhóm nhảy gấp đôi cho bạn một danh sách rút gọn các loại workload đáng đem ra thử. Nhóm chênh vài điểm thì không: ở mức đó, chi phí gấp đôi cần một lý do khác ngoài bảng benchmark. Như tác giả viết, bảng này cho "a shortlist of workloads to evaluate, not permission to skip application-specific acceptance tests".
Chỉ số cần đo
Phần hữu dụng nhất của bài là cách tác giả định nghĩa thành công khi migrate: "accepted-task completion — not whether the API returned HTTP 200". Quy trình đề xuất là bắt đầu bằng một request nhỏ với dữ liệu không nhạy cảm, khi credential, routing và xử lý response đã chạy thì chuyển sang replay trace production thật.
Tác giả cũng khoanh vùng khá rõ chỗ nên và không nên tiêu tiền. Đáng escalate: migration toàn repo, debug khó, research agent, tổng hợp tài liệu dài. Không đáng: tóm tắt, phân loại, trích xuất, trả lời hỗ trợ ngắn.
Việc làm được ngay
Trước khi đổi string model, tách log của bạn theo bốn nhóm workload trên và xem nhóm "đáng escalate" chiếm bao nhiêu phần trăm chi phí. Nếu phần lớn hoá đơn đang nằm ở tóm tắt và phân loại, thứ cần đổi là định tuyến xuống Sonnet, không phải lên Fable.
Không spam, hủy đăng ký bất kỳ lúc nào.
Bài viết liên quan

Đếm token cho Claude: vì sao tiktoken lệch 17% ngân sách
16 thg 9, 2026
