Bỏ qua để vào nội dung chính
Claude Opus 5.5: giá rẻ hơn 20% và 4 breaking change

Claude Opus 5.5: giá rẻ hơn 20% và 4 breaking change

Bởi Ryan Patel
22 thg 9, 20266 phút đọc

Opus 5.5 rẻ hơn Opus 5 20%, riêng cache read rẻ hơn 60%. Bóc tách con số thật, 4 breaking change phải sửa, và khi nào thì chưa nên đổi.

Bạn chạy agentic coding cả ngày trên Opus 5, và hóa đơn tháng này lại cao hơn tháng trước dù khối lượng việc không đổi. Opus 5.5 vừa ra với giá thấp hơn 20%, nhưng đổi model không phải là sửa một dòng config.

Bài này bóc tách con số nào thật sự làm giảm hóa đơn của bạn, bốn breaking change phải sửa trước khi migrate, và khi nào thì chưa nên đổi.

Giá mới: nhìn dòng cache read trước

Anthropic phát hành Claude Opus 5.5 ngày 22/09/2026, có mặt cùng ngày trên mọi nền tảng hãng này ship.

Mỗi triệu tokenOpus 5.5Opus 5Thay đổi
Input$4$5rẻ hơn 20%
Output$20$25rẻ hơn 20%
Cache read$0.20$0.50rẻ hơn 60%
Cache write (5m)$5$6.25rẻ hơn 20%

Số liệu theo công bố Opus 5.5 của Anthropic. TechCrunch xác nhận độc lập mức output $20 so với $25 của model trước.

Headline là giảm 20%, nhưng dòng đáng chú ý là cache read. Với workload agentic và coding, cache read là nơi phần lớn chi phí rơi vào, và nó rẻ đi 60%.

Điều này quyết định bạn tiết kiệm bao nhiêu. Một agent chạy dài, đọc lại cùng một context mỗi lượt, sẽ hưởng lợi nhiều hơn hẳn một endpoint chat one-shot. Trước khi tin con số nào, hãy kéo usage tháng trước tách theo loại token, không chỉ tổng bill.

Hai mức giá nằm ngoài bảng. Fast mode tính riêng $8 / $40 cho tốc độ tới 2.5x, có trên Claude Code và Claude Platform. Batch API vẫn giảm 50% cả input lẫn output — đây là cách rẻ nhất để chạy các job không cần realtime.

Con số 40% là của vendor — tự kiểm chứng thế nào

Anthropic đo tổng chi phí giảm 40% trên workload điển hình ở setting mặc định, cộng tốc độ sinh output nhanh hơn 30%+. The Verge cũng ghi nhận mức 40% này.

Con số đó gộp hai thứ: một phần là giá giảm, một phần là model tiêu ít token hơn cho cùng task. Phần thứ hai mới là phần bạn phải tự đo, vì nó phụ thuộc vào repo và prompt của bạn.

Hai khách hàng đã báo cáo phần token từ phía họ. Box nói model dùng một phần ba lượng token so với Opus 5 trong đánh giá của họ, câu trả lời ngắn hơn 40% mà không giảm độ chính xác. Factory gọi đây là model đầu tiên họ mặc định dùng ở medium effort, ngang Opus 5 ở high effort với ít hơn 20-25% output token.

Các ví dụ task-level của Anthropic mạnh hơn nhiều, và nên đọc như best case do vendor chọn. Hãng công bố một lần audit và fix codebase 200.000 dòng xong dưới ba tiếng, trong khi Opus 5 mất hơn 20 tiếng và đốt gấp 2.5 lần token.

Cách kiểm chứng trên repo của bạn không phức tạp. Chọn 5-10 task đã chạy qua Opus 5 tuần trước, chạy lại nguyên văn prompt trên Opus 5.5 ở effort mặc định, rồi so tổng token và thời gian hoàn thành. Đây mới là con số dùng để ra quyết định, không phải bảng giá.

Bốn breaking change phải sửa trước khi migrate

  1. Không tắt được thinking. Adaptive thinking luôn bật; độ sâu chỉ điều khiển qua tham số effort, mặc định là medium.
  2. Forced tool use trả về lỗi. Request ép model gọi một tool cụ thể sẽ bị từ chối.
  3. Thinking block gắn với model và conversation. Bạn không mang chúng qua model khác được.
  4. Computer use tool cũ bị từ chối. computer_20251124 không được chấp nhận trên Claude API và Google Cloud.

Ba cái đầu cũng áp dụng cho Fable 5.1. Team nào đã chạy Fable thì việc phải sửa ít hơn hẳn.

Cái bẫy không báo lỗi

Có một thay đổi thứ năm không làm request fail, và đây là cái dễ lọt ra tới người dùng nhất.

Text nằm giữa các tool call giờ trả về bên trong thinking block, và ở setting display mặc định thì phần text đó rỗng. Nếu app của bạn stream đoạn text này ra làm progress update, UI sẽ im lặng giữa các tool call cho tới khi bạn set một giá trị display trả lại nó.

Không có exception nào được ném ra. Test tự động của bạn vẫn xanh. Chỉ có người dùng ngồi nhìn màn hình đứng yên giữa một chuỗi tool dài. Hãy ship fix display chung một PR với lần bump model, đừng tách ra hai lần deploy.

Safeguard: ai thật sự bị ảnh hưởng

Đây là model đầu tiên Anthropic phát hành sau khi CEO Dario Amodei công bố kế hoạch "pace the frontier". Trong test, Opus 5.5 cố vượt boundary ít hơn 85% so với Opus 5 hoặc Claude Mythos 5.1, và mọi lần thử đều ở mức nghiêm trọng thấp và tự báo cáo.

Phần ảnh hưởng tới công việc nằm ở chỗ khác. Vì năng lực biology và cybersecurity giờ ngang Mythos 5.1, model ship kèm safeguard mức Fable 5.1: một số request liên quan cybersecurity được reroute sang Opus 4.8 yếu hơn, request biology bị flag thì sang Opus 5.

Việc tìm và fix bug trong development lifecycle bình thường vẫn chạy được. Nhưng nếu sản phẩm của bạn làm offensive security, một phần request sẽ do model cũ trả lời, và việc reroute diễn ra ngầm chứ không phải một lỗi hiện ra. Hãy đo tỉ lệ này trước khi cam kết SLA với khách.

Vậy khi nào nên đổi

Dựa trên các con số ở trên, đây là cách phân loại:

  • Đổi ngay nếu workload của bạn là agent chạy dài với tỉ lệ cache read cao. Đây là nhóm có phần lớn hóa đơn nằm đúng ở dòng được giảm 60%, thay vì chỉ hưởng 20% trên giá niêm yết.
  • Đổi sau khi đo nếu bạn chạy chat hoặc one-shot generation. Ở đây lợi ích chủ yếu là 20% giá, và mức tiết kiệm token phải tự xác nhận.
  • Chưa đổi nếu codebase còn phụ thuộc forced tool use hoặc computer_20251124. Sửa phụ thuộc trước, đổi model sau.
  • Cân nhắc kỹ nếu sản phẩm chạy tác vụ cybersecurity. Hãy đo tỉ lệ reroute trên traffic thật trước khi chuyển.

Việc cần theo dõi tiếp

Model ID là claude-opus-5-5; trên Amazon Bedrock là anthropic.claude-opus-5-5. Spec còn lại: context 1M token, output tối đa 128K, knowledge cutoff tháng 6/2026, và không bị retire sớm hơn 22/09/2027.

Claude Sonnet 5.5 và Haiku 5.5 sẽ ra trong vài tuần tới. Nếu bạn đang định tách traffic rẻ xuống tier thấp hơn, giá của hai model đó là thứ đáng chờ trước khi chốt kiến trúc routing.

Không spam, hủy đăng ký bất kỳ lúc nào.

Bài viết liên quan