Bỏ qua để vào nội dung chính
OpenAI giảm 80% giá GPT-5.6 Luna: hạ tier ở đâu thì an toàn

OpenAI giảm 80% giá GPT-5.6 Luna: hạ tier ở đâu thì an toàn

Bởi Ava Mitchell
22 thg 8, 20264 phút đọc

OpenAI giảm giá GPT-5.6 Luna ~80%, Terra ~20% và thêm Sol Fast mode. Đây là quyết định model routing, không phải đợt giảm hóa đơn toàn dòng.

OpenAI vừa giảm giá GPT-5.6 Luna khoảng 80% và GPT-5.6 Terra khoảng 20%. Đây là tin về routing, không phải tin hóa đơn tự nhỏ lại.

Mức giảm áp dụng cho API, đồng thời đổi cách tiêu credit trong ChatGPT Work và Codex. Cùng lúc đó OpenAI thêm Fast mode cho GPT-5.6 Sol: xử lý nhanh hơn tới 2,5 lần với giá khoảng gấp đôi, còn giá Sol tiêu chuẩn giữ nguyên.

Đợt giảm giá chạm vào đâu

Biến thể GPT-5.6Thay đổiÝ nghĩa vận hành
LunaGiảm giá khoảng 80%Lựa chọn rẻ cho workload volume lớn
TerraGiảm giá khoảng 20%Cải thiện vị thế chi phí cho một số workload
Sol tiêu chuẩnGiá không đổiCấu trúc chi phí nền giữ nguyên
Sol Fast modeNhanh hơn tới 2,5x, giá khoảng gấp đôiĐổi tiền lấy độ trễ, không phải để tiết kiệm

Điểm dễ đọc nhầm nhất: đây không phải giảm giá toàn dòng. Nguồn mô tả đây là điều chỉnh có chủ đích cho Luna và Terra cộng một tier hiệu năng mới cho Sol, và các tổ chức không nên giả định workload đang chạy Sol tiêu chuẩn sẽ tự động rẻ đi.

Vì sao hóa đơn của bạn có thể không giảm

Ba lý do, cả ba đều nằm trong nguồn:

  • Kênh mua khác nhau. API tính token thật, còn ChatGPT Work và Codex tính theo credit. Hai mô hình liên quan nhưng vận hành khác nhau, nên đừng áp cùng một phần trăm cho tổng chi.
  • Token không phải toàn bộ chi phí. Chi phí model thường nằm lẫn trong retrieval, xử lý dữ liệu, observability, human review và hạ tầng. Token rẻ hơn cải thiện kinh tế dự án nhưng không xóa nhu cầu đo chi phí và chất lượng đầu-cuối.
  • Điều kiện áp dụng. Rollout theo khu vực, điều kiện theo gói, quota và cơ chế tiêu credit đều ảnh hưởng tới giá cuối cùng của từng khách hàng.

Hạ tier ở đâu thì an toàn

Một phân tích khác trong tuần đặt vấn đề ngược lại: nhiều team đắt không phải vì giá, mà vì mua thừa trí tuệ — trả giá frontier cho việc model rẻ làm ngang ngửa. Tác giả liệt kê nhóm tác vụ hiếm khi cần tier cao nhất: phân loại, routing, structured extraction, và phần lớn RAG answering.

Cái bẫy, vẫn theo tác giả, là tin vào leaderboard tổng quát cho tác vụ hẹp: "chênh lệch benchmark tổng quát không chuyển giao được" — một model thấp hơn 10% trên bảng xếp hạng có thể kém 0% ở việc trích số tổng hóa đơn, hoặc kém 50% với thuật ngữ đặc thù của bạn. Không đo thì không biết.

Quy trình tác giả đề xuất đủ ngắn để làm trong một buổi chiều: định nghĩa task → dựng eval set 20+ ví dụ thật → chấm điểm các model ứng viên, bao gồm cả nhóm rẻ → nếu model rẻ đạt, ship; nếu không, thử tier cao hơn.

Khoảng cách giá lớn tới mức nào

Cũng bài đó dẫn bảng giá niêm yết tính đến tháng 8/2026 để so hai đầu cực của thị trường: Claude Fable 5 ở mức 10 USD/1M token input và 50 USD/1M token output, so với DeepSeek V4 Flash 0731 khoảng 0,14–0,22 USD input và 0,28–0,66 USD output. Tác giả quy ra rẻ hơn khoảng 20–70 lần mỗi token.

Hai cảnh báo do chính tác giả nêu: Flash nói nhiều, sinh nhiều token hơn mức trung vị nên khoảng cách chi phí trên mỗi task hẹp hơn trên mỗi token; và phần lớn benchmark trong bài là số nhà cung cấp tự công bố, chưa kiểm chứng độc lập. Đọc các con số này như tuyên bố cần kiểm chứng, không phải kết quả đo của bạn.

Làm gì tuần này

Tách dự báo chi phí thành hai dòng: token API và credit Work/Codex — chỉ dòng đầu ăn trực tiếp mức giảm. Rồi chọn một workload volume cao đang chạy tier đắt, dựng eval set 20 ví dụ thật, chấm cả tier rẻ lẫn tier hiện tại trước khi đổi route. Giữ nguyên quy tắc phê duyệt và giám sát chi tiêu: giá rẻ hơn nghĩa là volume dễ phình ra hơn.

Không spam, hủy đăng ký bất kỳ lúc nào.

Bài viết liên quan