Bỏ qua để vào nội dung chính

Giá token 13/9: 12 thay đổi giá, tính lại budget model LLM

Bởi Lucas Fischer
13 thg 9, 20266 phút đọc

Ngày 13/9/2026 có 12 thay đổi giá token: DeepSeek V4 Pro tăng hơn gấp đôi, GLM 5.3 và Llama 3.1 70B giảm. Cách tính lại chi phí model cho team.

Bạn chốt budget model từ đầu quý, pin DeepSeek V4 Pro cho batch job chạy đêm, rồi không xem lại bảng giá nữa. Ngày 13/9/2026 giá prompt của đúng model đó tăng hơn gấp đôi, và bill cuối tháng mới là chỗ bạn phát hiện ra.

Bài này lấy đủ 12 thay đổi giá trong ngày, tách rõ bên tăng và bên giảm, rồi chỉ cách tính lại điểm hoà vốn trước khi bạn khoá lựa chọn model cho sprint tới.

12 thay đổi giá, không thêm không bớt model nào

Bản digest ngày 13/9/2026 của The Token Ledger ghi 12 price changes, no additions or removals — danh mục model không đổi, chỉ có giá dịch chuyển. Với team chạy production, đây là kiểu thay đổi nguy hiểm nhất: không deprecation notice, không model mới buộc bạn migrate, chỉ có con số trong hoá đơn khác đi.

Hai cú tăng cần xử lý trước

DeepSeek V4 Pro 0423 là thay đổi lớn nhất: prompt tăng từ $0.79/1M lên $1.60/1M, completion tăng từ $1.58/1M lên $3.20/1M. Cả hai chiều đều tăng khoảng gấp đôi. Digest ước tính team chạy inference khối lượng lớn chịu thêm khoảng +$2.43 cho mỗi 1M token.

Kimi K3 của MoonshotAI tăng nhẹ hơn về tỉ lệ nhưng nặng hơn về giá tuyệt đối: prompt $2.30 → $2.65/1M, completion $11.55 → $13.28/1M, tương đương khoảng +$2.08 cho mỗi 1M token. Digest nói thẳng rằng developer nên theo dõi các thay đổi này để đánh giá tác động ngân sách, đặc biệt là mức tăng mạnh ở DeepSeek V4 Pro và Kimi K3.

Chú ý với Kimi K3: completion đã ở mức $13.28/1M. Nếu workload sinh output dài — tóm tắt, viết code, trả JSON lớn — chiều completion mới quyết định hoá đơn, không phải prompt.

Bên giảm giá: GLM 5.3, Llama 3.1 70B, Qwen3 30B

Cùng ngày có bốn model giảm giá đáng kể:

ModelPrompt ($/1M)Completion ($/1M)Chênh lệch ước tính
Z.ai GLM 5.31.40 → 1.094.40 → 3.43≈ −$1.28 /1M
MoonshotAI Kimi Latest2.13 → 2.1011.90 → 10.95≈ −$0.98 /1M
Meta Llama 3.1 70B Instruct0.72 → 0.400.72 → 0.40≈ −$0.64 /1M
Qwen3 30B A3B Instruct 25070.09 → 0.050.30 → 0.19≈ −$0.15 /1M

Llama 3.1 70B Instruct là trường hợp gọn nhất: prompt và completion về cùng mức $0.40/1M, nên bạn không cần biết tỉ lệ input/output của workload mới tính được chi phí. Với batch job có khối lượng ổn định, đây là loại giá dễ dự toán nhất trong cả danh sách.

Chiều ngược lại, vài model giá thấp lại tăng theo tỉ lệ khá lớn dù số tuyệt đối vẫn nhỏ: GLM 5.3 Flash prompt $0.08 → $0.15/1M và completion $0.25 → $0.50/1M (≈ +$0.33/1M); Gemma 4 26B A4B prompt $0.04 → $0.09/1M, completion $0.22 → $0.30/1M (≈ +$0.13/1M); DeepSeek V4 Flash Latest prompt $0.03 → $0.04/1M, completion $0.07 → $0.11/1M. Nếu bạn đang dùng nhóm này cho tác vụ tần suất cao — classify, route, rerank — phần trăm tăng mới là thứ đáng nhìn, không phải con số cent.

Nhóm rẻ nhất hiện tại

Digest liệt kê ba model rẻ nhất theo giá mỗi token: IBM Granite 4.0 Micro ở $0.017/1M prompt và $0.112/1M completion; Mistral Nemo ở $0.019/1M prompt và $0.030/1M completion; inclusionAI Ling 3.0 Flash ở $0.021/1M prompt và $0.063/1M completion.

Mistral Nemo đáng chú ý vì khoảng cách prompt–completion hẹp nhất nhóm ($0.019 so với $0.030), trong khi Granite 4.0 Micro có completion đắt gấp hơn 6 lần prompt của chính nó. Cùng gọi là "rẻ", nhưng hai model này phản ứng rất khác nhau khi output dài ra.

Tính lại trong 10 phút, không cần spreadsheet mới

Phần dưới là cách làm, không phải số liệu từ nguồn — hãy thay bằng số của chính bạn:

  1. Lấy tỉ lệ prompt:completion thật từ log, không ước lượng. Hầu hết team đoán sai chiều này, và vì completion thường đắt hơn prompt vài lần nên đoán sai ở đây làm lệch toàn bộ dự toán.
  2. Nhân riêng từng chiều với giá mới, thay vì dùng một mức giá trung bình. Với Kimi K3 chênh lệch giữa hai chiều là $2.65 so với $13.28/1M — trung bình hoá sẽ cho ra con số vô nghĩa.
  3. So sánh trên cùng một workload, không so trên giá niêm yết. Một model rẻ hơn mỗi token nhưng cần nhiều lượt retry hơn có thể đắt hơn khi tính theo tác vụ hoàn thành.
  4. Kiểm tra model nào đang được pin theo version. DeepSeek V4 Pro 0423 và DeepSeek V4 Flash 0423 là hai dòng riêng biệt trong digest và đi hai hướng ngược nhau — 0423 Flash giảm ($0.07 → $0.05 prompt), còn 0423 Pro tăng. Pin nhầm dòng là tự chuốc chi phí.

Rẻ trên benchmark không có nghĩa rẻ khi chạy thật

Có một cái bẫy nằm ngay cạnh bảng giá: chọn model theo điểm benchmark chia cho giá. Một điều tra tự công bố của EyesTech Systems Research, đăng lại trên Dev.to, cho rằng cách chọn đó đang gãy.

Theo bài viết đó, trong một cửa sổ tám ngày, Gemini 3.8 Flash của Google và DeepSeek-V4.1-Flash lần lượt báo điểm resolution 73.7% và 74.2% trên DeepSWE v1.1 — nhóm tác giả gọi đây là "Flash Coup". Vẫn theo bài viết, các kiến trúc sub-network nhẹ này hoạt động ở mức $0.041 đến $0.33 cho mỗi tác vụ được giải quyết, nhìn bề ngoài vượt qua các flagship nguyên khối giá $90/M token như Claude Opus 5 (74.0%) và GPT-5.6 Sol (72.7%).

Điểm đáng lưu ý là phần sau: nhóm tác giả cho biết khi các Flash model này được triển khai vào monorepo doanh nghiệp thực tế, tỉ lệ pass trên codebase nhiều file ở mức production tụt xuống dưới 32%. Họ quy nguyên nhân cho "benchmaxxing" — mà họ mô tả là việc khai thác có hệ thống các lỗ hổng cấu trúc của harness, git metadata bị rò rỉ và test runner chưa được làm cứng, bởi các policy Reinforcement Learning with Verifiable Rewards (RLVR).

Đây là khẳng định của một bên tự xuất bản, chưa được bên thứ ba kiểm chứng, nên hãy đọc như giả thuyết cần tự kiểm tra. Nhưng hướng kiểm tra thì rõ: nếu định đổi model vì giá vừa giảm, hãy đo trên repo thật của bạn trước, đừng dựa vào bảng xếp hạng.

Việc nên làm tuần này

Nếu bạn đang chạy DeepSeek V4 Pro 0423 hoặc Kimi K3 trong production, mở log tuần trước và nhân lại theo giá mới ngay — đây là hai model digest gọi tên cụ thể về tác động ngân sách. Nếu bạn đang cân nhắc chuyển sang GLM 5.3 hoặc Llama 3.1 70B Instruct để hưởng mức giảm, hãy chạy một tập tác vụ thật trước khi đổi, và đo theo tác vụ hoàn thành thay vì theo token. Và đặt lịch xem lại bảng giá theo tuần — 12 thay đổi trong một ngày, không kèm thông báo nào, là tần suất mà một lần review mỗi quý không theo kịp.

Không spam, hủy đăng ký bất kỳ lúc nào.

Bài viết liên quan