
DeepSeek tăng giá, Claude Code đội chi phí: Dev VN nên làm gì?
DeepSeek tăng giá API, Claude Code có thể đội hoá đơn lên 1.500 EUR/tháng. 3 cách kiểm soát chi phí AI: chọn model, set spend cap, và cân nhắc tự host LLM.
Bạn thấy hoá đơn Claude Code tháng này tăng vọt lên hàng nghìn USD, trong khi DeepSeek — API rẻ bạn từng dùng để tiết kiệm chi phí — vừa thông báo tăng giá trên toàn bộ dịch vụ. Nếu team vẫn để model mặc định là Opus cho mọi task, chi phí sẽ tiếp tục leo thang mà không ai nhận ra. Bài này chỉ ra 3 lever cụ thể để kiểm soát chi phí AI ngay trong tháng này, từ chọn model đến tự host LLM.
Tín hiệu tăng giá: DeepSeek không còn là API rẻ nhất mãi
DeepSeek vừa ra thông báo "plans to raise DeepSeek API service pricing across the board soon; a relatively large increase is expected". Trước đó, DeepSeek từng đưa V4-Flash xuống mức $0,14/M input token — một trong những giá rẻ nhất thị trường. Đáng chú ý hơn, DeepSeek đã công bố cơ chế time-of-day pricing: trong hai khung giờ cao điểm (9h-12h và 14h-18h giờ Bắc Kinh), giá input token sẽ tăng gấp đôi từ $0,14/M lên $0,28/M, output từ $0,28/M lên $0,56/M. Chênh lệch giữa cached input ($0,0028/M) và cache-miss input ($0,14/M) lên tới 50 lần — nghĩa là cách bạn thiết kế prompt-prefix để tối ưu cache giờ quan trọng hơn cả việc chọn model rẻ.
Claude Code: hoá đơn có thể vượt 1.500 EUR/tháng nếu không kiểm soát
Theo một hướng dẫn dành cho CTO/team lead, một team 10 người dùng Claude Code không kiểm soát có thể "drain €1.500+ monthly". Chênh lệch giá giữa Sonnet và Opus theo tài liệu này là khoảng 5:1, nên chọn model là lever tác động lớn nhất. Với usage trung bình (40 calls/ngày, 4.000 input token, 800 output token, 22 ngày làm việc), team 10 người tiêu khoảng 18-22 triệu token/tháng — ở mức giá Sonnet, chi phí rơi vào 180-300 EUR/tháng; cùng usage đó chuyển sang Opus, hoá đơn tăng lên 900-1.500 EUR/tháng. Anthropic Console cho phép set hard cap chặn API call khi vượt ngưỡng, và soft warning ở mốc 70% budget — hai control này không đòi hỏi đổi cách dev làm việc hàng ngày.
Tự host Llama 3.3 70B: tiết kiệm nhưng cần hiểu rõ trade-off
Một hướng dẫn khác mô tả việc deploy Llama 3.3 70B qua vLLM kết hợp dynamic LoRA routing trên một GPU Droplet DigitalOcean giá $12/tháng (NVIDIA H100) hoặc $10/tháng (L40S). Tác giả claim hệ thống phục vụ được 50+ concurrent request và test với 500K token inference chỉ tốn dưới $1. So với Claude Opus ở $15/M input token, tác giả tính ra chi phí hệ thống tự host khoảng $0,11/M input token — claim "135x cheaper" này là số liệu tự đo của một bài blog cá nhân, chưa qua benchmark độc lập, nên chỉ nên coi là tín hiệu tham khảo cho workload có volume lớn và dữ liệu không quá nhạy cảm, không phải con số để thay thế toàn bộ Claude Code trong công việc hàng ngày.
3 việc nên làm trong tuần này
- Vào Anthropic Console xem usage per-API-key 2-4 tuần gần nhất, set Sonnet làm default trong CLAUDE.md, chỉ dùng Opus cho task reasoning phức tạp.
- Set hard spend cap ở mức budget tháng, kèm soft alert ở 70% — chặn rủi ro automated loop/agent mode chạy quá lâu đội token bất ngờ.
- Nếu team có workload batch/off-peak volume lớn (data synthesis, offline indexing), thử nghiệm self-host Llama hoặc chuyển batch job sang khung giờ off-peak của DeepSeek trước khi cam kết chuyển hẳn traffic production.
Không spam, hủy đăng ký bất kỳ lúc nào.


