
Tự host LLM hay dùng API: tính điểm hòa vốn trước khi mua GPU
Công thức TCO hai vế, ví dụ hòa vốn 7.200 USD so với 4.283 USD mỗi tháng, và lý do bảng giá API tháng 9/2026 làm dịch chuyển ngưỡng đó cho team VN.
Hóa đơn API tháng này lại vượt budget, và ai đó trong team bắt đầu nói câu quen thuộc: "hay mình mua GPU tự host cho rẻ". Câu hỏi đúng không phải rẻ hơn hay không, mà là hòa vốn ở mức bao nhiêu token mỗi tháng.
Bài này lấy bộ công thức TCO và ví dụ hòa vốn từ một guide self-hosted LLM mới, rồi đối chiếu với giá API thực tế của launch week tháng 9/2026 — để bạn tính được ngưỡng của chính mình trước khi ký PO mua hardware.
Hai công thức, và chỗ team hay bỏ sót
Guide đặt bài toán bằng hai vế rất gọn:
Cloud API TCO = input-token charges + output-token charges + storage + networking + premium features
Self-hosted TCO = hardware amortization + power + hosting + engineering + monitoring + support
Vế trái ai cũng tính được vì nó nằm trên invoice. Vế phải là chỗ sai số dồn vào. Guide liệt kê năm nhóm chi phí phải đưa vào TCO: compute hardware (accelerator, CPU, memory, networking, redundant storage), infrastructure operations (điện, làm mát, rack space, bảo trì, linh kiện thay thế), software operations (model serving, request routing, logging, backup, security update), engineering labor (tối ưu, evaluation, incident response, capacity planning), và availability requirements (node dự phòng, failover cho production).
Khi được hỏi chi phí ẩn lớn nhất là gì, guide trả lời thẳng: engineering labor thường bị đánh giá thấp. Inference chạy ổn định đòi hỏi monitoring, patching, evaluation, capacity management và incident response — toàn bộ là người, không phải card đồ họa.
Guide cũng nhấn một điểm mà nhiều team VN bỏ qua: request volume một mình không đủ để quyết định. Phải đo thêm token throughput, context length, latency target và hardware utilization.
Lưu ý về nguồn: guide này do một bên bán giải pháp private LLM xuất bản, nên các con số bên dưới nên đọc như kịch bản minh họa của họ, không phải khảo sát độc lập. Công thức thì dùng được; con số thì phải thay bằng số của bạn.
Ví dụ hòa vốn: 7.200 USD so với 4.283 USD
Guide dựng một kịch bản minh họa cụ thể. Ứng dụng xử lý 1,2 tỷ billable token mỗi tháng ở blended rate 6 USD mỗi triệu token, tức khoảng 7.200 USD tiền API hàng tháng.
Phía self-host, hardware giá 48.000 USD khấu hao 36 tháng:
| Khoản mục | USD/tháng |
|---|---|
| Khấu hao hardware | 1.333 |
| Điện và hosting | 450 |
| Engineering, monitoring, support | 2.500 |
| Tổng self-hosted | 4.283 |
| API tương đương | 7.200 |
Chênh lệch khoảng 2.917 USD mỗi tháng nghiêng về self-host — nhưng guide ghi rõ đây là con số trước chi phí redundancy và financing. Và câu quan trọng nhất nằm ngay sau đó: nếu utilization rớt một nửa, cloud API có thể trở lại rẻ hơn.
Đó là bản chất của bài toán. Self-host là chi phí cố định, API là chi phí biến đổi. Bạn không mua GPU để rẻ hơn, bạn mua GPU để đổi rủi ro biến động lấy rủi ro utilization.
Mức 6 USD/1M token không còn mô tả đúng thị trường
Đây là chỗ ví dụ của guide cần cập nhật, và nó dịch chuyển điểm hòa vốn mạnh. Theo bảng so sánh launch week tháng 9/2026, giá list mỗi triệu token hiện trải rất rộng:
| Model | Input / 1M | Output / 1M |
|---|---|---|
| GPT-6 Astra | $10.00 | $50.00 |
| Claude Fable 5.1 | $10.00 | $50.00 |
| Gemini 3.8 Flash | $0.75 (promo) | $3.75 (promo) |
Giá promo của Gemini 3.8 Flash áp dụng đến 31/12/2026; sau đó Google niêm yết $1.50/$7.50 — vẫn chỉ bằng một phần nhỏ hai model còn lại. Nghĩa là "blended 6 USD" nằm đâu đó giữa hai thái cực, và điểm hòa vốn của bạn phụ thuộc gần như hoàn toàn vào việc workload của bạn thực sự cần tier nào.
Đây là phân tích, không phải số liệu từ nguồn: nếu phần lớn traffic của bạn là task đơn giản chạy được trên tier rẻ, blended rate thực tế tụt xuống rất sâu và ngưỡng hòa vốn self-host bị đẩy lên cao hơn nhiều so với ví dụ 1,2 tỷ token. Ngược lại, nếu toàn bộ traffic buộc phải chạy tier $10/$50, ngưỡng đó tụt xuống nhanh.
Một biến nữa cần cân: throughput đo được trong cùng bảng so sánh là ~305 tok/s cho Gemini 3.8 Flash, ~87 tok/s cho Astra và ~67-69 tok/s cho Fable 5.1. Nếu latency là ràng buộc sản phẩm, nó tham gia vào quyết định ngang với giá.
Đo sáu con số trước khi mua hardware
Guide đưa danh sách cần ghi lại trước khi mua: token input và output hàng tháng, peak concurrency, context length, latency objective, model memory requirement, và tăng trưởng dự kiến. Sau đó test model dự định dùng với prompt thật và đúng quantization setting.
Về quantization, guide mô tả nó là biểu diễn model weight bằng ít bit hơn: giảm memory requirement và tăng throughput, nhưng nén quá mạnh có thể ảnh hưởng chất lượng response. Đừng lấy benchmark của bản full precision để justify một cấu hình bạn sẽ chạy ở mức nén cao hơn.
Guide cũng cảnh báo: benchmark bằng prompt đại diện là bắt buộc, vì context dài, batch lớn và workload nặng output làm thay đổi cả API spending lẫn local throughput.
Khi self-host thắng dù không rẻ hơn
Guide nói rõ self-hosting hấp dẫn khi token volume ổn định và hardware utilization đủ cao để chi phí hạ tầng tháng thấp hơn hóa đơn API tương đương. Nhưng nó cũng liệt kê nhóm trường hợp mà tiền không phải lý do chính: bảo mật, vận hành offline, latency xác định, hoặc data residency là yêu cầu bắt buộc.
Với team VN làm sản phẩm cho ngân hàng, bảo hiểm hay y tế, đây thường là vế quyết định. Guide mô tả private infrastructure giữ prompt, tài liệu retrieve được, embedding và response sinh ra bên trong môi trường kiểm soát được, đồng thời cho phép team kiểm soát model version, retention policy, access permission và lịch update.
Đổi lại, guide thừa nhận cloud service giảm khối lượng bảo trì — nhưng thay đổi giá, rate limit, network latency và service dependency tạo ra bất định vận hành riêng của nó.
Checklist trước khi ký PO
- Ghi lại 6 con số guide liệt kê trong một tháng thật, không ước lượng từ một tuần cao điểm.
- Tính blended rate thật của bạn, không lấy giá tier cao nhất. Chênh lệch giữa $0.75 và $10 input quyết định toàn bộ bài toán.
- Cộng engineering labor vào TCO trước, không cộng sau. Trong ví dụ của guide, 2.500 USD nhân sự lớn gần gấp đôi khấu hao hardware.
- Chạy kịch bản utilization rớt 50% trước khi duyệt. Guide nói ở mức đó API có thể rẻ hơn trở lại.
- Tách câu hỏi compliance ra khỏi câu hỏi chi phí. Nếu data residency là bắt buộc, điểm hòa vốn không còn là tiêu chí quyết định.
Việc cần theo dõi tiếp: giá promo Gemini 3.8 Flash hết hạn 31/12/2026 và mức niêm yết sau đó là $1.50/$7.50. Nếu bạn đang tính hòa vốn dựa trên giá promo, hãy tính lại kịch bản sau ngày đó trước khi cam kết hardware 36 tháng.
Không spam, hủy đăng ký bất kỳ lúc nào.
Bài viết liên quan


Sora API dừng ngày 24/09/2026: checklist cần làm ngay
02 thg 9, 2026