
Chi Phí Thật Khi Tự Host Speech-to-Text: Whisper Có Rẻ Hơn API?
Tự host Whisper hay Parakeet nghe rẻ vì checkpoint miễn phí, nhưng GPU idle, diarization, streaming và ca trực mới là chi phí thật so với API quản lý.
Team bạn vừa tính xong hoá đơn AssemblyAI tháng này và có người hỏi: sao không tự host Whisper cho rẻ? Checkpoint tải miễn phí, pip install, trỏ vào file audio, xong trong một buổi chiều. Câu hỏi đúng hơn là: chi phí thực sự để chạy endpoint đó trong hai năm tới là bao nhiêu?
Giá niêm yết là 0, tổng chi phí sở hữu thì không
Một checkpoint ASR — Whisper Large-v3, Parakeet, Voxtral — chỉ là một phần của sản phẩm transcription, không phải toàn bộ sản phẩm. Khi bạn trả tiền cho API quản lý, khoản đó bao gồm cả phần bạn phải tự xây nếu self-host: hạ tầng inference, xử lý audio nhiễu ngoài đời thực, phân tách người nói (diarization), format entity, streaming, và ca trực 2 giờ sáng khi có sự cố. Tải checkpoint về là bạn nhận luôn toàn bộ phần đó.
Theo bài so sánh chi phí self-hosting của AssemblyAI, một GPU on-demand loại A100/H100 chạy khoảng $2–4+/giờ, và bạn trả tiền dù GPU có đang xử lý audio hay không — một GPU chỉ dùng hết 15% công suất vẫn bị tính phí như đang chạy 100%. Trong khi đó API quản lý như AssemblyAI tính phí theo giây audio thực tế xử lý, với mức khoảng $0.15–$0.21/giờ cho transcription bất đồng bộ, và $0.15–$0.45/giờ cho streaming.
Bảng so sánh nhanh
| Hạng mục | Tự host (Whisper, Parakeet, Voxtral) | API quản lý (AssemblyAI) |
|---|---|---|
| Chi phí model | $0 — trọng số mở, không phí license | $0 để bắt đầu, sau đó trả theo mức dùng |
| Bạn thực sự trả cho | Giờ GPU (tính phí cả lúc rảnh), cộng thời gian kỹ sư và DevOps | Chỉ audio thực xử lý, tính theo giây |
| Chi phí vận hành điển hình | ~$2–4+/giờ mỗi GPU A100/H100 on-demand, bất kể mức sử dụng | $0.15–$0.21/giờ bất đồng bộ; $0.15–$0.45/giờ streaming |
| Diarization | Phải tự xây hoặc ghép model riêng | Có sẵn, transcript và speaker được tạo cùng lúc |
| Streaming | Tự xây lớp serving độ trễ thấp | API streaming gốc, partial transcript khoảng 300ms |
Những chi phí ẩn không nằm trong giá checkpoint
Diarization (ai nói câu nào) hầu hết checkpoint mã nguồn mở không làm sẵn — bạn phải ghép thêm một model riêng, và phần này dễ vỡ nhất ở đúng chỗ quan trọng: lượt nói ngắn, ngắt lời, chồng tiếng. Streaming cũng vậy: phần lớn checkpoint mở chỉ chạy bất đồng bộ, nên nếu sản phẩm cần real-time (voice agent, phụ đề trực tiếp), bạn tự xây toàn bộ lớp streaming — chia chunk, xử lý partial hypothesis, endpointing.
Entity accuracy là chỗ dễ bị bỏ qua nhất. Người dùng đọc số thẻ tín dụng, email, mã xác nhận qua điện thoại — chỉ cần sai một ký tự là transcript vô dụng. Một checkpoint thô transcribe được từ ngữ, nhưng không tự động format đúng một chuỗi mã xác nhận đọc rời rạc qua điện thoại. Muốn có tính năng này, team phải tự xây và bảo trì vĩnh viễn, hoặc trả tiền một lần cho bên đã làm sẵn.
Ai gánh cái pager lúc 2 giờ sáng
Demo buổi chiều chạy trên một GPU phục vụ một request. Production là câu chuyện khác: concurrency ở quy mô thật, retry và graceful degradation, nâng cấp version không downtime, giám sát uptime. Khi tự host, toàn bộ bề mặt vận hành này thuộc về team bạn — ai đó phải cầm pager. Ngược lại, một nền tảng quản lý xử lý hàng trăm triệu lượt inference mỗi tháng với concurrency không giới hạn và không rate limit, vì độ tin cậy ở quy mô lớn chính là sản phẩm họ đang bán.
Rủi ro lớn nhất nằm ở độ chính xác trên audio thật: cuộc gọi trong xe, call center nhiều người nói chồng, thuật ngữ ngành mà model chưa từng thấy. Đây là chỗ hallucination xuất hiện — model tự bịa ra chữ khi gặp khoảng lặng hoặc tiếng ồn, nghe trôi chảy nhưng sai hoàn toàn. Theo dữ liệu benchmark nội bộ mà AssemblyAI công bố, model Universal-3 Pro của họ có tỷ lệ hallucination thấp hơn khoảng 30% so với Whisper trong phép thử của chính họ — đây là số liệu tự công bố từ phía vendor, không phải benchmark độc lập, nên nên xem là điểm tham khảo chứ không phải kết luận cuối cùng. Cùng nguồn này cũng dẫn một ví dụ cụ thể: Voxtral Mini đạt gần 18% word error rate trên audio code-switching (chuyển ngôn ngữ giữa câu), so với dưới 8% của một model quản lý flagship theo phép đo của họ.
Khi nào tự host là lựa chọn đúng
Không phải lúc nào self-host cũng sai. Ba trường hợp tự host hợp lý: đang nghiên cứu hoặc làm prototype cần toàn quyền kiểm soát model; chạy batch job offline khối lượng lớn, độ trễ không quan trọng và GPU giữ được mức sử dụng cao liên tục — đây là lúc bài toán kinh tế đảo chiều có lợi cho self-host; hoặc có yêu cầu bắt buộc dữ liệu không rời khỏi hạ tầng nội bộ. Nếu team không rơi vào ba trường hợp trên, phần "miễn phí" của model chính là dòng chi phí đắt nhất trong roadmap — chỉ là nó không hiện trên hoá đơn.
Việc cần làm tiếp theo
So sánh đúng không phải giá model so với giá API — mà là tổng chi phí có tải đầy đủ của việc tự vận hành (GPU, kỹ sư, hệ thống eval, ca trực) so với hoá đơn tính theo giây mà bên khác chịu trách nhiệm vận hành. Trước khi quyết định, hãy chạy thử cả hai hướng trên chính bộ audio khó nhất của bạn — file nhiễu, có giọng địa phương, nhiều thuật ngữ chuyên ngành. Đó mới là benchmark quyết định, không phải con số trên trang so sánh của bất kỳ vendor nào.
Không spam, hủy đăng ký bất kỳ lúc nào.


