Bỏ qua để vào nội dung chính
Chi phí AI coding assistant 2026: free tier, $10 hay local?

Chi phí AI coding assistant 2026: free tier, $10 hay local?

Bởi Hannah Cooper
18 thg 9, 20266 phút đọc

Bảng giá Qwen Code, Copilot, Cursor 2026 và số đo latency, pin, RAM của ba assistant chạy local trên MacBook Air M2 — khung chọn cho dev Việt.

Bạn trả $10 mỗi tháng cho GitHub Copilot và vẫn thấy hoá đơn API tăng đều mỗi quý. Hoặc bạn đã thử chạy model local một lần, gõ xong hai giây ghost text mới hiện, rồi gỡ luôn.

Bài này đưa ra một khung chọn dựa trên hai bộ số liệu mới: bảng giá 2026 của ba công cụ phổ biến, và một thử nghiệm đo latency thực tế của ba assistant chạy local trên MacBook Air.

Bốn mức giá, bốn kiểu ràng buộc khác nhau

Trước khi so chất lượng, hãy so cái bạn bị ràng buộc. Bảng giá dưới đây lấy từ một bài so sánh 2026 của Lieke Tech (bản cập nhật tháng 8/2026):

Công cụFree tierGói trả phíGiá API (mỗi triệu token)
Qwen Code CLI1.000 request/ngày$0,99/tháng (Coding Plan Lite)Không áp dụng (CLI)
Qwen3-Coder API70 triệu tokenTrả theo dùng, từ $0,20/M$0,20 / $1,00
GitHub Copilot2.000 completion/tháng$10-$100/thángTính theo credit
CursorBản dùng thử 2 tuần$20/tháng (Pro)$20/tháng đã gồm usage
Claude CodeChỉ bản dùng thử$20/tháng (Pro)$3 / $15 (Sonnet)

Điểm đáng chú ý không nằm ở con số tuyệt đối mà ở đơn vị tính. Qwen Code CLI tính theo request, không tính token — bài so sánh ghi rõ "No token consumption — request-based, not token-based", kèm giới hạn 60 request mỗi phút. Copilot năm 2026 đã chuyển sang mô hình credit cho phần chat/agent, trong khi code completion vẫn không giới hạn trên gói trả phí. Cursor gộp usage vào giá tháng nhưng model premium tính thêm.

Với một dev Việt Nam, khác biệt này quan trọng hơn giá niêm yết: gói tính theo request cho bạn chi phí cố định và dự đoán được; gói tính theo token cho bạn chi phí thấp khi dùng ít nhưng không có trần.

Free tier thật sự cho bạn được bao nhiêu

Ba con số đáng nhớ từ bảng trên. Qwen Code CLI: 1.000 request/ngày cho bản quốc tế (2.000 ở Trung Quốc), theo bài so sánh là không hết hạn và không cần thẻ tín dụng. Copilot: 2.000 completion mỗi tháng. Qwen3-Coder API: 70 triệu token trong 180 ngày cho tài khoản Alibaba Cloud quốc tế mới.

1.000 request/ngày nghe rất nhiều, nhưng nhớ rằng một phiên agent CLI tiêu một request cho mỗi lượt trao đổi, không phải mỗi ngày làm việc. Nếu bạn dùng agent để refactor nhiều file, trần 60 request/phút sẽ chạm trước trần 1.000/ngày.

Một lưu ý về nguồn: trang so sánh này bán credit Alibaba Cloud (kèm lời mời "70M Free Tokens + $200 Credit"), nên hãy đọc các con số ưu ái Qwen ở đó như số liệu của bên bán, không phải kiểm định độc lập.

Nếu chạy local: bốn chỉ số, một cấu hình máy

Đây là phần thường bị nói chung chung. Một dev đã chạy thử nghiệm có kiểm soát — cùng một chiếc MacBook Air M2 đời 2023, cùng một monorepo Python/TypeScript 50.000 dòng, mỗi công cụ dùng một tuần — và công bố số đo:

Chỉ sốContinue + Codestral 22BTabby (StarCoder2 7B)Ollama + DeepSeek-Coder 6.7B
Latency trung bình1,2s0,4s0,8s
Tỷ lệ chấp nhận gợi ý31%19%27%
Hao pin mỗi giờ18%8%11%
RAM chiếm dụng14GB4GB6GB
Chạy offline

Latency được đo bằng VS Code telemetry, tính từ lúc con trỏ dừng đến lúc ghost text hiện ra. Tỷ lệ chấp nhận lấy từ analytics có sẵn của Continue, các công cụ còn lại ghi tay.

Đọc bảng này theo cặp, đừng đọc từng cột. Tabby nhanh gấp ba Continue nhưng tỷ lệ chấp nhận chỉ 19% — tác giả mô tả gợi ý của nó "noticeably dumber", ví dụ hoàn thành def calculate_ thành def calculate_something(self) trong khi Continue đọc docstring và đoán đúng chữ ký hàm. Đổi lại, Continue ngốn 14GB RAM và 18% pin mỗi giờ, tức là trên một máy 16GB bạn gần như không còn chỗ cho Docker hay trình duyệt.

Chính tác giả không chọn một công cụ duy nhất: anh chạy Tabby cho boilerplate và Continue + Codestral cho logic, gán hai phím tắt trong keybindings.json để chuyển qua lại.

Chọn theo ba câu hỏi, không theo bảng xếp hạng

Đây là phân tích của chúng tôi dựa trên hai bộ số liệu trên, không phải khuyến nghị từ nguồn:

  1. RAM máy bạn là bao nhiêu? Dưới 16GB thì cửa local hẹp lại chỉ còn nhóm model 4GB (Tabby, DeepSeek-Coder 6.7B). Con số 14GB của Continue là chỉ số quyết định, không phải latency.
  2. Bạn làm việc trên máy cắm điện hay chạy pin? Chênh lệch 8% so với 18% pin mỗi giờ nghĩa là một buổi cà phê bốn tiếng có thể hết pin với cấu hình nặng.
  3. Chi phí của bạn cần cố định hay cần thấp? Cần dự đoán được thì chọn gói tháng (Copilot $10, Cursor $20). Cần thấp và chấp nhận biến động thì chọn API tính theo token hoặc free tier tính theo request.

Một lối đi thực tế cho dev Việt Nam: giữ một công cụ local nhẹ cho completion hằng ngày (chi phí bằng không, chạy được khi mạng chập chờn), và chỉ mở gói trả phí hoặc API cho việc refactor nhiều file — đúng phần mà theo bảng so sánh, Cursor được đánh giá "Excellent" còn Copilot chỉ "Limited".

Những con số cần tự kiểm chứng trước khi tin

Bài so sánh đưa ra vài tỷ lệ rất mạnh: rằng Qwen3-Coder API "costs 25x less than running GPT-4o through Copilot for equivalent token usage", và trong bảng tính 10 triệu token/tháng thì Qwen3-Coder 480B "is 9x cheaper than GPT-4o and 12x cheaper than Claude Sonnet". Đây là tính toán của tác giả bài đó, dựa trên giả định 80% input / 20% output.

Hai điều cần kiểm trước khi lấy con số này vào slide nội bộ: tỷ lệ input/output thực tế của team bạn có đúng 80/20 không, và giá niêm yết có còn đúng ở thời điểm bạn đọc không. Bảng giá này ghi "updated August 2026".

Việc nên làm tuần này

Đo trước, đổi sau. Bật analytics của công cụ bạn đang dùng và ghi lại tỷ lệ chấp nhận gợi ý trong một tuần — đó là con số duy nhất nối chi phí với giá trị thực nhận. Nếu tỷ lệ của bạn thấp hơn mức 31% mà thử nghiệm trên ghi nhận cho cấu hình tốt nhất, vấn đề nhiều khả năng nằm ở context bạn cấp cho model, không phải ở gói bạn đang trả tiền.

Điều đáng theo dõi: Copilot đã chuyển phần agent sang tính theo credit. Nếu bạn dùng chế độ agent nhiều, hãy xem lại hoá đơn tháng tới trước khi kết luận gói $10 vẫn là gói rẻ nhất.

Không spam, hủy đăng ký bất kỳ lúc nào.

Bài viết liên quan