
Chạy Claude Code bằng free LLM API: cấu hình 2 biến là xong
Trỏ Claude Code sang free LLM API tier chỉ với hai biến môi trường, kèm bảng so sánh provider và router failover để job nền không chết khi gặp 429.
Bạn mở billing dashboard cuối tháng và thấy phần lớn chi phí đến từ agent chạy nền, không phải từ lúc bạn ngồi code. Một retry loop lúc 2 giờ sáng ăn hết budget của side project chưa ra đồng doanh thu nào. Bài này chỉ cách trỏ Claude Code sang free LLM API tier — hai biến môi trường, không phải đổi workflow.
Hai biến môi trường là toàn bộ phần cấu hình
Claude Code đọc hai biến để override backend. Hướng dẫn gốc đưa đúng cặp này:
export ANTHROPIC_BASE_URL="https://generativelanguage.googleapis.com/v1beta/openai"
export ANTHROPIC_AUTH_TOKEN="your-google-ai-studio-key"
Endpoint ở trên là lớp OpenAI-compatible của Google AI Studio, nên Claude Code nói chuyện với Gemini qua đúng schema nó đã biết. Lấy key mất khoảng hai phút: vào aistudio.google.com hoặc console.groq.com, đăng nhập, tạo API key — tác giả hướng dẫn nhấn mạnh là không bị hỏi thẻ tín dụng.
Chọn provider nào trước
Hướng dẫn liệt kê các free tier vĩnh viễn, không cần credit card, kèm nhận định của chính tác giả về từng bên:
| Provider | Model nổi bật (theo tác giả) | Lý do tác giả chọn |
|---|---|---|
| Google AI Studio | Gemini 2.5 Flash (1M context, multimodal) | Free tier mạnh nhất, 500 req/day |
| Groq | Llama 3.3 70B, gpt-oss-120b | Inference nhanh nhất, latency rất thấp |
| NVIDIA NIM | 100+ open model (DeepSeek R1/V3, Llama) | Nhiều lựa chọn, một API key |
| OpenRouter | 35+ free model | Một key, một endpoint cho tất cả |
| Mistral | Mistral Small/Medium | Khoảng 1B token/tháng miễn phí |
Đây là con số tác giả công bố, không phải rate limit chúng tôi đo lại — và chính tác giả cũng cảnh báo free tier thay đổi liên tục nên danh sách tĩnh nhanh lỗi thời. Khuyến nghị của bài gốc: chọn Google AI Studio nếu ưu tiên chất lượng model cho coding, chọn Groq nếu ưu tiên tốc độ.
Router failover là thứ bạn cần khi free tier trả 429
Một hướng dẫn thứ hai về chạy agent ở mức $0/tháng chỉ ra sai lầm phổ biến: hard-code một provider duy nhất. Kiến trúc tác giả đề xuất là đặt một router mỏng trước mọi lời gọi LLM — free tier A trả 429 hoặc 500 thì rơi sang free tier B, B hỏng thì rơi tiếp xuống local model, response thành công đầu tiên thắng.
Với free tier, failover không phải tối ưu hoá mà là điều kiện để chạy được. Rate limit theo ngày nghĩa là job nền của bạn sẽ chạm trần vào một thời điểm xác định, không phải ngẫu nhiên. Một router vài chục dòng, giữ thứ tự provider trong config thay vì trong code, xử lý được phần lớn trường hợp đó.
Những gì hai bài gốc không bảo chứng
Tác giả bài thứ hai khẳng định chạy được 95% autonomous agent, scraper và dev tooling ở mức $0.00/tháng, và mô tả mức chi phí điển hình bị thay thế là $50–$150/tháng. Đây là tuyên bố của tác giả, không phải số liệu benchmark độc lập — hãy đọc nó như một ước lượng, không phải cam kết.
Phần cần tự thẩm định trước khi đưa vào việc thật: data policy của từng free tier. Free tier thường đi kèm điều khoản sử dụng dữ liệu rộng hơn tier trả phí, nên code nội bộ của công ty không phải thứ nên đẩy qua đó mặc định. Và vì chất lượng model khác nhau, hãy dùng free tier cho vòng lặp rẻ — refactor, viết test, đọc log — rồi giữ tài khoản trả phí cho phần reasoning nặng.
Việc nên làm tiếp
Tạo một key Google AI Studio, export hai biến ở trên trong một shell riêng, rồi chạy Claude Code trên một repo throwaway để xem chất lượng có đủ cho loại task bạn hay giao không. Nếu đủ, viết router failover trước khi cắm free tier vào bất kỳ job nền nào. Và hãy coi cấu hình này là thứ cần kiểm lại hàng quý: free tier bị siết là chuyện thường.
Không spam, hủy đăng ký bất kỳ lúc nào.
Bài viết liên quan

Dựng MCP server Python 20 dòng cho API nội bộ của bạn
04 thg 10, 2026
CLAUDE.md: viết gì, đặt ở đâu và kiểm tra Claude đã đọc
03 thg 10, 2026