Bỏ qua để vào nội dung chính
Chạy Claude Code bằng free LLM API: cấu hình 2 biến là xong

Chạy Claude Code bằng free LLM API: cấu hình 2 biến là xong

Bởi Isabella Chen
05 thg 10, 20264 phút đọc

Trỏ Claude Code sang free LLM API tier chỉ với hai biến môi trường, kèm bảng so sánh provider và router failover để job nền không chết khi gặp 429.

Bạn mở billing dashboard cuối tháng và thấy phần lớn chi phí đến từ agent chạy nền, không phải từ lúc bạn ngồi code. Một retry loop lúc 2 giờ sáng ăn hết budget của side project chưa ra đồng doanh thu nào. Bài này chỉ cách trỏ Claude Code sang free LLM API tier — hai biến môi trường, không phải đổi workflow.

Hai biến môi trường là toàn bộ phần cấu hình

Claude Code đọc hai biến để override backend. Hướng dẫn gốc đưa đúng cặp này:

export ANTHROPIC_BASE_URL="https://generativelanguage.googleapis.com/v1beta/openai"
export ANTHROPIC_AUTH_TOKEN="your-google-ai-studio-key"

Endpoint ở trên là lớp OpenAI-compatible của Google AI Studio, nên Claude Code nói chuyện với Gemini qua đúng schema nó đã biết. Lấy key mất khoảng hai phút: vào aistudio.google.com hoặc console.groq.com, đăng nhập, tạo API key — tác giả hướng dẫn nhấn mạnh là không bị hỏi thẻ tín dụng.

Chọn provider nào trước

Hướng dẫn liệt kê các free tier vĩnh viễn, không cần credit card, kèm nhận định của chính tác giả về từng bên:

ProviderModel nổi bật (theo tác giả)Lý do tác giả chọn
Google AI StudioGemini 2.5 Flash (1M context, multimodal)Free tier mạnh nhất, 500 req/day
GroqLlama 3.3 70B, gpt-oss-120bInference nhanh nhất, latency rất thấp
NVIDIA NIM100+ open model (DeepSeek R1/V3, Llama)Nhiều lựa chọn, một API key
OpenRouter35+ free modelMột key, một endpoint cho tất cả
MistralMistral Small/MediumKhoảng 1B token/tháng miễn phí

Đây là con số tác giả công bố, không phải rate limit chúng tôi đo lại — và chính tác giả cũng cảnh báo free tier thay đổi liên tục nên danh sách tĩnh nhanh lỗi thời. Khuyến nghị của bài gốc: chọn Google AI Studio nếu ưu tiên chất lượng model cho coding, chọn Groq nếu ưu tiên tốc độ.

Router failover là thứ bạn cần khi free tier trả 429

Một hướng dẫn thứ hai về chạy agent ở mức $0/tháng chỉ ra sai lầm phổ biến: hard-code một provider duy nhất. Kiến trúc tác giả đề xuất là đặt một router mỏng trước mọi lời gọi LLM — free tier A trả 429 hoặc 500 thì rơi sang free tier B, B hỏng thì rơi tiếp xuống local model, response thành công đầu tiên thắng.

Với free tier, failover không phải tối ưu hoá mà là điều kiện để chạy được. Rate limit theo ngày nghĩa là job nền của bạn sẽ chạm trần vào một thời điểm xác định, không phải ngẫu nhiên. Một router vài chục dòng, giữ thứ tự provider trong config thay vì trong code, xử lý được phần lớn trường hợp đó.

Những gì hai bài gốc không bảo chứng

Tác giả bài thứ hai khẳng định chạy được 95% autonomous agent, scraper và dev tooling ở mức $0.00/tháng, và mô tả mức chi phí điển hình bị thay thế là $50–$150/tháng. Đây là tuyên bố của tác giả, không phải số liệu benchmark độc lập — hãy đọc nó như một ước lượng, không phải cam kết.

Phần cần tự thẩm định trước khi đưa vào việc thật: data policy của từng free tier. Free tier thường đi kèm điều khoản sử dụng dữ liệu rộng hơn tier trả phí, nên code nội bộ của công ty không phải thứ nên đẩy qua đó mặc định. Và vì chất lượng model khác nhau, hãy dùng free tier cho vòng lặp rẻ — refactor, viết test, đọc log — rồi giữ tài khoản trả phí cho phần reasoning nặng.

Việc nên làm tiếp

Tạo một key Google AI Studio, export hai biến ở trên trong một shell riêng, rồi chạy Claude Code trên một repo throwaway để xem chất lượng có đủ cho loại task bạn hay giao không. Nếu đủ, viết router failover trước khi cắm free tier vào bất kỳ job nền nào. Và hãy coi cấu hình này là thứ cần kiểm lại hàng quý: free tier bị siết là chuyện thường.

Không spam, hủy đăng ký bất kỳ lúc nào.

Bài viết liên quan