
Chi phí thật khi chạy LLM local 24/7: điện, khấu hao, cost/query
Pi 5 chạy inference ăn 7-9 W, khoảng 5.8 kWh mỗi tháng. Công thức tính cost per query và điểm hòa vốn giữa self-host và API cloud cho dev Việt.

Pi 5 chạy inference ăn 7-9 W, khoảng 5.8 kWh mỗi tháng. Công thức tính cost per query và điểm hòa vốn giữa self-host và API cloud cho dev Việt.

Chuỗi do model sinh ra làm cache key là bug data-isolation chờ sẵn. Bốn thuộc tính bắt buộc của key, danh sách red flag, và lỗi tương tự ở tầng tool routing.

Model 35 tỷ tham số chạy CPU-only qua GGUF, 1,07 triệu lượt tải sau 7 tuần. Cách đọc đúng số liệu và checklist kiểm tra trước khi đưa vào pipeline.

Vòng lặp agent ngây thơ hỏng vì kiến trúc, không phải prompt. Kiến trúc OPVC, cổng verify hai lớp và một FSM đã cứu buổi phỏng vấn hỏng 20% số lần.

Token stream mượt ở local nhưng dồn một cục trên production? Nguyên nhân là buffer ở nginx, gzip, CDN và chính code bạn — cách đo và sửa từng lớp.

Ngày 13/9/2026 có 12 thay đổi giá token: DeepSeek V4 Pro tăng hơn gấp đôi, GLM 5.3 và Llama 3.1 70B giảm. Cách tính lại chi phí model cho team.

Hai bài đo chi phí mới: Colab Pro thành 1,43 USD mỗi giờ GPU hữu ích, ba subscription coding 540 USD/năm. Số liệu để bạn tính lại điểm hoà vốn.

iOS 26 mở Apple Intelligence qua Foundation Models, Android chạy Gemini Nano qua ML Kit. Một API TypeScript cho cả hai, và các giới hạn cần biết trước.

Apple công bố M5 Ultra với 512GB unified memory ở 1.2TB/s và M6 2nm. Khung quyết định cho dev VN: khi nào chạy LLM local rẻ hơn thuê cloud GPU.

Output đắt hơn input 3–10 lần. Ba đòn bẩy có số liệu để cắt hóa đơn: định tuyến theo task, cache prefix, và dừng agent run sớm — kèm giới hạn.

Ba lớp ép LLM trả JSON đúng cấu trúc, vì sao JSON mode chưa đủ, và vòng repair lấy chính thông báo lỗi của parser làm input để sửa kết quả.

Một tuần thử Ollama trên MacBook Pro M3 36GB với VS Code: Gemma 4 26B và gemma4:31b-mlx chạy tốt, nhưng vòng lặp agent nhiều bước vẫn quá chậm.