
Ollama nạp lại model 214 lần/ngày: thủ phạm là keep_alive
Mặc định 5 phút idle của Ollama làm first token đội từ 0,9s lên 11,4s. Cách đếm số lần load, hai cái bẫy keep_alive, và cấu hình server-side đã sửa được.
llm-integration

Mặc định 5 phút idle của Ollama làm first token đội từ 0,9s lên 11,4s. Cách đếm số lần load, hai cái bẫy keep_alive, và cấu hình server-side đã sửa được.

Token stream mượt ở local nhưng dồn một cục trên production? Nguyên nhân là buffer ở nginx, gzip, CDN và chính code bạn — cách đo và sửa từng lớp.

Ngày 13/9/2026 có 12 thay đổi giá token: DeepSeek V4 Pro tăng hơn gấp đôi, GLM 5.3 và Llama 3.1 70B giảm. Cách tính lại chi phí model cho team.

iOS 26 mở Apple Intelligence qua Foundation Models, Android chạy Gemini Nano qua ML Kit. Một API TypeScript cho cả hai, và các giới hạn cần biết trước.

Cache_read_input_tokens bằng 0 nghĩa là bạn trả 1.25 lần giá input cho không gì cả. Cách đọc usage object, ba bug phá prefix và bài test chặn lỗi.

Bốn endpoint, stateless transport, 401 phải kèm WWW-Authenticate, và một đòn chiếm token mà PKCE không chặn được. Ghi chú từ một triển khai thật.

Output đắt hơn input 3–10 lần. Ba đòn bẩy có số liệu để cắt hóa đơn: định tuyến theo task, cache prefix, và dừng agent run sớm — kèm giới hạn.

Eval phẳng qua 3-4 lần sửa, task hẹp, vài nghìn labelled run — bộ tín hiệu để biết khi nào prompting hết đường và khi nào fine-tune mới đáng.

Thí nghiệm đo bằng golden set: recall@1 chỉ 6/10 dù recall@3 đạt 10/10, và chunk theo AST mới cứu được retrieval cho code — không phải reranker.

DeepSeek chuyển V4 Pro sang giá theo giờ UTC, Sol có hạn promotional 21/11, Astra đẩy index +29% trong một ngày. Cách đọc lại giá theo tier.

Công thức TCO hai vế, ví dụ hòa vốn 7.200 USD so với 4.283 USD mỗi tháng, và lý do bảng giá API tháng 9/2026 làm dịch chuyển ngưỡng đó cho team VN.

Bạn sắp cài một MCP server vào Cursor? 89% trong 675 server được audit rơi vào nhóm high-risk. Ba câu hỏi cần đọc trong README trước khi thêm config.