
DeepSeek tăng giá 3x theo giờ UTC: dev VN nên chạy job lúc nào
DeepSeek chuyển V4 Pro sang giá theo giờ UTC, Sol có hạn promotional 21/11, Astra đẩy index +29% trong một ngày. Cách đọc lại giá theo tier.

DeepSeek chuyển V4 Pro sang giá theo giờ UTC, Sol có hạn promotional 21/11, Astra đẩy index +29% trong một ngày. Cách đọc lại giá theo tier.

Công thức TCO hai vế, ví dụ hòa vốn 7.200 USD so với 4.283 USD mỗi tháng, và lý do bảng giá API tháng 9/2026 làm dịch chuyển ngưỡng đó cho team VN.

Công thức ước tính hoá đơn LLM trước khi build, bốn chỗ token rò rỉ không đánh đổi chất lượng, và ngưỡng volume mà self-host mới rẻ hơn API.

Chạy model rẻ trước, chấm output bằng gate cấu trúc, chỉ escalate khi trượt: cách một team cắt 71% hóa đơn LLM và cái giá phải trả ở p95, p99.

Mốc RAM 8/16/32 GB, ngưỡng VRAM 8 GB, nên cài app nào trước, và khi nào vẫn phải gọi cloud API thay vì chạy model ngay trên laptop của chính bạn.

Bộ thước ba câu hỏi để chia component nào giao cho LLM, component nào giữ code deterministic, và vì sao chính đường ranh đó phải là static lookup.

M5 Ultra có 1.2 TB/s băng thông và 512GB RAM. Qwen MoE 125B chỉ tốn 62GB ở 4-bit. Phân tích con số để biết khi nào mua máy rẻ hơn trả tiền API.

Đo thực tế trên 393 model: Anthropic chỉ cache khi bạn khai báo, OpenAI cache mặc định nhưng có ngưỡng 1.024 token. Cách bật và ba cái bẫy hay gặp.

CoSnitch dụ Copilot mô tả kiến trúc và security posture. Ba việc dev Việt cần làm: coi context như network segment, xem output LLM là untrusted, red team kiểu SE.

Vì sao LLM bịa? Cách thiết kế hệ thống LLM grounded và verifiable qua 5 lớp: prompt design, RAG, tool calling, structured output, verification.

Paper arXiv thử Nanbeige4.2-3B trên Apple Silicon: năm bug chặn checkpoint, chunked-prefill nới context 2,7 lần, và trần thật của agent chạy local.

Chatbot RAG tra cứu 300 project LLM Zoomcamp cho thấy: đếm và xếp hạng là bài toán SQL, không phải retrieval — nhầm là model trả lời sai tự tin.