
Prompt caching: giảm chi phí LLM 10x, đo trên 393 model API
Đo thực tế trên 393 model: Anthropic chỉ cache khi bạn khai báo, OpenAI cache mặc định nhưng có ngưỡng 1.024 token. Cách bật và ba cái bẫy hay gặp.
25 thg 8, 20266 phút đọc

Đo thực tế trên 393 model: Anthropic chỉ cache khi bạn khai báo, OpenAI cache mặc định nhưng có ngưỡng 1.024 token. Cách bật và ba cái bẫy hay gặp.

Cache write đắt hơn input thường 1.25-2 lần. Dưới hit rate ~22%, cache 5 phút đang khiến bill của bạn tăng, không giảm. Đây là cách tự đo hit rate thật.

Drizzle ORM has no built-in query cache. Learn to wrap Drizzle queries with ioredis in Next.js 16 and eliminate database round-trips in under 30 minutes.