Chạy LLM on-device trong app Capacitor: iOS 26 và Gemini Nano
iOS 26 mở Apple Intelligence qua Foundation Models, Android chạy Gemini Nano qua ML Kit. Một API TypeScript cho cả hai, và các giới hạn cần biết trước.
EGGROLL, Unrolled: Understanding and Improving Low-Rank Evolution Strategies at Scale
What a Random Draw from the MCP Registry Contains, and What Tool-Use Benchmarks Contain Instead
Robust Multimodal Sentiment Analysis with Incomplete Modalities via Semantic-aware Completeness based Reconstruction
Generative models
OpenAI technical goals
Concrete AI safety problems
Machine Learning Unconference
Infrastructure for deep learning
2.114 lần chạy headless, 41 lần báo thành công nhưng không làm gì cả. Năm nguyên nhân đo được và bốn luật guard để job cron fail cho ra fail.
Phép đo trên Claude Code v2.1.263 cho thấy tool search giữ 40.170 token định nghĩa MCP ngoài prompt. Khi nào nên tắt, và vì sao auto:5 phản tác dụng.
Apple công bố M5 Ultra với 512GB unified memory ở 1.2TB/s và M6 2nm. Khung quyết định cho dev VN: khi nào chạy LLM local rẻ hơn thuê cloud GPU.
Bốn endpoint, stateless transport, 401 phải kèm WWW-Authenticate, và một đòn chiếm token mà PKCE không chặn được. Ghi chú từ một triển khai thật.
Test do AI sinh ra mà kiểm chứng sai còn tệ hơn không có test. Khung 8 chiều và 4 nhánh: giao AI viết, chỉ cho AI gõ, hay chưa nên tự động hoá.
Apple mới nêu đích danh 8 trong 16 ngôn ngữ của Siri mới, không có tiếng Việt. Đây là cách đọc đúng con số đó trước khi bạn quyết định đổi máy.
Coding agent sửa test đỏ bằng cách xoá nó. Một cổng chặn đọc HEAD và đếm assertion bằng AST bắt được việc đó — không cần thêm lần gọi model.
Output đắt hơn input 3–10 lần. Ba đòn bẩy có số liệu để cắt hóa đơn: định tuyến theo task, cache prefix, và dừng agent run sớm — kèm giới hạn.
Từ 15/9 Cloudflare chặn traffic agent theo mặc định trên free-tier và domain mới. Danh sách user-agent cần allow, bẫy block training, và cách đọc report AI.
Eval phẳng qua 3-4 lần sửa, task hẹp, vài nghìn labelled run — bộ tín hiệu để biết khi nào prompting hết đường và khi nào fine-tune mới đáng.
Hai chỗ token biến mất mà dashboard không báo: tool call kéo theo lịch sử, và prefix prompt tự phá cache. Cách đo bằng trace và ba field telemetry.
Thí nghiệm đo bằng golden set: recall@1 chỉ 6/10 dù recall@3 đạt 10/10, và chunk theo AST mới cứu được retrieval cho code — không phải reranker.
Ba lớp ép LLM trả JSON đúng cấu trúc, vì sao JSON mode chưa đủ, và vòng repair lấy chính thông báo lỗi của parser làm input để sửa kết quả.
Ba lớp quyết định việc AI search trích dẫn bạn: access, extractability, trust. Kèm dữ liệu 10.099 store Shopify cho thấy cái bẫy copy robots.txt.
Số đo thật từ một issue chia thành DAG cho agent chạy song song: 14m40s xuống 10m22s, vì sao chọn barrier thay vì eager, và các chi phí đi kèm.
Một tuần thử Ollama trên MacBook Pro M3 36GB với VS Code: Gemma 4 26B và gemma4:31b-mlx chạy tốt, nhưng vòng lặp agent nhiều bước vẫn quá chậm.
DeepSeek chuyển V4 Pro sang giá theo giờ UTC, Sol có hạn promotional 21/11, Astra đẩy index +29% trong một ngày. Cách đọc lại giá theo tier.