
Spec file cho coding agent: NVIDIA đo được 19% lên 100%
NVIDIA công bố đánh giá 65 prompt: coding agent đạt 19% checklist khi không có skills, 100% khi có. Và cách chuyển taxonomy lỗi đó vào repo bạn.
Agent của bạn import một package không có trong lockfile, rồi bịa thêm một config key không tồn tại. Tuần sau nó lặp lại đúng lỗi đó. NVIDIA vừa đo được cái giá của việc không viết spec cho agent, và con số đủ lớn để bạn dành một buổi chiều viết lại rules file.
Con số: 19% lên 100% trên cùng một model
Ngày 1/10, team DOCA của NVIDIA publish bộ agent skills lên GitHub kèm bài đánh giá 65 prompt. Cùng agent, cùng model. Không có skills, agent thoả mãn 19% số mục checklist. Khi load skills, 100% trên cả 65 prompt. Không fine-tune, không đổi model — chỉ là bản đặc tả agent đọc được lúc inference.
Trong demo side-by-side, hai agent viết cùng một chương trình Go gửi traffic RDMA thật trên BlueField-3. Cả hai đều chạy được, nhưng agent có skills chỉ cần 189 dòng code viết tay so với 695 dòng, và phát 20 lệnh hardware thay vì 37. Con số dòng code đáng chú ý hơn điểm checklist: agent không có spec đang dò lại API bằng thử-sai, và mỗi lần thử là một vòng debug của bạn.
Taxonomy lỗi mới là phần đáng mang về
Phần hữu ích nhất là bảng phân loại lỗi khi agent chạy không có skills: bịa hoặc dùng sai API và flag (59/65 prompt), không verify capability phần cứng trước khi viết code (46/65), route sai tool — đúng mục tiêu nhưng sai công cụ (39/65), bỏ qua smoke test (34/65), đoán số version (30/65).
Đọc lại danh sách đó bằng con mắt web dev: flag bịa ra thành config key không tồn tại, capability không verify thành import từ version library bạn không ship, version đoán bừa thành lockfile nói dối.
Rules hay skills: khác nhau ở ngân sách context
Mỗi skill của NVIDIA là một thư mục xoay quanh file SKILL.md, mang function signature thật, yêu cầu capability phần cứng, ràng buộc build và các failure mode đã biết kèm cách xử lý. Định dạng theo spec mở agentskills.io, và theo NVIDIA thì cùng một SKILL.md chạy được trên Claude Code, Codex và Cursor.
Một bài thực chiến khác trên MuleSoft Vibes chốt ranh giới rõ hơn: rules luôn được load nên phải ngắn; skills chỉ load khi request khớp, nên có thể mang chi tiết, template và ví dụ mà không chiếm chỗ của mọi thứ khác. Heuristic của họ đáng chép vào wiki team: nếu một rule cần cả đoạn văn để giải thích, nó nên là một skill. Ở đó skills được commit cùng project, mỗi skill một folder có SKILL.md kèm references/, assets/, scripts/.
Viết gì vào repo của bạn
Cách chuyển nhanh nhất: lấy từng lớp lỗi ở trên và viết điều ngược lại thành ràng buộc. Ví dụ minh hoạ, không phải cấu hình copy-paste:
## Versions (không đoán)
- Đọc package.json trước khi import; không chắc key tồn tại thì đọc next.config.ts.
## Capability check trước khi code
- Dependency phải có trong package.json VÀ lockfile. Thiếu thì dừng và hỏi.
## Build truth
- Sau mỗi thay đổi config, chạy build một lần trước khi báo xong.
Điểm kiến trúc đáng mượn: tri thức nằm ở tầng agent đọc lúc runtime, nên khi API đổi, bạn update skill chứ không update model.
Chiết khấu con số này bao nhiêu
Tác giả bài phân tích nói thẳng: NVIDIA tự viết 65 prompt, tự viết checklist và tự chấm, còn chính blog post thừa nhận 100% là mức thoả mãn checklist chứ không phải phần mềm production hoàn hảo. DOCA cũng là trường hợp gần như tệ nhất cho model trần — SDK gắn chặt phần cứng, đổi nhanh, dữ liệu huấn luyện mỏng. Tác giả dự đoán hiệu ứng trên codebase React sẽ nhỏ hơn nhiều, và khuyên đừng mang tỉ số 19-lên-100 ra hứa với team lead.
Việc đáng làm tuần này: mở 5 PR gần nhất do agent viết, đếm xem bao nhiêu comment review rơi vào đúng năm lớp lỗi trên. Đó là baseline của riêng bạn, và là thứ duy nhất đáng đo lại sau khi thêm skills file.
Không spam, hủy đăng ký bất kỳ lúc nào.
Bài viết liên quan

Guard của Claude Code fail-open: một dòng catch đổi kết cục
05 thg 10, 2026
Chạy Claude Code bằng free LLM API: cấu hình 2 biến là xong
05 thg 10, 2026