
Eval Open-Weight Model Mới Trong 30 Phút Trước Khi Tin Dùng
Quy trình 3 bước, 30 phút để tự kiểm tra một open-weight model mới có thật sự giúp được code trong repo của bạn, thay vì tin benchmark ngày ra mắt.
Model mới ra mắt, benchmark đẹp — nhưng liệu nó có sửa được bug thật trong repo của bạn?
Cứ vài tuần lại có một open-weight model mới làm nóng timeline của bạn, gần đây là các bản mới của MiniMax, trước đó là một cái tên khác. Biểu đồ ra mắt ấn tượng, một loạt hot take, rồi câu hỏi thật sự quan trọng vẫn còn bỏ ngỏ: model này có giúp được gì cho code, trong repo, với task của bạn hay không? Một quy trình eval 30 phút, tự làm một lần cho mỗi model mới, trả lời câu hỏi đó tốt hơn nhiều so với benchmark ngày ra mắt.
Vì sao benchmark ngày ra mắt không trả lời đúng câu hỏi bạn cần
Vấn đề không phải benchmark public gian dối — chúng chỉ đang trả lời một câu hỏi khác, đo hiệu năng trên task đã được chọn lọc kỹ với prompt sạch sẽ. Việc dùng thật của bạn lộn xộn hơn nhiều: context nhiều file với comment lỗi thời, API nửa vời sau khi migrate dở, codebase có convention mà chẳng dataset nào từng thấy qua. Một model có thể đứng đầu leaderboard và vẫn bịa ra sai method signature của logger nội bộ trong repo bạn. Benchmark duy nhất dự đoán được điều đó là benchmark bạn tự chạy, trên chính task lấy từ backlog của mình.
Quy trình 30 phút, ba bước
- Bước 1 — Đóng băng bộ task (10 phút): giữ sẵn một file chuẩn gồm 8-12 task thật bạn từng tự tay làm gần đây — một bugfix nhỏ, một refactor có ràng buộc, một task viết test, một task viết docstring/README, và một task "khó" mà bạn đã biết trước đáp án đúng khá tinh tế.
- Bước 2 — Chạy kiểu blind (10 phút): chạy cùng bộ prompt trên cả model mới lẫn model bạn đang dùng hàng ngày, cùng temperature, cùng context. Gán nhãn output là A/B trước khi chấm điểm, để không vô tình chấm nương tay cho cái mới sáng bóng hơn.
- Bước 3 — Chấm theo checklist, không theo cảm tính (10 phút): mỗi task chấm 0/1 theo từng mục checklist. Tổng điểm thường bớt kịch tính hơn nhiều so với những gì hot take ngày ra mắt gợi ý — và đôi khi lộ ra một regression thật trên đúng nhóm task bạn quan tâm.
Toàn bộ quy trình mất khoảng 30 phút, không tốn tiền nếu bạn có sẵn quyền dùng model hosting miễn phí, và quan trọng hơn: nó tạo ra bằng chứng bạn có thể bảo vệ trong buổi review PR thay vì chỉ là cảm giác.
Việc nên làm tiếp theo
Lần tới khi một open-weight model mới lên timeline của bạn, đừng vội đổi model coding chỉ vì benchmark ngày ra mắt đẹp. Dành 10 phút đóng băng bộ 8-12 task từ chính backlog gần đây của bạn trước khi cái tiếp theo xuất hiện — bạn sẽ có sẵn công cụ so sánh mà không cần làm gì thêm ngoài chạy lại A/B.
Không spam, hủy đăng ký bất kỳ lúc nào.


