Bỏ qua để vào nội dung chính
Chạy Model Agentic 3B Trên Mac: Năm Bug Chặn Từ Bước Load

Chạy Model Agentic 3B Trên Mac: Năm Bug Chặn Từ Bước Load

Bởi Marcus Bennett
18 thg 8, 20263 phút đọc

Paper arXiv thử Nanbeige4.2-3B trên Apple Silicon: năm bug chặn checkpoint, chunked-prefill nới context 2,7 lần, và trần thật của agent chạy local.

Một paper mới trên arXiv thử chạy model agentic 3B trên Mac và phát hiện năm bug độc lập khiến checkpoint không load nổi qua Hugging Face transformers. Nếu bạn đang định chạy LLM tool-calling ngay trên máy Mac thay vì gọi API, đây là danh sách chướng ngại vật đáng đọc trước.

Model gì, và vì sao nó nhắm vào máy Mac

Paper Nanbeige4.2-3B on Apple Silicon: Fixing Deployment Bugs and Decreasing Looped Transformer Memory Overhead (arXiv:2608.13987, John T. Halloran, nộp 14/8/2026) mô tả Nanbeige4.2-3B là "a 3B-parameter agentic model built around a Looped Transformer (LT) that reuses one stack of layers for a second forward pass, adding effective depth without additional parameters".

Ý tưởng layer-reuse rất hợp với máy cá nhân: thêm chiều sâu hiệu dụng mà không thêm tham số, tức không thêm dung lượng weight phải nạp vào RAM. Đó chính là lý do model dạng này hấp dẫn với người dùng Mac muốn chạy agent offline.

Năm bug chặn ngay ở bước load

Nhóm tác giả đánh giá trên Apple Silicon (MPS) và, theo abstract, "identify five independent bugs which prevent the released checkpoint from running via Hugging Face transformers out of the box (including a silently-zeroed RoPE buffer and calls to removed transformers cache APIs)".

Hai cái tên được nêu đích danh đáng chú ý ở chỗ chúng thuộc hai loại lỗi rất khác nhau. RoPE buffer bị zero âm thầm nghĩa là model vẫn chạy và vẫn sinh chữ — chỉ là sai. Còn gọi vào cache API đã bị gỡ khỏi transformers thì fail thẳng, dễ phát hiện hơn nhiều. Loại thứ nhất mới là thứ đốt thời gian debug của bạn.

Vá xong vẫn chưa đủ: bộ nhớ mới là trần thật

Paper nói rõ sửa hết bug vẫn chưa dùng được cho tác vụ agentic, vì chiến lược layer-reuse của Looped Transformer "effectively doubles peak attention memory". Giải pháp họ đưa ra là chunked-prefill, và con số báo cáo là mở rộng độ dài context cho phép 2,7 lần trên 32 GiB shared memory.

Với cấu hình Mac phổ biến ở Việt Nam, đây là chi tiết quan trọng nhất của paper: trần bạn gặp đầu tiên khi chạy agent local thường là bộ nhớ ở bước prefill, không phải tốc độ sinh token.

Sau khi vá, model làm được đến đâu

Theo abstract, sau khi xử lý cả bug system prompt lẫn bug bộ nhớ MPS-native, model mới đánh giá được ổn định trên các benchmark MCP và tool-calling tiêu chuẩn. Kết quả báo cáo: trên một subset của MCPMark, bản đã debug hoàn thành tới 30% tác vụ agentic thực tế, so với 0% của bản gốc; còn trên BFCL, model gần như hoàn hảo với single tool call nhưng trượt phần lớn bài multi-tool.

Đọc đúng nghĩa con số đó: model 3B chạy local hiện đủ tốt cho một bước gọi tool, chưa đủ cho chuỗi nhiều tool nối nhau. Đừng thiết kế workflow local phụ thuộc vào chuỗi 4-5 tool call liên tiếp.

Nên làm gì tuần này

Nếu bạn định thử: nhóm tác giả cho biết đã phát hành checkpoint đã vá, system prompt optimizer và evaluation harness. Lấy bản đã vá thay vì checkpoint gốc, và trước khi kết luận model "ngu", hãy kiểm tra xem output có đang chạy trên một RoPE buffer bị zero hay không.

Không spam, hủy đăng ký bất kỳ lúc nào.

Bài viết liên quan