Chạy LLM local trên MacBook M3 36GB để code: được và mất
Một tuần thử Ollama trên MacBook Pro M3 36GB với VS Code: Gemma 4 26B và gemma4:31b-mlx chạy tốt, nhưng vòng lặp agent nhiều bước vẫn quá chậm.
Một dev vừa dành trọn một tuần thử biến MacBook Pro M3 36GB RAM thành trợ lý code local, rồi quay về GitHub Copilot/Codex cho công việc hàng ngày. Điểm đáng đọc không phải kết luận đó, mà là ranh giới rất rõ giữa phần chạy tốt và phần không dùng nổi.
Setup thực tế
Cấu hình là Ollama chạy trên máy Mac làm inference host, VS Code kết nối tới từ một laptop khác qua mạng nội bộ. Tác giả mô tả đường đi rất gọn: "VS Code on Lenovo -> local Wi-Fi -> Ollama on MacBook Pro -> local model". Máy client là Lenovo Intel i9-13900HX, RTX 4060 Laptop GPU với 8GB VRAM, 32GB RAM, Windows 11.
Lý do máy Mac làm host chứ không phải chiếc Lenovo mạnh hơn về CPU nằm ở bộ nhớ: theo tác giả, 8GB VRAM rời "was not the best fit for the 26B-to-31B-class models I wanted to try", còn pool unified memory lớn hơn của Mac khiến nó là host thú vị hơn. Đây là chi tiết dev VN nên nhớ khi so máy: với model 26–31B, dung lượng bộ nhớ mà GPU truy cập được quyết định nhiều hơn điểm benchmark CPU.
Model nào chạy được
Trong tuần thử nghiệm, tác giả đổi model, so biến thể thường với biến thể MLX, đổi context size và thử dùng cho việc lớn hơn các đoạn code rời. Kết quả tác giả tự tổng kết: Gemma 4 26B chạy tốt, còn gemma4:31b-mlx cho trải nghiệm local tổng thể tốt nhất; qwen3-coder:30b cũng đáng thử cho các task thuần coding.
Chi tiết biến thể MLX là phần dễ bỏ qua nhất: trên Apple Silicon, cùng một model ở định dạng MLX và ở định dạng mặc định không cho cùng trải nghiệm. Nếu bạn đã có máy Mac và định thử local, đó là biến số nên test trước khi kết luận model "chậm".
Ranh giới: nơi setup này gãy
Phân định của tác giả rất cụ thể. Với câu hỏi, giải thích, sửa nhỏ và sinh code trong phạm vi hẹp, setup "was genuinely useful". Với một project độ phức tạp trung bình cần lặp lại việc lập kế hoạch, đọc quét repo, sửa code rồi kiểm chứng, nó "was too slow for the way I wanted to work" — và đó là lý do tác giả quay lại Copilot/Codex.
Nói cách khác, thứ không đủ ở đây không phải chất lượng câu trả lời của model, mà là tốc độ trong một vòng lặp nhiều bước. Tác giả chốt lại rằng thử nghiệm giúp anh hiểu "why the complete coding workflow matters as much as the model itself".
Đọc con số này thế nào cho quyết định mua máy
Phần dưới là phân tích, không phải số liệu từ nguồn: nếu nhu cầu của bạn là hỏi đáp, giải thích code và sửa nhỏ trong file đang mở, một máy Mac unified memory dung lượng lớn phủ được phần đó và giữ prompt lại trong máy. Nếu công việc chính là để agent tự đọc repo, lập kế hoạch rồi chạy nhiều vòng sửa–test, hãy tính setup local là môi trường phụ chứ không phải nơi thay thế API.
Đối chiếu chi phí cũng nên làm trước khi mua thêm RAM: báo cáo giá LLM ngày 01/09/2026 của ModelPriceWatch ghi mức giá sàn của nhóm model đạt một ngưỡng năng lực cố định là $0.113 cho mỗi triệu token. Một máy đủ RAM để chạy 31B thoải mái là chi phí trả một lần, nhưng nó cạnh tranh với một mức giá API đang rất thấp — con số cần so là tổng token bạn thực sự gọi mỗi tháng.
Việc nên làm nếu bạn đang có máy Mac: thử đúng ba model tác giả đã chạy, ở cả biến thể MLX, trên một task thật trong repo của bạn — rồi đo thời gian một vòng lặp sửa–test đầy đủ, không phải thời gian sinh một đoạn code.
Không spam, hủy đăng ký bất kỳ lúc nào.
Bài viết liên quan

Cursor có 5 lớp cấu hình: bạn đang dùng đúng một lớp
05 thg 9, 2026
GPT-6 Astra vs Fable 5.1: giá bằng nhau, chọn model nào?
05 thg 9, 2026