Bỏ qua để vào nội dung chính
Chạy LLM 125B local: M5 Ultra có đáng tiền với dev VN?

Chạy LLM 125B local: M5 Ultra có đáng tiền với dev VN?

Bởi Henry Morgan
26 thg 8, 20264 phút đọc

M5 Ultra có 1.2 TB/s băng thông và 512GB RAM. Qwen MoE 125B chỉ tốn 62GB ở 4-bit. Phân tích con số để biết khi nào mua máy rẻ hơn trả tiền API.

Bạn đang trả vài trăm đô mỗi tháng cho API để chạy agent coding, và mỗi lần chạy batch lớn là một lần nhìn đồng hồ đếm tiền. Câu hỏi "mua hẳn một cỗ máy chạy LLM local có rẻ hơn không?" vừa có thêm dữ liệu mới đáng để tính lại. Bài này bóc tách các con số thực tế của Mac Studio M5 Ultra và mẫu MoE 125B mới, để bạn quyết định trước khi mở ví.

Băng thông bộ nhớ mới là con số cần nhìn

Theo bài phân tích trên Dev.to, Apple công bố Mac Studio M5 Ultra với CPU 36 nhân, GPU 80 nhân, tối đa 512GB bộ nhớ hợp nhất và 1.2 TB/s băng thông. Tác giả so sánh: đó là 2.25x băng thông của NVIDIA DGX Spark (273 GB/s) và gần 5x AMD Strix Halo (256 GB/s).

Vì sinh token gần như hoàn toàn bị giới hạn bởi băng thông bộ nhớ — mỗi token là một lượt đọc trọng số từ RAM — con số này quyết định tốc độ bạn thực sự cảm nhận khi gõ prompt, chứ không phải số nhân GPU.

MoE là lý do model 125B vừa máy bàn

Qwen 3.8-Flash-Next, theo cùng bài viết, là model MoE 125 tỷ tham số nhưng chỉ kích hoạt 6 tỷ tham số mỗi token — tỷ lệ 20:1 giữa dung lượng model và chi phí tính toán từng token. Ở mức lượng tử 4-bit, 125B chiếm khoảng 62GB RAM, vừa thoải mái trên một máy 128GB.

Nói cách khác: bạn không cần bản 512GB để chạy một model đáng dùng. Đó là điểm dễ bị marketing kéo đi sai hướng nhất.

4-bit không còn là đánh đổi chất lượng

Đây là mảnh ghép làm bài toán local thay đổi hẳn. Nhóm Multiverse Computing vừa công bố Quantization-Aware Healing (QAH) trên Hugging Face: áp lên một model GPT-OSS 120B đã nén còn 60B rồi lượng tử xuống MXFP4, bản 4-bit thắng chính checkpoint bfloat16 của nó trên 7/9 benchmark. Mức tăng lớn nhất rơi đúng vào chỗ nén thường phá hỏng nặng nhất: +7.4 điểm long-context (AA-LCR) và +5.6 điểm toán (AIME 2025). Hai benchmark thua — MMLU-Pro và SciCode — chênh dưới 1.5 điểm.

Cấu hình nào đáng cân nhắc

MáyBộ nhớBăng thôngGiá khởi điểm
M5 Ultra Mac Studiotối đa 512GB unified1.2 TB/s$5,499
NVIDIA DGX Spark128GB unified273 GB/s$4,699
AMD Strix Halo128GB unified256 GB/s$3,999

Lưu ý lịch hàng: bài viết cho biết đợt mở bán 22/9 chỉ có tối đa 256GB, còn cấu hình 512GB phải chờ tới cuối tháng 10. Nếu bạn định mua để chạy inference ngay bây giờ, bản 192GB giá $5,499 mới là cấu hình cần đem ra so.

Khi nào nên bỏ qua phương án Mac

DGX Spark vẫn nhanh hơn 3-4x ở khâu prefill (xử lý prompt dài) so với phần cứng Mac tương đương. Nếu workflow của bạn là agent coding đẩy prompt 50-100K token liên tục, khác biệt đó cộng dồn qua hàng trăm lượt gọi trong một phiên. Blackwell cũng có đường FP4 native mà theo bài viết Apple chưa có.

Tác giả bài viết ước tính máy M5 Ultra 192GB hoàn vốn dưới hai năm nếu bạn đang tiêu trên $200/tháng cho API. Đây là ước tính của tác giả chứ không phải số đo, nên hãy thay bill thật của bạn vào trước khi tin.

Việc nên làm tuần này

Mở hóa đơn API ba tháng gần nhất và tính trung bình tháng. Nếu con số đó nhỏ hơn hẳn mốc $200/tháng mà tác giả lấy làm điểm hoàn vốn, chưa cần bàn tới phần cứng. Nếu vượt mốc đó, hãy thử chạy một model MoE 4-bit trên chiếc Mac bạn đang có trước đã — chỉ khi chất lượng đủ dùng cho phần lớn task hằng ngày thì phép tính hoàn vốn mới có ý nghĩa. Và nếu bạn thật sự cần trên 256GB, không có lý do gì để đặt hàng trước cuối tháng 10.

Không spam, hủy đăng ký bất kỳ lúc nào.

Bài viết liên quan