Bỏ qua để vào nội dung chính
POCKET-35B: chạy LLM 35B trên laptop không cần GPU rời

POCKET-35B: chạy LLM 35B trên laptop không cần GPU rời

Bởi Daniel Foster
16 thg 9, 20264 phút đọc

Model 35 tỷ tham số chạy CPU-only qua GGUF, 1,07 triệu lượt tải sau 7 tuần. Cách đọc đúng số liệu và checklist kiểm tra trước khi đưa vào pipeline.

Bạn cần chạy LLM trên dữ liệu nội bộ, nhưng cả team chỉ có laptop văn phòng và ngân sách GPU bằng không. Mỗi lần đề xuất thuê máy chủ có card rời, cuộc họp lại dừng ở dòng chi phí.

Tuần này có thêm một lựa chọn đáng thử cho tình huống đó: POCKET-35B. Bài này bóc tách model đó thực sự hứa gì, con số nào của nó có ý nghĩa kỹ thuật, và cần kiểm tra gì trước khi đưa vào pipeline thật.

POCKET-35B là gì

Theo bản tin gốc (ZDNet Korea, 15/09/2026, được tổng hợp lại trên Dev.to), POCKET-35B là model 35 tỷ tham số của VIDRAFT, "designed to run entirely on consumer hardware — laptops, mini-PCs, and tablets — without a dedicated GPU". Ngày phát hành ghi nhận là 22/07/2026, phân phối chính dưới dạng GGUF — định dạng lượng tử hoá quen thuộc của hệ llama.cpp, nên chạy được bằng llama.cpp hoặc Ollama mà không cần viết thêm runtime.

Điểm cần nhớ: "no GPU required" là mức yêu cầu tối thiểu, không phải giới hạn. Nguồn nói rõ hầu hết runtime GGUF vẫn có thể offload layer sang GPU tích hợp hoặc GPU rời nếu máy có, và throughput sẽ tốt hơn.

Đọc đúng các con số adoption

Bài gốc đưa ra số tải về, không phải điểm benchmark: 1.076.570 lượt tải tích luỹ trên Hugging Face tính đến 11/09/2026 (khoảng 7 tuần sau phát hành), trung bình ~19.936 lượt/ngày, và 76% tổng lượt tải (815.008) rơi vào cửa sổ 30 ngày gần nhất. Ở bảng xếp hạng GGUF toàn cầu, model đứng hạng 13 theo lượt tải 30 ngày.

Chính bài viết cũng cảnh báo: "These are distribution/adoption metrics. Task-specific benchmarks (reasoning, coding, instruction-following) have not been published in this article." Nói cách khác, không có bất kỳ số liệu nào ở đây cho bạn biết model trả lời tốt tới đâu bằng tiếng Việt, viết code ra sao, hay bám instruction chặt không. Lượt tải đo được sự tò mò của cộng đồng, không đo chất lượng đầu ra.

Kiểm tra gì trước khi đưa vào pipeline

  • RAM trước tiên. Nguồn đưa quy tắc ngón tay cái: dung lượng file GGUF xấp xỉ mức RAM tối thiểu cần có. Xem kích thước từng biến thể lượng tử hoá trên model card rồi đối chiếu RAM máy thật, đừng chọn theo tên quant.
  • Tự benchmark bằng task của bạn. Vì chưa có benchmark tác vụ công bố, hãy dựng một bộ 30-50 mẫu thật (email nội bộ, phân loại ticket, trích xuất field từ hoá đơn) và chấm tay. Đây là phép đo duy nhất liên quan tới bạn.
  • Kiểm tra tiếng Việt sớm. Bài gốc không nêu danh sách ngôn ngữ được hỗ trợ, nên đừng giả định. Thử vài chục prompt tiếng Việt có dấu trước khi viết bất cứ dòng tích hợp nào.
  • Đo latency trên đúng máy sẽ chạy. CPU-only nghĩa là tốc độ token phụ thuộc số core và băng thông RAM của chính chiếc máy đó, không suy ra được từ máy dev của bạn.

Đáng theo dõi tiếp

VIDRAFT chưa công bố chi tiết kiến trúc nền hay cách huấn luyện ngoài phần đã phát hành công khai — đây là khoảng trống lớn nhất nếu bạn cần đánh giá rủi ro trước khi đưa vào sản phẩm. Hai thứ nên chờ: model card có thêm kết quả đánh giá tác vụ, và một biến thể nhỏ hơn cho máy ít RAM (bài gốc nhắc tới "two POCKET models" trong bảng xếp hạng, gợi ý còn ít nhất một phiên bản khác).

Trong lúc chờ, cách rẻ nhất để có kết luận vẫn là tải một bản quant Q4 về một máy văn phòng bình thường và cho nó chạy đúng tác vụ bạn định giao.

Không spam, hủy đăng ký bất kỳ lúc nào.

Bài viết liên quan