Mua một máy AI local là chuyện dễ. Chọn đúng cấu hình mô hình cho số máy bạn có — đó mới là chuyện khiến nhiều người mua xong rồi để máy nằm im. Trong tháng 9/2026, cộng đồng chạy NVIDIA DGX Spark đã tạo ra một lượng recipe (công thức triển khai) và benchmark đủ lớn để trả lời câu hỏi đó bằng số liệu thật, không phải quảng cáo.

Chúng tôi đã gom lại những gì người dùng thực sự đang chạy trên từng quy mô — từ 1 máy cho đến 6 máy trở lên. Bài viết này tóm tắt thành một bản đồ cấu hình, kèm logic vận hành: mô hình nào làm "bộ não điều phối", mô hình nào làm "tay chân".

TL;DR

  • 1 máy DGX Spark (128 GB bộ nhớ hợp nhất): Qwen3.8 Flash Next là lựa chọn thắng thế gần như tuyệt đối.
  • 2–4 máy: GLM 5.3 Flash và DeepSeek v4.1 Flash chia nhau làm nền, kèm Qwen3.8 Flash Next làm worker.
  • 6 máy trở lên: mô hình orchestrator + worker + security scanner — một "công ty AI" thu nhỏ chạy ngay trên bàn.

DGX Spark là gì và vì sao nó thay đổi cuộc chơi?

DGX Spark là máy trạm AI của NVIDIA dựa trên chip Grace Blackwell GB10. Điểm nhấn nằm ở bộ nhớ hợp nhất 128 GB (unified memory — GPU và CPU dùng chung một kho nhớ) và mức tiêu thụ điện chỉ khoảng 38W khi chạy inference (theo tài liệu chính thức của NVIDIA). Giá tham khảo khoảng 4.000 USD một máy.

Điều quan trọng không phải con số đó, mà là hệ quả: nhiều máy Spark có thể nối trực tiếp với nhau không cần switch mạng, gộp bộ nhớ thành 128–256–384–512 GB. Nhờ vậy, những mô hình MoE (Mixture of Experts — kiến trúc chỉ kích hoạt một phần nhỏ tham số cho mỗi token) quy mô hàng trăm tỷ tham số bắt đầu chạy được trên bàn làm việc.

Cộng đồng đã phản ứng rất nhanh. Chỉ trong vài tuần, các recipe triển khai trên GitHub và diễn đàn NVIDIA Developer đã bao phủ gần như mọi cấp độ cluster. Đây là bức tranh tháng 9/2026.

1 máy DGX Spark: Qwen3.8 Flash Next gần như là câu trả lời duy nhất

Với một máy duy nhất, hầu hết người dùng đang chạy Qwen3.8 Flash Next — mô hình mở của Alibaba, khoảng 176B tham số (125B chính + 51B n-gram), nhưng chỉ kích hoạt 6B mỗi token nhờ kiến trúc MoE. Con số 6B active là lý do mô hình này chạy ngon trên một máy duy nhất: bộ nhớ cần cho quant (lượng tử hoá) nhỏ nhất chỉ 78 GB, vừa khít trong bộ nhớ hợp nhất của Spark.

Số liệu từ cộng đồng (tháng 9/2026):

  • Recipe vLLM chính thức NVFP4 của NVIDIA đạt 64 tok/s đỉnh cho luồng đơn trên 1, 2 và 4 máy.
  • Người dùng chạy thực tế báo khoảng 43 tok/s trong công việc code trên một máy (diễn đàn NVIDIA DGX Spark / GB10).
  • Hỗ trợ ngữ cảnh 262K token, đa phương thức (multimodal), và theo Unsloth đạt kết quả mạnh ở các bài agentic coding.

Có một chi tiết kỹ thuật đáng nể: một recipe cộng đồng đã phục vụ checkpoint 126 GiB trên máy chỉ có 121,63 GiB bộ nhớ thật — bằng cách tinh chỉnh SGLang và tận dụng đặc tính RAM-friendly của kiến trúc này. Qwen3.8 Flash Next được thiết kế để chạy hiệu quả trên bộ nhớ hợp nhất, đúng "sân nhà" của Spark.

Kết luận cho cấp độ này: nếu bạn chỉ có 1 máy, đừng lăn tăn. Cài Qwen3.8 Flash Next.

2 máy: GLM 5.3 Flash và DeepSeek v4.1 Flash bước vào

256 GB bộ nhớ hợp nhất mở cửa cho các mô hình "frontier" (cận biên giới — nhóm mô hình mạnh nhất hiện nay). Tại đây có hai cái tên, và cả hai đều phát hành mã nguồn mở giấy phép MIT.

GLM 5.3 Flash của Z.ai: 320B tham số, 18B active, checkpoint FP8 khoảng 306 GiB. Community recipe chạy trên 2× DGX Spark với vLLM TP=2 (tensor parallel — chia mô hình qua 2 máy) đã ghi nhận 43,4 tok/s với ngữ cảnh 262K. Điểm mạnh: nhận cả hình ảnh và video, chất lượng tổng hợp tốt.

DeepSeek v4.1 Flash: phát hành ngày 10/9/2026, 552B tham số kiến trúc encoder-decoder, checkpoint FP8 khoảng 510 GB. Mô hình tiền nhiệm v4 Flash đã là lựa chọn phổ biến nhất trên 2× Spark với 55–60 tok/s và ngữ cảnh 1M token; phiên bản 4.1 nặng hơn đáng kể, nên một số người dùng vẫn giữ checkpoint v4 Flash cũ vì nó tối ưu cho đúng cặp máy này.

Trên diễn đàn NVIDIA, các cuộc so sánh thực tế đi đến một kết luận khiêm tốn nhưng trung thực: hai mô hình gần như đồng cấp trong công việc thật. Một người dùng chạy song song cả hai qua OpenWebUI nhận xét GLM nhỉnh hơn nhờ có vision (thị giác), DeepSeek nhanh hơn một chút — và đề xuất giữ một mô hình vision riêng bất kể chọn gì.

Logic vận hành ở cấp độ 2 máy: một mô hình, dùng hết cả hai máy. Chưa đến lúc phân vai.

3 và 4 máy: bắt đầu phân vai — orchestrator và worker

384–512 GB là ngưỡng xuất hiện một pattern (mẫu hình) thú vị: không chạy một mô hình lớn trên toàn cluster, mà chia vai.

Cấu hình phổ biến nhất với 3 máy:

  • GLM 5.3 Flash trên 2 máy: làm orchestrator (bộ điều phối: nhận nhiệm vụ, lập kế hoạch, giao việc).
  • Qwen3.8 Flash Next trên 1 máy: làm worker (công nhân: thực thi từng việc cụ thể như viết code, đọc tài liệu, trả lời).

Với 4 máy, cùng logic đó nhưng mở rộng:

  • GLM 5.3 Flash trên 2 máy (orchestrator) + Qwen3.8 Flash Next trên 2 máy (worker pool), hoặc
  • Đổ hết DeepSeek v4.1 Flash / GLM 5.3 Flash lên cả 4 máy nếu bạn muốn một mô hình duy nhất nhưng mạnh nhất có thể.

Vì sao phân vai lại hay hơn chạy một mô hình khổng lồ? Ba lý do từ trải nghiệm cộng đồng:

  1. Độ trễ thấp: worker nhỏ trả lời nhanh, orchestrator chỉ "tỉnh" khi cần quyết định.
  2. Không lỗi lan truyền: mô hình worker gặp vấn đề không làm chết cả hệ điều phối.
  3. Nâng cấp độc lập: Qwen ra bản mới thì chỉ thay worker, orchestrator giữ nguyên cấu hình.

Đây cũng chính là pattern mà các đội ngũ vận hành agent ngày càng ưa chuộng — mô hình lớn nghĩ, mô hình nhỏ làm.

6 máy trở lên: một "công ty AI" thu nhỏ

Từ 6 máy (768 GB bộ nhớ hợp nhất trở lên), bạn có đủ tài nguyên để chạy ba vai trò song song. Thiết lập đang được nhiều người dùng dùng:

  • GLM 5.3 Flash trên 2 máy: orchestrator, lập kế hoạch, phân nhiệm vụ, duyệt kết quả.
  • Qwen3.8 Flash Next trên 2 máy: worker, thực thi mọi việc hằng ngày, tốc độ cao.
  • DeepSeek v4 Flash trên 2 máy: security scanner / cyber (máy quét bảo mật), rà soát code, phân tích mối đe dọa, kiểm tra output của hai vai trên.

Cấu hình này có một điểm tinh tế mà ít ai nói: vai security scanner không cần mô hình "cảm xúc" hay sáng tạo — cần mô hình kỷ luật, ít bịa, đọc kỹ. DeepSeek phù hợp vai đó vì ưu điểm nổi bật của nó là suy luận có cấu trúc và ngữ cảnh dài. Trong khi đó, việc giao công việc lặp lại tốc độ cao cho Qwen3.8 Flash Next (6B active, 43+ tok/s) là đúng bài về hiệu năng/chi phí điện.

Một điểm nữa: ở quy mô này, tổng điện năng vẫn chỉ ở mức vài trăm watt — thấp hơn một card đồ hoạ datacenter duy nhất. Đó là lời giải cho câu hỏi "AI riêng tư chạy ở đâu?" đối với những công ty không muốn gửi dữ liệu lên cloud.

Insight: ba điều mà bảng cấu hình không nói

Một — checkpoint size là ràng buộc thật, đừng chỉ nhìn số tham số. GLM 5.3 Flash nặng ~306 GiB FP8, DeepSeek v4.1 Flash ~510 GB. Số liệu này quyết định mô hình nào vừa mấy máy ngay từ đầu, trước cả khi nói tới tốc độ.

Hai — recipe community quan trọng ngang bộ nhớ. Theo nghiên cứu tổng hợp sizing guide (Market Intelligence Research, 9/2026), hệ sinh thái recipe dày nhất ở cấp 2 và 3 máy. Một mô hình "vừa vừa" nhưng có recipe đã được debug kỹ thường chạy ổn hơn mô hình "đỡ vừa" nhưng phải tự mò. Trước khi mua máy thứ 4, hãy kiểm tra đã có người chạy thành công mô hình bạn muốn trên 4 máy chưa.

Ba — quant chất lượng cao là bản sắc của Spark. Nhờ bộ nhớ hợp nhất lớn, các quant NVFP4/FP8 giữ được chất lượng gần như bản gốc. Đây là khác biệt so với việc ép mô hình lớn vào GPU 24 GB bằng quant 2-bit, thứ thường làm mô hình "ngu đi" thấy rõ.

Takeaway

Nếu bạn đang cân nhắc đầu tư AI local trong thời điểm này, quy tắc đơn giản:

  • 1 máy: Qwen3.8 Flash Next. Ngay lập tức.
  • 2 máy: GLM 5.3 Flash hoặc DeepSeek (v4 Flash cũ vẫn chạy ngon, v4.1 Flash nếu cần multimodal mới nhất).
  • 3–4 máy: GLM làm orchestrator + Qwen3.8 Flash Next làm worker.
  • 6+ máy: thêm DeepSeek làm security scanner và bạn đã có một tổ chức AI hoàn chỉnh trên bàn.

Bước tiếp theo cụ thể: chọn đúng quy mô máy của bạn trong bản đồ trên, tìm recipe tương ứng trên GitHub (các tên như qwen3.8-Flash-DGX, GLM-5.3-Flash-NVFP4-262K-2x-DGX-Spark đều công khai), chạy thử 1 tuần với công việc thật rồi mới quyết định mở rộng. Cluster AI local giống tuyển người — thử việc trước khi ký hợp đồng dài hạn.

Nếu team bạn cần tư vấn kiến trúc AI local hoặc triển khai agent trên hạ tầng riêng, hãy liên hệ 5ac.vn — chúng tôi xây và vận hành các hệ thống như thế này mỗi ngày.

Nguồn tham khảo