Điểm chính?
DeepSeek V4 Flash hay Ling-3.0-flash cho local deployment đều là lựa chọn tốt, chỉ khác nhau về điểm cân bằng. Ling-3.0-flash (124B MoE, 5.1B active, ~72GB INT4) chạy vừa một node DGX Spark với 141 tok/s, giúp giảm một nửa vốn đầu tư. DeepSeek V4 Flash (284B MoE, ~149GB FP8) cần hai node nhưng đạt ~350 tok/s và 1M context thật. Hãy chọn theo nhu cầu context, số agent song song và ngân sách, đừng chọn theo con số in trên giấy.
📊 Nguồn: benchmark @Lonely__MH trên DGX Spark 1 node, nghiên cứu 2× DGX Spark DeepSeek V4 Flash của 5ac (17/08/2026), NVIDIA DGX Spark datasheet.
Những tháng gần đây, có một câu hỏi lặp đi lặp lại giữa các chủ doanh nghiệp nhỏ và nhóm kỹ thuật của chúng tôi: "Mình nên mua phần cứng để tự chạy AI, hay cứ gọi API cho xong?" Rồi sau đó, khi đã quyết định đi sâu, lại thêm một câu nữa: "Vậy chạy model nào?"
Bài viết này không trả lời hộ bạn câu đầu tiên, vì câu trả lời thật sự phụ thuộc vào lượng dữ liệu, mức độ nhạy cảm của thông tin, và ngân sách của riêng bạn. Thay vào đó, tôi muốn giúp bạn trả lời câu thứ hai — một câu hỏi đang trở nên gấp hơn khi có thêm một ứng viên mới xuất hiện trong tháng Tám này: Ling-3.0-flash của Ant Group.
Xu hướng chạy AI local đang nóng lên vì một lý do rất thực tế
Trước khi đi vào so sánh, hãy nói về lý do vì sao chủ đề này nóng. AI local — tự chạy model trên máy của mình thay vì gọi qua mạng — không còn là trò chơi của riêng các tập đoàn lớn. Với sự ra đời của những chiếc máy trạm giá phải chăng như DGX Spark (khoảng 4.000 USD một node), một doanh nghiệp nhỏ ở Việt Nam hoàn toàn có thể sở hữu một cụm AI của riêng mình.
Điều gì thúc đẩy điều đó? Có ba động lực lớn. Một là chi phí về lâu dài: khi khối lượng token đủ lớn, việc tự chạy rẻ hơn so với gọi API. Hai là quyền kiểm soát dữ liệu: code khách hàng, hợp đồng, dữ liệu nội bộ không phải lên cloud của bên thứ ba. Ba là sự chủ động: bạn không phụ thuộc vào giá cả hay chính sách thay đổi của nhà cung cấp API.
Nhưng cốt lõi của bài toán local là một phép cân đối: model càng mạnh thì càng nặng, phần cứng càng đắt. Và đây chính là nơi sự so sánh DeepSeek V4 Flash với Ling-3.0-flash trở nên thú vị.
Ling-3.0-flash: ứng viên mới xuất hiện giữa tháng Tám
Vào tháng Tám năm 2026, một bài đăng trên mạng xã hội về việc chạy Ling-3.0-flash trên một node DGX Spark bắt đầu được chia sẻ rộng rãi. Con số gây chú ý: 141 token mỗi giây ở mức 8 luồng đồng thời, và quan trọng hơn, toàn bộ model vừa khít một node phần cứng duy nhất.
Ling-3.0-flash đến từ Ant Group, một tập đoàn tài chính và công nghệ lớn của Trung Quốc. Đây là model Mixture of Experts với 124 tỷ tham số, nhưng chỉ kích hoạt 5.1 tỷ tham số cho mỗi lần suy luận. Đó là bí quyết khiến nó nhẹ và nhanh: bạn không cần tải toàn bộ sức nặng lên bộ nhớ mỗi lần chạy, chỉ cần phần đang hoạt động. Với trọng số khoảng 72GB ở định dạng INT4, nó vừa khít bộ nhớ 128GB thống nhất của DGX Spark.
Điểm mấu chốt: Một model chạy vừa một node nghĩa là vốn đầu tư ban đầu giảm một nửa so với giải pháp hai node. Với một startup vừa gây quỹ, khoản chênh lệch này có thể quyết định giữa việc "có" hay "chưa có" một hạ tầng AI của riêng mình.
Dữ liệu thật: Ling-3.0-flash so với DeepSeek V4 Flash
Để dễ hình dung, đây là cách hai model này đứng cạnh nhau. Tôi dùng số liệu từ benchmark thực tế được chia sẻ cộng đồng, và từ nghiên cứu nội bộ của chúng tôi khi chạy DeepSeek V4 Flash trên hai node DGX Spark:
| Chỉ số | Ling-3.0-flash | DeepSeek V4 Flash |
|---|---|---|
| Tham số | 124B MoE (5.1B active) | 284B MoE (13B active) |
| Trọng số | ~72GB INT4 | ~149GB FP8 |
| Tốc độ suy luận (8 luồng) | 141 tok/s | ~350 tok/s |
| Context | ~128K-256K | 1M native |
| Giấy phép | Apache 2.0 | MIT |
Đọc bảng trên, có vẻ DeepSeek thắng ở mọi hàng: nhiều tham số hơn, nhanh hơn, context dài hơn. Nhưng đó là cái bẫy của bảng so sánh. DeepSeek V4 Flash đạt được những con số đó trên hai node phần cứng, trong khi Ling-3.0-flash làm được điều đó trên một node duy nhất. Hai con số 141 và 350 không cùng một đơn vị đầu tư.
Bài toán thật của doanh nghiệp nhỏ: 1 node hay 2 node?
Đây là câu hỏi mà tôi nghĩ đáng để dừng lại. Khi một doanh nghiệp nhỏ cân nhắc local deployment, quyết định quan trọng nhất không phải "model nào", mà là "phần cứng bao nhiêu". Bởi vì model là thứ bạn có thể đổi qua lại, còn phần cứng là khoản tiền bạn bỏ ra ngay từ đầu.
Một node (khoảng 4.000 USD). Vừa đủ cho Ling-3.0-flash ở INT4. Đáp ứng tốt cho nhiều ứng dụng của doanh nghiệp nhỏ: chatbot nội bộ, tóm tắt văn bản, hỗ trợ nhân viên, và một vài agent chạy nền. Ngưỡng vốn thấp, dễ quyết định, dễ mở rộng sau này bằng cách thêm node thứ hai khi nhu cầu tăng.
Hai node (khoảng 8.200 USD). Mở khóa DeepSeek V4 Flash ở chất lượng FP8 chính thức, với 1M context thật và khoảng 350 tok/s tổng. Đây là lựa chọn cho doanh nghiệp cần nhiều agent chạy song song, hoặc cần xử lý tài liệu dài, hoặc muốn một hạ tầng có thể phục vụ nhiều đội cùng lúc.
Một con số cần nhớ: Muốn có 6 agent cùng chạy với 1M context, bạn cần 4 node (khoảng 16.000 USD). Với 2 node, bạn chỉ có 1 luồng 1M hoặc 6 luồng ở context ngắn hơn. Đừng mua hai node rồi ngạc nhiên khi không thể phục vụ sáu agent cùng lúc với context khổng lồ.
Chúng tôi đã viết kỹ về cách vận hành một cụm DeepSeek V4 Flash hai node, từ stack vLLM, tensor parallelism, đến các vấn đề ổn định khi chạy lâu dài, trong bài về ba loài agent khác nhau và hạ tầng AI mã nguồn mở. Còn ở đây, điểm tôi muốn nhấn mạnh là: hãy để phần cứng quyết định model, không phải ngược lại.
Khuyến nghị thực tế cho startup Việt Nam
Nếu bạn đang bắt đầu, đây là cách tiếp cận tôi thấy hợp lý và ít rủi ro nhất:
Một: tính ngưỡng hòa vốn trước khi nghĩ đến phần cứng. Nghiên cứu nội bộ của chúng tôi cho thấy, ở mức giá DeepSeek cao điểm, hai node DGX Spark hòa vốn sau khoảng 160-200 triệu token mỗi tháng. Nếu khối lượng của bạn thấp hơn thế, gọi API rẻ hơn nhiều. Đừng mua phần cứng chỉ vì cảm thấy "phải sở hữu AI".
Hai: nếu đã quyết định mua, hãy bắt đầu bằng một node. Dùng nó để chạy Ling-3.0-flash hoặc một model tương tự vừa khít. Đo nhu cầu thật bằng dữ liệu của chính bạn trong một vài tháng, rồi mới quyết định có nâng lên hai node hay không. Cách này biến một khoản đầu tư lớn thành hai quyết định nhỏ, mỗi quyết định dựa trên dữ liệu.
Ba: chọn giấy phép mở và không bị khóa vào một nhà cung cấp. Cả Ling-3.0-flash (Apache 2.0) và DeepSeek V4 Flash (MIT) đều là mã nguồn mở. Điều này nghĩa là bạn có thể tự chủ hạ tầng, và — quan trọng hơn với mô hình kinh doanh — có thể chuyển model khi nhu cầu thay đổi mà không phá vỡ hạ tầng. Chúng tôi đã bàn kỹ về lý do vì sao không nên bị khóa vào một nhà cung cấp trong bài về cuộc hạ giá DeepSeek.
Bốn: đừng quên lý do thật sự khiến bạn mua phần cứng. Nếu lý do là quyền kiểm soát dữ liệu — giữ code khách hàng và hợp đồng không lên cloud — thì đó là quyết định đúng, bất kể con số hòa vốn. Nhưng nếu bạn mua chỉ để "chạy local cho rẻ", hãy quay lại bước một.
Kết luận: đừng chọn model, hãy chọn bài toán
Ling-3.0-flash và DeepSeek V4 Flash không phải hai phiên bản của cùng một thứ. Một model tiết kiệm phần cứng, một model mở khóa sức mạnh tối đa. Lựa chọn của bạn nên bắt đầu từ câu hỏi "bài toán của tôi cần gì", không phải "model nào thông minh hơn" hay "con số nào lớn hơn".
Với doanh nghiệp nhỏ vừa bắt đầu, bắt đầu bằng một node và Ling-3.0-flash là con đường ít rủi ro, dễ học, và đủ nhanh cho hầu hết ứng dụng thực tế. Khi nhu cầu tăng, bạn thêm node thứ hai và nâng lên DeepSeek V4 Flash — không phải phá bỏ cái cũ, mà là mở rộng tự nhiên trên cùng một nền tảng.
AI local không còn là đặc quyền của các tập đoàn. Với phần cứng ngày càng rẻ và model ngày càng thông minh hơn trong khả năng tiếp cận, câu hỏi đáng hỏi nhất không phải "mình có đủ tiền không", mà là "mình cần giải quyết bài toán gì".
Còn bạn thì sao? Doanh nghiệp của bạn đang cần kiểm soát dữ liệu, tiết kiệm chi phí, hay sức mạnh context lớn nhất? Hãy để lại bình luận — tôi đọc hết và sẽ chia sẻ thêm kinh nghiệm triển khai thực tế cho chủ doanh nghiệp nhỏ trong các bài tới.