Có một câu hỏi mà hầu như mọi SMB Việt Nam gửi đến 5ac trong năm qua đều xoay quanh: "Liệu tôi có thể tự chạy AI trong công ty mình không, hay tôi phải phụ thuộc vào các API bên ngoài?"
Câu trả lời ngắn gọn của năm 2026 là: bạn không chỉ có thể — bạn nên. Local AI đã đi qua điểm bùng phát. Thứ từng là sân chơi của hobbyist với một chiếc RTX 3090 giờ là hạ tầng mặc định cho cả enterprise. Và với doanh nghiệp vừa và nhỏ, nơi mỗi đồng chi phí và mỗi byte dữ liệu khách hàng đều đáng giá, câu chuyện on-prem không còn là lựa chọn kỹ thuật nữa — nó là quyết định chiến lược.
Bài viết này viết dưới góc nhìn CTO: hardware nào đáng mua, phần mềm nào đáng chạy, model nào đáng chọn, và quan trọng nhất, tại sao chạy AI trong tường nhà bạn lại là thế mạnh cạnh tranh thực sự cho một doanh nghiệp nhỏ năm 2026.
Luận điểm chính: Năm 2026, Local AI không còn là "chạy được model to trên máy to". Nó là một ngăn xếp hoàn chỉnh — hardware, inference engine, open-weight models — đủ trưởng thành để một chiếc máy trạm giá phải chăng thay thế hàng loạt API cloud cho khối lượng công việc hàng ngày của SMB.
Phần 1 — Hardware: hai con số quyết định mọi thứ
Trước khi bàn đến model nào, ta phải hiểu một điều: dung lượng quyết định cái gì vừa, bandwidth quyết định cái gì chạy nhanh. Hai con số này độc lập với nhau, và trộn lẫn chúng là sai lầm phổ biến nhất của người mới bắt đầu.
Công thức VRAM duy nhất bạn cần
Mối quan hệ "model → VRAM" chỉ đúng khi bạn tính đến cách trọng số được lượng tử hóa. Công thức gọn nhất là:
VRAM (GB) ≈ Số tham số (tỷ) × (số bit hiệu dụng ÷ 8)
Ba mốc nhớ nhanh:
- FP16 / BF16 → 16 bit → ~2 GB cho mỗi 1B tham số
- FP8 / INT8 → 8 bit → ~1 GB cho mỗi 1B tham số
- 4-bit quants → ~4 bit → ~0.5 GB cho mỗi 1B tham số
GGUF nằm giữa tùy theo scheme: Q6_K ~0.82 GB/1B, Q5_K ~0.69 GB/1B, Q4_K ~0.56 GB/1B, Q3_K ~0.43 GB/1B, Q2_K ~0.33 GB/1B. Càng nén sâu càng rẻ, nhưng chất lượng càng giảm — toán, code, JSON và tool use hỏng trước tiên.
Model nào vừa với GPU nào
Dịch sang phần cứng người ta thực sự sở hữu:
| VRAM | FP16 | FP8 | 4-bit |
|---|---|---|---|
| 8 GB | ~3B | ~6-7B | ~12-13B |
| 12 GB | ~5B | ~10B | ~18-20B |
| 16 GB | ~7B | ~13B | ~25B |
| 24 GB (RTX 3090/4090) | ~10-12B | ~20B | ~35-40B |
| 48 GB | ~20-24B | ~40B | ~70-80B |
| 80 GB | ~35-40B | ~70B | ~140B-class |
Điều này giải thích vì sao RTX 3090 (24 GB) vẫn là chuẩn vàng của local AI năm 2026: với 4-bit, nó chạy được cả lớp model 35-40B — đủ mạnh cho hầu hết công việc văn phòng, code, và agent. RTX 5090 (32 GB) đẩy lên mức thoải mái hơn nữa. Bạn không cần một cụm data center để bắt đầu.
Lưu ý về "thuế VRAM" ít ai nói: trọng số chỉ là một phần hóa đơn. KV cache phình to theo context — ở 32K hay 128K token nó "ăn" bộ nhớ rất nhanh. Activations, batching và concurrency (nhất là với agent workloads) nhân bộ nhớ lên nhiều lần. Nguyên tắc an toàn: cộng thêm 10-30% VRAM cho một lần chạy an toàn; với long context hoặc high concurrency, hãy cộng nhiều hơn.
Bandwidth — "capacity quyết định thứ vừa, bandwidth quyết định nó chạy nhanh cỡ nào"
Một chiếc máy 128 GB có thể chứa model rất to, nhưng nếu bandwidth thấp, nó sinh ra 3 token mỗi giây — cảm giác như decode trong xi-măng ướt. Bandwidth là con số phần cứng thực sự quyết định tốc độ cảm nhận.
Bản đồ 2026:
- 1.8 TB/s class — RTX PRO 6000 Blackwell, RTX 5090 → 1792 GB/s. Vua tốc độ.
- 800 GB/s class — Mac Studio M3 Ultra → 819 GB/s, lên tới 512 GB unified memory.
- 450-650 GB/s — Mac Studio M4 Max (546), MacBook Pro M5 Max (460-614), Radeon AI PRO R9700 (640), Tenstorrent Blackhole (512). Workstation nghiêm túc.
- 250-300 GB/s unified-memory — DGX Spark (273), Mac mini M4 Pro (273), Ryzen AI Max / Strix Halo (256). Nơi unified memory bắt đầu đáng giá.
- Thin-and-light — MacBook Air M5 (153), Snapdragon X Elite (135), Intel Lunar Lake (136). Chạy được model nhỏ, assistant, edge workloads — không phải sân chơi của 9B dense hay multi-agent.
Ba tier ngưỡng dễ nhớ: dưới ~150 GB/s là thin-and-light; quanh 250-300 GB/s unified memory bắt đầu thú vị; 450-650 GB/s là workstation; trên 800 GB/s là đắt và mạnh.
Ba lựa chọn phần cứng thực dụng cho SMB
- Hobbyist / thử nghiệm: 1 chiếc RTX 3090 hoặc 4090 (24 GB) → 35-40B model 4-bit. Đủ cho chat, code, RAG cỡ vừa.
- Mac-first: Mac Studio M3 Ultra (819 GB/s, tới 512 GB) → chứa được model rất to trên một box yên lặng, dùng MLX. Chậm hơn GPU rời về raw token/s nhưng "cái gì vừa thì vừa".
- Enterprise on-prem: DGX Spark (128 GB unified, 273 GB/s, full NVIDIA stack) → không phải quái vật bandwidth, mà là một developer appliance: bộ nhớ liền mạch + phần mềm NVIDIA trọn gói. Hỗ trợ NVFP4. Đây chính là hướng 5acAI-Lab đang triển khai cho SMB Việt Nam.
Bài học lớn nhất của phần hardware: đừng hỏi "phần cứng nào tốt nhất", hãy hỏi "tôi đang mua cái nghẽn cổ chai nào?" — dung lượng, bandwidth, hay phần mềm.
Phần 2 — Software/Inference: engine theo sau chiến lược, không phải ngược lại
Nguyên tắc đầu tiên về inference engine: bạn không chọn engine trước. Bạn chọn chiến lược hardware, hình dạng workload, và mô hình serving — engine theo sau.
Một engine không phải "model". Nó là traffic cop, memory manager, scheduler, cache accountant, parallelism planner, API surface — và đôi khi là cả deployment framework. Engine đúng phải khớp với memory hierarchy, interconnect, định dạng quantization, mục tiêu latency/throughput, và độ trưởng thành vận hành của bạn.
Bảng quyết định một trang
| Tình huống | Engine nên dùng |
|---|---|
| Laptop / edge / phần cứng lạ | llama.cpp |
| Mac-first workflows | MLX / MLX-LM |
| Một chiếc RTX local | ExLlamaV2 |
| 2-4+ GPU NVIDIA / CUDA | ExLlamaV3 |
| Serving production nói chung | vLLM |
| Long-context / MoE / routing | SGLang |
| Hiệu năng NVIDIA tối đa | TensorRT-LLM |
| Orchestration cluster | NVIDIA Dynamo |
Prefill và decode: hai chế độ, hai bài toán
Mọi LLM inference có hai pha:
- Prefill đọc prompt và dựng KV cache ban đầu. Nó compute-intensive — càng song song hóa được càng nhanh.
- Decode sinh từng token một, liên tục đọc lại trọng số và KV cache. Nó memory-bandwidth-bound — tốc độ decode bám theo bandwidth hơn là peak compute.
Điều này giải thích gần như mọi thứ: prompt ngắn + câu trả lời dài → decode thống trị → bandwidth và batching quan trọng. Prompt dài + câu trả lời ngắn → prefill thống trị → attention kernels và chunked prefill quan trọng. Nhiều người dùng → chất lượng scheduler quan trọng. Long context → KV cache thống trị → paged attention, KV quantization.
Các engine chính
- llama.cpp — vua portability. Chạy trên Apple Silicon (ARM NEON, Accelerate, Metal), x86 (AVX/AVX2/AVX512/AMX), RISC-V, CUDA, AMD HIP, Vulkan, CPU+GPU hybrid offload. llama-server cung cấp API tương thích OpenAI, Anthropic Messages, continuous batching, JSON schema, function calling, speculative decoding. Hạn chế: không dành cho multi-node production (RPC backend chỉ là proof-of-concept).
- MLX / MLX-LM — vũ khí Apple Silicon. Unified memory cho phép model to vừa trên Mac mà GPU rời 24 GB không thể. Chậm hơn GPU rời về raw tốc độ. Server của nó cảnh báo không nên dùng production.
- ExLlamaV2 / V3 — engine CUDA consumer cho một hoặc 2-4+ GPU, tối ưu cho quantized low-bit. V3 thêm EXL3 (dựa trên QTIP), tensor/expert parallelism, TabbyAPI OpenAI-compatible.
- vLLM — default cho open-source production serving. PagedAttention, continuous batching, chunked prefill, prefix caching, hỗ trợ rộng quantization (FP8, GPTQ, AWQ, GGUF...). Vẫn cần systems thinking: tune batching, context, parallelism.
- SGLang — "cousin có hệ thống não" của vLLM. RadixAttention prefix caching, prefill-decode disaggregation, rất giỏi structured outputs, long context, MoE.
- TensorRT-LLM — hiệu năng NVIDIA tối đa. FP8 (H100+) gấp đôi hiệu năng, giảm nửa bộ nhớ so với 16-bit. Đánh đổi portability.
Một cảnh báo đáng nhớ: nhiều bài hướng dẫn đề xuất Ollama vì tiện. Với production serving, tránh xa nó. Production nghĩa là bảo mật, observability, backpressure, routing, autoscaling và hành vi SLA — thứ mà một local runner không đảm bảo.
Đừng chọn theo một con số "tokens/s"
Benchmark tồi: "Tôi đạt 180 tok/s." Benchmark tốt phải ghi model chính xác, weights/quant, engine version, hardware, phân bố input/output, concurrency, và theo dõi TTFT, TPOT, p50/p95/p99, memory usage, cost per 1M tokens. Quy tắc vàng: không bao giờ so engine bằng tokens/s một người dùng; test đúng prompt và phân bố output thực tế của bạn, với concurrency thực.
Phần 3 — Models: open-weight đã trở thành tầng thượng hạng
Bước ngoặt lớn nhất của 2026 là ở phía model. Kỷ nguyên "Llama đấu với tất cả" đã qua. Open-weight giờ là lựa chọn ecosystem: trọng số, license, tokenizer, template, quantization, runtime support, serving path. Và các lab Trung Quốc đang dẫn đầu cuộc đua này.
Bốn cái tên đáng chú ý năm 2026
- Kimi K3 (Moonshot AI) — open-weight model to nhất từ Trung Quốc: 2.8T tham số, MoE 16/896 experts, context 1M token, Intelligence Index 57 — cao nhất trong mọi open-weight model. Đạt #1 bảng Agent, #2 WebDev. Open weights ngày 27/07/2026 (96 shards, ~1.56 TB). License riêng (không phải MIT).
- DeepSeek V4 — 284B Flash / 1.6T Pro, open source, context 1M, Hybrid Attention Architecture. Flash là model rẻ nhất về API trong tầng thượng hạng ($0.14/$0.28), Pro ở $0.44/$0.87. Lindy.ai chuyển sang DeepSeek V4 và tăng hiệu năng trên core use cases.
- GLM 5.2 (Z.ai) — bám sát Opus 4.8 trong vòng 1 điểm phần trăm trên agentic benchmarks ở khoảng 1/5 chi phí. Mạnh cho coding agents, long-horizon tasks, MoE, deployment.
- Qwen 3.5 / 3.6 — family open-weight phủ toàn dải: model nhỏ cho laptop, dense mid-size cho workstation, MoE cho multi-GPU, FP8, long context (27B dense lên tới 262K tokens), multilingual, coding, agentic. Qwen là default family hợp lý khi bạn muốn một hệ sinh thái duy nhất trải từ thử nghiệm laptop đến serving nghiêm túc.
Ghi chú về tên model: thị trường 2026 di chuyển rất nhanh. Ở thời điểm viết bài, các phiên bản đã xác minh là Qwen 3.5/3.6 và GLM 5.2. Hãy luôn kiểm tra model card mới nhất trước khi chọn — nhưng điều này không đổi bức tranh tổng thể: mô hình mở Trung Quốc đang cung cấp hiệu năng cao ở chi phí thấp.
MoE: đừng mắc bẫy tổng tham số
Mixture-of-Experts gây nhầm lẫn. "8x7B" nghe như 56B, nhưng mỗi token chỉ chạy một phần nhỏ experts. Vì vậy: compute cost ≠ memory cost. Tổng tham số quyết định footprint bộ nhớ; tham số active quyết định tốc độ. DeepSeek-V3 báo 671B tổng nhưng chỉ 37B active mỗi token; Kimi K3 là 2.8T tổng, 104B active. Nếu coi MoE như dense, bạn sẽ tính sai trầm trọng — có thể quá dư hoặc quá thiếu bộ nhớ.
Quantization: GGUF không phải phép màu
GGUF là container + chiến lược lượng tử tối ưu cho llama.cpp-style inference và CPU+GPU hybrid. Nhưng những con số bộ nhớ đó chỉ đúng trong runtime đó — chuyển sang framework khác, trọng số có thể bị dequantize và bộ nhớ tăng vọt. "Nó vừa trong 6 GB" là sự thật theo runtime, không phải sự thật phổ quát.
Quy tắc 2026: FP16/BF16 là baseline chất lượng; Q8/INT8 gần như không mất chất lượng nhưng vẫn to; Q4 là điểm ngọt mặc định cho chat và document; Q3/Q2 chỉ khi bắt buộc phải nhét model to hơn — và đó là lúc toán, code, structured output, tool use hỏng trước tiên. Một model nhỏ hơn ở precision cao hơn có thể đánh bại model to hơn bị nén quá mạnh. Đừng tôn sùng số tham số.
Tại sao SMB nên chạy local
Khi mô hình mở đạt tới chất lượng này với chi phí này, lý do để chạy local trở nên hiển nhiên:
- Chi phí dự đoán được: trả một lần cho phần cứng, không phải pay-as-you-go theo token có thể bất ngờ.
- Riêng tư: dữ liệu khách hàng, tài chính, code không rời khỏi tường nhà bạn.
- Không rate-limit: không bị giới hạn tốc độ, không bị đổi luật đột ngột.
- Không khóa vendor: bạn sở hữu trọng số, đổi model khi thị trường tốt hơn.
Phần 4 — Tại sao on-prem là quyết định đúng cho SMB và enterprise
Đến đây câu chuyện rời khỏi hobbyist và đi vào doanh nghiệp. Với một SMB Việt Nam — 800,000+ doanh nghiệp, hơn 95% là SMB, ngân sách IT trung bình 5.000-30.000 USD/năm, chi tiêu AI còn thấp (500-3.000 USD/năm) — mỗi đồng và mỗi quyết định đều tính. Và on-prem AI trả lời đúng những nỗi đau đó.
Bốn lý do chiến lược
- Data sovereignty: ngày càng nhiều SMB không muốn gửi dữ liệu khách hàng và tài chính lên cloud nước ngoài. GDPR, PDPA (luật bảo vệ dữ liệu cá nhân) thúc đẩy on-prem AI. Với doanh nghiệp Việt vốn ưa chuộng open-source, đây là lợi thế tự nhiên.
- Chi phí vận hành: token cost giảm 10x mỗi 18 tháng, nhưng một đội AI agent chạy suốt ngày đêm trên API có thể phình hóa đơn khó lường. Chạy local, chi phí trở thành chi phí cố định dự đoán được.
- Độ tin cậy và vận hành: không phụ thuộc uptime, thay đổi giá, hay export control của nhà cung cấp nước ngoài. Bạn là ops team của chính mình — khó hơn, nhưng kiểm soát tuyệt đối.
- Agentic workloads: multi-agent và tool use tạo concurrency cao, làm KV cache và latency trở thành vấn đề lớn trên API. Local cho phép bạn kiểm soát batching, context, và chi phí của từng agent loop.
Định vị 5acAI-Lab
5ac.vn được xây trên hai trụ cột: One-Person Company và Local AI Engine. 5acAI-Lab chính là mảnh Local AI: một engine on-prem dựa trên DGX Spark — 128 GB unified memory, 273 GB/s, full NVIDIA stack với NVFP4 — được thiết kế để doanh nghiệp vừa và nhỏ Việt Nam chạy agentic AI ngay trong tường nhà mình.
Chúng tôi không nói rằng on-prem là câu trả lời cho mọi thứ. Với khối lượng việc cần model chất lượng cao nhất tuyệt đối mà không có phần cứng tương xứng, hosted API vẫn là công cụ đúng. Nhưng với đa số SMB — nơi data riêng, chi phí ổn định, và tự chủ quan trọng hơn một vài điểm benchmark — on-prem đã là lựa chọn mặc định khôn ngoan.
"Khi bạn hiểu được VRAM math, bandwidth tier, và engine của mình, bạn ngừng hỏi 'tôi có chạy được model này không?' và bắt đầu hỏi 'tôi muốn chạy nó theo cách nào?' — đó là lúc bạn bắt đầu thiết kế hệ thống thay vì đoán mò."
Kết luận: Local AI 2026 là mặc định, không phải ngoại lệ
Hành trình từ hobbyist RTX 3090 đến enterprise on-prem không còn là khoảng cách xa. Cùng một công thức VRAM math, cùng các inference engine, cùng các open-weight models — chỉ khác quy mô. Cái đã thay đổi trong 2026 là độ trưởng thành: phần cứng đủ rẻ, engine đủ tốt, model mở đủ mạnh.
Với SMB, câu hỏi không còn là "có nên chạy local AI không". Câu hỏi là "bắt đầu từ đâu, với model nào, trên phần cứng nào, và cho workload nào trước". Bắt đầu nhỏ: một chiếc RTX 3090 cho thử nghiệm, một engine phù hợp, một model mở vừa sức. Khi bạn thấy được giá trị, mở rộng lên on-prem nghiêm túc.
Tại 5acAI-Lab, chúng tôi đang xây dựng chính con đường đó cho doanh nghiệp Việt Nam. Nếu bạn đang cân nhắc chạy AI trong tường nhà mình, và muốn hiểu ngăn xếp nào phù hợp với quy mô và dữ liệu của bạn, hãy liên hệ với 5acAI-Lab — chúng tôi đi cùng bạn từ chiếc GPU đầu tiên đến hạ tầng on-prem hoàn chỉnh.
Bước đi tiếp theo: Đọc series "Local LLMs From Zero to Hero" (bản dịch tiếng Việt trên blog 5ac) để nắm GPU Memory Math, Memory Bandwidth, Inference Engines, LLMs 101, LLM Engineering Projects, và Evals/Benchmarks. Đó là nền tảng vững chắc trước khi bạn mua phần cứng đầu tiên.