Một đoạn code do AI viết sai sẽ bị con người soát lại trước khi đi vào hệ thống thật. Đó là lớp chắn quen thuộc của mọi đội kỹ thuật. Một cú hành động sai của robot thì không có lớp chắn đó: nó không chờ ai duyệt, nó cứ thế xảy ra, ngay giữa căn nhà có cửa kính và trẻ nhỏ.

Câu gốc trong bài viết, nguyên văn tiếng Anh: "A bad robot action doesn't wait for human review and just happens." Tác giả là Perry Dong và Chelsea Finn, hai nhà nghiên cứu Stanford; bài đăng tháng 9/2026. Chủ đề nghe hàn lâm: post-training (tinh chỉnh sau huấn luyện trước) cho robot. Nhưng lập luận bên trong chạm đúng câu hỏi mà mọi doanh nghiệp đang chạy AI agent gặp hằng ngày: làm sao để thứ máy móc làm thay mình đáng tin từng ngày, chứ không chỉ ấn tượng trong buổi demo.

Trả lời nhanh: Robotics đang đi lại đúng giai đoạn LLM (mô hình ngôn ngữ lớn) thời GPT-2: model đã huấn luyện trước (pretraining) làm được việc phức tạp nhưng chưa đáng tin. Mảnh ghép còn thiếu là post-training. Theo hai tác giả, công thức 4 bước từng giúp LLM vượt qua cái tuổi đó là tấm bản đồ cho robotics, và họ cũng chỉ rõ tấm bản đồ gãy ở ba điểm nào.

99,9%ngưỡng tin cậy để robot chạy tự chủ một mình (theo nhóm tác giả)
500lệnh điều khiển cho một động tác nhấc ly (theo nhóm tác giả)
6nhiệm vụ thao tác thật EXPO-FT thử trên robot (theo nhóm tác giả)

TL;DR

  • Robotics đang ở đúng vị trí LLM thời GPT-2: phần huấn luyện trước đã phát triển rất tốt, model trôi chảy và biết nhiều, nhưng trôi chảy không phải đáng tin. Phần thiếu chính là post-training.
  • Công thức 4 bước giúp LLM chuẩn hoá post-training, nhưng chưa lắp thẳng vào robot được: dữ liệu thử nghiệm đắt, chuỗi hành động dài hàng nghìn bước, môi trường vật lý không bao giờ lặp lại y hệt.
  • Bằng chứng sớm, theo nhóm tác giả: hệ thống EXPO-FT đạt 30/30 lần thành công trên 6 nhiệm vụ, với trung bình khoảng 19 phút tương tác robot. Ba điểm chưa giải quyết: vẫn phụ thuộc con người, nhiệm vụ dài làm bộ chấm điểm bên trong chịu áp lực, và thời gian tính toán còn xa thời gian tương tác.

Robotics đang đứng đúng chỗ GPT-2 từng đứng

Ai từng dùng ChatGPT đời đầu sẽ nhớ cảm giác này: nó viết trôi chảy, trả lời có vẻ hiểu biết, và thi thoảng bịa một cách tự tin. Hai tác giả tóm GPT-2 thời đó bằng đúng ba chữ: "trôi chảy, hiểu biết, hoàn toàn không đáng tin". Ví dụ kinh điển của bài: hỏi GPT-2 cách nướng gà, nó trả lời bằng một đoạn lặp vô nghĩa rồi trôi dạt vào một thread Reddit mà nó tự tưởng tượng ra.

Bức tranh hôm nay thì sao? Nhóm Physical Intelligence, Generalist, DeepMind và các phòng lab robotics dẫn đầu đều đã có model huấn luyện trước làm được việc phức tạp thật: các model thị giác–ngôn ngữ–hành động (VLA, vision-language-action) và mô hình thế giới–hành động (WAM, world-action model), được huấn luyện trên kho dữ liệu khổng lồ. Hai tác giả kết luận: sự phát triển của robotics tiên tiến "trông rất giống sự phát triển của các model ngôn ngữ thời GPT-2".

Nhưng làm được việc phức tạp khác với đáng tin. Hai tác giả đặt một phép tính rất đời: một robot xếp bát đĩa đúng 95% số lần sẽ làm hỏng thứ gì đó mỗi tuần trong một ngôi nhà đầy kính, thú cưng và trẻ nhỏ. Muốn chạy tự chủ trong nhà hay trong nhà máy, độ tin cậy phải đi xa hơn nhiều về phía 99,9%. Ngưỡng của robot, nói cách khác, còn cao hơn ngưỡng của phần mềm, vì phần mềm còn có người soát lỗi trước khi sự cố xảy ra, còn robot thì hành động đã xảy ra rồi người ta mới kịp thấy.

Vì sao chủ doanh nghiệp Việt Nam nên đọc một bài về robot? Vì cùng cấu trúc bài toán đang chạy ngay trong phần mềm của bạn. AI agent viết báo cáo, trả lời khách hàng, theo dõi công nợ cũng đang sống trong cái tuổi "giỏi demo, chưa dám tin". Và trong 12–18 tháng tới, khi robot vật lý bắt đầu vào kho hàng, dây chuyền, bếp công nghiệp, ai hiểu đúng bài học này trước sẽ chọn được nhà cung cấp ít trả học phí hơn.

LLM đã thoát khỏi cái tuổi GPT-2 nhờ một mảnh ghép. Robotics đang thiếu đúng mảnh đó.

Công thức 4 bước từng cứu LLM khỏi tuổi demo

Mảnh ghép đó là post-training: giai đoạn model học từ phản hồi về chính hành vi của nó, thay vì chỉ học từ dữ liệu có sẵn. Với LLM, giai đoạn này không còn là nghệ thuật của vài phòng lab. Hai tác giả gọi thành quả đó là một "recipe": một công thức dùng chung, ai muốn tinh chỉnh (fine-tune) model nào cũng làm theo được. Cách họ tóm gọn gồm đúng 4 bước:

  1. Bắt đầu từ một model huấn luyện trước đủ mạnh.
  2. Định nghĩa môi trường và điểm thưởng (reward): hoặc kiểm chứng được, hoặc do model sở thích học từ lựa chọn của người dùng.
  3. Chạy tối ưu hoá bằng học tăng cường (reinforcement learning) với một họ thuật toán cụ thể, neo vào model tham chiếu.
  4. Canh và xử lý các bệnh đã biết, ví dụ reward hacking (model lách điểm thưởng thay vì làm đúng việc).

Giá trị của công thức không nằm ở từng bước riêng lẻ, mà ở chỗ nó biến tinh chỉnh thành con đường có sẵn. Nguyên văn bài viết: bất kỳ ai muốn tinh chỉnh LLM cho một tác vụ cụ thể đều có "con đường cụ thể để đi, với các kiểu thất bại đã được ghi chép và mặc định hợp lý ở mỗi bước". Đó là điều khiến post-training của LLM nhân rộng được ở quy mô lớn.

Còn robotics thì chưa. Hai tác giả viết thẳng: học tăng cường cho robotics tiên tiến "cho thấy tiềm năng đáng kinh ngạc, nhưng chưa phải là một công thức. Đó là một nghề thủ công". Nghề thủ công nghĩa là gì? Giống đầu bếp giỏi nêm nếm bằng cảm giác, làm được nhưng chỉ số ít người làm được. Để nghề thủ công thành công thức, họ cho rằng cần hai thứ. Thứ nhất là một thuật toán được thiết kế riêng: ổn định khi chạy trên model hàng tỷ tham số, và học được từ lượng kinh nghiệm nhỏ, vì mỗi lần thử đều tốn thời gian trên robot thật. Thứ hai, dễ bị bỏ qua nhưng quan trọng không kém: một bộ quy trình chuẩn bao quanh thuật toán, gồm cách mặc định để định nghĩa gì tính là thành công, để dọn lại bối cảnh giữa các lần thử, để một con người đưa phản hồi và biến phản hồi đó thành dữ liệu học.

Vấn đề là khi đem công thức ra khỏi màn hình và đặt vào cánh tay robot, nó kẹt ngay từ bước 2.

Vì sao công thức ChatGPT không lắp thẳng vào cánh tay robot

Bài viết chỉ ra ba giả định mà học tăng cường quy mô lớn dựa vào, và cả ba đều gãy khi chủ thể học là một cỗ máy vật lý.

Thứ nhất, tạo mẫu thử trong văn bản gần như miễn phí, tạo mẫu thử trên robot thì không. Một robot đang học gấp quần áo không thể thử một nghìn hành động khác nhau tại mỗi bước điều khiển, trong khi LLM tạo hàng nghìn bản nháp song song chẳng tốn mấy. Đường thoát hiển nhiên là mô phỏng, nhưng chính bài viết ghi nhận: mô phỏng vật lý thật chính xác đôi khi còn khó hơn học chính nhiệm vụ đó. Hệ quả là thuật toán phải tái sử dụng dữ liệu cũ, thu từ nhiều bước cập nhật trước đó, kiểu dữ liệu mà học tăng cường kinh điển vốn bỏ đi.

Thứ hai, nhiệm vụ của robot là chuỗi hành động dài. RL cho ngôn ngữ chủ yếu được đóng khung là "sinh một câu trả lời cho một câu hỏi"; nhiệm vụ của robot có thể nối dài hàng nghìn bước điều khiển. Nhấc một cái ly trông như một động tác, nhưng model phải xuất 500 lệnh nhỏ liên tiếp, và điểm thưởng chỉ đến ở cuối. Phân biệt được lệnh nào trong 500 lệnh đáng khen là bài toán quy trách nhiệm (credit assignment) thuộc hàng khó nhất. Bài viết có ghi chú công bằng: các tác vụ agentic của LLM gần đây cũng đang dài ra, nhưng vẫn chưa cùng tầm với vật lý.

Thứ ba, môi trường vật lý không lặp lại. Ngôn ngữ và cờ vua là môi trường xác định: cùng một nước đi cho cùng một kết quả. Với robot, gửi đúng một lệnh hai lần có thể cho hai hành vi hơi khác nhau, vì đồ vật trượt, cảm biến nhiễu, sàn không bằng phẳng, có gió. Model phải quy trách nhiệm cho những hành động cách đây hàng nghìn bước, xuyên qua các biến thiên cộng dồn theo thời gian.

Hai áp lực nêu trên đẩy cả ngành về phía value-based RL: các phương pháp học một hàm giá trị (value function), tức model chấm điểm, để phân bổ tín dụng qua chuỗi dài. Nhưng theo chính hai tác giả, value-based RL ở quy mô lớn đã được kiểm chứng ít hơn nhiều so với RL post-training của LLM. Các thuật toán cũ nổi tiếng (DDPG, TD3, SAC) sinh ra cho một thế hệ model khác: chúng giả định hành động rút từ phân phối chuẩn đơn giản, không hợp với model hiện đại sinh hành động theo kiểu diffusion, tức khử nhiễu từng bước cho tới khi ra một chuyển động mượt.

Giữa bức tranh không mấy thuận lợi đó, vẫn có nhóm đầu tiên báo cáo đi được một đoạn đáng kể. Không phải bằng cách áp cứng công thức, mà bằng cách thiết kế lại bài toán.

EXPO-FT: bằng chứng sớm và ba điều chưa giải quyết

Hệ thống của nhóm tác giả tên EXPO-FT, thử trên robot thật với các nhiệm vụ mà model huấn luyện trước không làm nổi đáng tin: luồn dây đèn trang trí qua các móc rồi cắm điện cho đèn sáng, đánh bi-a vào lỗ, cắm hoa vào cổ chai rượu vang, lật trứng trên chảo.

Thiết kế đáng chú ý nhất nằm ở một chi tiết nhỏ mà khéo. Model lớn không được cập nhật tự do theo RL. Một model nhẹ chỉ đề xuất các chỉnh sửa rất nhỏ, có chặn biên, lên hành động của model lớn. Tại mỗi bước, robot sinh vài ứng viên hành động từ model lớn, tạo phiên bản đã chỉnh có giá trị ước lượng cao hơn, rồi dùng hàm giá trị để chọn ứng viên tốt nhất.

Vì các chỉnh sửa bị giữ nhỏ nên một cú chỉnh nhẹ không thể đẩy robot làm việc nguy hiểm, và toàn bộ biến động của RL bị giam trong model nhỏ. Model nền, tức phần được huấn luyện bằng học bắt chước (imitation learning), vẫn học tiếp từ các hành động được chọn và chạy tốt, nên cải tiến do chỉnh sửa tìm ra được hấp thụ dần vào chính model lớn.

Trong lúc học, một người giám sát robot và có thể can thiệp bất cứ khi nào nó sắp đi sai. Những lần can thiệp đó được đưa ngược lại thành dữ liệu huấn luyện. Đây là dạng con người trong vòng lặp (human-in-the-loop): không phải để trông máy, mà để dạy máy bằng đúng khoảnh khắc nó sắp hỏng.

Số liệu tổng hợp mà nhóm tác giả công bố, cần đọc với tư cách kết quả tự báo cáo:

Chỉ sốSố liệu (theo nhóm tác giả)Cách đọc
Thành công trung bình trên 6 nhiệm vụ30/30 lầnMức tin cậy để nói tới chạy tự chủ, trên các nhiệm vụ ngắn
Thời gian tương tác robot trung bình cần để đạt mức đókhoảng 19 phútRất ngắn so với cách thu thập dữ liệu truyền thống
So sánh với các phương pháp đối chứngSFT (tinh chỉnh có giám sát), HG-DAgger, DSRL, HIL-SERLToàn bộ do nhóm tự báo cáo, chưa kiểm định độc lập

Nếu giữ đúng khi được kiểm định độc lập, ý nghĩa thực dụng rất lớn: theo nhóm tác giả, một model tiên tiến có thể được lắp lên nhiệm vụ thật rồi post-training tới 30/30 trong thời gian cỡ một buổi làm việc. Với một cỗ máy vật lý, đó là khoảng cách giữa "không ai dám để nó chạy một mình" và "chạy được trong nhà máy".

Rồi đây là con số cần đọc kỹ: 19 phút tương tác robot không phải là toàn bộ thời gian post-training. Phép cập nhật trọng số (gradient update) trên model cỡ này mới là thứ chi phối thời gian đồng hồ thực, và theo nhóm tác giả, thu hẹp khoảng cách đó là điều kiện để post-training trở thành quy trình hằng ngày.

Ba điều hệ thống này chưa giải quyết, chính nhóm tác giả tự liệt kê. Một: con người vẫn ở trong vòng lặp ở quy mô lớn — người định nghĩa thành công, người dọn lại bối cảnh giữa các lần thử, người can thiệp khi robot sắp sai. Khả năng mở rộng phụ thuộc vào việc mỗi robot thêm đòi hỏi bao nhiêu sự chú ý của con người; Waymo được nhắc như tham chiếu, nơi một người giám sát được nhiều xe cùng lúc. Hai: nhiệm vụ càng dài, việc quy trách nhiệm càng khó và bộ chấm điểm càng chịu áp lực; nhóm đã thử phần ngắn của phổ bài toán. Ba: chi phí tính toán như đoạn trên.

Trên lớp thuật toán, bài viết còn mở 5 câu hỏi về quy trình chuẩn mà chưa ai có câu trả lời mặc định: định nghĩa điểm thưởng thế nào (ngôn ngữ có RLVR, tức học tăng cường từ phần thưởng kiểm chứng được; robotics chưa có tương đương); dọn lại bối cảnh giữa các lượt thử bằng ai, khi hiện nay đó thường là việc của một người; tín hiệu can thiệp của người dùng nên cho bao nhiêu, cho lúc nào và dùng ra sao trong huấn luyện; bộ siêu tham số chỉnh thế nào, khi value-based RL nổi tiếng nhạy cảm; và khởi đầu từ bao nhiêu dữ liệu ban đầu, cân trọng số thế nào với dữ liệu thu mới trong lúc chạy. Hai tác giả xếp nhóm câu hỏi này vào hàng "vấn đề mở quan trọng nhất của lĩnh vực", và tin rằng chúng sẽ được giải bằng nỗ lực cộng đồng, bằng cách hội tụ về các câu trả lời chung.

Đến đây, bài viết chạm ranh giới của chính nó. Phần còn lại là cách chúng tôi đọc nó cho doanh nghiệp Việt.

Điểm nhìn của 5ac: đáng tin là quy trình, không phải tính năng

Điều đáng rút ra nhất từ bài viết không phải là con số của EXPO-FT, mà là cấu trúc của lập luận. Robot không trở nên đáng tin nhờ model lớn hơn. Nó trở nên đáng tin nhờ một hệ thống bao quanh: cách định nghĩa thành công, cách giữ biến động trong phạm vi an toàn, cách biến can thiệp của con người thành dữ liệu học. Câu kết của hai tác giả nói đúng điều đó: huấn luyện trước cho robotics model biết làm được gần như mọi thứ cùng lúc; post-training là cách chúng học làm mọi thứ đáng tin mỗi lần.

Đáng tin không phải một tính năng bạn mua kèm theo model. Nó là quy trình bạn dựng xung quanh model — và quy trình không nằm trong bảng giá API nào cả.

Cấu trúc đó giống hệt bài toán AI agent trong doanh nghiệp hôm nay. Một agent chạy tốt trong buổi demo không nói lên điều gì; điều nói lên là vòng lặp phía sau: ai định nghĩa việc xong, cách nào đo lỗi mỗi ngày, khi nó sai thì sai lầm quay lại thành dữ liệu hay thành thiệt hại. Trong vận hành G-Company OS của chúng tôi, phần khó nhất chưa bao giờ là chọn model. Phần khó là dựng vòng lặp đó, đúng như cách EXPO-FT dựng: đo, can thiệp sớm, đưa phản hồi ngược vào hệ thống. Bài viết về robot chỉ khiến phép loại suy này sắc hơn, vì robot thậm chí không có lớp người soát lỗi như phần mềm.

Nếu bạn đang dựng hệ thống agent cho doanh nghiệp, hai bài viết của chúng tôi đi thẳng vào bài toán này: agent control plane cho SMB Việt bàn về lớp kiểm soát khi agent chạy tự chủ, còn ba loại agent: Codex, Pi, Hermes là bản đồ toàn cảnh để chọn điểm bắt đầu.

Ba bài cùng mạch đi sâu hơn vào đúng bài toán này: multi-agent OS là gì cho bức tranh nền, lớp điều phối agent an toàn cho doanh nghiệp Việt bàn đúng cơ chế giữ biến động trong phạm vi an toàn, và kiểm soát chi phí token khi orchestration nói phần chi phí tính toán mà EXPO-FT chưa giải quyết.

Takeaway

Tuần này, khi đọc bất kỳ tin nào về robot hay AI agent, hãy mang theo ba câu hỏi của bài viết gốc. Một: nó đáng tin tới chữ số nào — 95% hay 99,9%? Hai: ai định nghĩa "thành công" và đo bằng gì? Ba: khi nó sai, sai lầm quay về thành dữ liệu học hay thành thiệt hại của bạn?

Một bước làm được ngay, không cần đợi robot: chọn một quy trình đang chạy thủ công trong công ty, để agent chạy thử 2 tuần, và đo tỉ lệ đúng thật theo từng ngày thay vì tin vào buổi demo. Chưa biết bắt đầu từ đâu thì bài AI Ops agentic cho SMB Việt Nam mô tả đúng vòng lặp đo, can thiệp và học cần dựng đầu tiên.

Câu hỏi thường gặp về bài học post-training cho robot

Post-training khác gì huấn luyện trước (pretraining)?

Huấn luyện trước cho model biết làm gần như mọi thứ cùng lúc, và đó là phần đã phát triển rất tốt ở robotics. Post-training là giai đoạn model học từ phản hồi về chính hành vi của nó, thay vì chỉ học từ dữ liệu có sẵn. Với LLM, giai đoạn này đã thành công thức chuẩn dùng chung. Với robot, theo hai tác giả, nó vẫn là nghề thủ công. Đó là mảnh ghép đang thiếu.

Vì sao công thức post-training của LLM không lắp thẳng vào robot?

Vì ba giả định của học tăng cường quy mô lớn đều gãy khi chủ thể học là một cỗ máy vật lý: tạo mẫu thử trên robot rất đắt, nhiệm vụ là chuỗi hành động dài với điểm thưởng chỉ đến ở cuối, và môi trường vật lý không lặp lại nên cùng một lệnh có thể cho hai hành vi hơi khác nhau. Mô phỏng không phải lối thoát, theo chính bài viết.

EXPO-FT đã chứng minh được gì và chưa chứng minh được gì?

Theo nhóm tác giả, EXPO-FT đưa model nền lên mức tin cậy cao trên các nhiệm vụ thao tác thật, với thời gian tương tác ngắn hơn nhiều cách thu dữ liệu truyền thống. Ba thứ chưa giải quyết: người vẫn định nghĩa thành công và dọn bối cảnh; nhiệm vụ dài làm bộ chấm điểm chịu áp lực; chi phí tính toán lớn hơn thời gian tương tác. Số liệu là tự báo cáo, chưa kiểm định độc lập.

Chủ doanh nghiệp Việt nên làm gì với bài học này?

Đừng mua độ tin cậy như một tính năng đi kèm model. Hãy chọn một quy trình đang làm thủ công, cho agent chạy thử, rồi đo tỉ lệ đúng thật theo từng ngày thay vì tin vào buổi demo. Trước khi mở rộng, cần trả lời: ai định nghĩa việc đã xong, cách đo lỗi mỗi ngày, và khi agent sai thì sai lầm quay lại thành dữ liệu học hay thành thiệt hại.

Nguồn tham khảo

  • Towards Universal Post-Training for Robotics, Perry Dong & Chelsea Finn (09/2026) — toàn bộ luận điểm, trích dẫn và số liệu trong bài này lấy từ bài gốc.
  • Ghi chú vị thế tác giả: Chelsea Finn đồng sáng lập Physical Intelligence, công ty được nêu trong bài và là nơi gắn với hệ thống EXPO-FT do nhóm tự xây. Bài gốc là bài viết quan điểm, không phải paper đã qua bình duyệt; các số liệu benchmark là kết quả nhóm tự báo cáo, chưa được kiểm định độc lập. Bài này giữ cách nói "theo nhóm tác giả" ở mọi vị trí số liệu xuất hiện.
James Marcus

Agent Content tại 5ac.vn — viết về AI agent, tự động hoá và vận hành doanh nghiệp nhỏ.

Đáng tin là quy trình, không phải tính năng. 5ac.vn xây và vận hành vòng lặp đo — can thiệp — học cho đội agent của doanh nghiệp nhỏ mỗi ngày. Xem bảng giá G-Company OS để bắt đầu với gói phù hợp.

Bài viết liên quan