Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Bản tin sinh tồn của nhân loại
VI

Các mô hình nền tảng thời đại AGI đang thay đổi những gì một cơ thể robot có thể làm như thế nào

Cách các phương pháp mô hình nền tảng thúc đẩy AGI được áp dụng cho cơ thể robot, thay thế điều khiển lập trình thủ công bằng khái quát hóa rộng hơn nhưng vẫn hạn chế.

Written by
Dwight Ringdahl
Status
Đã kiểm tra nguồn
Revised
Sources
16 cited
Reading
10 min

Hai cách cược khác nhau về cách một robot nên học

Robot học cổ điển xây dựng một nhiệm vụ bằng tay: các mô-đun cảm nhận, một bộ lập kế hoạch, một bộ giải động học nghịch, một máy trạng thái, và hàng nghìn dòng mã điều khiển được điều chỉnh cho một robot, một bộ kẹp, một tập hẹp các đối tượng. Nó mang lại điều gì đó có giá trị — những đảm bảo chính thức về những gì hệ thống sẽ và sẽ không làm — nhưng nó không chuyển giao được. Một nhiệm vụ mới, hoặc một cánh tay robot mới, thường có nghĩa là viết lại phần lớn ngăn xếp đó.

Cách cược đang định hình lại lĩnh vực này kể từ năm 2023 thì khác: cùng công thức đã tạo ra các mô hình ngôn ngữ lớn — bộ dữ liệu khổng lồ, một transformer, và quy mô — cũng nên hoạt động cho việc điều khiển robot, khám phá ra một “đa tạp” tổng quát cho kỹ năng vật lý theo cách nó đã khám phá ra một đa tạp cho văn bản và hình ảnh. Đó là một giả thuyết, không phải một sự thật đã được xác định, và bằng chứng cho đến nay thực sự lẫn lộn. Trang này trình bày những gì thực sự đã được chứng minh, bởi ai, và những người xây dựng các hệ thống này nói vẫn còn là những vấn đề mở.

Bằng chứng đầu tiên: token hành động và sự chuyển giao xuyên robot

RT-2 của Google DeepMind, công bố vào tháng 7 năm 2023, là một bài kiểm tra ban đầu, cụ thể về ý tưởng này. Thay vì xây dựng một mô-đun dự đoán hành động riêng biệt, DeepMind đã huấn luyện các token hành động robot trực tiếp vào bộ từ vựng đầu ra của chính một mô hình thị giác-ngôn ngữ, để cùng một mạng lưới mô tả một hình ảnh bằng lời cũng có thể phát ra một lệnh động cơ (arXiv:2307.15818). Trên 6.000 thử nghiệm đánh giá, nó đã khái quát hóa đến các đối tượng và bối cảnh chưa quen thuộc tốt hơn khoảng ba lần so với các đường cơ sở chuyên biệt cho nhiệm vụ trước đây — bằng chứng rằng kiến thức thị giác và ngôn ngữ quy mô web thực sự mang một số thông tin hữu ích cho việc thao tác.

Ba tháng sau, một sự hợp tác giữa 34 tổ chức đã tiến xa hơn với RT-X và tập dữ liệu Open X-Embodiment, gộp dữ liệu từ hàng chục loại robot khác nhau và huấn luyện một mô hình 55 tỷ tham số trên tất cả chúng (arXiv:2310.08864). Nó cho thấy thành công kỹ năng đột sinh cao hơn đáng kể so với một phiên bản 5 tỷ tham số của cùng kiến trúc — một tín hiệu ban đầu rằng quy mô cụ thể thúc đẩy sự chuyển giao xuyên các cơ thể robot khác nhau, chứ không chỉ trong một cơ thể.

Một lĩnh vực đông đúc các mô hình nền tảng cho cơ thể vật lý

Kết quả đó đã khởi động một làn sóng “mô hình nền tảng robot” do công ty xây dựng, mỗi mô hình có một kiến trúc khác nhau và mỗi mô hình đưa ra những tuyên bố xứng đáng được đọc như tuyên bố của công ty hơn là sự thật đã được xác minh độc lập.

π0 của Physical Intelligence (tháng 10 năm 2024) kết hợp mô hình thị giác-ngôn ngữ PaliGemma với một đầu hành động khớp dòng chảy, được huấn luyện trên tám hiện thân robot, và chứng minh các nhiệm vụ như gấp quần áo, dọn bàn, và đóng gói hàng tạp hóa. Bất thường đối với lĩnh vực này, Physical Intelligence đã công bố mã nguồn mở trọng số và mã dưới tên “openpi,” khiến kết quả có thể tái lập độc lập thay vì chỉ được tin tưởng. Ngay cả vậy, đánh giá của chính công ty vẫn thẳng thắn: “các chính sách robot tổng quát vẫn còn ở giai đoạn sơ khai, và chúng ta còn một chặng đường dài phía trước” (blog Physical Intelligence, 31/10/2024). Một phiên bản mới hơn, π0.7, tuyên bố khái quát hóa zero-shot trên các hiện thân robot (arXiv:2604.15483), nhưng tính đến thời điểm viết bài này, tuyên bố đó dựa trên một bản in trước chưa được tái lập độc lập.

NVIDIA phát hành GR00T N1 vào tháng 3 năm 2025 như mô hình nền tảng robot hình người mở đầu tiên, sau đó GR00T N1.7 vào tháng 4 năm 2026: một mô hình 3 tỷ tham số được huấn luyện trên 20.854 giờ video góc nhìn thứ nhất của con người và được xác thực trên ba nền tảng robot khác nhau, với trọng số mở trên Hugging Face. NVIDIA báo cáo rằng việc mở rộng quy mô dữ liệu huấn luyện góc nhìn thứ nhất đó khoảng hai mươi lần “hơn gấp đôi mức hoàn thành nhiệm vụ trung bình” trên các nhiệm vụ khéo léo — một tuyên bố đáng để đánh dấu là của riêng NVIDIA, vì không có bài đánh giá chuẩn độc lập nào đi kèm với nó (blog Hugging Face, 17/4/2026). Một phiên bản kế nhiệm, GR00T N2, đã được giới thiệu trước tại GTC vào tháng 3 năm 2026 như một “mô hình hành động thế giới” dự đoán các trạng thái tương lai trước khi hành động; tuyên bố trong bài phát biểu chính của NVIDIA rằng nó thành công ở các nhiệm vụ mới lạ “nhiều hơn gấp đôi” so với các đường cơ sở hàng đầu vẫn, tính đến tháng 9 năm 2026, là một tuyên bố sản phẩm chưa được phát hành hơn là một tuyên bố đã được kiểm chứng.

Người kế nhiệm của RT-2 từ Google DeepMind, Gemini Robotics 2 (còn gọi là ER 2), đã chuyển từ các minh chứng phần thân trên sang điều khiển toàn thân robot hình người trên Apollo 2 của Apptronik, bao gồm việc điều khiển một bàn tay năm ngón với 22 bậc tự do cho các nhiệm vụ như buộc nút và niêm phong túi. Các con số được công bố của chính DeepMind là thẳng thắn nhất trong lĩnh vực này: thành công 45,7–76,3% trên thao tác toàn thân và một mức rất biến động 32–92% trên sự khéo léo nhiều ngón, với DeepMind nói rõ ràng rằng “thao tác khéo léo nhiều ngón vẫn còn thách thức” (blog DeepMind, 30/7/2026). Chính tiêu đề của Bloomberg về việc phát hành này còn thẳng thừng hơn: robot của Google “đang vật lộn với sự khéo léo” (Bloomberg).

Sự so sánh trước-và-sau rõ ràng nhất: Helix 02 của Figure

Minh họa rõ ràng nhất về những gì thay đổi dưới cách tiếp cận này đến từ Figure. Hệ thống Helix ban đầu của họ (tháng 2 năm 2025) sử dụng một kiến trúc “Hệ thống 1 / Hệ thống 2” hai phần: một mô hình thị giác-ngôn ngữ 7 tỷ tham số suy luận ở 7–9 Hz, cấp cho một transformer 80 triệu tham số chạy điều khiển vận động tinh ở 200 Hz, được huấn luyện trên chỉ khoảng 500 giờ dữ liệu — Figure nói dưới 5% kích thước của các tập dữ liệu VLA trước đây (blog Figure, 20/2/2025).

Helix 02, ra mắt vào tháng 1 năm 2026, đã bổ sung một lớp thứ ba mà Figure gọi là “Hệ thống 0”: một bộ điều khiển thăng bằng toàn thân 10 triệu tham số, 1kHz được huấn luyện hoàn toàn trong mô phỏng trên hơn 200.000 môi trường cộng với hơn 1.000 giờ chuyển động của con người được tái định mục tiêu. Mô tả của chính Figure về những gì điều đó đã thay thế là sự so sánh cũ-so-với-mới sắc bén nhất có sẵn ở bất cứ đâu trong lĩnh vực này: Hệ thống 0 “thay thế 109.504 dòng mã C++ được kỹ thuật hóa thủ công bằng một tiên nghiệm nơ-ron duy nhất cho chuyển động ổn định, tự nhiên” (blog Figure, 27/1/2026). Đó là mô hình robot học cổ điển — logic điều khiển được liệt kê, điều chỉnh thủ công — bị thay thế hoàn toàn bởi một mô hình được học, theo chính lời kể của một công ty. Figure đã chứng minh một nhiệm vụ xếp máy rửa bát dài bốn phút, 61 hành động không cần con người thiết lập lại, trong khi cảnh báo trong cùng thông cáo đó rằng “các kết quả vẫn còn sớm.”

Boston Dynamics và Toyota Research Institute báo cáo một phát hiện liên quan nhưng có mức độ dè dặt hơn từ công trình “Mô hình Hành vi Lớn” trên robot hình người Atlas: những năng lực từng đòi hỏi lập trình thủ công giờ có thể được thêm vào mà không cần mã mới, vì một mô hình có quyền điều khiển trực tiếp toàn bộ robot (blog Boston Dynamics, 8/2025). Một nghiên cứu tiếp nối năm 2026 phát hiện rằng sau khi tinh chỉnh chuyên biệt cho nhiệm vụ, một mô hình hành vi đã được tiền huấn luyện cần ít hơn khoảng 3–5 lần dữ liệu chuyên biệt cho nhiệm vụ và vững chắc hơn trước các điều kiện thay đổi so với huấn luyện từ đầu (TRI) — một lợi ích hiệu quả thực sự, có giới hạn, không phải bằng chứng về tính tổng quát mở.

Chương trình Optimus của Tesla là ngoại lệ rõ ràng nhất của lĩnh vực này về tính minh bạch. Elon Musk và Ashok Elluswamy, người tiếp quản Optimus vào tháng 6 năm 2025, mô tả cùng kiến trúc đầu-cuối “photon vào, điều khiển ra” mà Tesla sử dụng cho phần mềm hỗ trợ lái xe của mình. Không giống DeepMind, NVIDIA, Physical Intelligence, hay Figure, Tesla chưa công bố một bài báo kỹ thuật về kiến trúc này — chỉ có các phát biểu tại hội nghị và bình luận trong cuộc gọi thu nhập (Not a Tesla App, tóm tắt cuộc gọi thu nhập Q2 2026 của Tesla, 8/2026).

Kỷ lục hẹp không phải là năng lực tổng quát

Thế vận hội Robot Hình người Thế giới tại Bắc Kinh (22–26 tháng 8 năm 2026) làm cho sự phân biệt giữa năng lực hẹp và tổng quát trở nên cụ thể. Trên 2.056 robot từ 666 đội, một máy móc, Tiangong Ultra, đã chạy 100 mét trong 8,64 giây — nhanh hơn kỷ lục thế giới 9,58 giây của con người Usain Bolt. Trong cùng giải đấu đó, việc đưa tin về các sự kiện bóng đá, quyền anh, và cử tạ mô tả các robot đang vật lộn trong các điều kiện phi cấu trúc, nhiều va chạm (Al Jazeera). Một cuộc chạy nước rút được kỹ thuật hóa, có thể lặp lại không phải là cùng thành tựu với năng lực linh hoạt trong một môi trường khó lường, và Thế vận hội này minh họa khoảng cách đó trong cùng một tuần chứ không phải trong trừu tượng.

Quan điểm về nền tảng thực tế

Vincent Vanhoucke, người đứng đầu bộ phận robot học tại Google DeepMind, đưa ra sự kiểm tra thực tế sắc bén nhất có sẵn về toàn bộ xu hướng này: “hầu hết — nếu không muốn nói là tất cả — các phương pháp học robot không thể được triển khai cho bất kỳ nhiệm vụ thực tế nào,” vì việc triển khai thực sự đòi hỏi “độ chính xác và độ tin cậy 99,X phần trăm hoặc cao hơn” trong khi các minh chứng học thuật báo cáo khoảng 80% thành công — theo lời ông, “một con thú về cơ bản khác,” không phải một vấn đề mở rộng quy mô có thể giải quyết bằng nhiều dữ liệu hơn (IEEE Spectrum, 28/5/2024).

Rodney Brooks, nhà robot học của MIT đồng sáng lập iRobot và Rethink Robotics, nhấn mạnh thêm về lý do vì sao việc huấn luyện bắt chước video cụ thể có thể là nền tảng sai: xúc giác liên quan đến một kênh mà các quy trình hiện tại chưa bao giờ nắm bắt được, với nghiên cứu khoa học thần kinh mà ông trích dẫn xác định ít nhất mười lăm họ nơ-ron cảm nhận xúc giác riêng biệt trong da người. Ông gọi các minh chứng thao tác ngày nay là sớm và hạn chế, và bác bỏ các tuyên bố rằng robot hình người sẽ đạt được sự khéo léo tổng quát cấp độ con người trong vòng vài thập kỷ là “tư duy hoàn toàn viển vông” (TechCrunch, 26/9/2025).

Cả hai điều đều đúng cùng lúc. Cách tiếp cận mô hình nền tảng đã tạo ra sự chuyển giao xuyên robot thực sự, được đo lường mà điều khiển lập trình thủ công chưa bao giờ đạt được, và mọi phòng thí nghiệm đáng tin cậy công bố số liệu — không chỉ những người hoài nghi — báo cáo tỷ lệ thành công còn kém xa những gì độ tin cậy công nghiệp và gia dụng thực sự đòi hỏi.

References

Summarized position

Google DeepMind trained robot action tokens directly into a vision-language model’s output vocabulary and reported roughly 3x better generalization to unseen objects, backgrounds, and settings than prior baselines across 6,000 evaluation trials.

Google DeepMind, Authors, "RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control"
arXiv, Primary source
Summarized position

Vincent Vanhoucke said most robot-learning approaches "cannot be deployed for any practical task" because real-world use demands 99.X percent reliability, calling that bar "a fundamentally different beast" from an 80 percent-success research demo.

Vincent Vanhoucke, Head of robotics, Google DeepMind / Google Research
IEEE Spectrum ("Will Scaling Solve Robotics?" by Nishanth J. Kumar), Reported interview
Summarized position

Google DeepMind disclosed whole-body manipulation success rates of 45.7–76.3% and multi-finger dexterity success of 32–92% for Gemini Robotics 2 on Apptronik’s Apollo 2, stating that "multi-finger dexterous manipulation remains challenging".

Google DeepMind, Gemini Robotics 2 / ER 2 announcement
DeepMind blog, Primary source
Summarized position

Figure said Helix 02’s new "System 0" whole-body balance controller "replaces 109,504 lines of hand-engineered C++ with a single neural prior for stable, natural motion," trained on over 1,000 hours of retargeted human motion across more than 200,000 simulated environments, and cautioned that "the results are early".

Figure, Helix 02 announcement
Figure AI blog, Primary source
Summarized position

NVIDIA reported that scaling GR00T N1.7’s egocentric-video training data from roughly 1,000 to 20,854 hours "more than doubles average task completion" on dexterous manipulation tasks, without citing an independent benchmark.

NVIDIA, GR00T N1.7 announcement
Hugging Face / NVIDIA blog, Primary source
Summarized position

Rodney Brooks argued that current video-imitation training pipelines skip the tactile channel entirely — citing touch-sensing research describing at least fifteen distinct families of touch neurons in human skin — and called claims that humanoids will reach human-level general dexterity within decades "pure fantasy thinking".

Rodney Brooks, Roboticist; MIT CSAIL emeritus; co-founder, iRobot and Rethink Robotics
"Why Today’s Humanoids Won’t Learn Dexterity" (rodneybrooks.com), Primary source
  1. arXiv:2310.08864 arxiv.org
  2. blog Physical Intelligence pi.website
  3. arXiv:2604.15483 arxiv.org
  4. Bloomberg bloomberg.com
  5. blog Figure figure.ai
  6. blog Boston Dynamics bostondynamics.com
  7. TRI toyotaresearchinstitute.github.io
  8. Not a Tesla App, tóm tắt cuộc gọi thu nhập Q2 2026 của Tesla notateslaapp.com
  9. Al Jazeera aljazeera.com
  10. TechCrunch techcrunch.com

Type to search the manual.

navigate open esc close