Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI 人类生存简报
ZH

AGI 时代的基础模型如何改变机器人身体的能力

推动 AGI 进展的基础模型方法,如何被应用于机器人身体,用更广泛、却仍然有限的泛化能力,取代手工编码的控制方式。

Written by
Dwight Ringdahl
Status
来源已核查
Revised
Sources
16 cited
Reading
1 min

关于机器人应当如何学习的两种不同押注

传统的机器人技术,是靠人工一点点搭建出一项任务:感知模块、规划器、逆运动学求解器、状态机,以及数千行针对某一台机器人、某一个夹爪、某一小类物体反复调优的控制代码。它提供了一些有价值的东西——关于系统会做什么、不会做什么的形式化保证——但它无法迁移。换一项新任务,或换一条新的机械臂,通常就意味着要重写这套技术栈的大部分内容。

自 2023 年以来重塑这一领域的,是另一种押注:打造大语言模型的那套配方——海量数据集、一个 Transformer 架构,再加上规模——也应当同样适用于机器人控制,以发现物理技能的一种通用「流形」,就像它曾在文本与图像领域发现的那样。这是一个假说,而不是一个已经确定的事实,而且迄今为止的证据确实喜忧参半。本页梳理的是目前已经被真正证实的内容、由谁证实,以及打造这些系统的人自己表示仍未解决的问题。

最初的证据:动作词元与跨机器人迁移

Google DeepMind 于 2023 年 7 月发布的 RT-2,是对这一想法的一次早期、具体的检验。DeepMind 没有另外构建一个独立的动作预测模块,而是直接把机器人动作词元训练进了一个视觉语言模型自身的输出词表之中,使得同一个网络,既能用语言描述一张图像,也能发出一条运动指令(arXiv:2307.15818)。在 6000 次评估试验中,它对陌生物体与陌生环境的泛化表现,比此前针对特定任务的基线模型高出约三倍——这是网络规模级别的视觉与语言知识,确实携带了一些对操作任务有用信息的证据。

三个月后,一项由 34 家机构参与的合作项目,借助 RT-X 与 Open X-Embodiment 数据集,把这一想法向前推进了一步:汇集了数十种不同机器人类型的数据,并在全部数据上训练出一个 550 亿参数的模型(arXiv:2310.08864)。结果显示,其涌现出的技能成功率,明显高于同一架构的 50 亿参数版本——这是一个早期信号,表明规模效应特别能够推动跨越不同机器人身体的迁移能力,而不仅仅是在单一机器人身体内部起作用。

一个拥挤的「机器人身体基础模型」赛道

这一结果引发了一波由各公司自行打造「机器人基础模型」的浪潮,每一家都采用不同的架构,每一家给出的说法,都应当被当作企业自身的宣称,而不是经过独立验证的事实来看待。

Physical Intelligence 的 π0(2024 年 10 月),将 PaliGemma 视觉语言模型与一个流匹配式的动作输出头结合起来,在八种机器人本体上进行训练,并展示了叠衣物、清理餐桌与打包购物袋等任务。在这一领域中比较少见的是,Physical Intelligence 以「openpi」之名开源了权重与代码,使得这一结果能够被独立复现,而不是仅凭信任来接受。即便如此,该公司自己的评估也十分坦率:「通用型机器人策略仍处于起步阶段,我们还有很长的路要走」(Physical Intelligence 博客,2024 年 10 月 31 日)。一个更新的版本 π0.7,宣称能够实现跨机器人本体的零样本泛化(arXiv:2604.15483),但截至本文撰写时,这一说法仅依据一篇尚未经过独立复现的预印本论文。

英伟达于 2025 年 3 月发布了 GR00T N1,作为首个开放的人形机器人基础模型,随后在 2026 年 4 月发布了 GR00T N1.7:一个 30 亿参数的模型,在 20854 小时的人类第一视角视频上训练而成,并在三种不同的机器人平台上完成了验证,权重在 Hugging Face 上开放。英伟达报告称,将这类第一视角训练数据规模扩大约二十倍,「使灵巧任务的平均完成率提升了一倍以上」——这一说法值得标注为英伟达自己的宣称,因为并没有独立的基准测试伴随其后(Hugging Face 博客,2026 年 4 月 17 日)。其后继版本 GR00T N2,已于 2026 年 3 月的 GTC 大会上以「世界行动模型」的名义预览,该模型会在行动之前预测未来的状态;英伟达在主题演讲中宣称,它在新颖任务上的成功率「比领先的基线模型高出一倍以上」,但截至 2026 年 9 月,这仍是一款尚未发布产品的宣称,而不是一项经过测试的结果。

Google DeepMind 对 RT-2 的后继产品 Gemini Robotics 2(也称 ER 2),已从上半身演示,发展到在 Apptronik 的 Apollo 2 上实现全身型人形控制,包括操控一只具有 22 个自由度的五指手,完成打结、封口袋等任务。DeepMind 自己披露的数字,是这一领域中最为坦诚的:全身操作成功率为 45.7% 至 76.3%,多指灵巧操作成功率则波动极大,介于 32% 至 92% 之间,DeepMind 明确表示「多指灵巧操作仍然充满挑战」(DeepMind 博客,2026 年 7 月 30 日)。彭博社对这一发布的报道标题,说得更加直白:谷歌的机器人「在灵巧性上举步维艰」(彭博社)。

最清晰的前后对比:Figure 的 Helix 02

在这一方法之下究竟发生了怎样的变化,最清晰的一个例证来自 Figure。其最初的 Helix 系统(2025 年 2 月)采用了一种两段式的「系统一/系统二」架构:一个 70 亿参数的视觉语言模型,以 7-9 赫兹的频率进行推理,将结果输入一个 8000 万参数的 Transformer,后者以 200 赫兹的频率运行精细运动控制,训练数据仅约 500 小时——Figure 表示,这只有此前视觉-语言-动作(VLA)数据集规模的不到 5%(Figure 博客,2025 年 2 月 20 日)。

2026 年 1 月发布的 Helix 02,新增了 Figure 称之为「系统零」的第三层:一个 1000 万参数、以 1 千赫兹运行的全身平衡控制器,完全在超过 20 万个模拟环境中训练而成,并叠加了超过 1000 小时经过重新映射的人类动作数据。Figure 自己对这一层所取代内容的描述,是这一领域中新旧方法对比最鲜明的一个例子:系统零「用一个单一的神经先验模型,取代了 109504 行手工编写的 C++ 代码,以实现稳定、自然的动作」(Figure 博客,2026 年 1 月 27 日)。按照这家公司自己的说法,这正是传统机器人范式——枚举式、手工调优的控制逻辑——被一个习得的模型整体取代的过程。Figure 展示了一项耗时四分钟、包含 61 个动作、无需人工重置的洗碗机装载任务,同时在同一份公告中提醒称「这些结果还处于早期阶段」。

Boston Dynamics 与丰田研究院,在 Atlas 人形机器人上开展的「大型行为模型」研究中,报告了一个相关、但更为审慎的发现:曾经需要手工编程才能实现的能力,如今无需新代码即可添加,因为一个模型直接控制着整台机器人(Boston Dynamics 博客,2025 年 8 月)。一项 2026 年的后续研究发现,经过针对特定任务的微调后,一个预训练的行为模型所需的特定任务数据,比从零开始训练要少大约三到五倍,并且在条件变化时表现得更为稳健(丰田研究院)——这是一项真实的、有边界的效率提升,而不是开放式通用能力的证据。

特斯拉的 Optimus 项目,是这一领域中在透明度方面最为突出的一个反例。Elon Musk 与自 2025 年 6 月起接管 Optimus 项目的 Ashok Elluswamy,所描述的都是特斯拉用于其驾驶辅助软件那种「光子输入、控制输出」的端到端架构。与 DeepMind、英伟达、Physical Intelligence 或 Figure 不同,特斯拉从未就这一架构发表过任何技术论文——只有会议发言与财报电话会议中的评论(Not a Tesla App,总结特斯拉 2026 年第二季度财报电话会议内容,2026 年 8 月)。

狭窄的纪录并不等于通用的胜任能力

2026 年 8 月 22 日至 26 日在北京举办的世界人形机器人运动会,将狭窄能力与通用能力之间的区别具体地呈现了出来。在来自 666 支队伍的 2056 台机器人中,一台名为「天工 Ultra」的机器,以 8.64 秒的成绩跑完了 100 米——比尤塞恩·博尔特 9.58 秒的人类世界纪录还要快。而在同一届赛事中,关于足球、拳击与举重项目的报道则描述了机器人在非结构化、高接触强度的条件下步履维艰(半岛电视台)。一次可重复的、经过工程优化的短跑成绩,与在不可预测环境中展现出灵活的胜任能力,并不是同一种成就,而这届运动会恰恰在同一周之内,而不是在抽象的讨论中,展示出了这道差距。

立足现实的观点

执掌 Google DeepMind 机器人业务的 Vincent Vanhoucke,对这整个趋势给出了最尖锐的现实检验:「大多数——如果不是全部的话——机器人学习方法,都无法被部署到任何实际任务中」,因为真正的部署需要「99 点几乃至更高的准确性与可靠性」,而学术演示所报告的成功率大约只有 80%——用他的话说,这「本质上是一头完全不同的野兽」,而不是一个只需增加数据就能解决的规模化问题(IEEE Spectrum,2024 年 5 月 28 日)。

麻省理工学院机器人学专家、iRobot 与 Rethink Robotics 的联合创始人 Rodney Brooks,进一步指出了为何视频模仿式训练在这一领域可能是一种错误的技术底层:触觉涉及一种当前技术管线从未捕捉到的信息通道,他所援引的神经科学研究指出,人类皮肤中至少存在 15 种不同类别的触觉感受神经元。他将当今的操作演示称为早期且有限的,并驳斥了人形机器人将在数十年内达到人类水平通用灵巧度的说法,称之为「纯粹的幻想式思维」(TechCrunch,2025 年 9 月 26 日)。

两件事可以同时成立。基础模型这一方法,确实产生了手工编码控制从未实现过的、真实可测量的跨机器人迁移能力;同时,每一家公布数据的可信实验室——而不仅仅是怀疑论者——所报告的成功率,也都远远达不到工业与家庭场景实际所需的可靠性水平。

References

Summarized position

Google DeepMind trained robot action tokens directly into a vision-language model’s output vocabulary and reported roughly 3x better generalization to unseen objects, backgrounds, and settings than prior baselines across 6,000 evaluation trials.

Google DeepMind, Authors, "RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control"
arXiv, Primary source
Summarized position

Vincent Vanhoucke said most robot-learning approaches "cannot be deployed for any practical task" because real-world use demands 99.X percent reliability, calling that bar "a fundamentally different beast" from an 80 percent-success research demo.

Vincent Vanhoucke, Head of robotics, Google DeepMind / Google Research
IEEE Spectrum ("Will Scaling Solve Robotics?" by Nishanth J. Kumar), Reported interview
Summarized position

Google DeepMind disclosed whole-body manipulation success rates of 45.7–76.3% and multi-finger dexterity success of 32–92% for Gemini Robotics 2 on Apptronik’s Apollo 2, stating that "multi-finger dexterous manipulation remains challenging".

Google DeepMind, Gemini Robotics 2 / ER 2 announcement
DeepMind blog, Primary source
Summarized position

Figure said Helix 02’s new "System 0" whole-body balance controller "replaces 109,504 lines of hand-engineered C++ with a single neural prior for stable, natural motion," trained on over 1,000 hours of retargeted human motion across more than 200,000 simulated environments, and cautioned that "the results are early".

Figure, Helix 02 announcement
Figure AI blog, Primary source
Summarized position

NVIDIA reported that scaling GR00T N1.7’s egocentric-video training data from roughly 1,000 to 20,854 hours "more than doubles average task completion" on dexterous manipulation tasks, without citing an independent benchmark.

NVIDIA, GR00T N1.7 announcement
Hugging Face / NVIDIA blog, Primary source
Summarized position

Rodney Brooks argued that current video-imitation training pipelines skip the tactile channel entirely — citing touch-sensing research describing at least fifteen distinct families of touch neurons in human skin — and called claims that humanoids will reach human-level general dexterity within decades "pure fantasy thinking".

Rodney Brooks, Roboticist; MIT CSAIL emeritus; co-founder, iRobot and Rethink Robotics
"Why Today’s Humanoids Won’t Learn Dexterity" (rodneybrooks.com), Primary source
  1. arXiv:2310.08864 arxiv.org
  2. Physical Intelligence 博客 pi.website
  3. arXiv:2604.15483 arxiv.org
  4. 彭博社 bloomberg.com
  5. Figure 博客 figure.ai
  6. Boston Dynamics 博客 bostondynamics.com
  7. 丰田研究院 toyotaresearchinstitute.github.io
  8. Not a Tesla App,总结特斯拉 2026 年第二季度财报电话会议内容 notateslaapp.com
  9. 半岛电视台 aljazeera.com
  10. TechCrunch techcrunch.com

Type to search the manual.

navigate open esc close