Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Брифинг о выживании человечества
RU

Как базовые модели эпохи AGI меняют возможности тела робота

Как методы базовых моделей, движущие прогресс AGI, приходят в тела роботов, заменяя ручное программирование более широкой, но ограниченной обобщающей способностью.

Written by
Dwight Ringdahl
Status
Источники проверены
Revised
Sources
16 cited
Reading
7 min

Две разные ставки на то, как должен обучаться робот

Классическая робототехника строит задачу вручную: модули восприятия, планировщик, решатель обратной кинематики, конечный автомат состояний и тысячи строк управляющего кода, настроенного под один робот, один захват, один узкий набор объектов. Это даёт нечто ценное — формальные гарантии того, что система будет и чего не будет делать, — но не переносится на другие случаи. Новая задача или новая рука-манипулятор обычно означают переписывание значительной части стека.

Ставка, переформатирующая область с 2023 года, иная: тот же рецепт, что дал большие языковые модели — огромные наборы данных, трансформер и масштаб, — должен сработать и для управления роботом, обнаружив общее «многообразие» для физического навыка так же, как оно было обнаружено для текста и изображений. Это гипотеза, а не установленный факт, и имеющиеся доказательства на самом деле неоднозначны. Эта страница излагает, что действительно было продемонстрировано, кем и какие проблемы, по словам создателей этих систем, остаются открытыми.

Первые доказательства: токены действий и перенос между разными роботами

RT-2 от Google DeepMind, опубликованная в июле 2023 года, стала ранней, конкретной проверкой этой идеи. Вместо создания отдельного модуля предсказания действий DeepMind обучила токены роботизированных действий прямо в собственном словаре вывода модели «зрение — язык», так что та же сеть, которая описывает изображение словами, может выдавать и моторную команду (arXiv:2307.15818). В 6000 оценочных испытаниях модель обобщалась на незнакомые объекты и условия примерно втрое лучше, чем прежние специализированные для конкретной задачи базовые линии, — доказательство того, что визуальные и языковые знания веб-масштаба действительно несут информацию, полезную для манипулирования объектами.

Три месяца спустя коллаборация из 34 институтов пошла дальше с RT-X и набором данных Open X-Embodiment, объединив данные с десятков разных типов роботов и обучив одну модель с 55 миллиардами параметров на всех них (arXiv:2310.08864). Она показала существенно более высокий успех в эмерджентных навыках, чем версия той же архитектуры с 5 миллиардами параметров, — ранний сигнал того, что именно масштаб движет переносом между разными телами роботов, а не только внутри одного.

Переполненное поле базовых моделей для тел

Этот результат вызвал волну корпоративных «базовых моделей для роботов», каждая со своей архитектурой и заявлениями, которые следует читать как заявления компаний, а не как независимо подтверждённые факты.

π0 от Physical Intelligence (октябрь 2024 года) объединила модель «зрение — язык» PaliGemma с головой действий на основе согласования потоков (flow matching), обученную на восьми воплощениях робота, и продемонстрировала такие задачи, как складывание белья, уборка со стола и упаковка продуктов в пакеты. Необычно для этой области, Physical Intelligence опубликовала веса и код в открытом доступе под названием «openpi», сделав результат независимо воспроизводимым, а не принимаемым на веру. Тем не менее собственная оценка компании была прямолинейной: «универсальные робото-политики всё ещё в зачаточном состоянии, и нам предстоит долгий путь» (блог Physical Intelligence, 31 октября 2024 года). Более новая версия, π0.7, заявляет об обобщении с нуля примеров между воплощениями робота (arXiv:2604.15483), но на момент написания это утверждение опирается на препринт, который не был независимо воспроизведён.

NVIDIA выпустила GR00T N1 в марте 2025 года как первую открытую базовую модель для человекоподобных роботов, а затем GR00T N1.7 в апреле 2026 года: модель с 3 миллиардами параметров, обученная на 20 854 часах видео от первого лица, снятого людьми, и проверенная на трёх различных робототехнических платформах, с открытыми весами на Hugging Face. NVIDIA сообщила, что увеличение объёма этих данных от первого лица примерно в двадцать раз «более чем удваивает среднее выполнение задач» в задачах, требующих ловкости, — утверждение, которое стоит пометить как исходящее от самой NVIDIA, поскольку его не сопровождает независимый эталонный тест (блог Hugging Face, 17 апреля 2026 года). Преемник, GR00T N2, был анонсирован на GTC в марте 2026 года как «модель действий мира», предсказывающая будущие состояния перед действием; заявление в основном докладе о том, что она справляется с новыми задачами «более чем вдвое чаще», чем ведущие базовые линии, по состоянию на сентябрь 2026 года остаётся заявлением о ещё не выпущенном продукте, а не проверенным фактом.

Преемник RT-2 от Google DeepMind, Gemini Robotics 2 (также называемая ER 2), перешла от демонстраций верхней части тела к управлению человекоподобным роботом целиком на платформе Apollo 2 от Apptronik, включая управление пятипалой кистью с 22 степенями свободы для таких задач, как завязывание узлов и запечатывание пакетов. Собственные раскрытые цифры DeepMind — самые откровенные в этой области: 45,7–76,3% успеха в манипулировании всем телом и крайне изменчивые 32–92% в многопальцевой ловкости, при этом DeepMind прямо заявляет, что «многопальцевое ловкое манипулирование остаётся сложной задачей» (блог DeepMind, 30 июля 2026 года). Собственный заголовок Bloomberg об этом релизе был ещё прямолинейнее: роботы Google «испытывают трудности с ловкостью» (Bloomberg).

Самое наглядное «до и после»: Helix 02 от Figure

Самая наглядная иллюстрация того, что меняется при таком подходе, — пример Figure. Её изначальная система Helix (февраль 2025 года) использовала двухчастную архитектуру «Система 1 / Система 2»: модель «зрение — язык» с 7 миллиардами параметров, рассуждающая с частотой 7–9 Гц, подавала данные на трансформер с 80 миллионами параметров, выполняющий тонкое моторное управление с частотой 200 Гц, обученный всего на примерно 500 часах данных — по словам Figure, менее 5% от размера прежних наборов данных VLA (блог Figure, 20 февраля 2025 года).

Helix 02, выпущенная в январе 2026 года, добавила третий слой, который Figure называет «Система 0»: контроллер баланса всего тела с 10 миллионами параметров и частотой 1 кГц, полностью обученный в симуляции более чем в 200 000 сред плюс более 1000 часов переориентированного человеческого движения. Собственное описание Figure того, что это заменило, — самое яркое доступное в этой области сравнение старого и нового: Система 0 «заменяет 109 504 строки вручную спроектированного кода на C++ единым обученным нейросетевым априором для устойчивого, естественного движения» (блог Figure, 27 января 2026 года). Это парадигма классической робототехники — перечисленная, вручную настроенная логика управления — полностью заменённая обученной моделью, по собственному описанию одной компании. Figure продемонстрировала четырёхминутную задачу загрузки посудомоечной машины из 61 действия без вмешательства человека для сброса, оговорившись в том же релизе, что «результаты пока ранние».

Boston Dynamics и Toyota Research Institute сообщают о смежной, но более сдержанной находке в рамках работы над «крупными поведенческими моделями» на человекоподобном роботе Atlas: возможности, ранее требовавшие ручного программирования, теперь можно добавлять без нового кода, поскольку одна модель напрямую управляет всем роботом (блог Boston Dynamics, август 2025 года). Последующее исследование 2026 года показало, что после дообучения под конкретную задачу предобученная поведенческая модель требовала примерно в 3–5 раз меньше специфичных для задачи данных и была устойчивее к меняющимся условиям, чем обучение с нуля (TRI) — реальный, но ограниченный выигрыш в эффективности, а не доказательство открытой универсальности.

Программа Optimus от Tesla — самое явное исключение в этой области с точки зрения прозрачности. Илон Маск и Эшок Эллусвами, возглавивший Optimus в июне 2025 года, описывают ту же сквозную архитектуру «фотоны на входе, управляющие сигналы на выходе», которую Tesla использует для своего программного обеспечения помощи водителю. В отличие от DeepMind, NVIDIA, Physical Intelligence или Figure, Tesla не опубликовала технической статьи об этой архитектуре — только выступления на конференциях и комментарии в ходе звонков по итогам квартала (Not a Tesla App, обзор звонка Tesla по итогам второго квартала 2026 года, август 2026 года).

Узкие рекорды — не общая компетентность

Всемирные игры человекоподобных роботов в Пекине (22–26 августа 2026 года) наглядно демонстрируют различие между узкой и общей способностью. Среди 2056 роботов от 666 команд одна машина, Tiangong Ultra, пробежала 100 метров за 8,64 секунды — быстрее человеческого мирового рекорда Усэйна Болта в 9,58 секунды. На том же турнире освещение соревнований по футболу, боксу и тяжёлой атлетике описывало роботов, испытывающих трудности в неструктурированных условиях с интенсивным физическим контактом (Al Jazeera). Повторяемый, инженерно отточенный спринт — не то же самое достижение, что гибкая компетентность в непредсказуемой среде, и Игры проиллюстрировали этот разрыв в течение одной и той же недели, а не абстрактно.

Взгляд, возвращающий к почве

Винсент Ванхукке, возглавляющий направление робототехники в Google DeepMind, предлагает самую резкую проверку реальностью применительно ко всей этой тенденции: «большинство — если не все — подходы к обучению роботов невозможно развернуть для какой-либо практической задачи», потому что реальное развёртывание требует «точности и надёжности на уровне 99,X процента или выше», тогда как академические демонстрации сообщают об успехе примерно в 80% случаев, — по его словам, это «принципиально иной зверь», а не проблема масштаба, решаемая большим объёмом данных (IEEE Spectrum, 28 мая 2024 года).

Родни Брукс, специалист по робототехнике из MIT, соучредитель iRobot и Rethink Robotics, идёт дальше в вопросе о том, почему обучение через имитацию видео в частности может оказаться неверным субстратом: осязание задействует канал, который нынешние конвейеры никогда не улавливают, ссылаясь на исследования в нейронауке, выявляющие как минимум пятнадцать различных семейств осязательных нейронов в коже человека. Он называет сегодняшние демонстрации манипулирования ранними и ограниченными и отвергает утверждения о том, что человекоподобные роботы достигнут общей ловкости человеческого уровня в течение десятилетий, как «чистое фантазёрство» (TechCrunch, 26 сентября 2025 года).

Обе вещи верны одновременно. Подход на основе базовых моделей дал реальный, измеренный перенос между разными роботами, которого вручную запрограммированное управление никогда не достигало, и каждая заслуживающая доверия лаборатория, публикующая цифры, — не только скептики — сообщает о показателях успеха, значительно недотягивающих до того, что реально требуется для промышленной и бытовой надёжности.

References

Summarized position

Google DeepMind trained robot action tokens directly into a vision-language model’s output vocabulary and reported roughly 3x better generalization to unseen objects, backgrounds, and settings than prior baselines across 6,000 evaluation trials.

Google DeepMind, Authors, "RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control"
arXiv, Primary source
Summarized position

Vincent Vanhoucke said most robot-learning approaches "cannot be deployed for any practical task" because real-world use demands 99.X percent reliability, calling that bar "a fundamentally different beast" from an 80 percent-success research demo.

Vincent Vanhoucke, Head of robotics, Google DeepMind / Google Research
IEEE Spectrum ("Will Scaling Solve Robotics?" by Nishanth J. Kumar), Reported interview
Summarized position

Google DeepMind disclosed whole-body manipulation success rates of 45.7–76.3% and multi-finger dexterity success of 32–92% for Gemini Robotics 2 on Apptronik’s Apollo 2, stating that "multi-finger dexterous manipulation remains challenging".

Google DeepMind, Gemini Robotics 2 / ER 2 announcement
DeepMind blog, Primary source
Summarized position

Figure said Helix 02’s new "System 0" whole-body balance controller "replaces 109,504 lines of hand-engineered C++ with a single neural prior for stable, natural motion," trained on over 1,000 hours of retargeted human motion across more than 200,000 simulated environments, and cautioned that "the results are early".

Figure, Helix 02 announcement
Figure AI blog, Primary source
Summarized position

NVIDIA reported that scaling GR00T N1.7’s egocentric-video training data from roughly 1,000 to 20,854 hours "more than doubles average task completion" on dexterous manipulation tasks, without citing an independent benchmark.

NVIDIA, GR00T N1.7 announcement
Hugging Face / NVIDIA blog, Primary source
Summarized position

Rodney Brooks argued that current video-imitation training pipelines skip the tactile channel entirely — citing touch-sensing research describing at least fifteen distinct families of touch neurons in human skin — and called claims that humanoids will reach human-level general dexterity within decades "pure fantasy thinking".

Rodney Brooks, Roboticist; MIT CSAIL emeritus; co-founder, iRobot and Rethink Robotics
"Why Today’s Humanoids Won’t Learn Dexterity" (rodneybrooks.com), Primary source
  1. arXiv:2310.08864 arxiv.org
  2. блог Physical Intelligence pi.website
  3. arXiv:2604.15483 arxiv.org
  4. Bloomberg bloomberg.com
  5. блог Figure figure.ai
  6. блог Boston Dynamics bostondynamics.com
  7. TRI toyotaresearchinstitute.github.io
  8. Not a Tesla App, обзор звонка Tesla по итогам второго квартала 2026 года notateslaapp.com
  9. Al Jazeera aljazeera.com
  10. TechCrunch techcrunch.com

Type to search the manual.

navigate open esc close