Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Le briefing de survie humaine
FR

Comment les modèles de fondation de l'ère de l'AGI changent ce qu'un corps de robot peut faire

Comment les modèles de fondation qui font progresser l'AGI s'appliquent aux corps de robots, remplaçant le contrôle codé à la main par une généralisation encore limitée.

Written by
Dwight Ringdahl
Status
Sources vérifiées
Revised
Sources
16 cited
Reading
8 min

Deux paris différents sur la façon dont un robot devrait apprendre

La robotique classique construit une tâche à la main : des modules de perception, un planificateur, un solveur de cinématique inverse, une machine à états, et des milliers de lignes de code de contrôle réglées pour un robot, une pince, un ensemble étroit d’objets. Elle offre quelque chose de précieux — des garanties formelles sur ce que le système fera et ne fera pas —, mais elle ne se transfère pas. Une nouvelle tâche, ou un nouveau bras robotique, exige généralement de réécrire une grande partie de la pile logicielle.

Le pari qui reconfigure le domaine depuis 2023 est différent : la même recette qui a produit les grands modèles de langage — d’immenses jeux de données, un transformeur, et l’échelle — devrait aussi fonctionner pour le contrôle robotique, découvrant une « variété » générale pour l’habileté physique comme elle en a découvert une pour le texte et les images. C’est une hypothèse, pas un fait établi, et les preuves rassemblées jusqu’ici sont réellement mitigées. Cette page expose ce qui a réellement été démontré, par qui, et quels problèmes restent ouverts selon les personnes qui construisent ces systèmes.

Les premières preuves : tokens d’action et transfert entre robots

RT-2, de Google DeepMind, publié en juillet 2023, a constitué un test précoce et concret de cette idée. Plutôt que de construire un module distinct de prédiction d’action, DeepMind a entraîné des tokens d’action robotique directement dans le vocabulaire de sortie d’un modèle de vision-langage, de sorte que le même réseau qui décrit une image en mots puisse aussi émettre une commande moteur (arXiv:2307.15818). Sur 6 000 essais d’évaluation, il a généralisé à des objets et des contextes inconnus environ trois fois mieux que les références antérieures spécifiques à une tâche — une preuve que les connaissances visuelles et linguistiques à l’échelle du web transportent réellement une information utile pour la manipulation.

Trois mois plus tard, une collaboration de 34 institutions est allée plus loin avec RT-X et le jeu de données Open X-Embodiment, mettant en commun des données provenant de dizaines de types de robots différents et entraînant un modèle unique de 55 milliards de paramètres sur l’ensemble (arXiv:2310.08864). Cela a montré une réussite de compétences émergentes nettement supérieure à celle d’une version à 5 milliards de paramètres de la même architecture — un signal précoce que l’échelle stimule spécifiquement le transfert entre différents corps de robots, et pas seulement à l’intérieur d’un seul.

Un domaine encombré de modèles de fondation pour les corps

Ce résultat a déclenché une vague de « modèles de fondation pour robots » construits par des entreprises, chacun avec une architecture différente et chacun formulant des affirmations qui méritent d’être lues comme des affirmations d’entreprise plutôt que comme des faits vérifiés de façon indépendante.

Le π0 de Physical Intelligence (octobre 2024) a combiné le modèle de vision-langage PaliGemma avec une tête d’action par appariement de flux (flow-matching), entraîné sur huit incarnations de robots, et a démontré des tâches comme plier du linge, débarrasser une table, ou emballer des courses. Fait inhabituel dans ce domaine, Physical Intelligence a publié les poids et le code en open source sous le nom « openpi », rendant le résultat reproductible de façon indépendante plutôt qu’à prendre sur parole. Malgré cela, l’évaluation de l’entreprise elle-même était sans détour : « les politiques de robots généralistes en sont encore à leurs balbutiements, et il reste un long chemin à parcourir » (blog de Physical Intelligence, 31 oct. 2024). Une version plus récente, π0.7, revendique une généralisation zero-shot à travers différentes incarnations de robots (arXiv:2604.15483), mais à l’heure où ces lignes sont écrites, cette affirmation repose sur un préprint qui n’a pas été répliqué de façon indépendante.

NVIDIA a publié GR00T N1 en mars 2025 comme premier modèle de fondation humanoïde ouvert, puis GR00T N1.7 en avril 2026 : un modèle de 3 milliards de paramètres entraîné sur 20 854 heures de vidéo égocentrique humaine, validé sur trois plateformes de robots différentes, avec des poids ouverts sur Hugging Face. NVIDIA a rapporté que multiplier par environ vingt ces données d’entraînement égocentriques « fait plus que doubler le taux moyen d’achèvement des tâches » sur des tâches de dextérité — une affirmation à signaler comme émanant de NVIDIA elle-même, puisqu’aucun test de référence indépendant ne l’accompagne (blog Hugging Face, 17 avr. 2026). Un successeur, GR00T N2, a été présenté en avant-première au GTC de mars 2026 comme un « modèle d’action du monde » qui prédit des états futurs avant d’agir ; l’affirmation de la keynote de NVIDIA selon laquelle il réussit des tâches inédites « plus de deux fois plus souvent » que les références de pointe reste, en septembre 2026, une affirmation sur un produit non publié plutôt qu’une affirmation testée.

Le successeur de RT-2 chez Google DeepMind, Gemini Robotics 2 (aussi appelé ER 2), est passé de démonstrations du haut du corps à un contrôle humanoïde du corps entier sur l’Apollo 2 d’Apptronik, y compris la commande d’une main à cinq doigts dotée de 22 degrés de liberté pour des tâches comme nouer des nœuds ou sceller des sacs. Les chiffres divulgués par DeepMind elle-même sont les plus francs du domaine : 45,7 à 76,3 % de réussite en manipulation du corps entier et un très variable 32 à 92 % en dextérité multidoigts, DeepMind déclarant sans détour que « la manipulation dextre multidoigts reste difficile » (blog DeepMind, 30 juil. 2026). Le titre même de Bloomberg à propos de cette sortie était plus direct encore : les robots de Google « peinent avec la dextérité » (Bloomberg).

L’illustration la plus nette d’un avant/après : le Helix 02 de Figure

L’illustration la plus nette de ce que change cette approche vient de Figure. Son système Helix d’origine (février 2025) utilisait une architecture en deux parties, « Système 1 / Système 2 » : un modèle de vision-langage de 7 milliards de paramètres raisonnant à 7-9 Hz, alimentant un transformeur de 80 millions de paramètres exécutant un contrôle moteur fin à 200 Hz, entraîné sur seulement environ 500 heures de données — moins de 5 % de la taille des jeux de données VLA antérieurs, selon Figure (blog Figure, 20 fév. 2025).

Helix 02, publié en janvier 2026, a ajouté une troisième couche que Figure appelle « Système 0 » : un contrôleur d’équilibre du corps entier à 10 millions de paramètres et 1 kHz, entraîné entièrement en simulation à travers plus de 200 000 environnements plus plus de 1 000 heures de mouvement humain reciblé. La propre description de Figure de ce que cela a remplacé constitue la comparaison ancien/nouveau la plus tranchée disponible dans tout ce domaine : le Système 0 « remplace 109 504 lignes de C++ conçues à la main par un unique modèle neuronal préalable pour un mouvement stable et naturel » (blog Figure, 27 janv. 2026). C’est le paradigme de la robotique classique — une logique de contrôle énumérée et ajustée à la main — remplacé en bloc par un modèle appris, selon le propre récit d’une entreprise. Figure a démontré une tâche de chargement de lave-vaisselle de quatre minutes en 61 actions sans réinitialisation humaine, tout en avertissant dans le même communiqué que « les résultats sont précoces ».

Boston Dynamics et le Toyota Research Institute rapportent un constat apparenté mais plus mesuré issu des travaux sur les « Large Behavior Models » (grands modèles de comportement) appliqués à l’humanoïde Atlas : des capacités qui exigeaient autrefois une programmation manuelle peuvent désormais être ajoutées sans code nouveau, puisqu’un seul modèle a le contrôle direct de l’ensemble du robot (blog Boston Dynamics, août 2025). Une étude de suivi de 2026 a constaté qu’après un réglage fin spécifique à une tâche, un modèle de comportement pré-entraîné nécessitait environ trois à cinq fois moins de données spécifiques à la tâche et était plus robuste face à des conditions changeantes qu’un entraînement partant de zéro (TRI) — un gain d’efficacité réel mais borné, non une preuve de généralité ouverte.

Le programme Optimus de Tesla constitue le cas atypique le plus net du domaine en matière de transparence. Elon Musk et Ashok Elluswamy, qui a pris la direction d’Optimus en juin 2025, décrivent la même architecture de bout en bout « des photons en entrée, des commandes en sortie » que Tesla utilise pour son logiciel d’aide à la conduite. Contrairement à DeepMind, NVIDIA, Physical Intelligence, ou Figure, Tesla n’a publié aucun article technique sur cette architecture — seulement des remarques en conférence et des commentaires lors d’appels de résultats (Not a Tesla App, résumant l’appel de résultats T2 2026 de Tesla, août 2026).

Des records étroits ne constituent pas une compétence générale

Les Jeux mondiaux des robots humanoïdes à Pékin (22-26 août 2026) rendent concrète la distinction entre capacité étroite et capacité générale. Parmi 2 056 robots issus de 666 équipes, une seule machine, Tiangong Ultra, a couru le 100 mètres en 8,64 secondes — plus vite que le record du monde humain d’Usain Bolt, à 9,58 secondes. Lors du même tournoi, la couverture des épreuves de football, de boxe, et d’haltérophilie a décrit des robots peinant dans des conditions non structurées et riches en contact physique (Al Jazeera). Un sprint reproductible et conçu pour l’occasion n’est pas le même exploit qu’une compétence flexible dans un environnement imprévisible, et les Jeux illustrent cet écart la même semaine, non dans l’abstrait.

Le point de vue de ceux qui gardent les pieds sur terre

Vincent Vanhoucke, qui dirige la robotique chez Google DeepMind, offre le rappel à la réalité le plus incisif disponible sur toute cette tendance : « la plupart — sinon la totalité — des approches d’apprentissage robotique ne peuvent être déployées pour aucune tâche pratique », parce que le déploiement réel exige « une précision et une fiabilité de 99,X pour cent ou plus » là où les démonstrations académiques rapportent environ 80 % de réussite — selon ses mots, « une bête fondamentalement différente », et non un problème d’échelle qu’il suffirait de résoudre avec plus de données (IEEE Spectrum, 28 mai 2024).

Rodney Brooks, le roboticien du MIT cofondateur d’iRobot et de Rethink Robotics, insiste davantage sur les raisons pour lesquelles l’entraînement par imitation vidéo en particulier pourrait être le mauvais substrat : le toucher implique un canal que les pipelines actuels ne capturent jamais, avec des recherches en neurosciences qu’il cite identifiant au moins quinze familles distinctes de neurones tactiles dans la peau humaine. Il qualifie les démonstrations de manipulation actuelles de précoces et limitées, et rejette comme relevant de « la pure pensée fantaisiste » l’idée que les humanoïdes atteindront une dextérité générale de niveau humain d’ici quelques décennies (TechCrunch, 26 sept. 2025).

Les deux choses sont vraies à la fois. L’approche par modèles de fondation a produit un transfert réel et mesuré entre robots que le contrôle codé à la main n’a jamais atteint, et chaque laboratoire crédible qui publie des chiffres — pas seulement les sceptiques — rapporte des taux de réussite très en deçà de ce qu’exige réellement la fiabilité industrielle et domestique.

References

Summarized position

Google DeepMind trained robot action tokens directly into a vision-language model’s output vocabulary and reported roughly 3x better generalization to unseen objects, backgrounds, and settings than prior baselines across 6,000 evaluation trials.

Google DeepMind, Authors, "RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control"
arXiv, Primary source
Summarized position

Vincent Vanhoucke said most robot-learning approaches "cannot be deployed for any practical task" because real-world use demands 99.X percent reliability, calling that bar "a fundamentally different beast" from an 80 percent-success research demo.

Vincent Vanhoucke, Head of robotics, Google DeepMind / Google Research
IEEE Spectrum ("Will Scaling Solve Robotics?" by Nishanth J. Kumar), Reported interview
Summarized position

Google DeepMind disclosed whole-body manipulation success rates of 45.7–76.3% and multi-finger dexterity success of 32–92% for Gemini Robotics 2 on Apptronik’s Apollo 2, stating that "multi-finger dexterous manipulation remains challenging".

Google DeepMind, Gemini Robotics 2 / ER 2 announcement
DeepMind blog, Primary source
Summarized position

Figure said Helix 02’s new "System 0" whole-body balance controller "replaces 109,504 lines of hand-engineered C++ with a single neural prior for stable, natural motion," trained on over 1,000 hours of retargeted human motion across more than 200,000 simulated environments, and cautioned that "the results are early".

Figure, Helix 02 announcement
Figure AI blog, Primary source
Summarized position

NVIDIA reported that scaling GR00T N1.7’s egocentric-video training data from roughly 1,000 to 20,854 hours "more than doubles average task completion" on dexterous manipulation tasks, without citing an independent benchmark.

NVIDIA, GR00T N1.7 announcement
Hugging Face / NVIDIA blog, Primary source
Summarized position

Rodney Brooks argued that current video-imitation training pipelines skip the tactile channel entirely — citing touch-sensing research describing at least fifteen distinct families of touch neurons in human skin — and called claims that humanoids will reach human-level general dexterity within decades "pure fantasy thinking".

Rodney Brooks, Roboticist; MIT CSAIL emeritus; co-founder, iRobot and Rethink Robotics
"Why Today’s Humanoids Won’t Learn Dexterity" (rodneybrooks.com), Primary source
  1. arXiv:2310.08864 arxiv.org
  2. blog de Physical Intelligence pi.website
  3. arXiv:2604.15483 arxiv.org
  4. Bloomberg bloomberg.com
  5. blog Figure figure.ai
  6. blog Boston Dynamics bostondynamics.com
  7. TRI toyotaresearchinstitute.github.io
  8. Not a Tesla App, résumant l'appel de résultats T2 2026 de Tesla notateslaapp.com
  9. Al Jazeera aljazeera.com
  10. TechCrunch techcrunch.com

Type to search the manual.

navigate open esc close