Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI El informe de supervivencia humana
ES

Cómo los modelos fundacionales de la era de la AGI están cambiando lo que puede hacer un cuerpo robótico

Cómo los modelos fundacionales que impulsan la AGI se aplican a cuerpos robóticos, sustituyendo el control a mano por generalización aún limitada.

Escrito por
Dwight Ringdahl
Status
Fuentes verificadas
Revisado
Fuentes
16 citadas
Lectura
7 min

Dos apuestas distintas sobre cómo debería aprender un robot

La robótica clásica construye una tarea a mano: módulos de percepción, un planificador, un solucionador de cinemática inversa, una máquina de estados, y miles de líneas de código ajustadas a un robot, una pinza, un conjunto acotado de objetos. Ofrece algo valioso — garantías formales sobre lo que el sistema hará y no hará —, pero no se transfiere: una tarea nueva, o un brazo robótico distinto, suele exigir reescribir buena parte de la pila.

La apuesta que reconfigura el campo desde 2023 es distinta: la misma receta que produjo los modelos de lenguaje amplios — datos enormes, un transformador y escala — debería funcionar para el control robótico, descubriendo una “variedad” general para la habilidad física como la descubrió para el texto y las imágenes. Es una hipótesis, no un hecho asentado, y la evidencia es mixta. Esta página expone qué se ha demostrado, por quién, y qué problemas siguen abiertos según quienes construyen estos sistemas.

La primera evidencia: tokens de acción y transferencia entre robots

RT-2, de Google DeepMind, publicado en julio de 2023, fue una prueba temprana y concreta de la idea. En vez de un módulo separado de predicción de acciones, DeepMind entrenó tokens de acción robótica directamente en el vocabulario de salida de un modelo de visión y lenguaje, de modo que la misma red que describe una imagen emite una orden de motor (arXiv:2307.15818). En 6,000 pruebas, generalizó a objetos y entornos desconocidos casi tres veces mejor que las líneas base previas — evidencia de que el conocimiento visual y lingüístico a escala web sí aporta información útil para la manipulación.

Tres meses después, una colaboración de 34 instituciones fue más allá con RT-X y el conjunto Open X-Embodiment, agrupando datos de docenas de tipos de robot y entrenando un modelo de 55,000 millones de parámetros en todos ellos (arXiv:2310.08864). Mostró un éxito de habilidades emergentes superior al de una versión de 5,000 millones de parámetros de la misma arquitectura — señal temprana de que la escala impulsa la transferencia entre cuerpos robóticos distintos, no solo dentro de uno.

Un campo abarrotado de modelos fundacionales para cuerpos

Ese resultado desató una ola de “modelos fundacionales para robots” construidos por empresas, cada uno con arquitectura distinta y afirmaciones que deben leerse como propias de la empresa, no como hechos verificados.

π0, de Physical Intelligence (octubre de 2024), combinó PaliGemma con una cabeza de acción de emparejamiento de flujo, entrenado en ocho tipos de robot, y demostró tareas como doblar ropa, recoger mesas y embolsar comestibles. Physical Intelligence liberó los pesos y el código como “openpi”, haciendo el resultado reproducible en vez de tomarse por fe. Aun así, su propia evaluación fue directa: “las políticas de robots generalistas todavía están en su infancia” (blog de Physical Intelligence, 31 de octubre de 2024). Una versión más reciente, π0.7, afirma generalización de disparo cero entre tipos de robot (arXiv:2604.15483), pero descansa en un preprint aún no replicado.

NVIDIA lanzó GR00T N1 en marzo de 2025 como el primer modelo fundacional humanoide abierto, y luego GR00T N1.7 en abril de 2026: 3,000 millones de parámetros entrenados con 20,854 horas de video egocéntrico humano, validado en tres plataformas distintas, con pesos abiertos en Hugging Face. NVIDIA dice que escalar esos datos veinte veces “más que duplica la finalización promedio de tareas” en destreza manual — sin benchmark independiente que lo respalde (blog de Hugging Face, 17 de abril de 2026). Un sucesor, GR00T N2, se adelantó en el GTC de marzo de 2026 como “modelo de acción del mundo” que predice estados futuros antes de actuar; su afirmación de éxito en tareas novedosas “más del doble de veces” que las líneas base líderes sigue siendo, a septiembre de 2026, un dato de producto no publicado, no un hecho probado.

Gemini Robotics 2 (también ER 2), sucesor de RT-2, pasó de demostraciones de la parte superior del cuerpo al control humanoide completo en el Apollo 2 de Apptronik, incluido el mando de una mano de cinco dedos con 22 grados de libertad para atar nudos y sellar bolsas. Las cifras de DeepMind son de las más francas del campo: 45.7%–76.3% de éxito en manipulación de cuerpo completo, y un muy variable 32%–92% en destreza multidedo, admitiendo que “la manipulación destra multidedo sigue siendo un desafío” (blog de DeepMind, 30 de julio de 2026). Bloomberg lo dijo más directo aún: los robots de Google están “luchando con la destreza” (Bloomberg).

El antes y el después más claro: el Helix 02 de Figure

La ilustración más clara de este cambio viene de Figure. Su Helix original (febrero de 2025) usaba dos partes, “Sistema 1 / Sistema 2”: un modelo de 7,000 millones de parámetros razonando a 7–9 Hz, alimentando un transformador de 80 millones de parámetros que ejecuta el control motor fino a 200 Hz, entrenado con solo unas 500 horas de datos — menos del 5% del tamaño de los conjuntos VLA previos, según Figure (blog de Figure, 20 de febrero de 2025).

Helix 02, de enero de 2026, añadió una tercera capa, “Sistema 0”: un controlador de equilibrio de cuerpo completo de 10 millones de parámetros y 1 kHz, entrenado en simulación en más de 200,000 entornos, más de 1,000 horas de movimiento humano reorientado. La comparación más contundente entre lo viejo y lo nuevo es de Figure misma: el Sistema 0 “sustituye 109,504 líneas de C++ diseñado a mano por un único modelo neuronal previo para un movimiento estable y natural” (blog de Figure, 27 de enero de 2026) — el control enumerado y ajustado a mano, sustituido por completo por un modelo aprendido. Figure demostró una tarea de carga de lavavajillas de cuatro minutos y 61 acciones sin reinicio humano, advirtiendo que “los resultados son tempranos”.

Boston Dynamics y el Toyota Research Institute reportan un hallazgo relacionado, más mesurado, en el Atlas: capacidades que antes exigían programación manual ahora se añaden sin código nuevo, pues un solo modelo controla todo el robot (blog de Boston Dynamics, agosto de 2025). Un estudio de 2026 halló que, tras ajuste fino, un modelo preentrenado necesitó de 3 a 5 veces menos datos y fue más robusto ante condiciones cambiantes que entrenar desde cero (TRI) — ganancia real y acotada, no evidencia de generalidad abierta.

Optimus, de Tesla, es el caso atípico del campo en transparencia. Musk y Ashok Elluswamy, al mando desde junio de 2025, describen la misma arquitectura de extremo a extremo “fotones entran, controles salen” que Tesla usa en su software de asistencia al conductor. A diferencia de DeepMind, NVIDIA, Physical Intelligence o Figure, Tesla no ha publicado un artículo técnico sobre esta arquitectura — solo comentarios en conferencias y llamadas de resultados (Not a Tesla App, agosto de 2026).

Los récords acotados no son competencia general

Los Juegos Mundiales de Robots Humanoides en Beijing (22–26 de agosto de 2026) concretan la distinción entre capacidad acotada y capacidad general. Entre 2,056 robots de 666 equipos, una sola máquina, Tiangong Ultra, corrió los 100 metros en 8.64 segundos — más rápido que el récord humano de Usain Bolt, 9.58 segundos. En el mismo torneo, la cobertura del fútbol, el boxeo y la halterofilia describió robots luchando en condiciones no estructuradas y con mucho contacto físico (Al Jazeera). Un sprint repetible y diseñado no es el mismo logro que la competencia flexible en un entorno impredecible, y los Juegos ilustran esa brecha en la misma semana, no en abstracto.

La visión que aterriza las expectativas

Vincent Vanhoucke, que dirige la robótica en Google DeepMind, ofrece el chequeo de realidad más agudo sobre esta tendencia: “la mayoría — si no todos — los enfoques de aprendizaje robótico no pueden desplegarse para ninguna tarea práctica”, porque el despliegue real exige “una precisión y fiabilidad del 99.X por ciento o superior” cuando las demostraciones académicas reportan apenas 80% de éxito — en sus palabras, “una bestia fundamentalmente distinta”, no un problema de escala resoluble con más datos (IEEE Spectrum, 28 de mayo de 2024).

Rodney Brooks, roboticista del MIT y cofundador de iRobot y Rethink Robotics, sostiene que el entrenamiento por imitación de video podría ser el sustrato equivocado: el tacto involucra un canal que las canalizaciones actuales nunca capturan, y cita investigación en neurociencia que identifica al menos quince familias de neuronas táctiles en la piel humana. Llama tempranas y limitadas a las demostraciones de manipulación actuales, y descarta como “pensamiento de pura fantasía” que los humanoides alcancen la destreza general al nivel humano en décadas (TechCrunch, 26 de septiembre de 2025).

Ambas cosas son ciertas a la vez. El enfoque de modelos fundacionales ha producido una transferencia real y medida entre distintos robots que el control programado a mano nunca logró, y todos los laboratorios creíbles que publican cifras — no solo los escépticos — reportan tasas de éxito muy por debajo de lo que exige la fiabilidad industrial y doméstica.

References

Postura resumida

Google DeepMind trained robot action tokens directly into a vision-language model’s output vocabulary and reported roughly 3x better generalization to unseen objects, backgrounds, and settings than prior baselines across 6,000 evaluation trials.

Google DeepMind, Authors, "RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control"
arXiv, Primary source
Postura resumida

Vincent Vanhoucke said most robot-learning approaches "cannot be deployed for any practical task" because real-world use demands 99.X percent reliability, calling that bar "a fundamentally different beast" from an 80 percent-success research demo.

Vincent Vanhoucke, Head of robotics, Google DeepMind / Google Research
IEEE Spectrum ("Will Scaling Solve Robotics?" by Nishanth J. Kumar), Reported interview
Postura resumida

Google DeepMind disclosed whole-body manipulation success rates of 45.7–76.3% and multi-finger dexterity success of 32–92% for Gemini Robotics 2 on Apptronik’s Apollo 2, stating that "multi-finger dexterous manipulation remains challenging".

Google DeepMind, Gemini Robotics 2 / ER 2 announcement
DeepMind blog, Primary source
Postura resumida

Figure said Helix 02’s new "System 0" whole-body balance controller "replaces 109,504 lines of hand-engineered C++ with a single neural prior for stable, natural motion," trained on over 1,000 hours of retargeted human motion across more than 200,000 simulated environments, and cautioned that "the results are early".

Figure, Helix 02 announcement
Figure AI blog, Primary source
Postura resumida

NVIDIA reported that scaling GR00T N1.7’s egocentric-video training data from roughly 1,000 to 20,854 hours "more than doubles average task completion" on dexterous manipulation tasks, without citing an independent benchmark.

NVIDIA, GR00T N1.7 announcement
Hugging Face / NVIDIA blog, Primary source
Postura resumida

Rodney Brooks argued that current video-imitation training pipelines skip the tactile channel entirely — citing touch-sensing research describing at least fifteen distinct families of touch neurons in human skin — and called claims that humanoids will reach human-level general dexterity within decades "pure fantasy thinking".

Rodney Brooks, Roboticist; MIT CSAIL emeritus; co-founder, iRobot and Rethink Robotics
"Why Today’s Humanoids Won’t Learn Dexterity" (rodneybrooks.com), Primary source
  1. arXiv:2310.08864 arxiv.org
  2. blog de Physical Intelligence pi.website
  3. arXiv:2604.15483 arxiv.org
  4. Bloomberg bloomberg.com
  5. blog de Figure figure.ai
  6. blog de Boston Dynamics bostondynamics.com
  7. TRI toyotaresearchinstitute.github.io
  8. Not a Tesla App notateslaapp.com
  9. Al Jazeera aljazeera.com
  10. TechCrunch techcrunch.com

Type to search the manual.

navigate open esc close