Asistencia, automatización y mejora recursiva son afirmaciones distintas
Los sistemas de IA ya asisten en el trabajo de software y aprendizaje automático. Generan código, buscan en la literatura, analizan experimentos, proponen pruebas y ayudan a depurar. Automatizar partes de la investigación en IA puede acortar los ciclos de desarrollo. Nada de eso, por sí solo, demuestra la automejora recursiva: un bucle en el que un sistema de IA mejora sustancialmente el proceso que crea a sus sucesores, esos sucesores lo mejoran aún más, y el crecimiento de la capacidad se acelera más allá del control humano.
Un análisis claro separa tres niveles:
- Asistencia a la investigación: las personas usan herramientas de IA mientras conservan el plan, el juicio y el trabajo de integración.
- Automatización de flujos de trabajo: un agente completa una tarea de investigación o ingeniería acotada con intervención limitada.
- Automatización de extremo a extremo de la I+D en IA: los sistemas realizan la mayor parte del trabajo necesario para producir avances algorítmicos importantes e integrarlos en sistemas mejorados.
Solo el tercer nivel crea el argumento más fuerte de bucle de retroalimentación, e incluso entonces el hardware, los experimentos, las organizaciones y las decisiones de despliegue pueden limitar la velocidad.
Capacidad de programación observada
La programación es uno de los dominios actuales más sólidos. Los agentes públicos pueden reparar problemas seleccionados de repositorios y generar programas funcionales. Sin embargo, las pruebas de referencia a menudo proporcionan un problema limpio, pruebas, herramientas y un punto final calificable automáticamente. El desarrollo maduro implica contexto no documentado, coordinación, juicio de producto, seguridad y mantenimiento.
El estudio aleatorizado de METR con 16 desarrolladores experimentados de código abierto que completaron 246 tareas en repositorios que conocían bien encontró que las herramientas de IA de principios de 2025 aumentaron el tiempo de finalización en un 19 por ciento, a pesar de que los desarrolladores creían que las herramientas los hacían más rápidos (estudio de productividad de desarrolladores de METR). Este es un resultado acotado y fechado — no una prueba de que las herramientas posteriores u otros desarrolladores sean más lentos. Demuestra por qué las ganancias en pruebas de referencia no pueden convertirse directamente en aceleración económica.
METR comenzó un seguimiento más amplio y cambió su diseño en 2026 a medida que las herramientas y el uso evolucionaron (actualización de impulso de METR). La productividad real depende de la carga de revisión, la selección de tareas, la familiaridad del desarrollador, las interfaces del agente y los errores que pasan las pruebas.
Evidencia de las pruebas de referencia de investigación en IA
RE-Bench sitúa a agentes y expertos humanos en siete entornos abiertos de ingeniería de investigación en aprendizaje automático. En su estudio original, los mejores agentes puntuaron aproximadamente cuatro veces más que los humanos con un presupuesto de dos horas. Los humanos mejoraron más con tiempo adicional, superaron ligeramente a los agentes a las ocho horas, y lograron aproximadamente el doble de la puntuación del agente a lo largo de 32 horas (artículo de RE-Bench).
Ese resultado muestra una experimentación fuerte de corto plazo: los agentes pueden generar y probar muchas soluciones candidatas rápidamente y a veces producen un excelente trabajo de optimización. También muestra una limitación: los agentes se atascan, no logran reorientarse, o ganan menos con un presupuesto más largo. Siete tareas no pueden representar la distribución completa de la investigación, y el muestreo repetido no es lo mismo que un científico persistente.
Otras evaluaciones cubren partes del proceso. PaperBench de OpenAI pide a los agentes replicar resultados de 20 artículos del ICML a partir de descripciones y ejecutar experimentos (PaperBench). MLE-bench evalúa la ingeniería de aprendizaje automático mediante competencias al estilo Kaggle (MLE-bench). Estas pruebas de referencia miden habilidades significativas pero no establecen la formación original de teorías, la fijación de la agenda, la gestión de laboratorios, la revisión por pares o el despliegue seguro.
Lo que reportan los desarrolladores
Los laboratorios de frontera ahora tratan la I+D automatizada como un umbral de riesgo. El Informe de Riesgo de febrero de 2026 de Anthropic dijo que Claude Opus 4.6 no estaba en, ni muy cerca de, la automatización completa de las actividades necesarias para la I+D en dominios clave, aunque advirtió que la automatización parcial podría acelerar el progreso de todos modos (Informe de Riesgo de Anthropic). Esta es una autoevaluación de un desarrollador, con redacciones y un conflicto de interés.
Anthropic revisó de nuevo su umbral de I+D automatizada en la versión 3.4 de la Política de Escalado Responsable en julio de 2026, ilustrando que el objeto que se mide no está resuelto (archivo de la RSP de Anthropic). Los umbrales de las empresas pueden guiar la acción interna, pero no deberían tratarse como consenso científico.
En agosto de 2026, investigadores de Anthropic reportaron experimentos en los que agentes de investigación automatizados encontraron mitigaciones para fallos de alineación seleccionados (informe de investigación automatizada de Anthropic). Esa es evidencia alentadora de que la investigación acelerada por IA puede fortalecer la seguridad. También es investigación de origen propio sobre tareas construidas, no prueba de una ciencia de alineación completamente automatizada.
El argumento del bucle de retroalimentación
Un bucle sencillo tiene cuatro pasos: desplegar IA para investigar IA; obtener una mejora algorítmica o de ingeniería; entrenar o configurar un sistema mejor; usar ese sistema para producir más mejoras. La aceleración depende del producto de varios factores, no de la mera existencia del bucle.
Cobertura de la investigación: ¿Cuánto del trabajo relevante pueden realizar los agentes? La asistencia en programación tiene valor, pero las personas pueden seguir siendo el cuello de botella en la selección de problemas, la evaluación, el hardware, los datos, la gestión y la seguridad.
Magnitud de la mejora: La mayoría de los experimentos fallan o aportan ganancias pequeñas. Un agente debe producir innovaciones que mejoren de forma material el siguiente sistema, no solo optimizar una prueba de referencia.
Tiempo de ciclo: El entrenamiento, la fabricación de chips, la construcción de centros de datos, las evaluaciones y el despliegue pueden tardar mucho más que escribir código. Una mejor investigación no puede fabricar cómputo al instante.
Reinversión: Las organizaciones deben elegir aplicar las ganancias a más capacidad. Pueden asignarlas al costo, la fiabilidad, los productos o la seguridad en su lugar.
Rendimientos decrecientes: Los descubrimientos pueden volverse más difíciles a medida que se agotan las mejoras fáciles. Un bucle puede continuar sin acelerarse de forma explosiva.
Verificación: La investigación poco fiable crea costos de revisión y replicación. Si los sistemas pueden manipular las evaluaciones, un resultado más rápido puede ralentizar el progreso confiable.
La mejora recursiva es, por tanto, un escenario condicional. No es una extrapolación directa de las tasas de generación de código.
El software puede avanzar más rápido que el hardware
La eficiencia algorítmica, las recetas de entrenamiento, la curación de datos, los métodos de inferencia, los compiladores y los andamiajes de agentes pueden mejorar dentro del hardware existente. Estas ganancias de “software” pueden difundirse rápidamente y aumentar la capacidad por chip. La IA puede ayudar a buscar en estos espacios, creando un canal de retroalimentación positiva genuino.
Pero los modelos de frontera siguen dependiendo de la energía, los chips, las redes, la memoria, las instalaciones y las cadenas de suministro. Un sistema no puede editar recursivamente su camino alrededor de cada restricción física. Puede mejorar cómo se usan los recursos o ayudar a diseñar hardware, mientras que la fabricación y la construcción conservan plazos de entrega reales.
La vía más rápida podría ser, por tanto, un estallido de mejora de software y de procesos seguido de límites físicos u organizativos — no una exponencial suave para siempre. Otras trayectorias siguen siendo posibles; la evidencia disponible no puede elegir una con confianza.
Por qué el bucle podría aumentar el riesgo
Los ciclos de capacidad rápidos pueden superar la evaluación, la regulación y el aprendizaje institucional. Si los agentes de investigación internos acceden a los pesos del modelo, la infraestructura de entrenamiento, el despliegue de código y las evaluaciones sensibles, un error o un uso malicioso tiene mayor alcance. La presión competitiva puede alentar a los desarrolladores a usar la automatización antes de que la supervisión sea madura.
El bucle también puede concentrar el poder. Las organizaciones con cómputo y sistemas de investigación automatizados pueden tomar la delantera, atrayendo más capital y talento. Alternativamente, los algoritmos eficientes pueden difundirse y reducir la concentración. Estos efectos opuestos deberían modelarse en lugar de asumirse.
Por qué el bucle podría mejorar la seguridad
La IA puede buscar vulnerabilidades, generar pruebas, analizar incidentes, mejorar herramientas de interpretabilidad y automatizar la verificación rutinaria. La investigación en seguridad puede beneficiarse de la misma escala e iteración. La pregunta crítica de gobernanza es si la capacidad de seguridad crece antes y junto con la capacidad — no si la asistencia de IA a la investigación es intrínsecamente peligrosa.
Los controles incluyen entornos de investigación aislados (sandbox), conjuntos de evaluación protegidos, acceso de mínimo privilegio, monitoreo independiente, integración por etapas, experimentos reproducibles y aprobación humana antes de que los cambios lleguen al entrenamiento o al despliegue. Los agentes de investigación no deberían poder alterar su propio evaluador, sus credenciales o los sistemas de producción.
Las organizaciones pueden medir tanto la aceleración de la capacidad como la de la seguridad: horas de investigador ahorradas, descubrimientos validados, experimentos fallidos detectados, carga de revisión, tasa de incidentes y tiempo requerido para la reproducción independiente.
Evidencia que cambiaría la evaluación
Una evidencia más sólida a favor de un bucle de retroalimentación rápido incluiría agentes que generan avances algorítmicos novedosos e importantes en múltiples dominios; replicación independiente; éxito sostenido en proyectos largos; tiempo de ciclo de extremo a extremo reducido; y sistemas sucesivos que mejoran de forma medible al agente de investigación sin un crecimiento equivalente en el trabajo humano.
La evidencia en contra de una aceleración explosiva a corto plazo incluiría la dependencia persistente de la fijación humana de la agenda, rendimientos rápidamente decrecientes, altos costos de verificación, incapacidad para operar proyectos largos, y cuellos de botella duros de cómputo o de experimentación.
La conclusión práctica
La investigación en IA acelerada por IA ya es real en el nivel de la asistencia y de la automatización acotada seleccionada. Las pruebas de referencia muestran una notable ingeniería de investigación de corto plazo, mientras que los estudios de productividad del mundo real y los presupuestos más largos exponen brechas importantes. Ninguna evidencia pública, a fecha del 13 de septiembre de 2026, demuestra una I+D en IA autónoma de extremo a extremo o un bucle de mejora recursiva incontrolable.
La respuesta correcta no es ni el rechazo ni la inevitabilidad. Hay que rastrear cada cuello de botella, probar el sistema de investigación desplegado, proteger sus herramientas y evaluadores, y hacer explícitos los supuestos sobre cobertura, magnitud de la mejora, tiempo de ciclo y reinversión.