Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI El informe de supervivencia humana
ES

Panel de capacidad actual de la IA: septiembre de 2026

Una instantánea fija de la capacidad de la IA de frontera — la 'inteligencia irregular' del AI Index de Stanford — y por qué las pruebas no prueban la AGI.

Escrito por
Dwight Ringdahl
Status
Fuentes verificadas
Revisado
Fuentes
9 citadas
Lectura
8 min

Cómo leer esta instantánea

Este panel registra la evidencia pública disponible el 13 de septiembre de 2026. No es una tabla de clasificación en vivo y no debería actualizarse silenciosamente. Los productos de IA, los andamiajes, los conjuntos de evaluación y los precios cambian demasiado rápido para que una página “actual” sin fecha siga siendo honesta.

La capacidad es multidimensional. Un sistema puede resolver un problema olímpico y aun así no leer un reloj analógico, responder preguntas expertas de biología y aun así no completar un flujo de trabajo de laboratorio, o aprobar un evaluador de código produciendo un parche que un mantenedor rechazaría. El AI Index 2026 de Stanford llama a este patrón inteligencia irregular y documenta grandes brechas entre entornos controlados y reales (Stanford AI Index, rendimiento técnico).

Las calificaciones a continuación describen la evidencia, no un modelo universal. “Fuerte” significa que los sistemas líderes rinden de manera impresionante en evaluaciones públicas relevantes. No significa seguro, equivalente a un humano, ni suficientemente fiable para un uso autónomo de alto riesgo.

Dimensión Evidencia de septiembre de 2026 Limitación importante
Lenguaje y conocimiento Fuerte en pruebas amplias de preguntas y respuestas y multimodales Persisten las alucinaciones, la contaminación y la fiabilidad factual irregular
Matemáticas y razonamiento estructurado Los sistemas de frontera alcanzaron resultados de nivel de competición de primer nivel en problemas seleccionados El rendimiento sigue siendo irregular y sensible a las herramientas y al presupuesto de inferencia
Programación y uso de computadoras Ganancias rápidas en pruebas de referencia de programación y de agentes de escritorio estructurados Aprobar los evaluadores no garantiza un trabajo de producción mantenible
Autonomía en tareas largas Los horizontes medidos de tareas de software aumentaron rápidamente Mayormente tareas limpias de software/AA/ciberseguridad; no es duración de operación independiente
Asistencia científica Conocimiento sólido del dominio y mejora en el rendimiento de protocolo y resolución de problemas Las puntuaciones de conocimiento no establecen competencia experimental de extremo a extremo
Capacidad cibernética Los agentes pueden encontrar vulnerabilidades reales y completar tareas expertas seleccionadas Los ataques autónomos de extremo a extremo no están públicamente establecidos
Persuasión Cambios de opinión medibles en experimentos controlados El impacto malicioso a escala poblacional no está demostrado
Robótica y corporeidad Fuerte progreso en entornos controlados La fiabilidad doméstica y en mundo abierto sigue siendo mucho menor
Seguridad y fiabilidad Las salvaguardas y evaluaciones están mejorando El reporte es inconsistente y ningún método garantiza el control

El razonamiento es impresionante e irregular

El AI Index 2026 reporta que un sistema de Google DeepMind logró una puntuación de nivel medalla de oro en la Olimpiada Internacional de Matemáticas de 2025 dentro del límite de tiempo de la competición. El mismo capítulo reporta que el mejor modelo probado en ClockBench leyó correctamente relojes analógicos solo aproximadamente la mitad de las veces, frente a aproximadamente el 90 por ciento de los humanos. Estas pruebas no son igualmente importantes, pero su contraste derrota la idea de un único “nivel de inteligencia” escalar.

Las ganancias en pruebas de referencia pueden reflejar un mejor modelo base, más cómputo en tiempo de inferencia, uso de herramientas, muestreo de varias soluciones, o andamiaje especializado. Un resultado pertenece al sistema completo probado bajo las condiciones declaradas. No debería transferirse casualmente a un nivel de producto más barato o a un despliegue con restricciones de tiempo.

Muchas pruebas también se saturan rápidamente. Stanford reporta grandes ganancias en Humanity’s Last Exam y casi saturación en SWE-bench Verified, mientras señala preguntas inválidas y una posible adaptación a la tabla de clasificación. La saturación significa que una evaluación tiene menos poder para distinguir entre sistemas líderes; no significa que el dominio subyacente esté resuelto.

Programación y uso de computadoras

Los agentes líderes pueden reparar problemas seleccionados de repositorios, escribir código sustancial y operar aplicaciones gráficas. Stanford reporta que el rendimiento en OSWorld subió de aproximadamente el 12 por ciento al 66,3 por ciento, fallando aún aproximadamente una de cada tres tareas estructuradas. El uso real de computadoras añade interfaces cambiantes, objetivos poco claros, credenciales, contenido adversarial y consecuencias que una prueba de referencia puede omitir.

La calificación automatizada es otro límite. El estudio de 2026 de METR sobre parches de SWE-bench encontró que aprobar las pruebas de la prueba de referencia no significaba que los mantenedores fusionarían los cambios, destacando dimensiones de calidad más allá de los casos de prueba funcionales (estudio de revisión de mantenedores de METR). La programación de producción requiere arquitectura, comunicación, seguridad, mantenimiento y responsabilidad por los fallos.

Esta evidencia respalda una asistencia y automatización sustanciales de trabajo seleccionado. No respalda que “la ingeniería de software esté resuelta”.

Autonomía en tareas largas

El panel de mayo de 2026 de METR estima la duración de la tarea de un experto humano a la que un agente tiene una tasa de éxito predicha del 50 o el 80 por ciento. Las tareas conciernen principalmente a la ingeniería de software, el aprendizaje automático y la ciberseguridad. METR afirma que las mediciones por encima de las dieciséis horas son poco fiables con el conjunto actual (horizontes de tarea de METR).

La métrica a menudo se malinterpreta. Un horizonte de cuatro horas no significa que el agente funcione de manera independiente durante cuatro horas; significa que un experto humano normalmente necesita aproximadamente cuatro horas para tareas de la dificultad medida. Los agentes exitosos pueden terminar mucho más rápido. El conjunto es autocontenido y objetivamente calificable, a diferencia de gran parte del trabajo organizacional.

METR advierte además que los dominios difieren en órdenes de magnitud, los márgenes de error pueden ser amplios, y un horizonte del 50 por ciento es inadecuado donde se requiere una fiabilidad del 98 por ciento (limitaciones de METR). La tendencia es evidencia significativa de progreso rápido en tareas digitales seleccionadas — no un reloj que cuenta regresivamente hacia la automatización del empleo o la AGI.

Ciencia, biología y ciberseguridad

El Instituto de Seguridad de IA del Reino Unido reporta que los sistemas probados hasta octubre de 2025 superaron sus líneas base de expertos en doctorado en preguntas seleccionadas de química y biología, y mejoraron en la generación de protocolos y la resolución de problemas de laboratorio. También reporta dificultad persistente con el diseño de plásmidos de extremo a extremo (Informe de Tendencias de IA de Frontera de AISI). Estos son resultados de evaluación gubernamental, pero las líneas base de expertos y la construcción de tareas siguen determinando el significado.

La capacidad cibernética ha avanzado desde responder preguntas hacia agentes que descubren vulnerabilidades y resuelven desafíos de varios pasos. AISI reportó un crecimiento más rápido en sus medidas de tareas cibernéticas en febrero de 2026 (tendencias cibernéticas de AISI). El Informe Internacional de Seguridad de la IA distingue esa evidencia del despliegue: los atacantes usan IA, pero los ataques autónomos de extremo a extremo no se han reportado públicamente, y sigue siendo incierto si la ofensiva o la defensa ganan más (Informe Internacional de Seguridad de la IA 2026).

Persuasión y capacidad social

La IA conversacional puede cambiar actitudes en experimentos. Un estudio de 2026 liderado por AISI con 76.977 participantes encontró efectos de persuasión mayores por parte de las instrucciones y el post-entrenamiento enfocado en persuasión que por la escala o la personalización básica; los efectos de personalización estuvieron por debajo de un punto porcentual. Una mayor persuasión se asoció con una menor precisión factual (estudio de persuasión de AISI).

Ese hallazgo establece una capacidad medida bajo condiciones experimentales. No demuestra un cambio de comportamiento duradero, efectos electorales, ni control poblacional. El alcance, la distribución en plataformas, los mensajes competidores, la confianza del usuario y la persistencia siguen siendo variables separadas.

La corporeidad sigue siendo una brecha importante

La robótica muestra la diferencia más clara entre entornos controlados y abiertos. Stanford reporta un alto éxito en una prueba de referencia de simulación pero solo el 12 por ciento en tareas domésticas reales probadas. Los vehículos autónomos operan a una escala significativa en áreas de servicio restringidas, con dominios de diseño operacional y apoyo humano fuera del sitio que importan para la interpretación.

La amplia interfaz digital de un modelo de lenguaje no debería confundirse con generalidad en el mundo físico. La percepción, la manipulación, la seguridad alrededor de las personas, la recuperación de errores novedosos, el mantenimiento del hardware y el costo limitan todos el despliegue. El capítulo de robots humanoides de este manual rastrea esa brecha entre las demostraciones de pruebas de referencia y el rendimiento real de los robots con más detalle, empresa por empresa.

La fiabilidad es parte de la capacidad

Un agente que tiene éxito el 66 por ciento de las veces puede ser útil con revisión e inaceptable sin ella. Los sistemas de alto riesgo requieren incertidumbre calibrada, detección de fallos, apelación, registros de auditoría, reversión, seguridad y respaldo humano. Las puntuaciones promedio de las pruebas de referencia ocultan errores raros pero consecuentes.

El AI Index 2026 encuentra que los desarrolladores reportan las pruebas de referencia de capacidad convencionales de forma mucho más consistente que las evaluaciones de IA responsable (capítulo de IA responsable del AI Index). La ausencia de resultados públicos no prueba la ausencia de pruebas internas, pero limita la comparación y la garantía pública.

Lo que este panel no establece

No establece consciencia, intenciones, valor económico en todos los empleos, ni un umbral de AGI aceptado. No muestra que un resultado de prueba de referencia se transfiera a un idioma, población, conjunto de herramientas, límite de costo o entorno adversarial diferente. No resuelve si las arquitecturas actuales pueden llegar a ser robustamente generales.

A fecha de esta instantánea, la conclusión más sólida es que los sistemas de frontera muestran una amplitud extraordinaria y una mejora rápida junto con fragilidad persistente, brechas de dominio y evidencia de seguridad incompleta. Eso es más consecuente — y más preciso — que “solo autocompletado” o “la AGI ha llegado”.

Type to search the manual.

navigate open esc close