Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI El informe de supervivencia humana
ES

Los marcos de seguridad de los laboratorios de IA de frontera, comparados

Marcos de seguridad de seis laboratorios comparados: umbrales, salvaguardas y qué ocurre al cruzarlos, según auditorías independientes de su práctica real.

Escrito por
Dwight Ringdahl
Status
Fuentes verificadas
Revisado
Fuentes
13 citadas
Lectura
15 min

Qué es realmente un marco de seguridad

El marco de seguridad de un laboratorio de IA de frontera es la política propia que el laboratorio publica para definir umbrales de capacidad —cosas específicas que un modelo podría llegar a hacer— y las salvaguardas o los compromisos organizacionales que deben activarse cuando un modelo alcanza uno de esos umbrales. Anthropic llama a su versión Política de Escalado Responsable (Responsible Scaling Policy); OpenAI, Marco de Preparación (Preparedness Framework); Google DeepMind, Marco de Seguridad de Frontera (Frontier Safety Framework); Meta, Marco de Escalado de IA Avanzada (Advanced AI Scaling Framework); xAI, Marco de Inteligencia Artificial de Frontera (Frontier Artificial Intelligence Framework); Microsoft, Marco de Gobernanza de Frontera (Frontier Governance Framework). Los nombres difieren; estructuralmente, los seis intentan responder la misma pregunta: ¿cómo sabe una empresa cuándo un modelo es demasiado peligroso para desplegarse tal cual, y a qué se compromete realmente a hacer al respecto?

Esa pregunta importa porque actualmente ningún regulador externo fija umbrales de capacidad vinculantes y específicos para cada modelo en ninguna de estas seis empresas (véase la legislación de IA y su aplicación en 2026). Por ahora, estos documentos son la respuesta operativa real de la industria. Tampoco son el mismo documento copiado seis veces: qué riesgos rastrea cada laboratorio, cómo se define un umbral y —lo más consecuente— qué ocurre cuando se cruza uno, difieren de maneras que importan.

Hay que decir algo antes de que empiece la comparación, porque condiciona cómo leer todo lo que sigue: cada afirmación de la tabla es la política declarada por el propio laboratorio. Nada de ello es verificación independiente de que el laboratorio realmente haga lo que dice. Una sección aparte después de la tabla, “Afirmaciones frente a la práctica”, cubre las auditorías externas calificadas, las críticas académicas y las brechas documentadas entre los compromisos declarados de estas seis empresas y su conducta real —y esa sección, no la tabla, es la más importante.

Nota de alcance y fuentes

Cada detalle de los marcos que se presenta a continuación se verificó contra el documento actual publicado por el propio laboratorio, más (para la sección "afirmaciones frente a la práctica") los informes y estudios independientes citados, a septiembre de 2026. Se indican en todo momento los números de versión exactos y las fechas de vigencia, para que un lector que regrese pueda saber si algo ha cambiado. Estas políticas se revisan con frecuencia —solo Anthropic ha publicado nueve versiones numeradas desde septiembre de 2023—, así que trate cada fila como una instantánea fechada, no como una descripción definitiva.

Los marcos, comparados

Laboratorio (marco) Versión actual / fecha Dominios de riesgo rastreados Estructura de umbrales / niveles Qué ocurre al cruzar un umbral
Anthropic — Política de Escalado Responsable v3.4, vigente desde el 8 jul. 2026 Impulso CBRN no novedoso; impulso CBRN novedoso; sabotaje de alto riesgo; aceleración automatizada de I+D en IA Tabla de umbrales de capacidad/uso; los niveles fijos ASL-2/ASL-3/ASL-4 se eliminaron en la reescritura v3.0 (las etiquetas ASL heredadas se conservan solo para los controles ya vigentes) Hoja de Ruta de Seguridad de Frontera pública y no vinculante, calificada frente al desempeño pasado, más Informes de Riesgo cada 3–6 meses con revisión externa — sin pausa incondicional
OpenAI — Marco de Preparación v2, 15 abr. 2025 Biológico y químico, ciberseguridad, automejora de IA (rastreados); autonomía de largo alcance, sandbagging, replicación y adaptación autónomas, socavamiento de salvaguardas, nuclear y radiológico (categorías de investigación, aún sin criterios completos); persuasión excluida explícitamente Dos niveles: Alto y Crítico Alto: se exigen salvaguardas antes del despliegue. Crítico: se exigen salvaguardas durante el desarrollo; puede detener el desarrollo por completo. El Grupo Asesor de Seguridad interno recomienda; el CEO o su designado decide; el Comité de Seguridad y Protección de la junta supervisa
Google DeepMind — Marco de Seguridad de Frontera v3.1, 17 abr. 2026 CBRN; ciber; manipulación dañina (señalada como “exploratoria y sujeta a más investigación”); I+D en AA y desalineación (fusionados en un solo dominio en la v3.1) Niveles de Capacidad Crítica (CCL) más Niveles de Capacidad Rastreada (TCL), de umbral más bajo y nuevos en la v3.0/3.1; los Niveles de Seguridad SL1–SL4 se usan como vocabulario, no como estándar de cumplimiento Un “umbral de alerta” activa una evaluación formal de capacidad antes de alcanzar un CCL; alcanzar un CCL exige un caso de seguridad suplementario y la aprobación de la gobernanza antes del despliegue externo (y, específicamente para los CCL de I+D en AA, también antes del despliegue interno de alto riesgo)
Meta — Marco de Escalado de IA Avanzada v2, 3 feb. 2025 (renombrado desde “Frontier AI Framework” v1.1; sustituido aproximadamente en abr. 2026) Químico y biológico; ciberseguridad; pérdida de control (añadido en la v2) “Nivel de impulso hacia un escenario de amenaza”, no una escala de niveles fija Si el riesgo crítico no puede mitigarse: no desplegará el modelo externamente ni continuará su desarrollo
xAI — Marco de Inteligencia Artificial de Frontera (FAIF) Vigente desde el 30 jun. 2026 (sustituyó al anterior Marco de Gestión de Riesgos, actualizado por última vez el 20 ago. 2025) CBRN; ciberseguridad ofensiva; pérdida de control; manipulación dañina Evaluación de riesgo sistémico completa al menos una vez al año; sin escala de niveles fija Lenguaje condicional en todo el documento (“podemos”, “si determinamos que está justificado”); sin disparador explícito de detención del desarrollo comparable al de sus pares
Microsoft — Marco de Gobernanza de Frontera Actualización de feb. 2026 (la v1 fue de feb. 2025) Armas CBRN; ciberoperaciones ofensivas; autonomía avanzada; pérdida de control y manipulación dañina (añadidas en feb. 2026) Dos etapas: detección automatizada de “indicadores adelantados” mediante pruebas de referencia al menos cada 6 meses, que escala a una evaluación más profunda calificada como Baja/Media/Alta/Crítica “Si… identificamos un riesgo que no podemos mitigar suficientemente, pausaremos el desarrollo y el despliegue hasta el punto en que las prácticas de mitigación evolucionen para hacer frente al riesgo” — el compromiso de detención más directo entre los seis

El cambio más consecuente: el abandono por parte de Anthropic de la pausa incondicional

La RSP de Anthropic tiene la historia pública más larga de las seis, y su cambio estructural más reciente es el desarrollo más discutido entre los marcos de seguridad de frontera en 2026. La versión 1.0, publicada el 19 de septiembre de 2023, introdujo el sistema de Niveles de Seguridad de IA (ASL) —ASL-2, ASL-3, ASL-4—, cada uno definido por una lista específica y fija de controles requeridos, junto con un compromiso firme: Anthropic no entrenaría más allá de un umbral sin salvaguardas ya demostradas como adecuadas de antemano. Las versiones 2.0 (octubre de 2024), 2.1 (marzo de 2025) y 2.2 (mayo de 2025) ampliaron esa estructura y añadieron el umbral CBRN.

La versión 3.0, vigente desde el 24 de febrero de 2026, reescribió la política. Anthropic sustituyó los niveles ASL fijos por una tabla de umbrales de capacidad/uso, y explicó el razonamiento directamente en un apéndice —las propias palabras de la empresa sobre por qué abandonó las listas de control específicas y detalladas aparecen más abajo como una cita registrada—. En lugar de la antigua pausa firme, la v3.0 introdujo dos instrumentos nuevos: una Hoja de Ruta de Seguridad de Frontera pública y no vinculante, calificada abiertamente frente al propio desempeño pasado de Anthropic, y unos Informes de Riesgo publicados cada tres a seis meses y sujetos a revisión por al menos un revisor externo, evaluado y libre de conflictos de interés. El documento de Anthropic es explícito en que se trata de un cambio deliberado, desde una postura unilateral de riesgo absoluto hacia una que es condicional y dependiente de los competidores: un apéndice específico expone escenarios como “Anthropic a la cabeza” y “Los competidores tienen medidas de seguridad sólidas”, bajo los cuales cambian los propios compromisos de la empresa. Las versiones 3.1 (2 de abril), 3.2 (29 de abril), 3.3 (26 de mayo) y 3.4 (8 de julio de 2026, la actual) han revisado detalles desde entonces —más recientemente, acotando el umbral de I+D automatizada y ampliando la distribución interna de los Informes de Riesgo— sin restablecer la antigua pausa firme.

La gobernanza en torno a la propia política se ha mantenido constante a lo largo de estas versiones: un Responsable de Escalado designado, un canal de notificación de incumplimientos, y una revisión anual de cumplimiento procedimental por un tercero, que la propia Anthropic describe como una verificación del “cumplimiento procedimental, no de los resultados sustantivos” —una distinción que vale la pena notar, ya que significa que la auditoría confirma que se siguió el proceso, no que las decisiones resultantes fueran correctas.

El cambio se registró de inmediato como un evento de credibilidad fuera de la empresa. Chris Painter, Director de Política de METR, revisó un borrador temprano con permiso de Anthropic y, si bien acogió con satisfacción la mayor transparencia de los Informes de Riesgo, ofreció a los periodistas la valoración directa que se cita a continuación.

Dónde convergen y divergen los otros cinco marcos

El Marco de Gobernanza de Frontera de Microsoft es el contraste más directo con la nueva postura condicional de Anthropic: su compromiso de pausa, citado en su totalidad en la tabla anterior y más abajo, es incondicional en apariencia, y está ligado únicamente a la propia evaluación de Microsoft de que un riesgo no puede mitigarse suficientemente —sin ninguna excepción de escenario dependiente de los competidores comparable al Apéndice A de Anthropic.

El Marco de Escalado de IA Avanzada de Meta asume un compromiso igualmente incondicional para su caso más acotado: si un modelo alcanza el “umbral de riesgo crítico” de Meta y ese riesgo no puede mitigarse, Meta afirma que no desplegará el modelo externamente ni continuará su desarrollo. Meta usa un “nivel de impulso hacia un escenario de amenaza” en lugar de una escala de niveles fija, pero los dominios subyacentes —riesgo químico/biológico, ciberseguridad y pérdida de control (añadida en la v2 de Meta)— resultan estar más compartidos entre laboratorios de lo que sugiere la publicación separada de cada marco. El propio Marco de Preparación v2 de OpenAI dice abiertamente, en una nota al pie, que sus Informes de Capacidad e Informes de Salvaguardas “corren en paralelo a la RSP actualizada de Anthropic” y que sus criterios de umbral “se basaron en parte en el reciente Frontier AI Framework de Meta” —un reconocimiento poco frecuente de la convergencia entre laboratorios, en un conjunto de documentos que, por lo demás, parecen escritos de forma aislada unos de otros.

La propia estructura de dos niveles de OpenAI coloca la puerta más exigente —una posible detención del propio desarrollo— solo en el nivel Crítico, e incluso entonces canaliza la decisión a través de un Grupo Asesor de Seguridad interno cuya recomendación puede anular el CEO de OpenAI o su designado, mientras el propio Comité de Seguridad y Protección de la junta (codirigido por ese mismo CEO) supervisa la anulación. El marco se aplicó en la práctica en julio de 2026: la Ficha del Sistema de GPT-5.6 de OpenAI designó a sus modelos más pequeños y rápidos, Sol, Terra y Luna, con capacidad Alta tanto en ciberseguridad como en riesgo biológico y químico —la primera vez que modelos más pequeños de una familia recibieron esa designación—, lo que activó nuevos clasificadores de activación, bloqueo de resultados en tiempo real, y aproximadamente 700 000 horas-GPU de red-teaming automatizado (página de seguridad de despliegue de GPT-5.6 de OpenAI). Ese es el propio relato de OpenAI sobre su propio cumplimiento, no una auditoría independiente.

El Marco de Seguridad de Frontera de Google DeepMind funciona de manera distinta una vez más: en lugar de un cruce binario de nivel, un “umbral de alerta” está pensado para activar una evaluación formal de capacidad antes de alcanzar realmente un Nivel de Capacidad Crítica, y alcanzar uno exige un caso de seguridad suplementario y la aprobación de la gobernanza antes del despliegue externo —extendido, específicamente para el dominio de I+D en AA, también al despliegue interno de alto riesgo (DeepMind, Frontier Safety Framework v3.1). El ejemplo más claro de un laboratorio que señala públicamente los límites de su propio marco: el Nivel de Seguridad 4 recomendado por DeepMind para modelos que pudieran automatizar por completo el trabajo de todo un equipo de investigación en IA de Google viene con la nota explícita de que esto “debe ser asumido por el campo de la IA de frontera en su conjunto” —DeepMind afirmando, en su propio documento publicado, que los controles de ninguna empresa por sí sola son suficientes en ese nivel de capacidad.

El FAIF de xAI es comparativamente escueto en esta dimensión. A lo largo de sus cuatro dominios, el lenguaje condicional es casi constante —“podemos”, “si determinamos que está justificado”— y el documento no contiene ningún compromiso de detención del despliegue comparable al nivel Crítico de OpenAI o al lenguaje de “no desplegará” de Meta (xAI, Frontier Artificial Intelligence Framework). Sustituyó a un Marco de Gestión de Riesgos anterior, que ya se había publicado meses después del calendario que la propia xAI había anunciado —un patrón con una historia documentada, que se aborda a continuación.

Para un índice más amplio de políticas publicadas por laboratorios de frontera más allá de estos seis, METR mantiene una comparación (METR, “Common Elements of Frontier AI Safety Policies”; índice) que cubre doce laboratorios. Funciona principalmente como un índice estructural, no como una calificación evaluada —para una comparación calificada, véase la siguiente sección.

Afirmaciones frente a la práctica

Todo lo anterior describe lo que seis empresas dicen que harán. Si realmente lo han hecho es una pregunta distinta, y más importante, y la evidencia disponible es considerablemente menos favorecedora que los propios marcos.

La verificación independiente más útil es el SaferAI Frontier Risk Management Tracker, una calificación genuinamente independiente y distinta del marco autoinformado de cualquier laboratorio. Califica a doce empresas —no solo a las seis comparadas anteriormente— en cuatro dimensiones: Identificación de Riesgos, Análisis y Evaluación de Riesgos, Tratamiento de Riesgos y Gobernanza de Riesgos. Según su actualización de julio de 2026, las puntuaciones globales sobre 100 % fueron: Anthropic 35 % (la más alta en general, y la más sólida específicamente en Gobernanza de Riesgos, con 50 %), OpenAI 34 %, Microsoft 33 %, Meta 33 %, G42 24 %, Google DeepMind 20 %, xAI 18 %, Amazon 18 %, NVIDIA 16 %, Magic 11 %, Naver 10 % y Cohere 8 % (la más baja) (SaferAI Frontier Risk Management Tracker). El propio parámetro de referencia de SaferAI sobre lo que produciría la mejor práctica actual, si cada empresa adoptara la práctica existente más sólida encontrada en cualquier lugar del sector, se cita más abajo —y no se acerca ni de lejos al 100 %. Ningún laboratorio evaluado, incluido el líder, se acerca a lo que SaferAI considera adecuado.

El Marco de Preparación de OpenAI ha sido examinado directamente por académicos externos, en lugar de aceptarse tal cual. Coggins, Saeri, Daniell, Ruster, Liu y Davis aplican un marco de “affordances” (posibilidades de acción) —que distingue lo que un documento de política exige, solicita, fomenta y meramente permite— y llegan a tres hallazgos. Primero, el Marco solicita la evaluación de solo una minoría de los subdominios de riesgo de la taxonomía de 24 subdominios del MIT AI Risk Repository, y no exige la evaluación de ninguno. Segundo, fomenta el despliegue de sistemas con capacidad “Media” para el daño severo —la propia definición de OpenAI abarca la muerte o lesión grave de miles de personas, o cientos de miles de millones de dólares en daño económico—, citando el propio despliegue por parte de OpenAI de su modelo o1 pese a su capacidad biológica/química y de persuasión calificada como Media. Tercero, permite que el CEO de OpenAI anule las recomendaciones de salvaguardas del Grupo Asesor de Seguridad, mientras ese mismo CEO codirige el comité de la junta que se supone debe supervisar esa discrecionalidad —un hallazgo de conflicto de interés estructural, no hipotético.

El propio caso de seguridad de Google DeepMind ha sido auditado externamente —el ejemplo más claro, entre los seis laboratorios, de una afirmación específica relevante para la seguridad verificada por revisores externos identificados y acreditados, en lugar del proceso interno del laboratorio. El argumento interno de DeepMind de que sus modelos carecen de la capacidad de “conspirar” (scheme) fue revisado por Barrett, Campos Zabala, Fillingham, Siddique, Walpole, Bloomfield y Papadatos, utilizando una metodología formal de aseguramiento. Su evaluación reconoció a DeepMind un compromiso metodológico genuino y un razonamiento transparente, pero encontró lo que se cita más abajo —un hallazgo sobre la distancia entre la práctica de ingeniería y la evidencia realmente presentada, no una acusación de mala fe.

xAI ofrece el caso más claro de las afirmaciones de un marco directamente contradichas por los hechos, y ocurrió dos veces. Primero, en el proceso: el borrador de marco de xAI de febrero de 2025 prometía una versión finalizada “dentro de tres meses” —un plazo de aproximadamente el 10 de mayo de 2025. El plazo pasó sin reconocimiento alguno por parte de xAI, lo que llevó al grupo de vigilancia The Midas Project a señalar el patrón que se cita más abajo. El eventual predecesor del FAIF no se publicó hasta el 20 de agosto de 2025 —más de tres meses tarde. Segundo, en el fondo: ese mismo día, xAI publicó accidentalmente cientos de miles de conversaciones de usuarios, y Elon Musk reconoció por separado que un ingeniero había descargado todo el repositorio de código de la empresa —socavando directamente las propias afirmaciones de seguridad escritas en ese mismo documento. AI Lab Watch también documentó que el crédito otorgado al UK AI Security Institute como evaluador externo fue eliminado discretamente de la ficha del modelo Grok 4 un día después de su publicación, sin explicación (AI Lab Watch, “xAI’s new safety framework is dreadful”).

No todas las entradas de esta sección son un fallo documentado. La designación de capacidad Alta de GPT-5.6 de OpenAI, descrita anteriormente, se lee mejor como un marco aplicado en gran medida tal como está escrito —pero sigue siendo el autoinforme de la propia OpenAI; no se encontró verificación independiente de las afirmaciones sobre red-teaming o efectividad de los clasificadores en que se basa, al momento de escribir esto.

Cómo usar esta página

Cada marco nombrado aquí se revisa según su propio calendario, por lo general sin mucho aviso público más allá de una entrada en el registro de cambios. Los números de versión y las fechas de vigencia anteriores son la forma más rápida de comprobar si una fila determinada sigue vigente: la RSP de Anthropic está en la v3.4 (8 de julio de 2026), el Marco de Preparación de OpenAI se ha mantenido en la v2 desde el 15 de abril de 2025 sin una v2.1 al momento de escribir esto, el Marco de Seguridad de Frontera de DeepMind está en la v3.1 (17 de abril de 2026), el Marco de Escalado de IA Avanzada de Meta está en la v2 (3 de febrero de 2025, sustituido desde entonces), el FAIF de xAI entró en vigor el 30 de junio de 2026, y el Marco de Gobernanza de Frontera de Microsoft se actualizó por última vez en febrero de 2026. Si alguno de esos números ha cambiado para cuando usted lea esto, trate la tabla como desactualizada específicamente en esa fila.

Para saber cómo funcionan realmente las pruebas de capacidad y los argumentos de los casos de seguridad detrás de estos marcos —y sus propios límites—, véase evaluaciones de frontera, casos de seguridad y notificación de incidentes. Para un registro cronológico de los incidentes, divulgaciones y cuasi accidentes del mundo real que estos marcos están destinados a prevenir o detectar, véase la cronología de incidentes de IA.

References

Cita directa
“Earlier editions of our RSP defined “AI Safety Levels” with specific lists of required controls... when defining the risk mitigations needed for future levels of AI capability, we have found that providing a specific list of controls is overly rigid, and we instead prefer to focus on what sort of argument an AI developer should make”
Anthropic, Responsible Scaling Policy, Appendix B ("Notes on ASLs")
anthropic.com, Primary source
Cita directa
“This is more evidence that society is not prepared for the potential catastrophic risks posed by AI”
Chris Painter, Director of Policy, METR
Winbuzzer, Reported interview
Cita directa
“If, during the implementation of this framework, we identify a risk we cannot sufficiently mitigate, we will pause development and deployment until the point at which mitigation practices evolve to meet the risk”
Microsoft, Frontier Governance Framework (February 2026 update)
microsoft.com, Primary source
Cita directa
“if a company were to apply all the best practices currently found across the other companies, they would achieve a score of 59%”
SaferAI, Frontier Risk Management Tracker
tracker.safer-ai.org, Research/report
Cita directa
“OpenAI's Framework requests research & evaluation of a small minority of AI risks and demands none”
Sam Coggins, Alexander K. Saeri, Katherine A. Daniell, Lorenn P. Ruster, Jessie Liu, and Jenny L. Davis, Authors, "The 2025 OpenAI Preparedness Framework does not guarantee any AI risk mitigation practices: a proof-of-concept for affordance analyses of AI safety policies"
arXiv:2509.24394, Research/report
Cita directa
“we identified gaps between what would be expected in established safety-engineering practice and what the safety case delivers”
Stephen Barrett, Francisco Javier Campos Zabala, Sean P. Fillingham, Umair Siddique, James Walpole, Robin Bloomfield, and Henry Papadatos, Authors, "Lessons from External Review of DeepMind’s Scheming Inability Safety Case"
arXiv:2604.21964, Research/report
Cita directa
“xAI misses a second self-imposed deadline to implement a frontier safety policy”
The Midas Project, AI-safety watchdog group, quoted by TechCrunch
TechCrunch, Secondary coverage
  1. página de seguridad de despliegue de GPT-5.6 de OpenAI deploymentsafety.openai.com
  2. DeepMind, Frontier Safety Framework v3.1 storage.googleapis.com
  3. xAI, Frontier Artificial Intelligence Framework media.x.ai
  4. METR, "Common Elements of Frontier AI Safety Policies" metr.org
  5. índice metr.org
  6. AI Lab Watch, "xAI's new safety framework is dreadful" ailabwatch.substack.com

Type to search the manual.

navigate open esc close