Что такое система безопасности на самом деле
Система безопасности передовой лаборатории ИИ — это собственная опубликованная политика лаборатории, определяющая пороги возможностей — конкретные вещи, которые модель потенциально может научиться делать, — а также защитные меры или организационные обязательства, которые должны срабатывать, когда модель достигает одного из этих порогов. Anthropic называет свою версию Политикой ответственного масштабирования (Responsible Scaling Policy); OpenAI — Рамочной программой готовности (Preparedness Framework); Google DeepMind — Рамочной программой безопасности передовых моделей (Frontier Safety Framework); Meta — Рамочной программой масштабирования продвинутого ИИ (Advanced AI Scaling Framework); xAI — Рамочной программой передового искусственного интеллекта (Frontier Artificial Intelligence Framework); Microsoft — Рамочной программой управления передовыми моделями (Frontier Governance Framework). Названия различаются; структурно все шесть пытаются ответить на один и тот же вопрос — как компания понимает, что модель слишком опасна, чтобы развёртывать её как есть, и что компания реально обязуется в связи с этим делать?
Этот вопрос важен, потому что ни один внешний регулятор в настоящее время не устанавливает обязывающие, привязанные к конкретной модели пороги возможностей ни для одной из этих шести компаний (см. законодательство об ИИ и правоприменение в 2026 году). Пока что эти документы — реальный рабочий ответ отрасли. При этом это не один и тот же документ, скопированный шесть раз: то, какие риски отслеживает каждая лаборатория, как определяется порог и — что важнее всего — что происходит при его превышении, различается значимым образом.
Прежде чем переходить к сравнению, нужно сказать одну вещь, которая определяет то, как следует читать всё изложенное ниже: каждое утверждение в таблице — это заявленная самой лабораторией политика. Ничто из этого не является независимым подтверждением того, что лаборатория действительно делает то, что заявляет. Отдельный раздел после таблицы, «Заявления против практики», охватывает оценённые внешние аудиты, академическую критику и документированные разрывы между заявленными обязательствами этих шести компаний и их реальным поведением — и именно этот раздел, а не таблица, важнее.
Каждая деталь систем безопасности ниже сверена с актуальным опубликованным документом самой лаборатории, а также (для раздела «заявления против практики») с указанными независимыми отчётами и статьями по состоянию на сентябрь 2026 года. Везде приведены точные номера версий и даты вступления в силу, чтобы вернувшийся читатель мог понять, изменилось ли что-то. Эти политики пересматриваются часто — только Anthropic опубликовала девять пронумерованных версий начиная с сентября 2023 года, — поэтому каждую строку стоит воспринимать как снимок на определённую дату, а не как окончательное описание.
Системы безопасности в сравнении
| Лаборатория (система) | Текущая версия / дата | Отслеживаемые области риска | Структура порогов / уровней | Что происходит при превышении порога |
|---|---|---|---|---|
| Anthropic — Политика ответственного масштабирования | v3.4, действует с 8 июля 2026 | Прирост CBRN-возможностей не нового типа; прирост CBRN-возможностей нового типа; саботаж с высокими ставками; ускорение автоматизированных исследований и разработок в сфере ИИ | Таблица порогов возможностей/использования; фиксированные уровни ASL-2/ASL-3/ASL-4 упразднены при переписывании версии 3.0 (унаследованные обозначения ASL сохранены только для уже действующих мер контроля) | Публичная, необязывающая Дорожная карта безопасности передовых моделей, оцениваемая по сравнению с прошлыми показателями, плюс Отчёты о рисках каждые 3–6 месяцев с внешней проверкой — без безусловной паузы |
| OpenAI — Рамочная программа готовности | v2, 15 апр. 2025 | Биологические и химические риски, кибербезопасность, автоматизированное самосовершенствование ИИ (отслеживаются); долгосрочная автономность, sandbagging, автономная репликация и адаптация, подрыв защитных мер, ядерные и радиологические риски (исследовательские категории, полные критерии ещё не разработаны); убеждение явно исключено | Два уровня: высокий и критический | Высокий: защитные меры требуются перед развёртыванием. Критический: защитные меры требуются уже во время разработки; разработка может быть полностью остановлена. Внутренняя Консультативная группа по безопасности даёт рекомендацию; решение принимает генеральный директор или назначенное им лицо; надзор за решением осуществляет Комитет совета директоров по безопасности и защите |
| Google DeepMind — Рамочная программа безопасности передовых моделей | v3.1, 17 апр. 2026 | CBRN; кибербезопасность; вредоносная манипуляция (помечена как «экспериментальная область, требующая дальнейшего исследования»); исследования и разработки в машинном обучении и рассогласование (объединены в одну область в версии 3.1) | Критические уровни возможностей (CCL) плюс отслеживаемые уровни возможностей с более низким порогом (TCL, новые в версиях 3.0/3.1); уровни безопасности SL1–SL4 используются как терминология, а не как стандарт соответствия | «Пороговый сигнал тревоги» запускает формальную оценку возможностей ещё до фактического достижения CCL; достижение CCL требует дополнительного обоснования безопасности и одобрения со стороны управляющего органа перед внешним развёртыванием (а для CCL в области исследований и разработок в машинном обучении — также перед внутренним развёртыванием высокого риска) |
| Meta — Рамочная программа масштабирования продвинутого ИИ | v2, 3 февр. 2025 (переименована из «Frontier AI Framework» v1.1; заменена примерно в апр. 2026) | Химические и биологические риски; кибербезопасность; потеря контроля (добавлено в версии 2) | «Уровень прироста возможностей по отношению к сценарию угрозы», а не фиксированная шкала уровней | Если критический риск невозможно снизить: компания не станет развёртывать модель для внешнего использования и не продолжит её разработку |
| xAI — Рамочная программа передового искусственного интеллекта (FAIF) | Действует с 30 июня 2026 (заменила более раннюю Рамочную программу управления рисками, последнее обновление которой датировано 20 авг. 2025) | CBRN; наступательная кибербезопасность; потеря контроля; вредоносная манипуляция | Полная оценка системного риска не реже раза в год; фиксированной шкалы уровней нет | На всём протяжении документа используются условные формулировки («мы можем», «если мы сочтём это оправданным»); явного триггера остановки разработки, сопоставимого с другими лабораториями, нет |
| Microsoft — Рамочная программа управления передовыми моделями | Обновление февр. 2026 (версия 1 — февр. 2025) | Оружие CBRN; наступательные кибероперации; продвинутая автономность; потеря контроля и вредоносная манипуляция (добавлены в февр. 2026) | Два этапа: автоматизированный скрининг по «опережающим индикаторам» на основе эталонных тестов не реже раза в 6 месяцев, с переходом к более глубокой оценке по шкале «низкий/средний/высокий/критический» | «Если… мы выявляем риск, который не можем в достаточной мере снизить, мы приостановим разработку и развёртывание до того момента, пока практики снижения риска не разовьются настолько, чтобы соответствовать этому риску» — самое прямое обязательство по остановке среди всех шести лабораторий |
Самое значимое изменение: отказ Anthropic от безусловной паузы
RSP компании Anthropic имеет самую долгую публичную историю среди всех шести документов, и её последнее структурное изменение — самое обсуждаемое событие среди систем безопасности передовых моделей в 2026 году. Версия 1.0, опубликованная 19 сентября 2023 года, ввела систему уровней безопасности ИИ (ASL) — ASL-2, ASL-3, ASL-4, — каждый из которых определялся конкретным фиксированным списком обязательных мер контроля, вместе с жёстким обязательством: Anthropic не будет обучать модель за пределами порога без заранее доказанных адекватных защитных мер. Версии 2.0 (октябрь 2024), 2.1 (март 2025) и 2.2 (май 2025) расширили эту структуру и добавили порог CBRN.
Версия 3.0, вступившая в силу 24 февраля 2026 года, переписала политику. Anthropic заменила фиксированные уровни ASL таблицей порогов возможностей/использования и прямо объяснила это решение в приложении — собственные слова компании о том, почему она отказалась от конкретных, детализированных списков контроля, приведены ниже как зарегистрированная цитата. Вместо прежней жёсткой паузы версия 3.0 ввела два новых инструмента: публичную, необязывающую Дорожную карту безопасности передовых моделей, открыто оцениваемую по сравнению с собственными прошлыми показателями Anthropic, и Отчёты о рисках, публикуемые каждые три-шесть месяцев и подлежащие проверке как минимум одним проверенным, независимым, свободным от конфликта интересов рецензентом. Документ Anthropic прямо говорит, что это осознанный переход от одностороннего, абсолютного подхода к риску к подходу условному и зависящему от поведения конкурентов: отдельное приложение описывает такие сценарии, как «Anthropic лидирует» и «У конкурентов есть надёжные меры безопасности», при которых собственные обязательства компании меняются. Версии 3.1 (2 апреля), 3.2 (29 апреля), 3.3 (26 мая) и 3.4 (8 июля 2026 года, текущая) с тех пор пересматривали отдельные детали — последний раз сузив порог для автоматизированных исследований и разработок и расширив внутреннее распространение Отчётов о рисках, — но не восстановили прежнюю жёсткую паузу.
Управление вокруг самой политики оставалось неизменным на протяжении всех этих версий: назначенное должностное лицо, ответственное за ответственное масштабирование, канал для сообщений о несоблюдении и ежегодная процедурная проверка соответствия сторонним аудитором, которую сама Anthropic описывает как проверку «процедурного соответствия, а не содержательных результатов» — различие, которое стоит отметить, поскольку оно означает, что аудит подтверждает соблюдение процесса, а не правильность итоговых решений.
Это изменение сразу же было воспринято вне компании как событие, влияющее на доверие к ней. Крис Пейнтер, директор по политике METR, ознакомился с ранним черновиком с разрешения Anthropic и, приветствуя возросшую прозрачность благодаря Отчётам о рисках, дал журналистам прямую оценку, процитированную ниже.
В чём остальные пять систем безопасности сходятся и расходятся
Рамочная программа управления передовыми моделями Microsoft — наиболее прямая противоположность новой условной позиции Anthropic: её обязательство по паузе, процитированное полностью в таблице выше и ниже, на первый взгляд безусловно и привязано исключительно к собственной оценке Microsoft того, что риск невозможно в достаточной мере снизить, — без каких-либо оговорок о сценариях, зависящих от поведения конкурентов, сопоставимых с приложением A у Anthropic.
Рамочная программа масштабирования продвинутого ИИ компании Meta даёт столь же безусловное обязательство для своего более узкого случая: если модель достигает «порога критического риска» Meta и этот риск невозможно снизить, Meta заявляет, что не станет развёртывать модель для внешнего использования и не продолжит её разработку. Meta использует «уровень прироста возможностей по отношению к сценарию угрозы», а не фиксированную шкалу уровней, но лежащие в основе области — химический/биологический риск, кибербезопасность и потеря контроля (добавлена в версии 2 у Meta) — оказываются более общими для разных лабораторий, чем можно предположить по отдельным публикациям каждой из систем. Собственная Рамочная программа готовности OpenAI версии 2 прямо говорит в сноске, что её Отчёты о возможностях и Отчёты о защитных мерах «идут параллельно обновлённой RSP компании Anthropic» и что её критерии порогов «частично опирались на недавнюю Frontier AI Framework компании Meta» — редкое признание конвергенции между лабораториями в наборе документов, которые в остальном читаются так, будто каждый писался в изоляции от других.
Собственная двухуровневая структура OpenAI помещает более жёсткие ворота — возможную остановку самой разработки — только на критическом уровне, и даже тогда решение проходит через внутреннюю Консультативную группу по безопасности, чью рекомендацию может отменить генеральный директор OpenAI или назначенное им лицо, а надзор за таким решением об отмене осуществляет собственный Комитет совета директоров по безопасности и защите (сопредседателем которого выступает тот же генеральный директор). Эта система была применена на практике в июле 2026 года: карточка системы GPT-5.6 компании OpenAI присвоила её более мелким и быстрым моделям Sol, Terra и Luna статус высокой возможности как в области кибербезопасности, так и в области биологического и химического риска — впервые в истории семейства моделей такой статус получили именно младшие модели, — что запустило новые классификаторы активации, блокировку вывода в реальном времени и порядка 700 000 часов работы GPU на автоматизированный red-teaming (страница безопасности развёртывания GPT-5.6 компании OpenAI). Это собственный отчёт OpenAI о собственном соответствии требованиям, а не независимый аудит.
Рамочная программа безопасности передовых моделей Google DeepMind устроена иначе: вместо бинарного пересечения уровня «пороговый сигнал тревоги» призван запускать формальную оценку возможностей ещё до фактического достижения критического уровня возможностей, а достижение такого уровня требует дополнительного обоснования безопасности и одобрения управляющего органа перед внешним развёртыванием — а применительно именно к области исследований и разработок в машинном обучении это требование распространяется и на внутреннее развёртывание высокого риска (DeepMind, Frontier Safety Framework v3.1). Самый наглядный пример того, как лаборатория публично называет пределы собственной системы безопасности: рекомендуемый DeepMind уровень безопасности 4 для моделей, способных полностью автоматизировать работу целой исследовательской команды Google в области ИИ, сопровождается явной оговоркой, что эта задача «должна быть взята на себя всей областью передового ИИ в целом», — DeepMind в собственном опубликованном документе заявляет, что меры контроля ни одной отдельно взятой компании недостаточны на этом уровне возможностей.
FAIF компании xAI сравнительно скуден по этому параметру. На протяжении всех четырёх областей условные формулировки почти постоянны — «мы можем», «если мы сочтём это оправданным», — и документ не содержит обязательства об остановке развёртывания, сопоставимого с критическим уровнем у OpenAI или формулировкой «не будет развёртывать» у Meta (xAI, Frontier Artificial Intelligence Framework). Этот документ заменил более раннюю Рамочную программу управления рисками, которая сама была опубликована на месяцы позже срока, заявленного самой xAI, — паттерн с документированной историей, о котором пойдёт речь ниже.
Более широкий перечень опубликованных политик передовых лабораторий помимо этих шести ведёт METR (METR, «Common Elements of Frontier AI Safety Policies»; указатель), охватывающий двенадцать лабораторий. Он служит в первую очередь структурным указателем, а не оценочной шкалой — для сравнения с оценками см. следующий раздел.
Заявления против практики
Всё изложенное выше описывает то, что шесть компаний заявляют о своих намерениях. Делают ли они это на самом деле — вопрос другой и более важный, а доступные доказательства выглядят заметно менее лестно, чем сами эти документы.
Самая полезная независимая проверка — трекер SaferAI Frontier Risk Management Tracker, по-настоящему независимая оценка, отличная от самоотчётов любой лаборатории. Он оценивает двенадцать компаний — не только шесть, сравниваемых выше — по четырём параметрам: выявление рисков, анализ и оценка рисков, снижение рисков и управление рисками. По данным обновления за июль 2026 года, общие баллы из 100% составили: Anthropic — 35% (самый высокий общий результат и самый сильный именно по управлению рисками — 50%), OpenAI — 34%, Microsoft — 33%, Meta — 33%, G42 — 24%, Google DeepMind — 20%, xAI — 18%, Amazon — 18%, NVIDIA — 16%, Magic — 11%, Naver — 10% и Cohere — 8% (самый низкий результат) (SaferAI Frontier Risk Management Tracker). Собственный ориентир SaferAI на тему того, какого результата достигла бы текущая лучшая практика, если бы каждая компания переняла самую сильную существующую практику, найденную где-либо в отрасли, процитирован ниже — и он далеко не достигает 100%. Ни одна из рассмотренных лабораторий, включая лидера, не приближается к тому, что SaferAI считает адекватным.
Рамочная программа готовности OpenAI была проверена напрямую внешними академическими исследователями, а не принята на веру. Коггинс, Саэри, Дэниелл, Рустер, Лю и Дэвис применяют рамку «возможностей действия» (affordances) — различающую то, что программный документ требует, запрашивает, поощряет и просто допускает, — и приходят к трём выводам. Во-первых, программа запрашивает оценку лишь по меньшинству поддоменов риска из таксономии MIT AI Risk Repository, включающей 24 поддомена, и не требует оценки ни по одному из них. Во-вторых, она поощряет развёртывание систем со «средней» способностью причинять тяжкий вред — собственное определение OpenAI охватывает гибель или тяжкие увечья тысяч людей либо экономический ущерб в сотни миллиардов долларов, — ссылаясь на собственное развёртывание OpenAI своей модели o1, несмотря на присвоенный ей средний уровень биологических/химических возможностей и возможностей убеждения. В-третьих, она допускает, что генеральный директор OpenAI может отменять рекомендации Консультативной группы по безопасности относительно защитных мер, при этом тот же генеральный директор является сопредседателем комитета совета директоров, который должен осуществлять надзор за этим правом отмены, — это структурный вывод о конфликте интересов, а не гипотетический.
Собственное обоснование безопасности Google DeepMind прошло внешний аудит — самый наглядный среди всех шести лабораторий пример того, как конкретное значимое для безопасности утверждение проверяется названными поимённо, обладающими соответствующей квалификацией внешними рецензентами, а не внутренним процессом самой лаборатории. Внутренний аргумент DeepMind о том, что её моделям не хватает способности к «скрытному планированию» (scheming), был рассмотрен Барреттом, Кампос Забалой, Филлингемом, Сиддик, Уолполом, Блумфилдом и Пападатосом с использованием формальной методологии обеспечения гарантий. Их оценка признала за DeepMind подлинную методологическую вовлечённость и прозрачность рассуждений, но обнаружила то, что процитировано ниже, — вывод о разрыве между инженерной практикой и реально представленными доказательствами, а не обвинение в недобросовестности.
xAI даёт самый наглядный случай, когда заявления системы безопасности напрямую опровергаются событиями, и это произошло дважды. Во-первых, в отношении процесса: черновик системы безопасности xAI от февраля 2025 года обещал финальную версию «в течение трёх месяцев» — то есть примерно к 10 мая 2025 года. Срок прошёл без каких-либо комментариев со стороны xAI, что побудило наблюдательную группу The Midas Project отметить закономерность, процитированную ниже. Итоговый предшественник FAIF был опубликован лишь 20 августа 2025 года — с опозданием более чем на три месяца. Во-вторых, по существу: в тот же день xAI случайно опубликовала сотни тысяч переговоров пользователей, а Илон Маск отдельно признал, что инженер скачал весь репозиторий кода компании, — что напрямую подрывает собственные же письменные заявления о безопасности в том же документе. AI Lab Watch также задокументировала, что упоминание британского Института безопасности ИИ как стороннего оценщика было тихо удалено из карточки модели Grok 4 через день после публикации, без объяснений (AI Lab Watch, «xAI’s new safety framework is dreadful»).
Не каждый пункт этого раздела представляет собой документированный провал. Присвоение GPT-5.6 статуса высокой возможности компанией OpenAI, описанное выше, лучше всего рассматривать как пример применения системы безопасности в целом так, как она написана, — но это по-прежнему собственный самоотчёт OpenAI; независимой проверки заявлений о red-teaming или эффективности классификаторов, лежащих в его основе, на момент написания найдено не было.
Как пользоваться этой страницей
Каждая названная здесь система безопасности пересматривается по собственному графику, обычно без особого публичного уведомления, кроме записи в журнале изменений. Приведённые выше номера версий и даты вступления в силу — самый быстрый способ проверить, актуальна ли ещё конкретная строка: RSP компании Anthropic находится на версии 3.4 (8 июля 2026), Рамочная программа готовности OpenAI остаётся на версии 2 с 15 апреля 2025 года, версии 2.1 на момент написания не существует, Рамочная программа безопасности передовых моделей DeepMind — на версии 3.1 (17 апреля 2026), Рамочная программа масштабирования продвинутого ИИ Meta — на версии 2 (3 февраля 2025 года, с тех пор заменена), FAIF компании xAI вступила в силу 30 июня 2026 года, а Рамочная программа управления передовыми моделями Microsoft последний раз обновлялась в феврале 2026 года. Если к моменту, когда вы это читаете, какие-либо из этих номеров изменились, считайте таблицу устаревшей именно в этой строке.
О том, как на самом деле работают тесты возможностей и аргументация обоснований безопасности, лежащие в основе этих систем, — и об их собственных пределах — см. передовые оценки, обоснования безопасности и отчётность об инцидентах. Хронологическую запись реальных инцидентов, раскрытий информации и ситуаций, едва не завершившихся вредом, которые эти системы безопасности призваны предотвращать или выявлять, см. в хронологии инцидентов с ИИ.