04 Пути отступления
Пути отступления, которые действительно существуют
Технические и институциональные механизмы контроля определяют, станут ли тяжёлые сценарии из главы 02 более или менее вероятными; подготовка домохозяйства не может их заменить.
Технические рычаги безопасности
- Исследования интерпретируемости. Изучение внутренних представлений модели и её вычислений как одно из дополнений к поведенческим оценкам, контролю доступа и мониторингу развёртывания.
- Масштабируемый надзор. Методы — дебаты, рекурсивное моделирование вознаграждения, обобщение от слабого к сильному — призванные помочь менее способным контролёрам осуществлять надзор за более способными системами.
- Исследования корригируемости. Изучение того, как системы могут оставаться восприимчивыми к законной коррекции, изменению и отключению; устойчивое к масштабированию решение пока не продемонстрировано.
- Управление вычислительными мощностями. Экспортный контроль, зависящий от юрисдикции, мониторинг инфраструктуры и пороговые значения, используемые как несовершенные косвенные показатели возможностей — а не как определение AGI или безопасности.
Генеральный директор Anthropic обосновал необходимость первого из этих пунктов в своём эссе 2025 года на эту тему:
Dario Amodei argues that researchers still lack a precise account of why models choose particular outputs.
The Urgency of Interpretability, Primary source
Институциональные рычаги
Международная координация важна, потому что односторонние меры контроля могут менять как стимулы к безопасности, так и конкурентные позиции. Политический ландшафт больше не является полностью добровольным: Закон ЕС об ИИ налагает обязательные требования на подпадающих под его действие поставщиков, тогда как рамочные документы лабораторий по безопасности и обязательства саммитов остаются в основном добровольными. В настоящее время не существует обязательного глобального договора о контроле над передовыми моделями по аналогии с контролем вооружений.
Ранней международной отправной точкой стала необязывающая декларация, поддержанная 28 странами и ЕС на первом глобальном саммите по безопасности ИИ:
28 nations and the European Union commits signatories to AI that is designed, developed, deployed and used safely and responsibly.
GOV.UK, Signed statement
- Соразмерная риску оценка опасных возможностей до развёртывания, проводимая перед неограниченным выпуском системы.
- Отчётность об инцидентах, позволяющая регуляторам и разработчикам извлекать уроки из серьёзных сбоев и ситуаций, близких к ним.
- Правила ответственности, учитывающие контроль, осведомлённость, причинно-следственную связь и способность предотвратить вред.
Что может сделать отдельный технический специалист
Читатели могут влиять на политику как избиратели, работники, исследователи, клиенты, инвесторы и члены гражданских организаций. Практические варианты включают: вносить вклад в исследования интерпретируемости и согласования (alignment) или финансировать их; продвигать практики безопасности внутри собственной организации, если вы разворачиваете системы ИИ в продакшене; поддерживать описанную выше инфраструктуру отчётности и оценки, а не воспринимать её как регуляторное препятствие; и проверять источник и доказательства, стоящие за убедительными утверждениями, вместо того чтобы сразу предполагать либо автоматизированную манипуляцию, либо подлинный консенсус.