Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Брифинг о выживании человечества
RU

04 Пути отступления

Пути отступления, которые действительно существуют

Технические и институциональные механизмы контроля определяют, станут ли тяжёлые сценарии из главы 02 более или менее вероятными; подготовка домохозяйства не может их заменить.

Written by
Dwight Ringdahl
Revised
Sources
2 cited

Технические рычаги безопасности

  • Исследования интерпретируемости. Изучение внутренних представлений модели и её вычислений как одно из дополнений к поведенческим оценкам, контролю доступа и мониторингу развёртывания.
  • Масштабируемый надзор. Методы — дебаты, рекурсивное моделирование вознаграждения, обобщение от слабого к сильному — призванные помочь менее способным контролёрам осуществлять надзор за более способными системами.
  • Исследования корригируемости. Изучение того, как системы могут оставаться восприимчивыми к законной коррекции, изменению и отключению; устойчивое к масштабированию решение пока не продемонстрировано.
  • Управление вычислительными мощностями. Экспортный контроль, зависящий от юрисдикции, мониторинг инфраструктуры и пороговые значения, используемые как несовершенные косвенные показатели возможностей — а не как определение AGI или безопасности.

Генеральный директор Anthropic обосновал необходимость первого из этих пунктов в своём эссе 2025 года на эту тему:

Summarized position

Dario Amodei argues that researchers still lack a precise account of why models choose particular outputs.

Dario Amodei, CEO, Anthropic
The Urgency of Interpretability, Primary source

Институциональные рычаги

Проблема координации

Международная координация важна, потому что односторонние меры контроля могут менять как стимулы к безопасности, так и конкурентные позиции. Политический ландшафт больше не является полностью добровольным: Закон ЕС об ИИ налагает обязательные требования на подпадающих под его действие поставщиков, тогда как рамочные документы лабораторий по безопасности и обязательства саммитов остаются в основном добровольными. В настоящее время не существует обязательного глобального договора о контроле над передовыми моделями по аналогии с контролем вооружений.

Ранней международной отправной точкой стала необязывающая декларация, поддержанная 28 странами и ЕС на первом глобальном саммите по безопасности ИИ:

Summarized position

28 nations and the European Union commits signatories to AI that is designed, developed, deployed and used safely and responsibly.

28 nations and the European Union, The Bletchley Declaration, AI Safety Summit
GOV.UK, Signed statement
  • Соразмерная риску оценка опасных возможностей до развёртывания, проводимая перед неограниченным выпуском системы.
  • Отчётность об инцидентах, позволяющая регуляторам и разработчикам извлекать уроки из серьёзных сбоев и ситуаций, близких к ним.
  • Правила ответственности, учитывающие контроль, осведомлённость, причинно-следственную связь и способность предотвратить вред.

Что может сделать отдельный технический специалист

Читатели могут влиять на политику как избиратели, работники, исследователи, клиенты, инвесторы и члены гражданских организаций. Практические варианты включают: вносить вклад в исследования интерпретируемости и согласования (alignment) или финансировать их; продвигать практики безопасности внутри собственной организации, если вы разворачиваете системы ИИ в продакшене; поддерживать описанную выше инфраструктуру отчётности и оценки, а не воспринимать её как регуляторное препятствие; и проверять источник и доказательства, стоящие за убедительными утверждениями, вместо того чтобы сразу предполагать либо автоматизированную манипуляцию, либо подлинный консенсус.

Исследования Политика Организационное

В этой главе

11 страниц в этой главе

Корригируемость: системы, принимающие коррекцию Почему «просто встроить выключатель» сложнее, чем кажется, и что пытаются решить исследования корригируемости — включая то, почему агент может сопротивляться отключению.
Источники проверены 6 min
Защита осведомителей внутри лабораторий ИИ Как права осведомителей, каналы отчётности и правила против ответных мер помогают сотрудникам лабораторий ИИ раскрывать сбои безопасности до вреда обществу.
Источники проверены 6 min

Type to search the manual.

navigate open esc close