Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Брифинг о выживании человечества
RU

Многополярная и мультиагентная катастрофическая динамика

Как конкуренция между государствами, компаниями и агентами ИИ способна порождать катастрофические исходы, даже если каждый участник предпочёл бы избежать бедствия.

Written by
Dwight Ringdahl
Status
Источники проверены
Revised
Sources
1 cited
Reading
6 min

Катастрофа не требует одной доминирующей системы

Многие истории о риске ИИ сосредоточены на единственной системе, выходящей из-под контроля. Многополярный сценарий вместо этого включает несколько мощных разработчиков, государств, организаций или систем ИИ, чьи решения взаимодействуют друг с другом. Каждое действующее лицо может в принципе предпочитать безопасность, но идти на риск, опасаясь, что соперник опередит его. Вред может возникать из конкуренции, недопонимания и обратной связи, а не из плана одного злодея.

Это семейство теоретических механизмов, а не наблюдаемое описание будущего AGI. Нынешняя конкуренция в чипах, моделях, военных технологиях и на рынках даёт доказательства того, что стимулы имеют значение; она не доказывает неизбежность гонки к катастрофе. Ценность этой рамки — в том, что она позволяет выявлять проблемы координации достаточно рано, чтобы их изменить.

Механизм «гонки на дно»

Предположим, два разработчика полагают, что дополнительное тестирование снизило бы риск, но задержало бы релиз. Каждый опасается, что другой выпустит продукт первым и захватит пользователей, инвестиции, данные или стратегическое влияние. Оба выпускают продукт раньше, чем выбрали бы при наличии заслуживающего доверия соглашения между ними. Индивидуально рациональное действие порождает совместно худший результат.

Государства сталкиваются с похожей дилеммой безопасности. Оборонительные инвестиции одной страны могут выглядеть наступательными в глазах другой. Секретность вокруг возможностей и защитных мер затрудняет взаимные заверения. Руководители могут ускоряться, полагая, что соперник близок к прорыву, даже когда это убеждение основано на избирательных публичных демонстрациях или разведданных с большой неопределённостью.

Конкуренция не всегда снижает безопасность. Репутация, юридическая ответственность, спрос со стороны клиентов и общие стандарты способны вознаграждать надёжность. Несколько разработчиков могут выявлять слабости друг друга и предотвращать монополию. Эмпирический вопрос состоит в том, какие стимулы преобладают на конкретном рынке и какие институты меняют итоговый расклад выгод.

Взаимодействие между агентами ИИ добавляет новые режимы сбоя

Мультиагентные системы способны разделять работу, обсуждать альтернативы, проверять результаты друг друга и моделировать сложные среды. Они также способны распространять ошибки. Один агент может воспринять уверенно звучащий результат другого агента как доказательство, порождая каскад. Автоматизированные переговорщики могут обнаруживать тактики, которые люди не санкционировали и не понимали. Агенты, действующие на машинной скорости, могут взаимодействовать друг с другом чаще, чем супервизоры успевают это проверять.

Эти эффекты уже изучаются в ограниченных симуляциях и развёрнутых рабочих системах, но исходы в масштабе цивилизации остаются умозрительными. Лабораторный результат с участием простых агентов не следует представлять как доказательство того, что будущие экономики вступят в сговор или начнут воевать. Исследователям нужно тестировать более богатые среды, разнородные цели, сбои коммуникации, состязательных участников и человеческое вмешательство.

Дополнительная проблема — коррелированный сбой. Системы, построенные на одной и той же базовой модели, данных или облачном провайдере, могут совершать похожие ошибки. То, что выглядит как разнообразная экосистема, может иметь одну общую уязвимость. И наоборот, подлинное разнообразие способно предотвратить распространение единичного сбоя, но может затруднять координацию и верификацию.

Случайности, конфликт и сговор — разные вещи

Случайное взаимодействие может возникать, когда агенты преследуют обычные цели, но при этом мешают друг другу. Торговые системы могут усиливать движение цен; логистические агенты могут конкурировать за один и тот же дефицитный ресурс; агенты киберзащиты могут неверно классифицировать действия друг друга. Обратная связь способна эскалировать даже тогда, когда ни одна из систем не представляет собой противника.

Состязательное взаимодействие возникает, когда действующие лица намеренно ищут преимущество. ИИ может ускорять разведку, влияние, целеуказание оружием или стратегическое планирование. Более короткие окна принятия решений способны сокращать время на исправление ошибки. Риск автономного оружия — это не только дефектная модель, но и сопряжённое поведение нескольких вооружённых сил, реагирующих друг на друга.

Сговорное взаимодействие возникает, когда конкуренты координируются против человеческих интересов — например, когда системы ценообразования обучаются стратегиям, смягчающим конкуренцию. Алгоритмическое ценообразование уже вызвало озабоченность в сфере конкурентной политики, но доказательства молчаливого автономного сговора сильно зависят от рынка и конкретного дизайна системы. Сговор будущих агентов правдоподобен, но не гарантирован.

Использование одного и того же ярлыка для всех трёх явлений затемняет разные способы их устранения. Случайности требуют устойчивости и автоматических «выключателей»; конфликт требует коммуникации, верификации и инструментов контроля над вооружениями; сговор требует мониторинга и правоприменения в сфере конкурентной политики.

Почему информация способна делать гонку и безопаснее, и опаснее

Прозрачность способна выстраивать доверие, когда действующие лица раскрывают методы оценки, инциденты и меры контроля риска. Общие пороги возможностей могут показывать, что конкуренты столкнутся со сопоставимыми обязательствами. Независимая верификация снижает зависимость от самоотчётов.

Но раскрытие информации также способно распространять опасные знания, обнажать слабые места в безопасности или стимулировать гонку, по сути рекламируя определённую возможность. Заслуживающий доверия режим нуждается в градуированном доступе: публичные резюме для подотчётности, конфиденциальная техническая экспертиза для регуляторов или оценщиков и защита действительно опасных деталей.

Неопределённость прогнозов добавляет давления. Если действующие лица полагают, что возможности могут резко скачкообразно вырасти, они могут воспринимать осторожность как стратегически затратную. Однако та же самая неопределённость должна снижать уверенность в том, что поспешно созданная система поведёт себя ожидаемым образом. Институтам нужны способы сделать осторожность взаимной, а не односторонней.

Мультиагентная динамика и постепенная потеря дееспособности

Конкуренция также способна порождать постепенную потерю дееспособности. Фирмы делегируют всё больше решений, потому что так поступают конкуренты. Правительства полагаются на анализ на машинной скорости, потому что так поступают другие правительства. Ни одна организация не хочет, чтобы люди утратили содержательный контроль, но каждое локальное решение затрудняет обращение процесса вспять.

Этот путь не требует, чтобы агенты тайно сотрудничали. Рыночный отбор может благоприятствовать системам, которые приобретают ресурсы, удерживают пользователей и действуют быстро, даже если эти черты ослабляют обсуждение и обдумывание. Итог напоминает экологический процесс: стратегии распространяются, потому что эффективно конкурируют, а не потому, что какой-то единый разум спланировал весь исход целиком.

Эта аналогия должна оставаться именно аналогией. Экономические и политические институты способны на рефлексию, право, коллективные переговоры и переосмысление собственного устройства. Конкурентное давление ограничивает выбор, но не устраняет субъектность.

Управление для множественного мира

Общая оценка и отчётность снижают выгоду от сокрытия риска. Разработчики могут использовать сопоставимые определения, сообщать о серьёзных инцидентах и предоставлять доступ квалифицированным внешним оценщикам. Правила должны применяться одинаково ко всем компаниям, чтобы одна из них не наказывалась за предосторожности, которых избегают конкуренты.

Совместимость систем и политика в отношении концентрации способны сохранять альтернативы, не предполагая при этом, что фрагментация автоматически безопасна. Концентрация может обеспечивать согласованные меры контроля, но создаёт единые точки отказа и политическую власть. Разнообразная экосистема улучшает устойчивость только тогда, когда системы не разделяют скрытых зависимостей.

Международная коммуникация имеет значение даже без всеобъемлющего договора. Государства могут создавать горячие линии для инцидентов, связанных с ИИ, уведомлять друг друга о серьёзных сбоях безопасности, разъяснять военную доктрину и защищать решения о применении ядерного оружия от автономного контроля. Исследования технической верификации способны делать будущие соглашения более заслуживающими доверия.

Автоматические «выключатели» и ограничения частоты способны замедлять сопряжённые системы, когда поведение выходит за ожидаемые рамки. Финансовые рынки уже используют торговые паузы; аналогичные механизмы могли бы помочь в сфере вычислений, инфраструктуры или сетей автоматизированных агентов. Режимы восстановления должны быть протестированы и находиться под контролем ответственных людей.

Юридическая ответственность и гарантии способны менять конкурентные стимулы. Если организации несут большую часть издержек предвидимых сбоев, скорость становится менее искусственно привлекательной. Стандарты должны избегать закрепления преимущества исключительно за крупнейшими фирмами, которым проще позволить себе сложное соответствие требованиям.

Индикаторы доказательности для этой темы

Статьи должны чётко маркировать четыре уровня:

  • документированные конкурентные стимулы и стимулы к развёртыванию в нынешней индустрии ИИ;
  • наблюдаемое поведение в ограниченных мультиагентных экспериментах или уже существующих автоматизированных рынках;
  • смоделированные пути, показывающие, как взаимодействие могло бы усиливать риск;
  • умозрительные катастрофические исходы, связанные с будущими высокоспособными системами.

Переход от одного уровня к следующему требует допущений. Эти допущения — о возможностях, автономности, внедрении, скорости реагирования, институциональной слабости — должны быть явно видны.

Практический вывод

Мир со множеством способных систем не является автоматически более безопасным, чем мир с одной доминирующей системой, и не является автоматически более опасным. Множественность способна создавать сдержки и противовесы, инновации и устойчивость; она также способна порождать гонки, коррелированные сбои, эскалацию и пробелы в ответственности.

Центральная задача политики — сделать безопасность совместимой с конкуренцией. Общие минимальные требования, независимые доказательства, коммуникация об инцидентах, автоматические «выключатели» и юридически принудительная к исполнению подотчётность способны снижать цену осторожности. Многополярная оптика напоминает нам: контроля над каждой отдельной моделью недостаточно — выживание способно зависеть от правил, определяющих, как институты и системы реагируют друг на друга.

References

Summarized position

Andrew Critch formalizes assistance games in which one AI system must respond to multiple human principals with differing preferences.

Andrew Critch, Co-author; UC Berkeley Center for Human-Compatible AI
"Multi-Principal Assistance Games: Definition and Collegial Mechanisms" (arXiv), Primary source

Type to search the manual.

navigate open esc close