Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Брифинг о выживании человечества
RU

Массовое убеждение и эпистемическая манипуляция

Что показывают эксперименты об убедительности ИИ, чего пока не подтверждают реальные доказательства и как масштаб меняет риск — по данным исследования 2026 года.

Written by
Dwight Ringdahl
Status
Источники проверены
Revised
Sources
5 cited
Reading
5 min

Убеждение — не то же самое, что дипфейк

Дипфейк фабрикует медиаконтент, который выглядит как документирование события. Убеждение с помощью ИИ может использовать полностью синтетический, но открыто сгенерированный разговор: аргумент, рекомендацию, обмен репликами с чат-ботом или ранжированную ленту, спроектированные так, чтобы изменить убеждение или поведение. Содержание может быть истинным, ложным или смешанным. Отличительная особенность здесь — оптимизация и распространение, а не одна лишь фабрикация.

Нынешние модели способны генерировать убедительный текст в контролируемых исследованиях. Доказательств из реального мира о том, что злонамеренные действующие лица используют ИИ для манипуляции целыми группами населения в масштабе, пока немного. Международный отчёт по безопасности ИИ за 2026 год утверждает оба этих тезиса и предостерегает от превращения экспериментальной возможности в ничем не подкреплённое утверждение о широко распространённом воздействии (резюме отчёта).

Что показали ранние исследования

В предварительно зарегистрированном эксперименте с дебатами Сальви и коллеги сравнивали людей и GPT-4 в качестве собеседников, обсуждающих политические вопросы. GPT-4 с доступом к базовой информации об участниках вызывал более значительные сдвиги мнений, чем оппоненты-люди; без персонализации преимущество было меньше (Salvi и др., Nature Human Behaviour). Этот результат продемонстрировал убедительные возможности в конкретных текстовых дебатах. Он не измерял длительную кампанию, поведение при голосовании, устойчивость мнения после получения более поздней информации или эффекты на уровне населения в целом.

Исследователи Anthropic протестировали сгенерированные моделью аргументы по разным политическим темам и обнаружили, что ведущие модели могут быть сопоставимо убедительны с аргументами, написанными людьми, в рамках их экспериментальной постановки. Они также изучили стратегии, включающие фактические и сфабрикованные утверждения (исследование Anthropic об убедительности). Это полезное исследование компании, но его не следует резюмировать как доказательство того, что фабрикация всегда является самой убедительной стратегией. Выбор темы, промпты, показатели результата и сами участники формируют итоговые результаты.

Крупные эксперименты 2026 года сместили акцент

Британский Институт безопасности ИИ (UK AI Security Institute) вместе с академическими партнёрами провёл три эксперимента с участием 76 977 человек, 19 моделей и 707 политических тем. Они также проверили сотни тысяч сгенерированных утверждений. Исследование обнаружило, что посттренинг и промптинг давали более значительные изменения убедительности, чем масштаб модели или персонализация. Эффекты персонализации неизменно составляли менее одного процентного пункта. Методы, повышающие убедительность, также систематически снижали фактическую точность, хотя авторы предостерегли, что это не доказывает, будто ложные утверждения сами по себе более убедительны (исследование AISI).

Эти доказательства усложняют привычный нарратив о микротаргетинге. Персональные данные могут иметь значение в других условиях, особенно при повторяющихся взаимодействиях, но базовая демографическая адаптация не была доминирующим рычагом в этих экспериментах. Плотность информации, риторические инструкции и специализированный посттренинг заслуживают как минимум не меньшего внимания.

Этот вывод также показывает, почему утверждение «ИИ убедителен» слишком грубо. Разработчики могут намеренно настроить меньшую по размеру модель так, чтобы она была более убедительной. Продуктовые цели, такие как вовлечённость, удержание или конверсия, способны формировать поведение даже без явного политического намерения. Оценка должна тестировать именно развёрнутую версию и её целевую функцию оптимизации.

От индивидуальных эффектов к социальному воздействию

Статистически обнаруживаемый средний сдвиг мнения не приводит автоматически к дестабилизации демократии. Реальная среда включает конкурирующие сообщения, недоверие, социальные связи, освещение в СМИ и повторяющиеся возможности пересмотреть свою позицию. Участники лабораторных исследований знают, что находятся в исследовании, и измеренные установки могут не сохраняться и не менять реальное поведение.

Тем не менее масштаб порождает правдоподобное опасение. Модель способна вести множество одновременных разговоров, отвечать мгновенно, тестировать варианты и работать при низких предельных издержках. Организация могла бы сочетать сгенерированный контент с таргетингом платформ и автоматизированными аккаунтами. Долгосрочные разговорные системы могут узнавать о пользователе больше, чем фиксирует однократный сессионный эксперимент.

Распространение остаётся узким местом. Самая убедительная модель почти не имеет влияния без доступа к вниманию аудитории. Платформы, рекламные системы, рекомендательные механизмы, сети обмена сообщениями и заслуживающие доверия интерфейсы определяют охват. Это означает, что управление не может сосредотачиваться только на весах моделей; оно должно рассматривать дизайн продукта и скоординированные кампании.

Истина, уверенность и эпистемическое здоровье

Риск шире, чем убеждение кого-то в одном ложном утверждении. Информационная среда может становиться менее заслуживающей доверия, когда сгенерированный материал дёшев, источники неясны, а системы оптимизируются под согласие. Люди могут реагировать, веря в удобную ложь — либо отвергая подлинные доказательства как синтетические. Оба исхода ослабляют коллективное установление фактов.

Высокая плотность информации создаёт особую проблему. Бегло звучащий ответ может содержать множество проверяемых утверждений, превышающих способность человека их верифицировать. Даже если большинство из них точны, несколько стратегических ошибок способны сформировать итоговый вывод. Интерфейсы с цитированием источников помогают лишь тогда, когда источники действительно существуют, подтверждают утверждение и не сфабрикованы.

ИИ также способен укреплять эпистемическое здоровье. Он может переводить доказательства, знакомить пользователей с контраргументами, обучать медиаграмотности и помогать проверять факты в больших объёмах контента. Тот же самый убедительный навык может поддерживать коммуникацию в сфере здравоохранения или деэскалацию конфликтов. Намерение, оптимизация, прозрачность и контроль пользователя во многом определяют итоговый результат.

Что следует измерять

Ответственная оценка должна отчитываться о непосредственном изменении установки, его устойчивости во времени, поведении, фактической точности, различиях между подгруппами и исходных взглядах участников. Она должна тестировать несколько языков и культур, а не исходить из того, что одна страна обобщается на весь мир. Исследователям следует сравнивать одноразовый текст с голосом, изображениями, долгими отношениями и агентным распространением, защищая при этом участников.

Мониторинг в реальном мире нуждается в данных платформ и защитных мерах приватности. Полезные сигналы включают скоординированное неаутентичное поведение, автоматизированные расходы на кампании, охват и подтверждённые поведенческие результаты. Исследователям следует избегать публикации операционных рецептов манипуляции.

Атрибуция остаётся сложной. Кампания может использовать ИИ для перевода или составления текста, не получая при этом дополнительной убедительной силы. Формулировка «сгенерировано ИИ» описывает производство, а не причинный эффект. Исследования должны, где это возможно, выделять именно предельный вклад ИИ.

Практические защитные меры

Платформы могут маркировать автоматизированные аккаунты, ограничивать массовую рассылку незапрошенных сообщений, сохранять доступ для исследователей и расследовать скоординированное поведение. Правила политической рекламы могут требовать прозрачности в отношении спонсора и таргетинга. Происхождение контента может помочь установить, как был создан тот или иной медиафайл, хотя метаданные можно удалить, и само их наличие не доказывает истинность.

Разработчики моделей могут оценивать убедительность и правдивость вместе, отслеживать злоупотребления и избегать вознаграждения за согласие любой ценой. Продукты должны раскрывать, что пользователь взаимодействует с ИИ, облегчать проверку источников и позволять ограничивать или отключать персонализацию. Чувствительные области, такие как выборы, здравоохранение и финансы, оправдывают более строгие меры контроля.

Образование остаётся важным, но не может нести на себе всю нагрузку целиком. Отдельные люди не способны в одиночку проверять факты в потоке промышленного масштаба. Институты, платформы, кампании, разработчики и регуляторы контролируют структуры, создающие охват и стимулы.

Взвешенный вывод

Убеждение с помощью ИИ — это наблюдаемая экспериментальная возможность. Нынешние доказательства не показывают широко распространённой успешной манипуляции в масштабе населения, а крупное исследование 2026 года обнаружило, что эффекты базовой персонализации меньше, чем принято было считать. Оно обнаружило более значительные эффекты от промптинга и посттренинга, нацеленного именно на убедительность, сопровождающиеся снижением фактической точности.

Поэтому катастрофический сценарий носит условный характер: убедительные системы, оптимизированные без ограничений на истинность и подключённые к массовому распространению, могли бы деградировать демократический выбор и общее знание. Этот путь заслуживает мониторинга и защитных мер. Его не следует представлять так, будто контролируемые сдвиги мнений уже продемонстрировали контроль в цивилизационном масштабе.

References

Summarized position

Francesco Salvi found that personalized GPT-4 outperformed the human baseline in a structured debate study, while the direct personalized-versus-unpersonalized GPT-4 comparison was not statistically significant.

Francesco Salvi, Lead author, EPFL
"On the conversational persuasiveness of GPT-4" (Nature Human Behaviour), Primary source
Summarized position

Esin Durmus found no statistically significant difference between Claude 3 Opus and human-written arguments in its study, and found a fact-fabricating prompt strategy most persuasive in that test setup.

Esin Durmus, Lead researcher, Anthropic
"Measuring the Persuasiveness of Language Models" (Anthropic), Primary source
  1. резюме отчёта internationalaisafetyreport.org
  2. исследование Anthropic об убедительности anthropic.com
  3. исследование AISI aisi.gov.uk

Type to search the manual.

navigate open esc close