Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Брифинг о выживании человечества
RU

Почему экспертные оценки вымирания так расходятся

Что на самом деле говорят опросы экспертов, структурированные модели и исторические базовые частоты о вероятности вымирания от ИИ, и как использовать эти цифры.

Written by
Dwight Ringdahl
Status
Источники проверены
Revised
Sources
4 cited
Reading
5 min

Что это за страница, и чем она не является

Эта страница — о доказательствах, стоящих за цифрами, а не о самих цифрах. Вы видели заголовки: один серьёзный исследователь говорит, что вероятность вымирания человечества, вызванного ИИ, составляет около 20%, другой говорит, что она практически нулевая, и оба ссылаются на экспертизу. Эта страница объясняет, откуда берутся эти оценки, почему они расходятся на два порядка величины, и — что самое полезное — что осторожному читателю делать с величиной, которую никто не может измерить.

Результаты опросов и модели, обсуждаемые здесь, — это наблюдаемые публикации. Интерпретация того, что означает их разногласие, — это анализ. Сопутствующий довод о том, что эти цифры описывают категориально иной вид исхода, см. в статье «Вымирание против событий с массовыми жертвами»; более широкое рассмотрение этих оценок в руководстве находится в статье «Оценки риска и разногласия экспертов».

Что на самом деле говорят опросы

Крупнейший релевантный опрос попросил тысячи исследователей машинного обучения — авторов на крупных конференциях по ИИ — назвать свои вероятности насчёт долгосрочного влияния продвинутого ИИ. Волна 2023 года обнаружила медианную оценку около 5% для вымирания человечества или сходной по необратимости и тяжести утраты власти, вызванной будущими достижениями ИИ, со средним значением около 16% и межквартильным размахом примерно от 0% до 19% (Grace et al., 2024). Читайте это распределение, а не только медиану: среднее, вчетверо превышающее медиану, означает длинный правый хвост, с существенным меньшинством экспертов выше 20% и некоторыми около 50%, тогда как другое существенное меньшинство сидит практически на нуле.

Та же статья документирует, что цифра меняется вместе с формулировкой. Когда вопрос уточнял вымирание, вызванное неспособностью людей контролировать продвинутый ИИ, медиана удвоилась примерно до 10%. Когда волна 2022 года спрашивала о вымирании от ИИ в целом, медиана составила 5%; более ранние раунды опроса AI Impacts показывают ту же чувствительность к формулировке (Опрос экспертов о прогрессе в ИИ 2022 года). Величина, меняющаяся вдвое при переформулировке вопроса, говорит нечто о неопределённости респондентов — и, откровенно говоря, о нестрогости измеряемого понятия. Ничто из этого не делает опросы бесполезными. Это делает их сырьём, а не вердиктами.

Оценки на основе моделей против интуитивных суждений

Второе семейство оценок не спрашивает ничьей интуиции; оно строит явный аргумент и назначает вероятности каждому шагу. Самый строгий пример — структурированный анализ Джозефа Карлсмита о том, представляет ли стремящийся к власти ИИ экзистенциальный риск, который раскладывает утверждение на шесть конъюнктов — системы станут намного способнее, они будут стремиться к власти, люди не смогут это исправить, и так далее — и защищает вероятность для каждого. Его итог составляет около 10% для катастрофы, вызванной ИИ, в этом столетии, с широкими доверительными интервалами, которые он тщательно демонстрирует (Carlsmith, 2022). Философы, работающие в той же традиции, приходят к другим цифрам, оспаривая отдельные конъюнкты: Тоби Орд в The Precipice (2020) отстаивает общий экзистенциальный риск от несогласованного ИИ примерно в один из шести в этом столетии, исходя из более пессимистичного прочтения проблемы согласования.

У этих моделей есть достоинство, которого нет у опросов: каждый шаг виден и оспорим. У них есть и два недостатка. Каждый шаг также оспорим, поэтому разумные читатели меняют знак отдельных конъюнктов на противоположный; а вероятности, приписанные каждому шагу, в конечном счёте всё равно остаются суждениями. Интуитивное суждение со схемой — всё равно интуитивное суждение. Разногласие между структурированной моделью на 10% и интуицией на 0,1% — это не конфликт измерения. Это конфликт о том, какие референтные классы и какие режимы отказа заслуживают веса.

Почему референтные классы тянут в разные стороны

Под каждой оценкой лежит аналогия, и эти аналогии по-настоящему конфликтуют:

  • Биологическое вымирание. Виды вымирают постоянно; фоновая частота составляет примерно от одного до пяти видов в год в последние десятилетия. Но это виды с малыми популяциями и узкими ареалами. Ближайший человеческий аналог, бутылочное горлышко суперизвержения Тоба, спорен и полностью предшествует цивилизации. Эта базовая частота тянет к «вымирание — нормальный исход», почти ничего не говоря о глобальном технологическом виде.
  • Ядерные почти-катастрофы. Карибский кризис, инцидент со Станиславом Петровым 1983 года и норвежский ракетный испуг 1995 года показывают системы под максимальным напряжением, производящие почти-сбои, а затем не отказывающие. Оптимисты читают это как длинную серию событий, спасённых удачей; пессимисты читают ту же серию как доказательство того, что удача заканчивается.
  • Технологические аварии. Авиалайнеры, реакторы и космические аппараты отказывают с измеримой частотой, а затем становятся безопаснее благодаря тяжело выученному перепроектированию. Оптимисты экстраполируют это перепроектирование; пессимисты отмечают, что авиации не нужно было преуспевать лишь однократно.

Каждая аналогия честна. Каждая кодирует априорное убеждение, а не факт. Оценки расходятся, потому что расходятся априорные убеждения, а априорные убеждения расходятся, потому что нет прямых доказательств — ни одного завершённого прогона эксперимента, — способных дисциплинировать любое из них.

Что говорит само разногласие

Вот аналитический момент, который упускает большинство публикаций: сама дисперсия и есть находка. Если бы вероятность вымирания было легко оценить, тысячи информированных экспертов не давали бы оценки от почти нуля до почти подбрасывания монеты. Разброс — это доказательство о состоянии знания, точно так же, как дико расходящиеся погодные модели служат доказательством того, что шторм по-настоящему непредсказуем, а не того, что средний прогноз обязательно верен. Усреднение экспертов до аккуратной средней цифры — скажем, 5% — создаёт ощущение точности, не наследуя при этом никакой информации. Международный отчёт о безопасности ИИ за 2026 год, самая всеобъемлющая на сегодня попытка синтеза, честно признаёт, что доказательства тяжёлого риска скудны, оспариваемы и сконцентрированы в горстке лабораторий (Международный отчёт о безопасности ИИ 2026).

Ещё один факт, который кодирует это распределение: разногласие не случайно. В опросах исследователи, ожидающие более быстрого прогресса возможностей, назначают более высокие вероятности катастрофического риска, а исследователи в передовых лабораториях назначают более низкие, чем независимые академические учёные. Отчасти это доказательство того, кто что видит. Отчасти это стимул. Читателям стоит держать в уме оба объяснения.

Как реально использовать эти цифры

Практический вывод не в том, что цифры бесполезны; он в том, что их нужно использовать правильным инструментом. Бухгалтерия ожидаемой ценности — умножение точной вероятности на выигрыш и ранжирование результатов — здесь не работает, потому что входные данные представляют собой суждение шириной в два порядка величины, и небольшие ошибки во входных данных незаметно доминируют над результатом. Принятие решений в условиях глубокой неопределённости работает иначе: вы спрашиваете, какие действия остаются оправданными во всём правдоподобном диапазоне, и предпочитаете действия, устойчивые, а не оптимальные.

Применённая к риску вымирания от ИИ, эта логика проясняет ситуацию. Работа по предотвращению — оценки возможностей, гарантии при развёртывании, управление вычислительными мощностями — выглядит оправданной и при 20%, и при 5%, и при 1%, потому что издержки этой работы скромны, а исход, от которого она защищает, категориально отличается от всего, что оценивается в обычной политике. Отмахивание выглядит защитимым только вблизи нуля. Так что опросы, несмотря на свою нестрогость, выполняют реальную работу: они говорят вам, что околонулевая позиция — предмет спора, а не консенсус. О том, как ожидания насчёт сроков лежат в основе этого разногласия, см. «Прогнозы сроков». Вам не нужно знать вероятность пожара, чтобы оправдать покупку огнетушителя. Вам нужно знать, что серьёзные люди, глядя на одни и те же доказательства, продолжают чуять дым.

References

Summarized position

AI Impacts found the same sensitivity to question wording in its 2022 round of AI-researcher surveys as the larger 2023 wave, with a median 5% estimate for extinction from AI in general.

AI Impacts, 2022 Expert Survey on Progress in AI
AI Impacts, Research/report
Summarized position

Joseph Carlsmith decomposes the case for AI-caused existential catastrophe into six conjuncts and defends an overall probability of roughly 10% for this century, with wide displayed uncertainty.

Joseph Carlsmith, Author, "Is Power-Seeking AI an Existential Risk?"
arXiv, Primary source
Summarized position

International AI Safety Report found that severe AI risk pathways — including loss of control, large-scale disruption, and deliberate misuse — are plausible enough to warrant mitigation work now, despite a still-thin evidence base.

International AI Safety Report, 2026 edition, chaired by Yoshua Bengio
internationalaisafetyreport.org, Research/report
  1. Grace et al., 2024 arxiv.org

Type to search the manual.

navigate open esc close