Часто смешивают два значения
Возможность ИИ может быть «эмерджентной» как минимум в двух смыслах. В широком смысле модель демонстрирует полезное поведение, которое не было явной, специфичной для конкретной задачи целью обучения. Языковая модель, обученная преимущественно предсказывать токены, может переводить, писать код, резюмировать юридические тексты или решать некоторые арифметические задачи. Эти способности могут возникать потому, что обучающие данные и целевая функция вознаграждают переиспользуемые внутренние закономерности.
В более сильном смысле эмерджентность означает, что способность появляется резко по мере роста масштаба: модели меньшего размера терпят неудачу, а затем более крупная модель внезапно добивается успеха. Широко обсуждаемая статья 2022 года сообщила о примерах таких скачков в разных семействах моделей и задачах (Wei et al., 2022). Это различие важно. Существование незапланированной способности хорошо установлено; была ли измеренная способность подлинным разрывом, зависит от метрики, данных и выборки.
Ни то ни другое значение не подразумевает сознание, намерение или магию. Сложные системы могут приобретать представления общего назначения без того, чтобы разработчик писал отдельный модуль для каждого применения. Научный вопрос состоит в том, как поведение меняется вместе с обучением и устройством системы и насколько хорошо мы можем это предвидеть.
Почему некоторые скачки — артефакты измерения
Предположим, что точность модели в арифметике постепенно растёт с 20 до 30, затем до 40 процентов. Эталонный тест, который начисляет одно очко только тогда, когда точность превышает 35 процентов, покажет ноль, ноль, а затем единицу — разрыв, созданный самой системой оценки. Тот же эффект возникает, когда оценка по точному совпадению не даёт баллов за почти правильный ответ, или когда задача требует нескольких подспособностей и проваливается при отсутствии хотя бы одной из них.
Шаффер, Миранда и Койеджо повторно проанализировали описанные случаи и показали, что многие резкие переходы становились плавными при измерении непрерывными, нелинейными или чувствительными к ошибке метриками («Являются ли эмерджентные способности больших языковых моделей миражом?»). Это не доказывает, что подлинные разрывы никогда не происходят. Это показывает, что график по одному эталонному тесту не может установить наличие разрыва, не исключив предварительно эффекты метрики, разреженную выборку и различия между семействами моделей.
Масштаб также не единственная меняющаяся переменная. Более крупные модели могут использовать другие данные, рецепты обучения, токенизаторы, настройку по инструкциям, инструменты или бюджеты вывода. Сравнение поимённо названных продуктов может спутать инженерное улучшение на уровне системы с чистым порогом по числу параметров. Исследователям нужны контролируемые серии масштабирования, плотные контрольные точки и несколько метрик, чтобы установить механизм.
Что по-прежнему по-настоящему трудно предсказать
Даже плавное базовое улучшение может создать значимый порог. Кибер-агент, переходящий от 40 к 60 процентам успеха, может пересечь точку, в которой развёртывание становится экономически оправданным. Способность модели связать по отдельности слабые подспособности может разблокировать целый рабочий процесс. Внешние системы способны усиливать небольшие улучшения: инструменты дают возможность действовать, память расширяет контекст, а повторная выборка находит успешный ответ.
Разработчики также не могут исчерпывающе протестировать каждую возможную задачу. Модели обучаются на широких данных и разворачиваются для миллионов пользователей, которые обнаруживают применения и сбои, не предусмотренные оценщиками. Поэтому способность может оказаться неожиданностью для лаборатории, даже если развивалась постепенно. Неожиданность может отражать ограниченность измерения, а не математически резкий фазовый переход, но операционно это всё равно имеет значение.
Международный отчёт по безопасности ИИ 2026 года подчёркивает, что оценки передовых систем могут обладать ограниченной внешней валидностью и быстро устаревать по мере изменения систем и обвязки вокруг них (Международный отчёт по безопасности ИИ 2026). Это утверждение о практической неопределённости, а не свидетельство того, что любое опасаемое поведение проявится само собой.
Способность — это не склонность
Модель может быть способна на действие при намеренном соответствующем запросе, не будучи при этом склонной совершать его самостоятельно. Анализ безопасности должен разделять способность — может ли система что-то сделать — и склонность — имеет ли она тенденцию делать это в релевантных условиях. То, что модель может выдать план обмана в ролевой игре, само по себе не показывает, что она преследует обман при реальном развёртывании. И наоборот, низкая измеренная склонность может отражать оценку, которая не создала нужный триггер.
То же различие применимо к осведомлённости о ситуации, обходу защитных мер, самосохранению и стратегическому поведению. Это активные темы исследований и возможные компоненты моделей угроз. Неточно утверждать, что они обязательно проявятся лишь потому, что проявились перевод или арифметика. Доказательства должны указывать протестированную модель, промпт, среду, частоту и альтернативные объяснения.
Антропоморфный язык добавляет путаницы. Модели могут генерировать высказывания о желании выжить, потому что похожий язык встречается в их обучающих данных или потому что взаимодействие вознаграждает определённую персону. Такой текст — поведение, заслуживающее изучения; это не прямой доступ к устойчивой внутренней цели. Утверждения о мотивах требуют более весомых доказательств, чем цитаты из одного разговора.
Почему эмерджентность всё же значима для безопасности
Разумный урок для безопасности не в том, что «может внезапно случиться что угодно». Он в том, что широкое обучение создаёт больше видов поведения, чем разработчики явно перечисляют, а нынешняя оценка обеспечивает неполное покрытие. Это оправдывает поэтапное тестирование, мониторинг и эшелонированную защиту. Это также предостерегает от предположения, что отсутствие проявления в одном эталонном тесте означает отсутствие при любой обвязке или промпте.
Оценку следует начинать уже во время обучения, используя контрольные точки для измерения тенденций до завершения финального прогона. Команды могут поддерживать наборы тестов для рисков в кибербезопасности, биологической помощи, убеждении, автономности и контроле над моделью, добавляя при этом открытое red-teaming для поиска непредвиденного поведения. Приватные тесты снижают загрязнение данными; внешние оценщики уменьшают институциональные слепые зоны. Отчётность об инцидентах после развёртывания фиксирует сбои, которые лабораторные задачи упускают.
Пороговая политика должна реагировать на продемонстрированную способность, не требуя философского согласия относительно природы эмерджентности. Если система способна материально снизить барьеры к тяжёлому вреду, соответствующие защитные меры должны применяться независимо от того, была ли кривая плавной или резкой. Если доказательства слабы, в отчёте следует прямо указать на неопределённость, а не тихо трактовать гипотетическое поведение как наблюдаемое.
Предсказуемость устроена слоями
Одни свойства модели предсказуемее других. Совокупная ошибка по распределению данных часто следовала плавным законам масштабирования. Производительность на стабильном эталонном тесте может быть предсказуема в ограниченном диапазоне. Успех в запутанной среде зависит от инструментов, надёжности и взаимодействий, которые труднее моделировать. Социальное воздействие добавляет ещё принятие технологии, стимулы, институты и противников, что делает предсказание ещё труднее.
Эта иерархия предотвращает распространённую ошибку вывода: предсказуемая ошибка обучения не делает предсказуемой любую последующую способность, но неожиданное последующее поведение не опровергает законы масштабирования. Исследователи могут прогнозировать среднее значение, оставаясь при этом неуверенными в отношении редких сбоев или отдельных задач.
Интерпретируемость может со временем улучшить прогнозы, раскрывая представления или механизмы ещё до того, как они чётко проявятся в поведении. Однако сегодня методы интерпретируемости дают лишь частичные доказательства, а не полное считывание того, что модель «знает» или сделает. Поведенческая оценка и контроль в реальных условиях остаются необходимыми.
Как читать заявление об эмерджентности
Стоит спросить, что именно изменилось при сравнении: параметры, вычисления, данные, цель обучения, инструменты или формулировка промптов. Проверить, является ли метрика непрерывной, существуют ли промежуточные контрольные точки и пересекаются ли доверительные интервалы неопределённости. Проверить, была ли задача в обучающих данных и воспроизвели ли результат независимые исследователи. Важнее всего — различать «неожиданное для авторов» и «научно доказанный разрыв».
Эмерджентная способность — полезное понятие при аккуратном использовании. Широко обученные модели действительно приобретают способности, которые ни один инженер не задавал по отдельности. Некоторые способности становятся видимыми лишь после того, как системы пересекают практические пороги. Но многие знаменитые «обрывы» отчасти являются артефактами того, как мы оцениваем поведение. Точный вывод не в том, что эмерджентность — иллюзия, и не в том, что масштаб непредсказуемо вызывает любую способность. Он в том, что развитие возможностей понято лишь частично, выбор способа измерения имеет значение, а политика безопасности должна быть устойчивой как к постепенным, так и к неожиданным изменениям.