Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Брифинг о выживании человечества
RU

Тест Тьюринга и что пришло ему на смену

Почему человекоподобный разговор не доказывает наличие AGI и как современные оценки измеряют возможности, надёжность и автономность через портфель эталонных тестов.

Written by
Dwight Ringdahl
Status
Источники проверены
Revised
Sources
7 cited
Reading
5 min

Что на самом деле предложил Тьюринг

В 1950 году Алан Тьюринг задался вопросом, могут ли машины мыслить, и быстро заменил этот философски запутанный вопрос операциональным. В его «игре в имитацию» человек-собеседник переписывался с человеком и с машиной и пытался определить, кто есть кто. Тьюринг предложил это как способ обсуждать интеллект машин через наблюдаемое поведение, а не через недоступную внутреннюю сущность (Тьюринг, «Computing Machinery and Intelligence»).

Идея была глубокой, но привычная фраза «прошла тест Тьюринга» скрывает множество решений. Сколько длится разговор? Что известно судье? Какие темы допустимы? Сколько судей участвует и какая частота ошибок считается успехом? Тьюринг не устанавливал современную программу сертификации с единым официальным порогом. Тест — это мысленный эксперимент и веха исследований, а не измерительный прибор для регулятора AGI.

Почему разговор оказалось слишком легко обыграть

Игра в имитацию вознаграждает систему за то, что она выглядит человеком в конкретном взаимодействии. Этого можно достичь за счёт подлинной широты, но также за счёт уклончивости, ролевой игры, юмора, намеренных ошибок или эксплуатации ожиданий судьи. Ранний чат-бот ELIZA ещё в 1960-х годах показал, что люди охотно проецируют понимание на поверхностные разговорные паттерны. Сегодняшние языковые модели генерируют куда более связный диалог, что делает антропоморфизм ещё легче.

Прохождение короткого текстового разговора не продемонстрировало бы надёжного планирования, математической точности, научного суждения, компетентности в физическом мире или способности восстанавливаться после ошибок. Оно не показало бы, что модель способна освоить новую работу, сохранять цели на протяжении длительного проекта или распознавать, когда следует уступить человеку. И наоборот, мощная невербальная система могла бы трансформировать науку или логистику, при этом не сумев сымитировать непринуждённого собеседника. Сходство с человеком не является ни необходимым, ни достаточным условием значимых машинных возможностей.

Тест также смешивает интеллект с обманом. Систему могут наказать за честное признание себя машиной и вознаградить за манипулирование судьёй, заставляющее того поверить в обратное. Это плохо согласуется с оценкой безопасности, где калиброванная неопределённость, прослеживаемость и правдивое раскрытие информации зачастую важнее социальной правдоподобности.

От одного теста к портфелю оценок

Современная оценка использует множество наборов задач, поскольку интеллект многомерен. Эталонные тесты знаний и рассуждения проверяют вопросы по разным предметам; оценки программирования запускают сгенерированные программы против тестовых случаев; мультимодальные тесты сочетают текст, диаграммы, изображения, аудио и видео; эталонные тесты для агентов помещают модели в интерактивные среды, где им нужно ориентироваться, использовать программы и достигать целей.

Каждое семейство отвечает на узкий вопрос. MMLU, например, отбирает академические и профессиональные знания в формате множественного выбора, но высокие баллы не устанавливают, что модель способна практиковать эти профессии. GAIA тестирует ассистентов на реальных вопросах, которые могут требовать рассуждения, инструментов и нескольких шагов (статья GAIA). OSWorld оценивает агентов, работающих с компьютером, в реальных приложениях операционной системы (статья OSWorld). ARC-AGI фокусируется на адаптации к новым задачам визуального рассуждения, а не на воспроизведении сохранённых знаний (эталонный тест ARC Prize). Эти оценки выявляют разные сильные стороны и режимы сбоя; ни одна из них не является детектором AGI.

Исследования выполнения задач добавляют измерение времени и сложности. METR оценивает длительность задачи эксперта-человека, при которой у агента есть заданная вероятность успеха. Её нынешний набор охватывает в основном разработку ПО, машинное обучение и кибербезопасность, и организация прямо предупреждает, что «временной горизонт» — это сложность задачи, измеренная в человеческом времени, а не длительность, в течение которой ИИ может работать независимо (методология METR). Она также предупреждает, что чётко специфицированные задачи эталонного теста чище, чем большинство реальной работы, и что производительность резко различается по доменам.

Надёжность меняет смысл балла

Средней производительности недостаточно для использования в ситуациях с высокими ставками. Система, успешная в половине случаев, может впечатлять в исследованиях, но быть непригодной для использования в медицине, авиации или инфраструктуре. Поэтому оценщикам нужны показатели успешности, повторные испытания, поведение в худшем случае, интервалы неопределённости и тесты при сдвиге распределения данных. Им следует измерять, знает ли модель, когда она не уверена, запрашивает ли уточнение и безопасно ли возвращает контроль.

Настройка оценки важна не меньше, чем сама базовая модель. Доступ к инструментам, формулировка промпта, память, настройки выборки, вычисления на этапе вывода и окружающее агента программное обеспечение способны существенно изменить результаты. Балл относится к протестированной конфигурации системы на заявленную дату. Обращение с ним как с неизменным свойством названия модели поощряет ложные сравнения.

Загрязнение данных — ещё одна проблема. Публичные вопросы и решения эталонных тестов могут попадать в обучающие данные. Даже без дословного запоминания настройка, ориентированная на эталонный тест, может улучшить балл без сопоставимого обобщения. Лучшие оценки используют приватные или недавно созданные задачи, документируют возможное воздействие загрязнения и часто обновляются. Независимое тестирование снижает — но не устраняет — риск того, что разработчик отбирает только благоприятные результаты.

Оценка безопасности задаёт другие вопросы

Оценка возможностей измеряет, что система способна делать в благоприятных условиях. Оценка безопасности спрашивает, что она могла бы сделать при неправомерном использовании, под нагрузкой, при обмане, при противоречивых инструкциях или в среде со значимыми последствиями. Релевантные тесты включают помощь в биологическом или кибер-злоупотреблении, манипуляцию, автономность, обход защитных мер, обман и способность приобретать ресурсы. Международный отчёт по безопасности ИИ 2026 года подчёркивает, что оценки сталкиваются с ограниченной внешней валидностью, быстрым устареванием и неполным доступом к передовым системам (Международный отчёт по безопасности ИИ 2026).

Red-team-команды творчески ищут сбои, тогда как структурированные эталонные тесты позволяют сравнение. Мониторинг в реальных условиях затем проверяет, предсказали ли результаты до развёртывания реальное использование. Отчётность об инцидентах необходима, потому что ни один лабораторный набор задач не может перечислить каждый контекст. Режим оценки должен связывать результаты с решениями: дополнительными защитными мерами, ограниченным доступом к инструментам, поэтапным выпуском, внешней проверкой или паузой в развёртывании при пересечении заданного порога.

Что потребовалось бы для заслуживающей доверия оценки AGI

Система «Уровни AGI» от Google DeepMind утверждает, что оценки должны охватывать как производительность, так и универсальность и учитывать взаимодействие человека и ИИ, через которое проявляется способность (система DeepMind). Заслуживающая доверия оценка потребовала бы широких доменов, по-настоящему новых задач, нескольких уровней производительности и ясной отчётности об автономности. Она проверяла бы перенос, эффективность обучения, устойчивость, социальное взаимодействие и открытую работу — а не только экзаменационные вопросы.

Ей также потребовались бы независимое воспроизведение и состязательная проверка. Разработчикам следовало бы публиковать достаточно методологии для интерпретации заявлений, не раскрывая опасных деталей и не компрометируя приватные тесты. Результаты должны отделять базовую модель от инструментов и обвязки, включать примеры сбоев и избегать превращения одного составного числа в метафизический вердикт.

Преемник — это панель приборов, а не финишная черта

Ни один современный тест не «заменил» игру Тьюринга в смысле превращения в общепринятые врата к AGI. То, что пришло ему на смену, — это целый портфель: тесты знаний, задачи на новое рассуждение, интерактивные среды, измерения временного горизонта задач, экспертную проверку в конкретных предметных областях, оценки опасных возможностей и данные о развёртывании.

Такой ответ менее театрален, чем машина, обманывающая судью, но гораздо полезнее. Правильный вопрос больше не «прошла ли она тест?». Это: что эта система способна надёжно делать, при каких условиях, с какой помощью и что происходит, когда условия меняются? Прозрачная панель приборов с датированными доказательствами — лучший ориентир для оценки возможностей и риска, чем любая единая финишная черта.

Type to search the manual.

navigate open esc close