Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Брифинг о выживании человечества
RU

Панель текущих возможностей ИИ: сентябрь 2026 года

Зафиксированный многомерный снимок возможностей передового ИИ — то, что Stanford AI Index называет «неровным интеллектом», — и почему эталонные тесты не доказывают AGI.

Written by
Dwight Ringdahl
Status
Источники проверены
Revised
Sources
9 cited
Reading
6 min

Как читать этот снимок

Эта панель фиксирует публичные данные, доступные на 13 сентября 2026 года. Это не таблица лидеров в реальном времени, и её не следует незаметно обновлять. Продукты на основе ИИ, обвязка вокруг моделей, наборы для оценки и цены меняются слишком быстро, чтобы страница «текущего состояния» без даты оставалась честной.

Возможности многомерны. Система может решить олимпиадную задачу и при этом не суметь прочитать стрелочные часы, ответить на экспертные вопросы по биологии и при этом не завершить лабораторный рабочий процесс, или пройти автоматическую проверку кода, выдав патч, который сопровождающий проекта отклонил бы. Stanford AI Index 2026 года называет эту закономерность неровным интеллектом и документирует большие разрывы между контролируемыми и реальными условиями (Stanford AI Index, техническая производительность).

Оценки ниже описывают имеющиеся данные, а не некую универсальную модель. «Сильно» означает, что ведущие системы впечатляюще выступают в релевантных публичных оценках. Это не означает «безопасно», «на уровне человека» или «достаточно надёжно для автономного использования в ситуациях с высокими ставками».

Измерение Данные на сентябрь 2026 года Важное ограничение
Язык и знания Сильные результаты в широких тестах вопрос-ответ и мультимодальных тестах Сохраняются галлюцинации, загрязнение данных и неровная фактическая надёжность
Математика и структурированное рассуждение Передовые системы достигли результатов олимпиадного уровня на отдельных задачах Производительность остаётся неровной и чувствительной к инструментам и бюджету вывода
Программирование и работа с компьютером Быстрый прогресс в эталонных тестах по программированию и работе агентов с рабочим столом Прохождение автоматической проверки не гарантирует поддерживаемую производственную работу
Автономность в длительных задачах Измеренные горизонты программных задач быстро выросли В основном чистые задачи по разработке ПО, машинному обучению и кибербезопасности; это не длительность независимой работы
Помощь в науке Прочные предметные знания и улучшение при составлении протоколов и устранении неполадок Показатели знаний не устанавливают сквозную экспериментальную компетентность
Кибервозможности Агенты умеют находить реальные уязвимости и выполнять отдельные экспертные задачи Сквозные автономные атаки публично не подтверждены
Убеждение Измеримые сдвиги мнений в контролируемых экспериментах Вредоносное воздействие в масштабе населения не продемонстрировано
Робототехника и физическое воплощение Значительный прогресс в контролируемых условиях Надёжность в быту и открытом мире остаётся намного ниже
Безопасность и надёжность Защитные меры и оценки совершенствуются Отчётность непоследовательна, ни один метод не гарантирует контроль

Рассуждение впечатляет и одновременно неровно

AI Index 2026 года сообщает, что система Google DeepMind набрала результат уровня золотой медали на Международной математической олимпиаде 2025 года в рамках регламентного времени соревнования. Та же глава сообщает, что лучшая протестированная модель в ClockBench верно читала стрелочные часы лишь примерно в половине случаев против примерно 90 процентов у людей. Эти тесты не равнозначны по важности, но их контраст опровергает идею единого скалярного «уровня интеллекта».

Прирост в эталонных тестах может отражать более совершенную базовую модель, больший объём вычислений на этапе вывода, использование инструментов, выборку нескольких решений или специализированную обвязку. Результат относится к целостной протестированной системе при заявленных условиях. Его не следует небрежно переносить на более дешёвый уровень продукта или развёртывание с ограничением по времени.

Многие тесты также быстро насыщаются. Stanford сообщает о резком приросте в Humanity’s Last Exam и почти полном насыщении SWE-bench Verified, отмечая при этом некорректные вопросы и возможную подстройку под таблицу лидеров. Насыщение означает, что оценка теряет способность различать ведущие системы; оно не означает, что базовая предметная область решена.

Программирование и работа с компьютером

Ведущие агенты умеют исправлять отдельные проблемы в репозиториях, писать значительный объём кода и управлять графическими приложениями. Stanford сообщает о росте результата в OSWorld примерно с 12 до 66,3 процента — при этом агент по-прежнему проваливает примерно каждую третью структурированную задачу. Реальная работа с компьютером добавляет меняющиеся интерфейсы, неясные цели, учётные данные, состязательный контент и последствия, которые эталонный тест может не учитывать.

Автоматическая проверка — ещё одна граница. Исследование METR 2026 года по патчам SWE-bench показало, что прохождение тестов эталонного набора не означает, что сопровождающие проекта примут изменения, — это подчёркивает измерения качества, выходящие за рамки функциональных тестовых случаев (исследование METR о проверке сопровождающими). Производственное программирование требует архитектуры, коммуникации, безопасности, сопровождения и ответственности за сбои.

Эти данные подтверждают существенную помощь и автоматизацию отдельных видов работы. Они не подтверждают тезис «разработка ПО решена».

Автономность в длительных задачах

Панель METR за май 2026 года оценивает длительность задачи эксперта-человека, при которой у агента есть предсказанная вероятность успеха 50 или 80 процентов. Задачи в основном касаются разработки ПО, машинного обучения и кибербезопасности. METR отмечает, что измерения свыше шестнадцати часов ненадёжны при нынешнем наборе задач (горизонты задач METR).

Эту метрику часто неверно трактуют. Четырёхчасовой горизонт не означает, что агент работает независимо четыре часа; это означает, что человеку-эксперту обычно требуется около четырёх часов на задачи измеренной сложности. Успешные агенты могут справляться намного быстрее. Набор задач самодостаточен и объективно оцениваем, в отличие от значительной части организационной работы.

METR также предупреждает, что домены различаются на порядки величины, доверительные интервалы могут быть широкими, а 50-процентный горизонт неадекватен там, где требуется надёжность 98 процентов (ограничения METR). Эта тенденция — значимое свидетельство быстрого прогресса в отдельных цифровых задачах, а не часы, отсчитывающие время до автоматизации труда или AGI.

Наука, биология и кибербезопасность

Институт безопасности ИИ Великобритании сообщает, что системы, протестированные до октября 2025 года, превзошли его базовые показатели экспертов уровня PhD по отдельным вопросам химии и биологии и улучшили результаты в составлении протоколов и устранении лабораторных неполадок. Институт также сообщает о сохраняющейся трудности со сквозным проектированием плазмид (отчёт AISI о тенденциях передового ИИ). Это результаты государственной оценки, но экспертные базовые показатели и способ построения задач по-прежнему определяют их смысл.

Кибервозможности продвинулись от ответов на вопросы к агентам, обнаруживающим уязвимости и решающим многошаговые задачи. AISI сообщил об ускорении роста своих показателей по кибербезопасности в феврале 2026 года (тенденции AISI в кибербезопасности). Международный отчёт по безопасности ИИ отличает эти данные от практики развёртывания: злоумышленники используют ИИ, однако полностью автономные сквозные атаки публично не зафиксированы, и остаётся неясным, кто выигрывает больше — нападение или защита (Международный отчёт по безопасности ИИ 2026).

Убеждение и социальные возможности

Диалоговый ИИ способен менять установки в экспериментах. Исследование 2026 года под руководством AISI с участием 76 977 человек показало, что более сильные эффекты убеждения дают формулировка промптов и посттренинг, нацеленный на убеждение, а не масштаб модели или базовая персонализация; эффект персонализации был ниже одного процентного пункта. Усиление убедительности было связано со снижением фактической точности (исследование AISI об убеждении).

Эта находка устанавливает измеренную способность в экспериментальных условиях. Она не доказывает устойчивое изменение поведения, влияние на выборы или контроль над населением. Охват, распространение по платформам, конкурирующие сообщения, доверие пользователей и устойчивость эффекта остаются отдельными переменными.

Физическое воплощение остаётся крупным разрывом

Робототехника демонстрирует самое явное различие между контролируемыми и открытыми условиями. Stanford сообщает о высоком успехе в симуляционном эталонном тесте, но лишь 12 процентах в протестированных реальных бытовых задачах. Автономные транспортные средства работают в значимом масштабе в ограниченных зонах обслуживания, при этом для интерпретации важны заданные операционные домены и удалённая человеческая поддержка.

Широкий цифровой интерфейс языковой модели не следует путать с универсальностью в физическом мире. Развёртывание ограничивают восприятие, манипулирование объектами, безопасность рядом с людьми, восстановление после нестандартных ошибок, обслуживание оборудования и стоимость. Глава о человекоподобных роботах этого руководства подробнее отслеживает этот разрыв между демонстрациями в эталонных тестах и реальной производительностью роботов, разбирая его по каждой компании.

Надёжность — часть возможностей

Агент, успешный в 66 процентах случаев, может быть полезен при проверке и неприемлем без неё. Системы с высокими ставками требуют калиброванной неопределённости, обнаружения сбоев, механизма обжалования, журналов аудита, отката, безопасности и резервного варианта с участием человека. Средние показатели эталонных тестов скрывают редкие, но значимые по последствиям ошибки.

AI Index 2026 года обнаруживает, что разработчики сообщают о результатах основных эталонных тестов возможностей гораздо последовательнее, чем об оценках ответственного ИИ (глава AI Index об ответственном ИИ). Отсутствие публичных результатов не доказывает отсутствия внутреннего тестирования, но ограничивает возможность сравнения и публичные гарантии.

Чего эта панель не устанавливает

Она не устанавливает наличие сознания, намерений, экономической ценности во всех профессиях или общепринятого порога AGI. Она не показывает, что результат эталонного теста переносится на другой язык, группу населения, набор инструментов, ограничение по стоимости или состязательную среду. Она не решает, могут ли нынешние архитектуры стать устойчиво универсальными.

На момент этого снимка самый обоснованный вывод состоит в том, что передовые системы демонстрируют экстраординарную широту и быстрое совершенствование наряду с устойчивой хрупкостью, пробелами в отдельных областях и неполными данными о безопасности. Это более значимо — и точнее — чем утверждения «это всего лишь автодополнение» или «AGI уже наступил».

Type to search the manual.

navigate open esc close