Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Брифинг о выживании человечества
RU

Вычисления и законы масштабирования: разбор

Что предсказывают законы масштабирования ИИ, где их прогнозы дают сбой и почему обучающие вычисления остаются несовершенным, но полезным сигналом для регулирования.

Written by
Dwight Ringdahl
Status
Источники проверены
Revised
Sources
4 cited
Reading
5 min

Закон масштабирования — это эмпирическая закономерность

В машинном обучении закон масштабирования описывает, как изменяется измеряемая величина по мере роста входного параметра. Для больших языковых моделей исследователи обнаружили, что ошибка обучения часто улучшается относительно плавно и предсказуемо по мере роста размера модели, объёма обучающих данных и вычислений. В работе OpenAI 2020 года были зафиксированы степенные зависимости в проверенных диапазонах (Kaplan et al.). Более позднее исследование DeepMind «Chinchilla» показало, что при фиксированном вычислительном бюджете многие модели обучались на слишком малом объёме данных и что параметры и обучающие токены следует масштабировать вместе более равномерно (Hoffmann et al.).

Эти результаты были важны, потому что сделали дорогостоящие обучающие прогоны более предсказуемыми. Лаборатория могла провести эксперименты меньшего масштаба, оценить, как изменится ошибка при большем масштабе, и распределить бюджет между данными, параметрами и вычислениями. Но закон описывает измерения внутри наблюдаемого режима. Это не физическая гарантия того, что любая способность будет улучшаться бесконечно, и не гарантия, что достаточное количество графических процессоров автоматически произведёт AGI.

Вычисления — лишь один из ингредиентов

«Вычисления» обычно означают число численных операций, использованных при обучении или выводе, но даже это упрощение скрывает важные различия. Два обучающих прогона с одинаковым номинальным числом операций могут дать разные системы из-за загрузки чипов, численной точности, качества данных, архитектуры, оптимизации и программного обеспечения. Алгоритмические улучшения могут дать более высокую производительность на том же оборудовании. Дообучение, поиск по внешним источникам, инструменты, память и обвязка для агентов могут существенно изменить развёрнутое поведение после предобучения.

Данные важны и по количеству, и по составу. Дублированные, низкокачественные или загрязнённые примеры не эквивалентны тщательно отобранной информации. Синтетические данные могут расширить или прицельно дополнить корпус, но ошибки могут усиливаться, если генерация и фильтрация выполнены плохо. Права на данные, конфиденциальность, языковой охват и представленность также влияют на то, чему обучается модель.

Вычисления на этапе вывода добавляют ещё одно измерение. Некоторые системы тратят больше операций на генерацию и проверку промежуточных вариантов ответа для сложного запроса. Это может улучшить производительность без изменения предобученной модели, но повышает стоимость и задержку и не гарантирует правильность. Полноценное обсуждение масштабирования теперь должно учитывать как минимум обучающие вычисления, вычисления на этапе вывода, данные, алгоритмы и окружающую систему.

Кривые ошибки — не кривые возможностей

Ошибка обучения измеряет предсказательную погрешность, усреднённую по огромным наборам данных. Плавное снижение ошибки может сопровождаться неравномерными изменениями в задачах, ориентированных на человека. Эталонный тест может показать пороговый скачок, потому что скрытое улучшение наконец пересекает проходной балл, потому что модель осваивает несколько необходимых подспособностей, либо потому что система оценки превращает постепенный прогресс в бинарный результат. Другие способности могут улучшаться плавно, оставаться неизменными или ухудшаться после настройки безопасности или изменений системы.

Это различие предотвращает две противоположные ошибки. Первая — считать, что предсказуемая кривая ошибки делает предсказуемым любое будущее поведение. Это не так. Вторая — утверждать, что всякий прирост возможностей является загадочным скачком. Многие внешне резкие скачки в эталонных тестах становятся более плавными, когда исследователи применяют непрерывные метрики или более информативные тесты (Schaeffer, Miranda и Koyejo, 2023). И неопределённость, и частичная предсказуемость могут быть верны одновременно.

Масштабирование также взаимодействует с дизайном оценки. Публичные тесты могут насыщаться или просачиваться в обучающие данные. Модель может улучшаться в прохождении тестов без сопоставимого выигрыша в надёжности в реальном мире. И наоборот, существующие эталонные тесты могут упускать полезные возможности. Чтобы понять, что именно дало снижение ошибки, нужны множественные оценки, приватные задачи, экспертная проверка людьми и данные о реальном развёртывании.

Где тенденция может изогнуться

Физические мощности не безграничны. Обучение и обслуживание передовых моделей зависят от современных чипов, памяти с высокой пропускной способностью, сетей, электроэнергии, охлаждения, земли, строительства и цепочек поставок. Международное энергетическое агентство ожидает существенного роста спроса на электроэнергию со стороны дата-центров вплоть до 2030 года, подчёркивая при этом неопределённость и сильную географическую концентрацию (МЭА, Energy and AI). Локальные задержки в электросетях могут иметь значение даже тогда, когда глобальной энергии достаточно.

Качественные данные, созданные людьми, также конечны, хотя эффект этого ограничения зависит от новых источников данных, мультимодального обучения, синтетических данных и более эффективного использования существующих корпусов. Экономические пределы могут наступить раньше технических: более крупная модель должна создавать достаточно ценности, чтобы оправдать издержки на обучение, обслуживание и упущенные возможности. Задержка и пропускная способность памяти могут ограничивать продукты даже при наличии достаточного совокупного объёма вычислений.

Убывающая отдача заложена в само масштабирование. Степенной закон может продолжать действовать, при этом каждое дополнительное улучшение требует намного больших затрат. Это не означает остановки прогресса, но меняет экономику. Новая архитектура или алгоритм могут сдвинуть кривую, тогда как безопасность, надёжность или физическое воплощение могут потребовать прорывов, не улавливаемых ошибкой предсказания следующего токена. Никто не может, опираясь только на нынешние законы масштабирования, установить, где произойдут эти прорывы.

Почему вычисления остаются рычагом управления

Несмотря на эти оговорки, передовые вычислительные мощности необычно физичны и сконцентрированы. Передовые чипы производятся через узкую глобальную цепочку поставок, а крупнейшие обучающие кластеры требуют заметного объёма капитала, энергии и сетевой инфраструктуры. Поэтому правительства используют экспортный контроль над чипами, требования к отчётности и правила для дата-центров как косвенные показатели передовых возможностей. Вычисления могут быть проще для мониторинга, чем алгоритмы или скопированное программное обеспечение.

Этот косвенный показатель несовершенен. Пороговые значения могут устаревать по мере того, как алгоритмы становятся эффективнее. Распределённое обучение и распределённый вывод усложняют учёт. Плохо составленное правило по вычислениям может обременять легитимные исследования, закреплять положение крупных действующих игроков или поощрять уклонение. Обучающие вычисления также упускают из виду мощные системы, собранные путём дообучения, использования инструментов или множества обращений к модели на этапе вывода. Эффективная политика должна обновлять пороги, учитывать эффективность, защищать конфиденциальность и сосредотачивать обязательства на риске, а не рассматривать сами операции как вред.

Управление через вычисления сильнее всего работает в паре с оценкой возможностей. Вычисления могут указать, какие прогоны заслуживают пристального внимания; оценки могут проверить, пересекает ли получившаяся система порог опасных возможностей; мониторинг развёртывания может выявить неправомерное использование и сбои. Ни одна отдельная метрика не должна нести всю регуляторную нагрузку.

Масштабирование не определяет сроки появления AGI

Быстрый рост инвестиций — свидетельство того, что разработчики ожидают отдачи от более крупных и эффективных систем. Историческое масштабирование — свидетельство того, что дополнительные ресурсы часто улучшали измеряемую производительность. Ни то ни другое не доказывает конкретную дату появления AGI. Прогнозы должны моделировать аппаратное обеспечение, энергию, данные, алгоритмы, вывод, надёжность и само определение AGI.

Утверждения о том, что «масштабирование остановилось», требуют указания, какая именно метрика и система имеются в виду. Утверждения о том, что «всё, что нужно, — это масштабирование», требуют показать, что оставшиеся пробелы сводимы к той же тенденции. Между этими лозунгами лежит защитимая позиция: законы масштабирования — одна из самых полезных эмпирических закономерностей современного ИИ, но они предсказывают средние значения внутри режимов лучше, чем предсказывают качественные социальные последствия.

Что стоит спрашивать читателю

Когда новая модель объясняется масштабом, стоит спросить, какой именно ресурс вырос, насколько и относительно какой базовой точки. Было ли сравнение оптимальным по вычислениям? Изменились ли данные или алгоритмы? О чём сообщается выигрыш — об ошибке обучения, эталонном тесте, работе экспертов или развёрнутом результате? Как выглядели надёжность и стоимость? Воспроизводимы ли результаты независимо?

Эти вопросы сохраняют реальный урок законов масштабирования, не превращая его в мифологию. Больше вычислений неоднократно позволяло получать более совершенные модели. Это важный промышленный ресурс и практическая точка надзора. Это не универсальная единица измерения интеллекта, не гарантия безопасного поведения и не обратный отсчёт до AGI.

Type to search the manual.

navigate open esc close