Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Брифинг о выживании человечества
RU

Дебаты об ИИ с открытым исходным кодом: инструмент безопасности или риск

Разбор сильнейших аргументов о безопасности, конкуренции и злоупотреблениях за и против открытой публикации весов моделей ИИ, включая джейлбрейк за 200 долларов.

Written by
Dwight Ringdahl
Status
Источники проверены
Revised
Sources
3 cited
Reading
6 min

Сначала точные термины

«ИИ с открытым исходным кодом» часто описывает очень разные виды релизов. Разработчик может опубликовать веса модели, удерживая при этом обучающие данные, код обучения, методы обработки данных, детали оценки или широкие права на изменение и распространение. Определения из мира открытого программного обеспечения нельзя автоматически переносить на обученную модель с непрозрачным происхождением данных.

Поэтому на этой странице используется термин открытые веса — когда числовые параметры, необходимые для запуска и изменения модели, широко доступны. Релиз может иметь открытые веса под ограничительной лицензией или, наоборот, предоставлять открытый код без весов. Документация и воспроизводимость — отдельные измерения.

Терминология имеет значение, потому что выгоды и риски зависят от того, что именно опубликовано. Исследователи не могут воспроизвести обучение только по весам, но веса всё равно могут обеспечивать локальный вывод, дообучение и внутренний анализ, которые API не допускает.

Аргументы в пользу более широкого доступа

Открытые веса снижают зависимость от небольшого числа хостинговых провайдеров. Разработчики могут запускать модели на собственной инфраструктуре, защищать чувствительные промпты от стороннего сервиса, адаптировать системы под местные языки и предметные области и продолжать работу, даже если поставщик изменит цену или политику. Конкуренция способна снижать издержки и распространять технический потенциал.

Исследователи могут изучать активации, тестировать редактирование модели, воспроизводить оценки и исследовать предвзятость или безопасность, не дожидаясь одобрения поставщика. Гражданское общество и университеты могут внимательно изучать модель, к которой разработчик не предоставил бы привилегированный доступ через API. Локальное развёртывание может поддерживать приватность и сценарии использования с ограниченной связью.

Открытость также способна сохранять знания. Закрытый сервис может исчезнуть; опубликованные веса можно архивировать и изучать. Сообщества могут создавать функции доступности и языковой поддержки, которые невыгодны крупному поставщику.

Эти выгоды не наступают автоматически. Запуск крупной модели по-прежнему требует оборудования и экспертизы. «Демократизация» может на практике означать доступ для хорошо финансируемых компаний, а не для обычных людей. Поставщик открытых весов может извлекать коммерческую выгоду из вклада сообщества, спроса на облачные вычисления или установления стандартов. Эти стимулы следует раскрывать, не отбрасывая при этом реальную общественную пользу.

Аргументы в пользу контролируемого доступа

Как только веса широко зеркалированы, их уже нельзя надёжно отозвать. Пользователи могут удалить обучение отказу, дообучить модель для злоупотреблений, скрыть свою активность от центрального монитора и развернуть множество копий. Это доказанный факт, а не гипотеза: исследователи отменили обучение безопасности модели Llama 2-Chat 70B менее чем за 200 долларов на одном GPU с помощью облегчённой техники дообучения (Lermen и др., 2023). Хостинговый провайдер может ограничивать частоту запросов, отслеживать паттерны, исправлять поведение и закрывать учётные записи; локальная эксплуатация модели устраняет большую часть этого контроля.

Предельный риск зависит от того, что модель добавляет сверх уже существующих инструментов, закрытых API, экспертных знаний и более ранних открытых моделей. Если возможность уже дёшево доступна где-то ещё, ограничение весов может дать мало пользы для безопасности. Если же веса делают существенно более эффективными киберэксплуатацию, биологическое содействие, мошенничество или автономную деятельность, необратимая публикация может иметь очень большое значение.

Актуальный вопрос — не в том, можно ли вообще когда-либо злоупотребить информацией, а в том, меняет ли конкретный релиз возможности, масштаб, стоимость, атрибуцию или доступ для действующих лиц, склонных причинять вред.

Что показал обзор доказательств в США

Национальное управление по телекоммуникациям и информации (NTIA) рассмотрело 332 публичных комментария и доступные доказательства в 2024 году. Оно пришло к выводу, что на тот момент доказательств было недостаточно для немедленного категорического ограничения максимально широкой доступности весов моделей, при этом рекомендовав активный мониторинг и наращивание государственного потенциала для реагирования в случае изменения рисков (NTIA, июль 2024).

Этот вывод датирован и условен. Он не доказывает, что будущие передовые релизы безопасны или что ограничения никогда не могут быть оправданы. NTIA — государственное ведомство, балансирующее между инновациями, конкуренцией и безопасностью; многие материалы поступили от заинтересованных компаний и защитников открытости. Его отчёт — это весомый политический синтез, а не эксперимент, доказывающий чистый общественный эффект.

Дифференцированный подход Европейского союза

Закон ЕС об ИИ предоставляет некоторые исключения из определённых обязанностей по документации для отвечающих критериям свободных моделей общего назначения с открытым исходным кодом, но не полное освобождение. Поставщики моделей общего назначения с системным риском по-прежнему несут дополнительные обязанности. Соответствует ли релиз критериям, зависит от юридических признаков, включая доступ и раскрытие информации, а не от маркетинговых формулировок (разъяснения Европейской комиссии по GPAI, 2025).

Это иллюстрирует управление, градуированное по возможностям: поощрять открытость там, где предельные риски управляемы, сохраняя при этом обязанности для моделей с системным риском. Правоприменение по-прежнему сталкивается с трудностью оценки возможностей до необратимой публикации.

Альтернативы бинарному выбору

Доступ можно предоставлять поэтапно. Разработчик мог бы начать с внутренних и независимых оценок, затем предложить контролируемый исследовательский доступ, хостинговый сервис, веса проверенным институтам на условиях безопасности и, наконец, публичный релиз, если это подтверждают доказательства. Задержки могут дать защитникам время устранить уязвимости, а регуляторам — подготовиться.

Структурированный доступ способен сохранить часть исследовательской пользы, ограничивая при этом распространение, но он создаёт привратников, которые могут исключать критиков или конкурентов. Необходимы критерии отбора, правила разрешения конфликтов, порядок обжалования, права на публикацию и надзор. Программа «доверенного исследователя», контролируемая исключительно самим разработчиком модели, не является независимой прозрачностью.

Другие варианты включают выпуск меньших или дистиллированных моделей, публикацию кода и подробных оценок без передовых весов, предоставление защищённых анклавов для анализа или использование лицензий, запрещающих определённое поведение. Лицензии влияют на добросовестных пользователей, но остаются слабым техническим барьером против злоумышленников.

Как принимать решение о релизе

Серьёзная оценка релиза должна сопоставлять:

  • опасные возможности с уже существующими открытыми и закрытыми альтернативами;
  • объём вычислений и экспертизы, необходимых для снятия защитных мер или дообучения;
  • выгоды, которые действительно требуют именно весов, а не только доступа через API;
  • защищённость ещё не опубликованных весов и риск их кражи;
  • способность отслеживать злоупотребления после публикации;
  • затрагиваемые группы, включая исследователей за пределами богатых государств;
  • обратимость и варианты поэтапного доступа;
  • документацию модели, права по лицензии и происхождение данных.

Оценки должны охватывать содействие в киберсфере, химии и биологии, убеждение, автономную репликацию, приватность, а также, где это уместно, обычную дискриминацию или мошенничество. Одного порогового значения по эталонному тесту недостаточно, если он не отражает реальные рабочие процессы.

Безопасность через неясность — не единственная проблема

Критики закрытых систем отмечают, что удержание весов в тайне может скрывать уязвимости и концентрировать доверие. Критики открытости отмечают, что публикация возможности, значимой с точки зрения оружия, — это не то же самое, что ответственное раскрытие информации о программной ошибке. Оба наблюдения могут быть верными одновременно.

Ответственное раскрытие информации обычно даёт затронутым защитникам время на реагирование. Для одних моделей широкое изучение может принести больше пользы для защиты, чем вреда; для других — широкий доступ может создать необратимую опасность ещё до появления средств смягчения. Именно доказательства о предельном риске и готовности к реагированию должны определять последовательность действий.

AGI меняет ставки, но не отменяет потребность в доказательствах

Ни одна открытая модель не была признана AGI по какому-либо согласованному тесту. Утверждения о публикации весов AGI — это анализ гипотетических сценариев. Если бы модель могла автономно вести исследования высокого уровня, эксплуатировать системы, приобретать ресурсы или совершенствовать своих преемников, её копирование могло бы резко ослабить возможности сдерживания. И наоборот, помещение такой возможности под исключительный корпоративный или государственный контроль могло бы создать глубокие риски концентрации власти и злоупотреблений.

Именно поэтому лозунги не работают. «Открытое всегда безопаснее» игнорирует необратимость; «закрытое всегда безопаснее» игнорирует концентрацию, кражу и отсутствие независимого изучения. Будущая политика должна определять условия для конкретных возможностей и доступа, а не регулировать целую категорию по бренду.

Взвешенная позиция

Для нынешних моделей с более низким риском открытость способна давать существенные выгоды для конкуренции, исследований, устойчивости, приватности и инклюзивности. Для всё более способных моделей поэтапный релиз и основанная на доказательствах оценка приобретают всё большее значение. Ограничения должны демонстрировать конкретный предельный риск, предполагать надлежащую процедуру и периодически пересматриваться; решения о релизе должны объяснять, почему оправдан именно необратимый доступ.

Эти дебаты — не выбор между свободой и безопасностью. Это задача проектирования, включающая возможности, доступ, концентрацию, подотчётность и обратимость. Точная терминология и прозрачные доказательства делают эту задачу управляемой.

References

Summarized position

Simon Lermen undid Llama 2-Chat 70B’s safety training for under $200 using a single GPU.

Simon Lermen, Lead author, "LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B"
arXiv, Primary source
  1. NTIA, июль 2024 ntia.gov
  2. разъяснения Европейской комиссии по GPAI, 2025 digital-strategy.ec.europa.eu

Type to search the manual.

navigate open esc close