Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Das Überlebens-Briefing für die Menschheit
DE

Die Debatte um Open-Source-KI: Sicherheitswerkzeug oder Sicherheitsrisiko

Die stärksten Sicherheits-, Forschungs-, Wettbewerbs- und Missbrauchsargumente für und gegen offene KI-Modellgewichte, samt einem Jailbreak für 200 Dollar.

Written by
Dwight Ringdahl
Status
Quellen geprüft
Revised
Sources
3 cited
Reading
6 min

Zuerst präzise Begriffe verwenden

„Open-Source-KI” beschreibt oft sehr unterschiedliche Veröffentlichungen. Ein Entwickler kann Modellgewichte veröffentlichen und dabei Trainingsdaten, Trainingscode, Methoden der Datenverarbeitung, Evaluationsdetails oder weitreichende Rechte zur Veränderung und Weiterverbreitung zurückhalten. Definitionen von Open-Source-Software lassen sich nicht automatisch auf ein trainiertes Modell mit undurchsichtiger Datenherkunft übertragen.

Diese Seite verwendet daher den Begriff offene Gewichte, wenn die numerischen Parameter, die zum Betreiben und Verändern eines Modells nötig sind, breit verfügbar sind. Eine Veröffentlichung kann offene Gewichte unter einer restriktiven Lizenz haben oder offenen Code ohne Gewichte bereitstellen. Dokumentation und Reproduzierbarkeit sind eigenständige Dimensionen.

Terminologie ist wichtig, weil Nutzen und Risiken davon abhängen, was veröffentlicht wird. Forscher können das Training nicht allein aus den Gewichten reproduzieren, doch Gewichte können weiterhin lokale Inferenz, Fine-Tuning und interne Analyse ermöglichen, die eine API verhindert.

Das Argument für weiteren Zugang

Offene Gewichte verringern die Abhängigkeit von einer kleinen Gruppe gehosteter Anbieter. Entwickler können Modelle auf eigener Infrastruktur betreiben, sensible Prompts vor einem Drittanbieter-Dienst schützen, Systeme an lokale Sprachen und Domänen anpassen und weiterarbeiten, wenn ein Anbieter Preis oder Richtlinie ändert. Wettbewerb kann Kosten senken und technische Kapazität verbreiten.

Forscher können Aktivierungen inspizieren, Modellbearbeitung testen, Evaluationen reproduzieren und Verzerrung oder Sicherheit untersuchen, ohne auf die Zustimmung des Anbieters zu warten. Zivilgesellschaft und Universitäten können ein Modell prüfen, dessen Entwickler keinen privilegierten API-Zugang gewähren würde. Lokaler Einsatz kann Datenschutz und Nutzungen mit eingeschränkter Konnektivität unterstützen.

Offenheit kann auch Wissen bewahren. Ein geschlossener Dienst kann verschwinden; eine Gewichte-Veröffentlichung kann archiviert und untersucht werden. Communities können Barrierefreiheits- und Sprachfunktionen entwickeln, die für einen großen Anbieter nicht profitabel sind.

Diese Vorteile sind nicht automatisch gegeben. Der Betrieb eines großen Modells erfordert weiterhin Hardware und Fachwissen. „Demokratisierung” kann Zugang für gut finanzierte Unternehmen bedeuten statt für gewöhnliche Menschen. Ein Anbieter offener Gewichte kann kommerziell von Beiträgen des Ökosystems, von Cloud-Nachfrage oder von Standardsetzung profitieren. Diese Anreize sollten offengelegt werden, ohne den öffentlichen Nutzen zu verwerfen.

Das Argument für kontrollierten Zugang

Sind Gewichte einmal breit gespiegelt, lassen sie sich nicht mehr zuverlässig zurückrufen. Nutzer können Ablehnungstraining entfernen, per Fine-Tuning auf Missbrauch trimmen, Aktivität vor einem zentralen Monitor verbergen und viele Kopien einsetzen. Das ist nachgewiesen, nicht hypothetisch: Forscher hoben das Sicherheitstraining von Llama 2-Chat 70B für unter 200 Dollar auf einer einzelnen GPU mithilfe einer leichtgewichtigen Fine-Tuning-Technik auf (Lermen et al., 2023). Ein gehosteter Anbieter kann die Nutzungsrate begrenzen, Muster überwachen, Verhalten nachbessern und Konten schließen; der lokale Betrieb entfernt einen Großteil dieser Kontrolle.

Das Grenzrisiko hängt davon ab, was das Modell über bestehende Werkzeuge, geschlossene APIs, Expertenwissen und frühere offene Modelle hinaus hinzufügt. Ist eine Fähigkeit bereits andernorts günstig verfügbar, trägt eine Beschränkung der Gewichte womöglich wenig zur Sicherheit bei. Ermöglichen die Gewichte wesentlich wirksamere Cyber-Ausnutzung, biologische Unterstützung, Betrug oder autonomen Betrieb, kann eine irreversible Veröffentlichung erheblich ins Gewicht fallen.

Die relevante Frage ist nicht, ob Information jemals missbraucht werden kann, sondern ob diese Veröffentlichung Fähigkeit, Umfang, Kosten, Zurechenbarkeit oder Zugang für Akteure verändert, die wahrscheinlich Schaden anrichten würden.

Was die US-Evidenzprüfung ergab

Die National Telecommunications and Information Administration prüfte 2024 332 öffentliche Stellungnahmen und die verfügbare Evidenz. Sie kam zu dem Schluss, dass die damalige Evidenz nicht ausreichte, um eine sofortige kategorische Beschränkung der breitesten Verfügbarkeit von Modellgewichten zu stützen, empfahl aber aktive Überwachung und staatliche Fähigkeit zur Reaktion, falls sich Risiken änderten (NTIA, Juli 2024).

Diese Schlussfolgerung ist datiert und bedingt. Sie beweist nicht, dass künftige Frontier-Veröffentlichungen sicher sind oder dass Beschränkungen niemals gerechtfertigt sein können. Die NTIA ist eine Regierungsbehörde, die Innovation, Wettbewerb und Sicherheit abwägt; viele Eingaben stammten von interessierten Unternehmen und Fürsprechern. Ihr Bericht ist eine starke politische Synthese, kein Experiment, das die gesellschaftliche Nettowirkung nachweist.

Der differenzierte Ansatz der Europäischen Union

Die KI-Verordnung der EU sieht für qualifizierende freie und quelloffene Modelle mit allgemeinem Verwendungszweck einige Ausnahmen von bestimmten Dokumentationspflichten vor, aber keine pauschale Ausnahme. Anbieter von Modellen mit allgemeinem Verwendungszweck und systemischem Risiko unterliegen weiterhin zusätzlichen Pflichten. Ob eine Veröffentlichung qualifiziert, hängt von rechtlichen Kriterien ab, einschließlich Zugang und Offenlegung — nicht von Marketingsprache (Leitlinien der Europäischen Kommission zu GPAI, 2025).

Das veranschaulicht eine nach Fähigkeit gestufte Governance: Offenheit fördern, wo Grenzrisiken beherrschbar sind, während Pflichten für Modelle mit systemischem Risiko erhalten bleiben. Die Durchsetzung steht weiterhin vor der Schwierigkeit, Fähigkeit vor einer irreversiblen Veröffentlichung zu bewerten.

Alternativen zu einer binären Entscheidung

Zugang kann gestuft erfolgen. Ein Entwickler könnte mit internen und unabhängigen Evaluationen beginnen, dann kontrollierten Forschungszugang, einen gehosteten Dienst, Gewichte für geprüfte Institutionen unter Sicherheitsbedingungen, und schließlich eine öffentliche Veröffentlichung anbieten, wenn die Evidenz dies stützt. Verzögerungen können Verteidigern erlauben, Schwachstellen zu beheben, und Regulierungsbehörden, sich vorzubereiten.

Strukturierter Zugang kann einen Teil des Forschungsnutzens erhalten und zugleich die Verbreitung begrenzen, schafft aber Torwächter, die Kritiker oder Wettbewerber ausschließen können. Auswahlkriterien, Regeln zu Interessenkonflikten, Widerspruchsmöglichkeiten, Publikationsrechte und Aufsicht sind notwendig. Ein Programm für „vertrauenswürdige Forscher”, das allein vom Modellentwickler kontrolliert wird, ist keine unabhängige Transparenz.

Weitere Optionen umfassen die Veröffentlichung kleinerer oder destillierter Modelle, die Veröffentlichung von Code und detaillierten Evaluationen ohne Frontier-Gewichte, die Bereitstellung sicherer Enklaven für Analysen oder die Nutzung von Lizenzen, die bestimmtes Verhalten untersagen. Lizenzen beeinflussen rechtstreue Nutzer, sind aber schwache technische Barrieren gegen böswillige Akteure.

Wie eine Veröffentlichungsentscheidung getroffen wird

Eine ernsthafte Bewertung einer Veröffentlichung sollte Folgendes vergleichen:

  • gefährliche Fähigkeiten gegenüber bestehenden offenen und geschlossenen Alternativen;
  • Compute und Fachwissen, die nötig sind, um Schutzmaßnahmen zu entfernen oder per Fine-Tuning zu verändern;
  • Nutzen, der einzig Gewichte statt API-Zugang erfordert;
  • die Sicherheit der noch nicht veröffentlichten Gewichte und das Diebstahlrisiko;
  • die Fähigkeit, Missbrauch nach der Veröffentlichung zu überwachen;
  • betroffene Gruppen, einschließlich Forscher außerhalb wohlhabender Staaten;
  • Reversibilität und Optionen für gestuften Zugang;
  • Modelldokumentation, Lizenzrechte und Datenherkunft.

Evaluationen sollten, soweit relevant, Cyber-, chemische und biologische Unterstützung, Überzeugungskraft, autonome Replikation, Datenschutz sowie gewöhnliche Diskriminierung oder Betrug abdecken. Ein Schwellenwert einer Prüfsammlung reicht nicht aus, wenn er reale Arbeitsabläufe nicht abbildet.

Sicherheit durch Verschleierung ist nicht das einzige Thema

Kritiker geschlossener Systeme merken an, dass das Zurückhalten von Gewichten Schwachstellen verbergen und Vertrauen konzentrieren kann. Kritiker der Offenheit merken an, dass die Veröffentlichung einer waffenrelevanten Fähigkeit nicht der verantwortungsvollen Offenlegung eines Software-Fehlers gleichkommt. Beide Beobachtungen können zutreffen.

Verantwortungsvolle Offenlegung gibt betroffenen Verteidigern typischerweise Zeit zu handeln. Bei manchen Modellen kann breite Prüfung mehr Verteidigung als Schaden erzeugen; bei anderen kann breiter Zugang eine irreversible Gefahr schaffen, bevor Gegenmaßnahmen existieren. Evidenz zu Grenzrisiko und Reaktionsbereitschaft sollte die Reihenfolge bestimmen.

AGI verändert den Einsatz, nicht den Bedarf an Evidenz

Kein offenes Modell wurde nach einem vereinbarten Test als AGI festgestellt. Behauptungen über die Veröffentlichung von AGI-Gewichten sind Szenarioanalyse. Könnte ein Modell autonom hochrangige Forschung betreiben, Systeme ausnutzen, Ressourcen erwerben oder Nachfolger verbessern, könnte das Kopieren die Eindämmung drastisch verringern. Umgekehrt könnte es tiefgreifende Konzentrations- und Missbrauchsrisiken schaffen, diese Fähigkeit unter exklusive unternehmerische oder staatliche Kontrolle zu stellen.

Deshalb versagen Slogans. „Offen ist immer sicherer” ignoriert Irreversibilität; „geschlossen ist immer sicherer” ignoriert Konzentration, Diebstahl und mangelnde Prüfung. Künftige Politik sollte Fähigkeits- und Zugangsbedingungen definieren, nicht eine Markenkategorie regulieren.

Eine ausgewogene Position

Bei aktuellen Modellen mit geringerem Risiko kann Offenheit erhebliche Vorteile bei Wettbewerb, Forschung, Resilienz, Datenschutz und Inklusion bringen. Bei zunehmend fähigen Modellen werden gestufte Veröffentlichung und evidenzbasierte Bewertung wichtiger. Beschränkungen sollten ein spezifisches Grenzrisiko nachweisen, rechtsstaatliche Verfahren bieten und überprüft werden; Veröffentlichungsentscheidungen sollten begründen, warum irreversibler Zugang gerechtfertigt ist.

Die Debatte ist keine Wahl zwischen Freiheit und Sicherheit. Sie ist ein Gestaltungsproblem, das Fähigkeit, Zugang, Konzentration, Rechenschaftspflicht und Reversibilität betrifft. Präzise Terminologie und transparente Evidenz machen dieses Problem regierbar.

References

Summarized position

Simon Lermen undid Llama 2-Chat 70B’s safety training for under $200 using a single GPU.

Simon Lermen, Lead author, "LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B"
arXiv, Primary source
  1. NTIA, Juli 2024 ntia.gov
  2. Leitlinien der Europäischen Kommission zu GPAI, 2025 digital-strategy.ec.europa.eu

Type to search the manual.

navigate open esc close