Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Offene Gewichte, Open Source und ein Modell, das Harry Potter auswendig lernte

Ein neues arXiv-Paper zeigt: Llama 3.1 70B kann mindestens ein Buch fast wörtlich wiedergeben. Damit lebt die Debatte neu auf, was "Open Weights" tatsächlich offenlegt.

KI & ModelleAnalyseKatrin HoffmannVeröffentlicht: 27. September 20265 Min. LesezeitQuellen 3
Offene Gewichte, Open Source und ein Modell, das Harry Potter auswendig lernte

Zwei Dinge stimmen für Sprachmodelle mit offenen Gewichten gleichzeitig, und die Branche hat drei Jahre lang so getan, als wäre es anders. Sie sind wirklich nützlich. Und sie sind nicht Open Source.

Der Unterschied ist keine Wortklauberei. Er entscheidet, ob jemand außerhalb des herausgebenden Labors nachprüfen kann, was ein Modell gelernt hat, wie es das gelernt hat und ob Aussagen zu Verzerrungen und Sicherheit stimmen. Die aktuelle Welle "offener" Modellveröffentlichungen, von Metas Llama-Reihe bis zu Mistrals Mixtral, veröffentlicht Gewichte und sonst wenig. Trainingscode, Datensätze und Methodik bleiben hinter der Wand. Der Text von Prompt Engineering vom Dezember 2023 benannte die Lücke klar: Open Weights erlaubt die Nutzung eines Modells, aber keine vollständige Transparenz. Open Source ermöglicht Verständnis und Anpassung eines Modells, verlangt dafür aber deutlich mehr Arbeit bei der Veröffentlichung.

Was ein Gewicht tatsächlich ist

Gewichte sind das numerische Ergebnis eines Trainingslaufs. Sie sind nicht lesbar, nicht debugbar und keine Anweisungen. Quellcode ist alles drei. Laut Prompt Engineering ist die Verwechslung der beiden ein häufiger Fehler mit echten Folgen. Er führt dazu, dass Menschen eine proprietäre Trainingspipeline als Open Source bezeichnen, nur weil eine Datei mit Parametern herunterladbar ist.

Die praktischen Kosten zeigen sich bei der Prüfbarkeit. Sind nur Gewichte verfügbar, können Entwickler moderne Modelle ausführen, aber Verzerrungen, Grenzen und gesellschaftliche Auswirkungen nicht sinnvoll bewerten, argumentiert derselbe Text. Eine Fehlausrichtung zwischen einem Modell und realen Anforderungen lässt sich schwer erkennen. Mit vollem Quellzugriff können Forschende über Organisationen hinweg strenge Prüfungen von Fairness, Sicherheit und Robustheit durchführen. Das ist der Handel: Bequemlichkeit jetzt, Überprüfbarkeit nie.

Nur die Gewichte eines Modells zu veröffentlichen, ermöglicht breit die Anwendungsentwicklung, konzentriert die Kontrolle aber bei einer kleinen Gruppe von Organisationen. Open-Source-Zugang zu ermöglichen, verteilt die Kontrolle, verlangt aber größeres Engagement für Transparenz und Dezentralisierung.

Diese Einordnung ist gut gealtert, auch weil die Belege für das Problem der Überprüfbarkeit nicht abreißen.

Das Problem des Auswendiglernens

Am 18. Mai 2025 reichte eine Gruppe von Forschenden um A. Feder Cooper, Mark A. Lemley und Percy Liang ein Paper bei arXiv ein. Es misst, wie viel urheberrechtlich geschützter Buchtext sich aus Sprachmodellen mit offenen Gewichten heraus holen lässt. Die Gruppe wandte ihre Extraktionstechnik auf 200 Bücher und 14 Modelle mit offenen Gewichten an und führte mehr als 3000 Experimente durch. Version sechs des Papers, überarbeitet am 20. Juli 2026, ist die aktuelle.

Der zentrale Befund läuft beiden Seiten der Urheberrechtsklagen zuwider. Die meisten LLMs lernen die meisten Bücher nicht auswendig, weder ganz noch teilweise, heißt es in dem Paper. Es gibt jedoch bemerkenswerte Ausnahmen. Llama 3.1 70B lernt manche Bücher vollständig auswendig, darunter Harry Potter and the Sorcerer's Stone. Das Auswendiglernen ist so umfangreich, dass sich das ganze Buch fast wörtlich und deterministisch extrahieren lässt, wenn man seine ersten Worte als ersten Prompt verwendet.

Kläger und Beklagte in Urheberrechtsverfahren zu generativer KI, schreiben die Autoren, erheben pauschale und gegensätzliche Behauptungen zum Auswendiglernen, die das Verhältnis zwischen Auswendiglernen und Urheberrecht stark vereinfachen. Ihre Ergebnisse, fügen sie hinzu, haben erhebliche Folgen für Urheberrechtsfälle, allerdings keine, die eindeutig eine Seite begünstigen.

Man beachte, was das Experiment voraussetzte. Es brauchte Gewichte, die heruntergeladen und befragt werden konnten. Ein eingeschränktes Modell hätte denselben Test für externe Forschende unmöglich gemacht. Offene Gewichte ermöglichten den Befund also, obwohl offene Gewichte nicht Open Source sind.

Ein kleines Gegenbeispiel

Nicht jede Veröffentlichung mit offenen Gewichten ist ein Frontier-Modell. Superwhisper veröffentlichte s1-mini, einen Textnormalisierer mit 0,6B Parametern für die Ausgabe von Spracherkennung, unter Apache 2.0 plus einer Namensklausel. Er nimmt ein rohes ASR-Transkript und schreibt es als sauberen geschriebenen Text um: Füllwörter entfernt, falsche Anfänge aufgelöst, Zeichensetzung und Großschreibung angewendet, gesprochene Zahlen und Daten in Schriftform gebracht. Auf einem zurückgehaltenen Satz von 7.519 englischen Fällen erreicht er 94,8 % Token-Genauigkeit, und der quantisierte Build ist eine 462 MiB große Datei, die auf einer Laptop-CPU läuft.

Die Versionshinweise sind ungewöhnlich offen für eine Eigenheit der Dokumentation. Die Seitenleiste auf Hugging Face meldet 0,8B Parameter, doch die Modellkarte nennt als echten Wert 596,0M eindeutige Parameter. Das Embedding mit 155,6M Parametern ist zweimal gespeichert: 751,6M Tensorelemente gegen 596,0M eindeutige. Das Layout stammt von Qwen/Qwen3-0.6B, das auf dem Hub aus demselben Grund 0,8B meldet.

Diese Art Offenlegung ist das ganze Argument dafür, Gewichte mit Dokumentation zu veröffentlichen. Sie ist zugleich genau kein Quellcode. Die Modellkarte nennt das Basismodell, die Präzision, die erwartete Eingabeform und die Lizenz. Sie liefert nicht die Trainingsdaten und nicht das vollständige Rezept.

Warum die Bezeichnungen weniger zählen als der Zugang

Prompt Engineering schlug vor, das Vokabular aufzuteilen: "Open Weights" für Lizenzen, die Gewichte neuronaler Netze abdecken, und "Ethical Weights" für eine eigene Kategorie von Lizenzen, die speziell für Gewichte gedacht sind. Der Vorschlag hat sich nicht breit durchgesetzt, und das Marketing ist nicht langsamer geworden.

  • Open Weights: Parameter veröffentlicht, Trainingscode und Daten zurückgehalten, Nutzung und Feinabstimmung erlaubt.
  • Open Source: Architekturcode, Trainingsmethodik, Hyperparameter, ursprünglicher Datensatz und Dokumentation veröffentlicht.
  • Restricted Weights: Parameter nur unter erheblichen rechtlichen oder ethischen Einschränkungen verfügbar.

Der Unterschied hat einen Effekt zweiter Ordnung, der selten in den Ankündigungen steht. Open Source stärkt dezentralen Fortschritt, wie Prompt Engineering es formuliert. Forschende weltweit können Verbesserungen und alternative Entwicklungsrichtungen vorschlagen, statt den Fortschritt bei den wenigen Unternehmen zu belassen, die riesige proprietäre Modelle trainieren können. Offene Gewichte konzentrieren diese Fähigkeit stattdessen, während sie die Artefakte verteilen.

Nichts davon bedeutet, dass Veröffentlichungen mit offenen Gewichten wertlos sind. Die Studie zum Auswendiglernen existiert, weil sie es nicht sind. Aber ein herunterladbarer Checkpoint ist eine Lizenz, ein Modell zu nutzen, keine Lizenz, es zu verstehen. In der Lücke zwischen diesen beiden Dingen findet der größte Teil der aktuellen Auseinandersetzung über KI-Offenheit tatsächlich statt.

Kommentare 0

Quellen

3
  1. 01Openness in Language Models: Open Source vs Open Weights vs Restricted WeightsEN
  2. 02Extracting memorized pieces of (copyrighted) books from open-weight language modelsEN
  3. 03S1-mini, Superwhisper's first open-weights language modelEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.