Studie zur Memorierung: Die meisten LLMs geben die meisten Bücher nicht wieder
Ein bei COLM 2026 angenommenes Paper wertet mehr als 3.000 Extraktionsexperimente mit 200 Büchern und 14 Open-Weight-Modellen aus. Ergebnis: Die meisten Modelle memorieren die meisten Bücher nicht. Llama 3.1 70B aber gibt mindestens eines vollständig wieder.

Die meisten großen Sprachmodelle memorieren die meisten Bücher aus ihrem Training nicht. Das steht in einem Paper, das bei COLM 2026 angenommen wurde. Grundlage sind mehr als 3.000 Extraktionsexperimente mit 200 Büchern und 14 Open-Weight-Modellen. Das Ergebnis widerspricht den pauschalen Behauptungen, mit denen beide Seiten in Urheberrechtsverfahren rund um generative KI arbeiten.
Die Arbeit heißt "Extracting memorized pieces of (copyrighted) books from open-weight language models". Sie erschien erstmals im Mai 2025 auf arXiv und wurde bis Juli 2026 überarbeitet. Zu den Autoren gehören A. Feder Cooper, Mark A. Lemley, Allison Casasola, Ahmed Ahmed, Aaron Gokaslan, Amy B. Cyphert, Christopher De Sa, Daniel E. Ho und Percy Liang. Im Abstract heißt es, die polarisierten Positionen von Klägern und Beklagten "dramatically oversimplify the relationship between memorization and copyright".
Was die Extraktionsmethode tatsächlich fand
Das Hauptergebnis ist negativ, und es ist enger, als es klingt. Bezogen auf die spezifische Extraktionsmethodik der Autoren memorieren die meisten LLMs die meisten Bücher nicht, weder vollständig noch in Teilen. Diese Einschränkung ist wichtig. Die Feststellung bezieht sich darauf, was diese eine Technik herausziehen konnte. Sie ist kein allgemeiner Beweis, dass Trainingsdaten keine Spuren hinterlassen.
Unangenehm wird es für Modellentwickler bei den Ausnahmen. Llama 3.1 70B memoriert einige Bücher vollständig, schreiben die Autoren, und nennen Harry Potter and the Sorcerer's Stone. Die Memorierung reicht so weit, dass sich das ganze Buch nahezu wörtlich und deterministisch extrahieren lässt. Als erster Prompt genügen die ersten Worte des Buches. Keine Sampling-Tricks, kein Jailbreak, nur die Anfangswendung.
Über die 14 getesteten Open-Weight-Systeme hinweg variierte die Memorierung sowohl nach Modell als auch nach Buch. Das Abstract nennt die anderen Modelle nicht und liefert keine Aufschlüsselung pro Buch. Welche Titel außerhalb des Harry-Potter-Beispiels am stärksten exponiert sind, bleibt in der veröffentlichten Zusammenfassung offen.
Die Autoren sind vorsichtig, wenn es um die Bedeutung für Gerichte geht. Sie kommen zu dem Schluss, dass die Befunde erhebliche Auswirkungen auf Urheberrechtsfälle haben, "though not ones that unambiguously favor either side". Dieser Satz ist der eigentliche Beitrag des Papers zur Debatte. Beide Anwaltsteams dürften ihn aus dem Zusammenhang gerissen zitieren.
Das Lizenzargument neben der Forschung
Während Forscher messen, was Modelle behalten, läuft ein anderer Streit darüber, was das Wort "offen" bedeutet, wenn es an sie gehängt wird. The Register veröffentlichte am 15. September eine Kolumne von Steven J. Vaughan-Nichols. Darin argumentiert er, die Branche bezeichne Veröffentlichungen routinemäßig als "open source models", obwohl sie nur Open Weight seien.
Der Unterschied entscheidet, so die Kolumne, ob man ein fertiges neuronales Netz nur einsetzen darf oder ob man das System, das es erzeugt hat, einsehen, reproduzieren, verändern und weiterverbreiten kann. Gewichte sind die erlernten numerischen Parameter, die beim Training entstehen. Zusammen mit der Architektur und dem Inferenzcode bringen sie ein Modell zum Laufen. Sie sagen nicht, was hineingeflossen ist.
Die Open Source Initiative zieht die Grenze direkt. Ihre im Artikel zitierte Position lautet, dass offene Gewichte die finalen Gewichte und Bias-Werte eines trainierten neuronalen Netzes bezeichnen. Ihre Veröffentlichung lege nur "a fraction of the information required for full accountability" offen.
"Open weights are progress. You can download the model, run it on your own machine, keep it out of someone else's data pipeline. But you still can't see how the thing was built, what it was trained on, or why it behaves the way it does. That's not an open model. That's open distribution."
Das ist James Landay, Direktor des Stanford Institute for Human-Centered AI, im Gespräch mit The Register. Er ergänzte, es gebe "a wide gap between open-weight AI and open source AI". Ohne offengelegte Trainingsdaten oder eine dokumentierte, prüfbare Darstellung davon könnten Außenstehende die Arbeit nicht im vollen Sinne testen oder reproduzieren, argumentierte er.
Ohne die Trainingsdaten, so die Kolumne, können Außenstehende nicht feststellen, welche Quellen verwendet wurden. Sie erfahren nicht, welches urheberrechtlich geschützte oder private Material enthalten gewesen sein könnte, wie Daten ausgewählt oder entfernt wurden, welche Sprachen und Gemeinschaften unterrepräsentiert waren, ob Benchmark-Daten ins Training gelangt sind oder welche Alignment-Methoden das Modell nach dem Pretraining geformt haben. Diese Liste entspricht genau dem Fragenkatalog, den das Memorierungs-Paper empirisch zu beantworten versucht, von außen, mit Extraktion statt mit Offenlegung.
Die eigene Open Source AI Definition der OSI, OSAID 1.0, im Oktober 2024 veröffentlicht, verlangt, dass Modellparameter einschließlich Gewichte unter OSI-anerkannten Bedingungen verfügbar sind. Einen bestimmten rechtlichen Mechanismus schreibt sie nicht vor. Kritik kam unter anderem von Bruce Perens, dem Autor der ursprünglichen Open Source Definition. Er erklärte: "It's not Open Source! ... It's unfortunate that the Open Source Initiative itself is now involved in Openwashing." Bradley Kuhn von der Software Freedom Conservancy und Red Hats Richard Fontana haben gefordert, OSAID zurückzuziehen. Ihr Argument: Die OSI habe "acted too quickly to impose an overly ambitious policy compromise on the community".
Eine konkurrierende Initiative, die Open Model, Data, and Weights licence der Linux Foundation, kurz OpenMDW, wurde bei der OSI eingereicht. Sie existiert seit 2025, listet Mitwirkende von Amazon, Meta, IBM, Microsoft und Nvidia und definiert getrennte Bedingungen für Architektur, Trainingsdaten und Gewichte eines Modells. The Register berichtet, die Einreichung sei auf der Lizenzprüfungs-Mailingliste der OSI auf Einwände gestoßen. Stefano Maffulli, ehemaliger Geschäftsführer der OSI, sagte, er habe weiterhin den Eindruck, die Prüfung sei "tainted by an ideological bias".
Billiger, näher dran und trotzdem nicht reproduzierbar
Mozilla veröffentlichte am 15. September Version 1.1 seines Berichts State of Open Source AI, mit Datenstand zum 1. September. Tom's Hardware berichtete am folgenden Tag darüber. Der Bericht setzt das beste offene Modell drei Punkte hinter den geschlossenen Spitzenreiter im Artificial Analysis Intelligence Index, bei 60% des Preises, und zwei Punkte hinter Claude Fable 5 bei 30%. Mozillas Anpassung an die METR-Aufgabenhorizont-Daten setzt die Lücke zwischen offen und geschlossen bei etwa 4,4 Monaten an, im Einklang mit der Vier-Monats-Schätzung von Epoch AI.
Die Methodik verdient Prüfung. METR bewertet Modelle nach der Länge der Aufgabe in menschlicher Arbeitszeit, die sie in der Hälfte der Fälle bewältigen. Nach Mozillas angepasster Schätzung bewältigen geschlossene Modelle Aufgaben, für die menschliche Experten 8 bis 12 Stunden brauchen. Offene Modelle erreichen das etwa vier Monate später, wobei sich die offene Fähigkeit alle 3,9 Monate verdoppelt gegenüber 5,5 bei geschlossenen. Der Bericht stützt sich auf eine Umfrage von Mozilla und SlashData unter rund 1.400 Entwicklern, OpenRouter-Verkehrsdaten und Benchmark-Indizes Dritter. Mozilla setzt sich für offene Modelle ein, und TIME berichtete am 14. Juli, Mozillas Technologievorstand Raffi Krikorian habe den Bericht teils als Advocacy bezeichnet.
Auf vals.ais Terminal-Bench 2.1, der jedes Modell durch denselben Prüfaufbau schickt, erreichte Z.ais GLM-5.2 einen Punkt Abstand zu Claude Opus 4.7 und etwa vier Punkte Rückstand auf Opus 4.8, bei weniger als einem Fünftel der Kosten pro Test. Auf OpenRouter zählte Mozilla acht der zehn führenden Modelle nach Token-Volumen im August als Open Weight, sieben davon chinesisch gebaut. Geschlossene Anbieter erzielten dennoch 96% des Umsatzes auf Modellebene bei OpenRouter von Mai bis September 2025, laut der Linux Foundation. "We see the decision to pay for closed [models] as workload-specific rather than organization-specific", sagte Krikorian in einer E-Mail an Ars Technica.
Der Bericht zählt 16 bemerkenswerte offene Veröffentlichungen, und Tom's Hardware merkt an, dass keine das von der OSI-Definition verlangte Datenrezept liefert. Die Vier-Monats-Lücke und die 30%-Token-Preisangabe sind API zu API auf gehosteten Endpunkten und zu Listenpreisen gemessen. Die eigene Hardware-Grafik des Berichts setzt das beste offene Modell, das auf einen Server passt, bei 52,6 und das beste auf einer GPU bei 40, Rückgänge von 10 und 23 Punkten gegenüber der Spitze. Das ist eine größere Lücke, als vier Monate nahelegen. Der native MXFP4-Checkpoint von Kimi K3 läuft über etwa 1,56TB verteilt auf 96 Shards. Mozillas Serving-Konfiguration listet 64 oder mehr Beschleuniger, und vLLM verlangt für Produktionsverkehr mindestens acht GB300 GPUs mit mehreren Knoten. Der Bericht beschreibt dies als offen, aber nicht lauffähig für die meisten, die es besitzen. Thinking Machines' Inkling-Small unter Apache 2.0 ist eine Ausnahme, mit einer NVFP4-Version, die auf einen B300 bei einer Untergrenze von 180GB passt.
Die Daten enden am 1. September, und die Benchmarks haben sich seither bewegt. Artificial Analysis ist inzwischen bei Index v4.3 mit einem anderen Evaluationssatz. Sein Live-Board führt Claude Fable 5.1 mit 53 auf seiner höchsten Effort-Einstellung und Kimi K3 mit 44. Diese Zahlen sind nicht mit den Werten aus v4.1.1 vergleichbar, die Mozilla aufgetragen hat. Mozillas eigene Grafikunterschrift lautet: "the gap resets every release cycle."
Ein weiterer Punkt im Bericht wird als Behauptung und nicht als Befund dargestellt. Eine gemeinsame Warnung von NSA, CISA und FBI vom 8. September (AA26-251A) behauptet, Moonshot habe Claude Fable 5-Daten extrahiert, um K3 durch Destillation zu trainieren, also durch das Training eines Modells auf den Ausgaben eines anderen. Mozillas Bericht beschreibt die Behauptung als "asserted, and unshown".
Führt man beide Stränge zusammen, ergibt sich ein unbequemes Bild für jeden, der eine saubere Antwort will. Ein Modell kann herunterladbar, billig und nur Monate von der Frontier entfernt sein und trotzdem undurchsichtig bleiben, was seine Trainingsdaten angeht. Und wenn Forscher suchen, was es behalten hat, wie das COLM-Paper mit 200 Büchern und mehr als 3.000 Experimenten, dann hängt die Antwort davon ab, welches Modell und welches Buch man fragt. Landays Zusammenfassung der Lücke, zitiert von The Register: "Open weights answer 'Can I run this?' Open source answers 'Can I trust this, improve it, and build the next thing on top of it?'"
Quellen
3- 01Extracting memorized pieces of books from open-weight language modelsEN
- 02Open weights are not open source: Why AI's favorite label is under disputeEN
- 03China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.