Offene Gewichte sind kein Open Source: Was die KI-Debatte falsch versteht
Mozilla behauptet im Bericht State of Open Source AI, die besten Modelle mit offenen Gewichten aus China lägen nur noch etwa vier Monate hinter den US-Spitzenmodellen zurück. Die Open Source Initiative hält dagegen: Offene Gewichte liefern nur einen Teil dessen, was Open Source bedeutet.

Offene Gewichte sind der umstrittenste Begriff der KI-Politik. Mozilla hat am 15. September Version 1.1 des Berichts State of Open Source AI veröffentlicht, mit Datenstand 1. September. Die zentrale Aussage lautet: Die besten Modelle mit offenen Gewichten liegen rund vier Monate hinter den führenden US-Angeboten. Tom's Hardware berichtete am 16. September über den Bericht. Darin gleicht Mozilla METR-Daten zum Task-Horizont ab und beziffert die Lücke zwischen offen und geschlossen auf etwa 4,4 Monate. Das passt zu einer Schätzung von Epoch AI von vier Monaten.
Die Open Source Initiative bestreitet nicht, dass offene Gewichte nützlich sind. Sie bestreitet das Etikett. In einem Blogbeitrag vom 19. September zieht die OSI eine Grenze. Auf der einen Seite stehen Modelle mit offenen Gewichten, die nur die Gewichte freigeben und sonst nichts. Auf der anderen Seite steht Open Source AI, wo zusätzlich der Code zum Training des Modells veröffentlicht wird und entweder die Trainingsdaten oder eine detaillierte Beschreibung, wie diese Daten erstellt wurden. Nur die zweite Kategorie erlaubt Nutzern nach Ansicht der OSI alle vier Softwarefreiheiten: nutzen, studieren, verändern und weitergeben, ohne den Rechteinhaber zu fragen.
Die Lücke von vier Monaten und worauf sie beruht
Mozillas Zahl ist enger, als sie klingt. Der Bericht zählt 16 nennenswerte offene Veröffentlichungen, und keine liefert das Datenrezept, das die Definition Open Source AI der OSI verlangt. Die Vier-Monats-Zahl wird API gegen API auf gehosteten Endpunkten und zum Listenpreis gemessen, so Tom's Hardware. Sie beschreibt also, was ein Entwickler einem Anbieter zahlt, nicht was ein Modell auf eigener Hardware kostet.
Im Artificial Analysis Intelligence Index lag das beste offene Modell laut Mozilla drei Punkte hinter dem geschlossenen Spitzenmodell, bei 60% des Preises. Auf Claude Fable 5 fehlten zwei Punkte, bei 30% des Preises. Auf dem Terminal-Bench-2.1-Board von vals.ai, das jedes Modell durch dieselbe Softwareumgebung schickt, erreichte GLM-5.2 von Z.ai einen Punkt Abstand zu Claude Opus 4.7 und etwa vier Punkte Rückstand auf Opus 4.8, bei weniger als einem Fünftel der Kosten pro Test. Auf OpenRouter zählte Mozilla acht der zehn nach Token-Volumen stärksten Modelle im August zu den offenen Gewichten, sieben davon aus China. Geschlossene Anbieter erzielten laut Linux Foundation von Mai bis September 2025 dennoch 96% der Einnahmen auf Modellebene bei OpenRouter.
Dann ist da der Hardware-Vorbehalt, der Teil des Berichts, der die Schlagzeile untergräbt. Mozillas eigene Grafik setzt das beste offene Modell, das auf einen Server passt, bei 52,6 an und das beste, das auf eine GPU passt, bei 40. Das sind Rückgänge von 10 und 23 Punkten gegenüber der Spitze. Diese Lücke ist größer als vier Monate. Der native MXFP4-Checkpoint von Kimi K3 läuft über etwa 1,56TB verteilt auf 96 Shards. Mozillas Serving-Konfiguration listet 64 oder mehr Beschleuniger, vLLM verlangt mindestens acht GB300 GPUs, für Produktionslast mehrere Knoten. Der Bericht selbst beschreibt das als offen, aber für die meisten Besitzer nicht lauffähig. Eine Ausnahme nennt er: Inkling-Small von Thinking Machines unter Apache 2.0, dessen NVFP4-Version auf einen B300 mit 180GB Untergrenze passt.
"Wir sehen die Entscheidung, für geschlossene [Modelle] zu zahlen, als arbeitslastspezifisch und nicht organisationsspezifisch", sagte Mozillas Chief Technology Officer Raffi Krikorian per E-Mail zu Ars Technica.
Mozilla ist eine Interessenvertretung, und das sagt die Organisation selbst. Tom's Hardware merkt an, dass TIME am 14. Juli berichtete, Krikorian habe den Bericht teils als Advocacy bezeichnet. Der Bericht stützt sich auf eine Umfrage von Mozilla und SlashData unter rund 1.400 Entwicklern, dazu OpenRouter-Verkehrsdaten und Benchmark-Indizes Dritter. Die Bildunterschrift in Mozillas Grafik ist offen gegenüber dem beweglichen Ziel darunter: "the gap resets every release cycle."
Warum der Definitionsstreit wichtiger ist als der Benchmark
Die OSI argumentiert nicht, dass offene Gewichte schlecht sind. Sie argumentiert, dass der Begriff gedehnt wurde, um Modelle zu erfassen, die Feinabstimmung und Selbsthosting erlauben, während Trainingsdaten und Trainingscode geschlossen bleiben. Dieser Unterschied hat Gewicht in politischen Debatten, in denen offene Gewichte oft als Stellvertreter für Offenheit, Wettbewerb und Prüfbarkeit gelten.
"Modelle mit offenen Gewichten begrenzen Ihre Möglichkeit, das Modell zu verändern, und Sie können es nicht vollständig studieren", heißt es im OSI-Beitrag. Das Gegenbeispiel der Organisation ist Olmo, ein großes Sprachmodell von Ai2, das mit vollständigem Trainingsdatensatz und Modell-Checkpoints veröffentlicht wurde. Forscher konnten damit neue Informationen in die Trainingsdaten einspeisen und beobachten, wie das Modell sie memorierte oder vergaß.
Solche Untersuchungen sind keine akademische Kür. Eine separate Arbeit auf arXiv, "Extracting memorized pieces of (copyrighted) books from open-weight language models", im Mai 2025 eingereicht und bis Juli 2026 überarbeitet, wendet eine Extraktionstechnik auf 200 Bücher und 14 LLMs mit offenen Gewichten in mehr als 3.000 Experimenten an. Die Autoren, darunter A. Feder Cooper, Mark A. Lemley und Percy Liang, fanden, dass die meisten LLMs die meisten Bücher nicht memorieren, weder ganz noch teilweise, dass es aber deutliche Ausnahmen gibt. Llama 3.1 70B memorierte einige Bücher vollständig, so die Arbeit, darunter Harry Potter und der Stein der Weisen. Das ganze Buch lässt sich damit aus den ersten Worten als Prompt nahezu wörtlich extrahieren.
Das Fazit der Arbeit ist für beide Seiten des Urheberrechtsstreits bewusst unbefriedigend: Memorierung variiert je nach Modell und je nach Buch, und die Ergebnisse begünstigen weder Kläger noch Beklagte eindeutig. Offene Gewichte haben diese Messung überhaupt erst möglich gemacht. Geschlossene Modelle lassen sich von außen nicht so untersuchen.
Das praktische Bild ist also unordentlicher als die Sprechpunkte beider Lager. Veröffentlichungen mit offenen Gewichten sind wettbewerbsfähig beim Preis und liegen bei manchen Benchmarks ein oder zwei Punkte hinter der Spitze. Am oberen Ende sind sie teuer im Betrieb, ungleichmäßig dokumentiert und nach der Definition der OSI nicht Open Source. Die Lücke, die Mozilla misst, ist real. Die Lücke, die die OSI beschreibt, zwischen dem Veröffentlichen von Gewichten und dem Veröffentlichen eines wirklich prüfbaren Modells, ist es auch.
Quellen
3- 01China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
- 02Open Weights Are Good. Open Source Is Better.EN
- 03Extracting memorized pieces of (copyrighted) books from open-weight language modelsEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.