Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Mozilla-Bericht: Chinas beste Open-Weight-Modelle liegen rund 4,4 Monate hinter der US-Spitze

Die besten chinesischen Open-Weight-Modelle liegen inzwischen rund 4,4 Monate hinter den führenden US-Angeboten. Das steht in Version 1.1 von Mozillas Bericht State of Open Source AI, der am 15. September erschien und dessen Datenstand der 1. September ist.

KI & ModelleNachrichtKatrin HoffmannVeröffentlicht: 28. September 20267 Min. LesezeitQuellen 4
Mozilla-Bericht: Chinas beste Open-Weight-Modelle liegen rund 4,4 Monate hinter der US-Spitze

Mozilla hat die Task-Horizon-Daten von METR angepasst und kommt damit auf eine Lücke von etwa 4,4 Monaten zwischen offenen und geschlossenen Modellen. Das deckt sich mit der Vier-Monats-Schätzung von Epoch AI, wie Tom's Hardware am 16. September berichtete. METR ist ein gemeinnütziges Forschungsinstitut. Es bewertet Modelle danach, wie lang eine Aufgabe in menschlicher Arbeitszeit ist, die sie in der Hälfte der Fälle bewältigen.

Nach Mozillas angepasster Schätzung schaffen geschlossene Modelle Aufgaben, für die menschliche Experten 8 bis 12 Stunden brauchen. Offene Modelle erreichen das etwa vier Monate später. Mozilla zufolge verdoppelt sich die Leistungsfähigkeit offener Modelle alle 3,9 Monate, bei geschlossenen dauert das 5,5 Monate.

Der Bericht ist eine wiederkehrende Einschätzung und erschien erstmals am 14. Juli im Mozilla-Blog. Grundlage sind eine Umfrage von Mozilla und SlashData unter rund 1.400 Entwicklern, Verkehrsdaten von OpenRouter und Benchmark-Indizes Dritter. Mozilla tritt für offene Modelle ein. TIME berichtete am 14. Juli, Raffi Krikorian, Mozillas Chief Technology Officer, habe den Bericht als teils advocacy beschrieben.

"Open weights" bedeutet in diesem Zusammenhang herunterladbare Gewichte, nicht Trainingsdaten oder Code. Der Bericht zählt 16 nennenswerte offene Veröffentlichungen. Keine davon liefert das Datenrezept, das die Definition der Open Source Initiative verlangt.

Benchmarks und Preise erzählen unterschiedliche Geschichten

Auf dem Artificial Analysis Intelligence Index lag das beste offene Modell drei Punkte hinter dem geschlossenen Spitzenreiter, bei 60% des Preises. Hinter Claude Fable 5 lag es zwei Punkte zurück, bei 30% des Preises. So liest Tom's Hardware den Bericht.

Mozilla hat außerdem die Ergebnisse von vals.ai im Terminal-Bench 2.1 erfasst. Dort läuft jedes Modell durch denselben Harness, also die Softwareschicht, die einem Modell seine Werkzeuge bereitstellt. In dieser Tabelle lag Z.ais GLM-5.2 innerhalb eines Punktes von Claude Opus 4.7 und etwa vier Punkte hinter Opus 4.8, bei weniger als einem Fünftel der Kosten pro Test.

Auf OpenRouter, einem Marktplatz, der Entwicklerverkehr zu Hunderten von Modellen leitet, zählte Mozilla acht der zehn Modelle mit dem höchsten Token-Volumen im August zu den offenen Gewichten, sieben davon chinesisch gebaut. Geschlossene Anbieter nahmen zwischen Mai und September 2025 dennoch 96% der Einnahmen auf Modellebene auf OpenRouter ein, wie die Linux Foundation berichtete.

"Wir sehen die Entscheidung, für geschlossene [Modelle] zu zahlen, als arbeitslastspezifisch und nicht als organisationsspezifisch", sagte Krikorian per E-Mail zu Ars Technica.

Mozillas eigene Bildunterschrift ist deutlich, was die Haltbarkeit der Schlagzeilenzahl angeht: "die Lücke setzt sich mit jedem Release-Zyklus zurück."

Die Vier-Monats-Zahl hat Einschränkungen

Eine Einschränkung: Die Vier-Monats-Lücke und die 30%-Token-Preisangabe werden API zu API auf gehosteten Endpunkten und zum Listenpreis gemessen. Die Hardware-Grafik des Berichts setzt das beste offene Modell, das auf einen Server passt, bei 52,6 und das beste auf einer GPU bei 40. Der Abfall von der Spitze beträgt 10 bzw. 23 Punkte, eine größere Lücke als die berichteten vier Monate.

Die andere Hürde sind die Serving-Anforderungen. Der native MXFP4-Checkpoint von Kimi K3 läuft über etwa 1,56TB verteilt auf 96 Shards. Mozillas Serving-Konfiguration listet 64 oder mehr Beschleuniger, während vLLM mindestens acht GB300 GPUs verlangt, mit mehreren Knoten für Produktionsverkehr.

Der Bericht beschreibt das als offen, aber für die meisten, die es besitzen, nicht lauffähig. Tom's Hardware bezifferte den Speicherbedarf im Juli auf nahe 1,5TB.

Eine Ausnahme ist Thinking Machines' Modell Inkling-Small unter der Apache-2.0-Lizenz. Seine NVFP4-Version passt auf einen B300 mit 180GB Untergrenze.

An eines der Modelle ist zudem ein Herkunftsstreit geknüpft. K3 trägt eine Behauptung, die in der gemeinsamen Warnung von NSA, CISA und FBI vom 8. September (AA26-251A) ausgeführt wird. Der Vorwurf, den Mozillas Bericht als "behauptet und nicht gezeigt" wiedergibt, lautet: Moonshot habe Claude Fable 5-Daten extrahiert, um K3 durch Destillation zu trainieren, also das Trainieren eines Modells auf den Ausgaben eines anderen.

Mozillas Daten enden am 1. September. Seitdem hat Artificial Analysis seinen Index auf v4.3 mit einem anderen Evaluierungssatz umgestellt. Die aktuelle Tabelle führt Claude Fable 5.1 mit 53 auf seiner höchsten Effort-Einstellung und Kimi K3 mit 44. Diese Zahlen sind nicht vergleichbar mit den v4.1.1-Zahlen, die Mozilla aufgetragen hat. Die Tabelle von vals.ai im Terminal-Bench 2.1, aktualisiert am 11. September, wird nun von GPT-6 Astra mit 87,27% angeführt, mit Fable 5.1 bei 85,02%.

Zur Einordnung, wie schnell sich diese Ranglisten bewegen: Am 17. Juli hatte Artificial Analysis K3 bei 57 gegenüber Fable 5 bei 60. Am 1. September sah Mozilla es zwei Punkte dahinter.

Der Definitionsstreit unter den Zahlen

Mozilla misst eine Fähigkeitslücke. Die Open Source Initiative hält das für den falschen Maßstab. In einem Blogbeitrag vom 19. September schrieb der OSI-Präsident (im Beitrag ohne Namensnennung), offene Gewichte erlaubten Nutzern, einige der vier Softwarefreiheiten auszuüben: die Freiheit zu nutzen, zu studieren, zu verändern und zu teilen, ohne den Rechteinhaber um Erlaubnis zu fragen. Aber nicht alle, und nur bis zu einem gewissen Grad.

KI-Modelle bestehen laut OSI aus drei Hauptkomponenten: Trainingsdaten, Gewichte und Parameter sowie Code für Datenaufbereitung und Training. Der Zugang eines Nutzers zu diesen Komponenten entscheidet, ob ein Modell geschlossen, Open-Weight oder Open Source ist. Open-Weight-Veröffentlichungen teilen die Gewichte. Nutzer können ein Modell damit lokal laufen lassen, einen Dritten mit dem Hosting beauftragen oder es auf eigenen Daten feinabstimmen. Sie teilen weder den Code noch die Trainingsdaten.

Die OSI räumt ein, dass offene Gewichte mehr Wahlfreiheit bieten als vollständig geschlossene Systeme wie ChatGPT, Claude und viele autonome Fahrsysteme. Ihr Einwand betrifft die Überprüfbarkeit. Ohne den Code und die Trainingsdaten, so argumentiert die OSI, lässt sich ein Modell nicht vollständig untersuchen, um eine Ausgabe zu erklären oder zu bestätigen, dass man ihm trauen kann.

Der Beitrag nennt Ai2s Olmo als Beispiel für die strengere Kategorie. Forscher nutzten den vollständigen Trainingsdatensatz und die Modell-Checkpoints, um neue Informationen in die Trainingsdaten einzuspeisen und dann zu beobachten, wie das Modell sie memorierte oder vergaß, schrieb die OSI. Eine solche Studie sei nur bei einer Open-Source-AI-Veröffentlichung möglich, argumentiert die Organisation.

Der Unterschied ist nicht akademisch. Mozillas Bericht zählt 16 nennenswerte offene Veröffentlichungen und findet keine, die das Datenrezept liefert, das die Open Source Initiative verlangt.

Kleine Modelle, enge Aufgaben

Abseits der Frontier-Debatte sind einige Open-Weight-Veröffentlichungen bewusst klein und auf einen Zweck zugeschnitten. Superwhisper veröffentlichte S1-mini, einen Text-Normalisierer mit 0,6B Parametern für Speech-to-Text-Ausgaben, laut seiner Modellkarte auf Hugging Face.

Er nimmt ein rohes ASR-Transkript und schreibt es als sauberen geschriebenen Text um: Füllwörter entfernt, Fehlstarts auf den Wert aufgelöst, bei dem der Sprecher gelandet ist, Interpunktion und Großschreibung angewendet, und gesprochene Zahlen, Daten, Zeiten, Währungen und E-Mail-Adressen in geschriebener Form wiedergegeben.

Auf einem zurückgehaltenen Satz von 7.519 englischen Fällen erreicht er 94,8% Token-Genauigkeit. Der quantisierte Build ist eine 462 MiB große Datei, die auf einer Laptop-CPU läuft. Er ist von Qwen/Qwen3-0.6B feinabgestimmt und trägt eine Apache-2.0-Lizenz plus eine Namensklausel. Die Modellkarte stellt ausdrücklich klar, dass dies kein Chat-Modell ist und allgemeinen Anweisungen nicht folgen wird.

Ein ähnliches Muster zeigt sich in einer Deployment-Beschreibung vom 22. September von James Cruce auf ASTGL. Er ersetzte einen deterministischen Router durch Laya, ein offenes typisiertes Entscheidungsmodell mit etwa 421 Millionen Parametern. Es basiert auf einem ModernBERT-large-Encoder mit einem Limit von 1.024 Token und läuft über eine reine Loopback-API auf einem Mac Studio mit M3 Ultra und 256 GB Unified Memory.

Er entschied sich dafür statt für TypeSafe's Jev, einen Hosted Service im Early Access. Jev listet 0,042 US-Dollar pro Million Input-Token ohne Ausgabe-Token-Gebühr und unterstützt Entscheidungen mit bis zu 255 Optionen. Cruce wollte Routineentscheidungen auf seiner Maschine behalten. Er ist vorsichtig damit, was das Ergebnis zeigt: Das Modell schlug seinen deterministischen Router in einer eingefrorenen Wiederholung, doch er testete nicht, ob Laya generell Jev schlägt.

Er benennt außerdem eine Grenze, die für jede Zahl im Mozilla-Bericht gilt. Die Modellkarte warnt, Laya sei überconfident und brauche domänenspezifische Kalibrierung. Eine typisierte Antwort, schreibt er, kann strukturell perfekt und faktisch falsch sein.

Kommentare 0

Quellen

4
  1. 01China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
  2. 02Open Weights Are Good. Open Source Is Better.EN
  3. 03S1-mini, Superwhisper's first open-weights language modelEN
  4. 04Local Laya vs Hosted Jev: Why My Agents Make Typed Decisions on My MacEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.