Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Chinesische Open-Weight-Modelle legen vor: neue Zahlen zur tatsächlichen Nutzung

Chinesische KI-Modelle kamen in der Woche des 14. September 2026 auf 57% bis 67% aller Tokens bei OpenRouter, nach 6% bis 13% im Februar. Das zeigen Nutzungsdaten, über die CNBC am 26. September berichtete.

KI & ModelleErklärtKatrin HoffmannVeröffentlicht: 28. September 20266 Min. LesezeitQuellen 5
Chinesische Open-Weight-Modelle legen vor: neue Zahlen zur tatsächlichen Nutzung

Zwei Benchmark-Tabellen erzählen inzwischen die Geschichte des Rennens um KI-Modelle. Die eine misst, wie gut Modelle in Tests sind. Die andere misst, für welche Modelle Entwickler tatsächlich bezahlen. Im Jahr 2026 bewegte sich die zweite Tabelle zuerst, und sie bewegte sich in Richtung chinesischer Open-Weight-Veröffentlichungen.

Nutzungsdaten, die CNBC vorlagen und am 26. September veröffentlicht wurden, zeigen einen Wechsel auf zwei Entwickler-Gateways: OpenRouter und Vercel. Chinesische Modelle waren dort von einer kleinen Minderheit des Verkehrs zur Mehrheit geworden. Bei OpenRouter entfielen auf sie in der Woche des 14. September 57% bis 67% der genutzten Tokens, nach 6% bis 13% im Februar. Bei Vercel stieg der Anteil im August auf 55%, nach 11% im Januar. Die Zahl von OpenRouter umfasst Unternehmen in den USA, in Europa und in dem, was das Unternehmen als "Global South" definiert, 82 Länder in Mittel- und Südamerika, Afrika und Asien. Vercel machte keine Angaben zur geografischen Verteilung.

Das ist nicht dasselbe wie eine Qualitätsführerschaft. CNBC berichtete, dass die fortschrittlichsten US-Modelle weiterhin die meisten Benchmarks anführen und dass Frontier-Modelle aus den USA weiterhin mehr Gesamtausgaben auf sich ziehen.

Erst der Preis, dann die Kompetenz

Peter Walker, Leiter der Analyse bei OpenRouter, sagte CNBC, die in diesem Jahr veröffentlichten chinesischen Open-Source-Modelle "can credibly perform in advanced agentic use cases, especially in regards to coding, in a way that was just not true in late 2025." Sie seien zudem "incredibly cost-effective compared to most models from American labs." Harpreet Arora, Leiter der agentischen Infrastruktur bei Vercel, beschrieb den Mechanismus gegenüber CNBC nüchtern: "Chinese models are becoming capable enough for more tasks at a much lower cost. Once a model meets the quality bar for the job, that price difference becomes compelling." Arora sagte außerdem, Unternehmen wollten für einige kompliziertere Aufgaben weiterhin Frontier-Modelle aus den USA. Der Wandel hängt also an bestimmten Arbeitslasten und ist kein vollständiger Wechsel.

Dianne Penn, bei Anthropic für Produktmanagement in Forschung und Labs zuständig, sagte CNBC, das Unternehmen versuche, seine Modelle "more efficient, so it uses less tokens depending on your effort setting" antworten zu lassen. OpenAI und Anthropic kündigten in der Woche vor dem CNBC-Bericht beide günstigere Modelle an. Zusammen mit den Nutzungszahlen gelesen ist das eine Preisreaktion auf ein Preisproblem.

Wer tatsächlich wechselt

Die Geografie ist wichtig. Unternehmen in dem, was OpenRouter als Global South definiert, waren die größten Nutzer chinesischer KI-Modelle in seinem System; 67% der Tokens, die diese Unternehmen verwenden, entfallen auf chinesische Modelle. Etwa die Hälfte aller Tokens bei OpenRouter wird von Unternehmen in den USA genutzt.

Daniel Remler, Senior Fellow im Programm für Technologie und nationale Sicherheit am Center for a New American Security, sagte CNBC, der chinesische KI-Ausbau stelle "real economic and security risks for the United States" dar. Seine erklärte Sorge gilt nicht den Benchmark-Werten: "The ultimate concern is that the integration of Chinese AI models pulls countries into a Chinese technology sphere of influence that hardens into geopolitical alignment." Remler sagte, besonders in Südostasien sei eine erhebliche Verbreitung möglich, angesichts wirtschaftlicher und kultureller Verbindungen zu China, und "anywhere from Lagos to São Paulo to Jakarta where entrepreneurs and governments are looking for cheap, open models, will look first to Chinese AI."

Zwei Ausschüsse des US-Repräsentantenhauses untersuchen laut CNBC die Folgen der steigenden Verbreitung chinesischer Modelle, und die USA haben chinesischen KI-Unternehmen durch Exportkontrollen den Kauf der fortschrittlichsten Chips untersagt. Zu den Sorgen Washingtons gehören der Fernzugriff auf Nvidia-Chips über Übersee-Rechenzentren und "distillation", bei der neue Modelle ältere, etabliertere nachahmen. KI war ein zentrales Thema, als sich US-Präsident Donald Trump und der chinesische Präsident Xi Jinping in der Woche des Berichts trafen, so CNBC.

Das Problem der veralteten Daten darunter

Es gibt ein zweites, leiseres Problem damit, wie Modellveröffentlichungen beurteilt werden, und es hat nichts mit Geopolitik zu tun. Ein Veröffentlichungsdatum ist der Tag, an dem ein Labor ein Modell ausgeliefert hat. Der Trainings-Cutoff ist der Zeitpunkt, an dem es aufhörte zu lesen. Die Lücke zwischen beiden zeigt, wie weit das Modell am Tag des Starts bereits zurücklag.

Eine am 16. September veröffentlichte Seite, "How stale is your AI?", listet Veröffentlichungsdaten und Trainings-Cutoffs für 20 Modelle aus 8 Labors auf. GPT-6 Astra, das die Seite auf den 3. September 2026 datiert, hat einen Trainings-Cutoff vom 30. April 2026. GPT-6 Sol hat einen Cutoff vom 20. April 2026, GPT-6 Luna vom 18. Mai 2026. Claude Opus 5.5 und Claude Fable 5.1 hören beide im Juni 2026 auf zu lesen. Zehn der 20 Modelle auf dieser Seite tragen einen Cutoff, den ihr Labor veröffentlicht; der Rest ist mit "not established" gekennzeichnet. Laut der Seite bedeutet das, dass die geprüften Anbieterquellen keinen festgestellt haben, nicht dass kein Cutoff existiert.

"A blank means the checked vendor sources did not establish a cutoff for that model; it is not proof that the lab has never published one."

Die Seite berichtet außerdem von einem Test, ob Modelle zu einem Suchwerkzeug greifen, wenn sie es sollten. Bei über 2.000 Aufrufen über 16 Modelle hinweg, jedes mit einem Web-Suchwerkzeug ausgestattet, entschieden Frontier-Modelle fast immer richtig. Schwächere Modelle dagegen beantworteten Fragen aus dem Gedächtnis, deren Antwort sich geändert hatte, und durchsuchten für Dinge wie den Siedepunkt von Wasser das Web. Bei einem Prompt über den König von Norwegen nannten laut der Seite fünf Modelle einen Toten.

Die Suche behebt das nicht, argumentiert die Seite, weil das Modell vergisst, was es gelesen hat, wenn die Sitzung endet, und weil die Entscheidung zu suchen auf denselben Gewichten läuft, die die veraltete Tatsache tragen.

Der Gegenpunkt der kleinen Modelle

Nicht jede Veröffentlichung in derselben Woche jagt Skalierung. Cactus veröffentlichte Needle 3 am 18. September, ein Foundation-Modell für winzige Geräte mit 9 bis 29 MB großen CQ2-Bit-Binärdateien und einer gestaffelten Architektur von 29M bis 121M Parametern. Die Dokumentation behauptet, dass das 4-Schichten-Subnetz mit DeepSeek V4 Flash mithalten kann, wenn es eine Epoche lang auf Downstream-Aufgaben abgestimmt wird, und berichtet 400 bis 4.000 Tokens/s Dekodierung auf einem Raspberry Pi 5.

Am 21. September veröffentlichte ein Projekt namens mini-AGI ein kontinuierlich lernendes Byte-Level-Sprachmodell, das von Grund auf auf einer einzelnen GPU mit 8 GB VRAM trainiert wurde und einen Datenstrom liest. Das README nennt es "a small toy-level model" und sagt, die Gewichte seien noch nicht veröffentlicht, weil der Lauf noch in seinem ersten Durchgang über den Korpus ist. Der bisher niedrigste Hold-out-Verlust liegt bei 0.7417 Nats, oder 1.0700 Bits pro Zeichen, bei 562.9M von 7,879M Zeichen, 7.14% durch die Daten.

Am selben Tag veröffentlichte Cua CUA-S1 als reine Quellcode-Forschung: kleine, spezialisierte "System 1"-Modelle für Computer-Nutzungsentscheidungen wie die Wahl, welcher Wert in ein Feld gehört. Das Unternehmen beschreibt es als technische Analogie für schnelle, begrenzte Entscheidungen, nicht als Ersatz für die Planung eines Allzweck-Agenten.

Keines dieser drei wird eine Benchmark-Tabelle anführen. Das ist der Punkt. Der Veröffentlichungszyklus läuft inzwischen auf mehreren Spuren gleichzeitig, und die mit der schnellsten Verbreitung ist nicht die mit den besten Werten.

Kommentare 0

Quellen

5
  1. 01Chinese AI models surge in global popularity — and Washington is worriedEN
  2. 02How stale is your AI? Release age and training cutoff for 20 modelsEN
  3. 03Needle 3 - 8-29 MB foundation model for tiny devicesEN
  4. 04mini-AGI: Continual learning model trained from scratch on 8GB VRAMEN
  5. 05CUA-S1 – A System One Model for Computer UseEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.