Chinesische Open-Modelle stellen auf zwei Entwickler-Gateways die Mehrheit der Tokens
Chinesische KI-Modelle sind 2026 auf OpenRouter und Vercel von einer kleinen Minderheit zur Mehrheit der Tokens geworden. Das zeigen Nutzungsdaten, die CNBC vorliegen. In Washington laufen dazu Untersuchungen.

Zwei Entwickler-Gateways leiten den Verkehr zu vielen Modellanbietern. Inzwischen geht der größte Teil ihrer Tokens an chinesische Labore. Auf OpenRouter entfielen in der Woche des 14. September 57% bis 67% der genutzten Tokens auf chinesische Modelle, nach 6% bis 13% im Februar. Das geht aus Nutzungsdaten hervor, die CNBC vorliegen. Auf Vercel stieg der Anteil im August auf 55%, nach 11% im Januar. CNBC berichtete die Zahlen am 26. September.
Die Zahlen beschreiben Routing, nicht Benchmark-Ergebnisse. Sie sind trotzdem das deutlichste Signal für die Verbreitung, das in diesem Quartal veröffentlicht wurde.
Die Daten von OpenRouter umfassen Unternehmen in den USA, in Europa und in dem, was das Unternehmen "Global South" nennt: 82 Länder in Mittel- und Südamerika, Afrika und Asien. Vercel machte für seine Zahl keine geografische Aufschlüsselung. Etwa die Hälfte der Tokens auf OpenRouter entfällt auf Unternehmen in den USA. Die Gesamtmischung der Plattform wird also nicht von einer einzigen Region bestimmt.
Erst der Preis, dann die Fähigkeiten
Peter Walker, Leiter der Analyse bei OpenRouter, sagte CNBC, die in diesem Jahr veröffentlichten chinesischen Open-Source-Modelle "can credibly perform in advanced agentic use cases, especially in regards to coding, in a way that was just not true in late 2025." Er ergänzte, sie seien "incredibly cost-effective compared to most models from American labs." Harpreet Arora, Leiter der Agentic-Infrastruktur bei Vercel, brachte denselben Punkt in eine Reihenfolge: "Chinese models are becoming capable enough for more tasks at a much lower cost. Once a model meets the quality bar for the job, that price difference becomes compelling." Arora sagte außerdem, Unternehmen wollten für einige schwierigere Aufgaben weiterhin Frontier-Modelle aus den USA. Diese Einschränkung ist wichtig. Der CNBC-Bericht merkt an, dass US-Frontier-Modelle weiterhin mehr Ausgaben insgesamt auf sich ziehen, auch dort, wo sich der Token-Anteil umgedreht hat. Token-Zahlen belohnen billige Arbeit mit hohem Volumen wie Codegenerierung und Agenten-Schleifen. Ausgaben belohnen die teuren Aufrufe, die Kunden für Aufgaben reservieren, bei denen sie sich keinen Fehler leisten können.
In der Gruppe "Global South", die OpenRouter verfolgt, gingen in den vergangenen Wochen mehr als zwei Drittel der Tokens, nämlich 67%, an chinesische Modelle. Daniel Remler, Senior Fellow beim CNAS, sagte CNBC, besonders in Südostasien sei eine deutliche Übernahme möglich, wegen wirtschaftlicher und kultureller Verbindungen nach China und wegen der wachsenden digitalen Infrastruktur. "Anywhere from Lagos to São Paulo to Jakarta where entrepreneurs and governments are looking for cheap, open models, will look first to Chinese AI," sagte er.
Anthropic und OpenAI kündigten beide früher in jener Woche günstigere Modelle an. Dianne Penn, die bei Anthropic die Produktentwicklung für Forschung und Labore leitet, sagte CNBC, das Unternehmen versuche, Antworten "more efficient, so it uses less tokens depending on your effort setting" zu machen.
Washington eröffnet Verfahren
Zwei Ausschüsse des US-Repräsentantenhauses untersuchen die Folgen der wachsenden Verbreitung chinesischer Modelle, wie derselbe Bericht zeigt. Die genannten Sorgen sind Technologiewettbewerb, Sicherheit und Pekings globaler Einfluss. Die USA haben versucht, ihren Vorsprung zu schützen, indem sie chinesischen KI-Firmen über Exportkontrollen den Kauf der fortschrittlichsten Chips untersagen. Washington sorgt sich außerdem um den Fernzugriff auf Nvidia-Chips über Übersee-Rechenzentren und um "Distillation", bei der neue Modelle darauf trainiert werden, ältere, etablierte nachzuahmen. Remler fasste das Risiko eher als Ausrichtungsfrage denn als reine Leistungsfrage. Chinesische KI berge "real economic and security risks for the United States", sagte er CNBC, und "the ultimate concern is that the integration of Chinese AI models pulls countries into a Chinese technology sphere of influence that hardens into geopolitical alignment." KI war ein zentrales Thema, als sich US-Präsident Donald Trump und der chinesische Präsident Xi Jinping in dieser Woche trafen, berichtete CNBC.
Die Verbreitungsdaten stehen neben einer separaten Reihe von Behauptungen über die Aktualität von Modellen. Diese Behauptungen sind schwerer zu prüfen und leichter falsch zu verstehen. Eine am 16. September veröffentlichte Show-HN-Seite, stale.jock.pl, listet Veröffentlichungsdaten und Trainings-Cutoffs für 20 Modelle aus 8 Laboren und zählt ab jedem Datum live hoch. Sie besagt, dass 10 der 20 Modelle einen Cutoff haben, den ihr Labor tatsächlich veröffentlicht, und dass 5 von 8 Laboren, Anthropic, Google DeepMind, Meta, OpenAI und xAI, für mindestens ein Modell auf der Liste einen Cutoff veröffentlicht haben. Die Seite merkt an, dass eine Leerstelle bedeutet, dass die geprüften Anbieterquellen keinen Cutoff belegen, nicht dass keiner existiert.
Ihr eigenes Beispiel ist die klarste Veranschaulichung dieser Lücke. GPT-6 Astra wurde dieser Seite zufolge am 3. September 2026 veröffentlicht, mit Trainingsdaten, die am 30. April 2026 enden, am Starttag also rund vier Monate zurück. Dieselbe Seite berichtet von einem Test, bei dem 16 Modelle jeweils ein Web-Suchwerkzeug über mehr als 2.000 Aufrufe erhielten. Frontier-Modelle entschieden fast jedes Mal richtig. Schwächere Modelle nannten gesicherte Fakten, die sich ohne Prüfung geändert hatten, und suchten im Web nach Dingen wie dem Siedepunkt von Wasser.
Das ist ein Vorbehalt für alle, die Verbreitungszahlen als Qualitätsurteil lesen. Der Token-Anteil misst, wohin Entwickler leiten. Er misst nicht, ob das Modell weiß, welcher Tag ist.
Drei weitere Veröffentlichungen in diesem Monat zeigen in verschiedene Richtungen. Cactus Compute veröffentlichte am 18. September Needle 3, eine Modellfamilie, die nach Unternehmensangaben 9 bis 29 MB große CQ2-Bit-Binärdateien erzeugt, mit einem 4-Schichten-Subnetz, das DeepSeek V4 Flash entsprechen soll, wenn es eine Epoche lang auf Downstream-Aufgaben abgestimmt wird. Das Unternehmen gibt an, auf 360B Tokens eines proprietären strukturierten Datensatzes trainiert zu haben, und meldet 400 bis 4.000 Tokens/s Dekodierung auf einem Raspberry Pi 5. Cua veröffentlichte am 19. September CUA-S1, eine nur als Quellcode unter MIT-Lizenz freigegebene Forschungsveröffentlichung kleiner Modelle für Computer-Use-Entscheidungen, deren Gewichte separat auf Hugging Face liegen. Und am 21. September zeigte ein Projekt namens mini-AGI ein kontinuierlich lernendes Byte-Level-Modell, das auf einer einzelnen GPU mit 8 GB VRAM trainiert, wobei die Gewichte noch nicht veröffentlicht sind und der Lauf 7,14% seines Korpus durchlaufen hat.
Keine dieser drei Veröffentlichungen verändert die Zahlen von OpenRouter oder Vercel. Sie zeigen aber, wohin das kleinere Ende des Marktes drängt: geräteinterne Inferenz, begrenzte Entscheidungen und Trainingsläufe, die auf Hardware passen, die ein einzelner Entwickler besitzt. Ob das die Token-Mischung ändert, ist eine Frage für die nächsten Gateway-Zahlen, nicht für diese.
Quellen
5- 01Chinese AI models surge in global popularity, and Washington is worriedEN
- 02How stale is your AI? Release age and training cutoff for 20 modelsEN
- 03Needle 3: 8-29 MB foundation model for tiny devicesEN
- 04CUA-S1: A System One Model for Computer UseEN
- 05mini-AGI: continual learning model trained on 8GB VRAMEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.