Nicht das Veröffentlichungsdatum zählt: Trainings-Cutoffs und Nutzungszahlen verschieben die Maßstäbe für KI-Modelle
Zehn der 20 aktuellen KI-Modelle auf stale.jock.pl tragen einen Trainings-Cutoff, den ihr eigenes Labor veröffentlicht. Auf OpenRouter stieg der Anteil chinesischer Modelle von 6% bis 13% der Tokens im Februar 2026 auf 57% bis 67% in der Woche des 14. September. Beide Zahlen fehlen in jeder Standard-Benchmark-Tabelle.

Eine Benchmark-Tabelle sagt, welche Punktzahl ein Modell erreicht hat. Sie sagt nicht, wann das Modell aufgehört hat zu lesen. Diese Lücke zwischen dem Veröffentlichungsdatum in einem Launch-Post und dem Trainings-Cutoff, der in einer Modellkarte vergraben ist, gehört inzwischen zu den nützlicheren Zahlen, die ein Käufer nachschlagen kann. Sie ist die Grundlage eines kleinen Werkzeugs, das am 16. September auf stale.jock.pl unter dem Titel "How stale is your AI?" erschienen ist.
Die Seite listet 20 aktuelle Modelle aus 8 Labors und stellt jedem Veröffentlichungsdatum einen Trainings-Cutoff gegenüber, wobei beide ab dem jeweiligen Datum hochgezählt werden. Zehn der 20 haben einen Cutoff, den das Labor tatsächlich veröffentlicht. Fünf der acht Labors, Anthropic, Google DeepMind, Meta, OpenAI und xAI, haben für mindestens ein Modell auf der Liste einen veröffentlichten Cutoff. Die übrigen sind mit "Not established" markiert. Das bedeutet laut Seite nicht, dass das Labor nie einen veröffentlicht hat, sondern nur, dass die geprüften Herstellerquellen keinen zutage förderten.
Einige der Lücken sind groß.
GPT-6 Astra, am 3. September 2026 von OpenAI veröffentlicht, hat einen Trainings-Cutoff vom 30. April 2026. Es war am Tag seiner Auslieferung bereits vier Monate im Rückstand. Gemini 3.1 Pro, veröffentlicht am 19. Februar 2026, endet im Januar 2025, eine Lücke von mehr als einem Jahr. Claude Sonnet 5, erschienen am 30. Juni 2026, hat einen Cutoff vom Januar 2026; Claude Opus 5.5, erschienen am 22. September 2026, hat Juni 2026. Llama 4 von Meta, veröffentlicht am 5. April 2025, trägt einen Cutoff vom August 2024.
Das zentrale Argument der Seite lautet, dass ein Suchwerkzeug das nicht behebt. Wenn ein Modell das Web durchsucht, liest es ein paar Seiten, nutzt sie für diese eine Antwort und vergisst sie, heißt es auf der Seite. Die Suche muss außerdem vom Modell selbst ausgelöst werden, mit denselben Gewichten, die das veraltete Faktum enthalten. Fehler häufen sich also dort, wo das Modell am sichersten ist. Der Autor berichtet, 16 Modelle über 2.000 Aufrufe durch ein Websuchwerkzeug geschickt zu haben. Frontier-Modelle entschieden sich fast jedes Mal korrekt zu suchen. Schwächere Modelle beantworteten abgeschlossene Fragen aus dem Gedächtnis, nachdem sich die Antwort geändert hatte, und durchsuchten das Web nach Dingen wie dem Siedepunkt von Wasser. In einem Beispiel nannten fünf der 16 einen Toten als König von Norwegen.
Nichts davon ist peer-reviewt. Die Seite ist ein Show-HN-Projekt, die Zahlen stammen aus dem eigenen Testaufbau des Autors, und die Modellliste ist eine Momentaufnahme, kein Zensus. Der zugrunde liegende Punkt hängt jedoch nicht davon ab, ob das Experiment Bestand hat. Ein Modell, das im September startete und einen April-Cutoff hat, liegt beim September falsch, und eine Benchmark-Punktzahl zeigt das nicht.
In derselben Woche gibt es ein zweites, schwerer zu ignorierendes Signal, und es betrifft die Frage, welche Modelle tatsächlich genutzt werden. CNBC berichtete am 26. September, dass chinesische Modelle von einem kleinen Nutzungsanteil zur Mehrheit auf zwei Entwickler-Gateways wurden. Auf OpenRouter machten sie in der Woche des 14. September 57% bis 67% der Tokens aus, nach 6% bis 13% im Februar. Auf Vercel stieg ihr Anteil im August auf 55%, nach 11% im Januar.
Die Zahlen von OpenRouter erfassen Unternehmen in den USA, Europa und dem, was das Unternehmen als "Global South" definiert, 82 Länder in Mittel- und Südamerika, Afrika und Asien. Vercel gab keine geografische Aufschlüsselung. Derselbe Bericht hält fest, dass US-Frontier-Modelle weiterhin mehr Gesamtausgaben auf sich ziehen. Token-Anteil und Umsatzanteil zeigen also in unterschiedliche Richtungen.
Peter Walker, Head of Insights bei OpenRouter, sagte CNBC, chinesische Open-Source-Modelle, die in diesem Jahr erschienen sind, "can credibly perform in advanced agentic use cases, especially in regards to coding, in a way that was just not true in late 2025", und sie seien "incredibly cost-effective compared to most models from American labs". Harpreet Arora, Head of Agentic Infrastructure bei Vercel, brachte den Mechanismus auf den Punkt: Sobald ein Modell die Qualitätsschwelle für eine Aufgabe erreicht, werde der Preisunterschied zwingend.
Washington schaut zu. Zwei Ausschüsse des US-Repräsentantenhauses untersuchen die steigende Nutzung chinesischer Modelle. CNBC berichtet von Sorge über Fernzugriff auf Nvidia-Chips über Übersee-Rechenzentren und über Destillation, bei der neuere Modelle ältere nachahmen. Daniel Remler vom Center for a New American Security sagte CNBC, die "ultimate concern is that the integration of Chinese AI models pulls countries into a Chinese technology sphere of influence that hardens into geopolitical alignment".
Stellt man die beiden Geschichten nebeneinander, ändert die Benchmark-Frage ihre Form.
Ein Leaderboard misst ein Modell an einem festen Aufgabensatz an dem Tag, an dem es getestet wird. Es misst nicht, wie weit das Wissen des Modells von der Gegenwart abgedriftet ist, und es misst nicht, ob sich der Betrieb in großem Umfang überhaupt lohnt. Die Seite stale.jock.pl argumentiert, Modelle seien schlechte Quellen über sich selbst, und schlägt vor, einen Agenten auf eine maschinenlesbare models.json-Datei zu richten, bevor er ein Modell, eine Version oder ein Datum als aktuell bezeichnet. Das ist eine kleine Korrektur. Das größere Problem ist, dass das Standardbeweisstück der Branche, die Benchmark-Tabelle, sowohl zur Aktualität als auch zum Preis schweigt.
Nvidia setzt laut Rest of World auf eine verwandte Wette. Das Unternehmen zahlte letzten Monat 7 Milliarden Dollar für eine Beteiligung am US-Coding-Startup Poolside und eine Lizenz auf dessen Werkzeuge zum Modellbau und hat zugestimmt, fast 13 Milliarden Dollar für Hugging Face zu zahlen. Das eigene kostenlose Modell, voraussichtlich Nemotron 4 genannt, soll bis Ende des Jahres erscheinen. Der Bericht besagt, frühere offene US-Modelle hätten hinter Chinas kostenlosen Modellen zurückgelegen, die in diesem Jahr laut einem Hugging-Face-Bericht vom August rund 2 Milliarden Mal heruntergeladen wurden. Nvidias Ausgaben sollen Nemotron zur Basis machen, die Regierungen wählen, statt der von Meta oder Alibaba.
Die VAE ist der Testfall. Ihr Flaggschiff-Rechenzentrum soll mit 400.000 Nvidia-Chips laufen, und G42, das staatlich gestützte KI-Unternehmen, trat im Juli Nvidias Open-Model-Allianz bei. Das Technology Innovation Institute, das Falcon gebaut hat, vertritt die andere Seite. "As a model-building lab, we believe that maintaining diversity in AI perspectives, and preserving full technological sovereignty, requires a strong, homegrown foundation", sagte TII-Chefforscher Hakim Hacid zu Rest of World.
Keine der beiden Positionen wird durch einen Benchmark entschieden. Ein Land oder ein Unternehmen, das ein Basismodell wählt, wählt eine Lieferkette, eine Kostenkurve und einen Erneuerungsrhythmus. Der veröffentlichte Cutoff ist eine der wenigen harten Zahlen, die es zu letzterem gibt.
Quellen
3- 01Show HN: How stale is your AI? Release age and training cutoff for 20 modelsEN
- 02Chinese AI models surge in global popularity — and Washington is worriedEN
- 03Nvidia's free AI model could push the UAE closer to the U.S.EN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.