Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

KI-Modelle erscheinen immer schneller, doch die Benchmarks kommen nicht mit

Zehn der 20 aktuellen Modelle, die stale.jock.pl erfasst, kommen ohne veröffentlichten Trainings-Cutoff. Chinesische Modelle holten in der Woche des 14. September 57 bis 67 Prozent der Token auf OpenRouter.

KI & ModelleAnalyseLena BrandtVeröffentlicht: 28. September 20267 Min. LesezeitQuellen 3
KI-Modelle erscheinen immer schneller, doch die Benchmarks kommen nicht mit

Zwischen dem 1. und dem 22. September 2026 kamen sechs Modelle auf den Markt. Das geht aus dem Modell-Tracker von stale.jock.pl hervor. Er listet Veröffentlichungsdaten und Trainings-Cutoffs für 20 aktuelle Modelle aus acht Labors. Allein OpenAI lieferte am 22. September drei: GPT-6 Sol, GPT-6 Luna und Claude Opus 5.5 von Anthropic am selben Tag, wie aus der Tabelle des Trackers und aktuellen Schlagzeilen hervorgeht. Der Veröffentlichungskalender für Frontier-Modelle wird inzwischen in Tagen gemessen, nicht in Quartalen.

Doch das Instrument, mit dem diese Modelle beurteilt werden, hält nicht Schritt. Trainings-Cutoffs, also die Daten, an denen ein Modell aufgehört hat zu lesen, sind nur für die Hälfte der Modelle auf dieser Liste veröffentlicht. Fünf der acht Labors, Anthropic, Google DeepMind, Meta, OpenAI und xAI, geben für mindestens ein Modell einen Cutoff an, heißt es im Tracker. Ein leerer Eintrag bedeutet, dass die geprüften Quellen der Anbieter keinen Cutoff belegen, nicht dass keiner existiert.

Die Lücke zwischen Auslieferung und Wissen

Der Tracker formuliert es selbst deutlich: Zwei Daten entscheiden, wie aktuell ein Modell wirklich ist. Das Veröffentlichungsdatum ist der Tag, an dem das Labor es ausgeliefert hat; der Trainings-Cutoff ist der Tag, an dem es aufgehört hat zu lesen. GPT-6 Astra, veröffentlicht am 3. September 2026, hat laut der Seite einen Cutoff vom 30. April 2026. Am Starttag lag es also rund vier Monate zurück. Claude Fable 5.1, veröffentlicht am 1. September 2026, trägt einen Cutoff vom Juni 2026. Gemini 3.1 Pro, veröffentlicht am 19. Februar 2026, hörte im Januar 2025 auf zu lesen, mehr als ein Jahr vor seiner Auslieferung.

Ein Modell kann im September erscheinen und trotzdem im April aufgehört haben zu lesen, was bedeutet, dass es am Tag seines Starts fünf Monate zurückliegt.

Diese Lücke wiegt schwerer, je stärker die Veröffentlichungszyklen schrumpfen. Mistral AI lieferte Mistral Large 3 am 2. Dezember 2025, Mistral Small 4 am 16. März 2026 und Mistral Medium 3.5 am 28. April 2026, keines mit veröffentlichtem Cutoff, so der Tracker. Auch Alibabas Qwen3.8-Max (3. August 2026), Qwen3.8-Flash (26. August 2026) sowie DeepSeeks V4-Pro (13. August 2026) und V4.1-Flash (10. September 2026) sind ohne veröffentlichten Cutoff gelistet. Dasselbe gilt für Metas Muse Glimmer und Muse Spark 1.3 und für Google DeepMinds Gemini 3.8 Flash.

Suchwerkzeuge schließen die Lücke nicht, argumentiert die Seite. Ein Modell, das das Web durchsucht, liest ein paar Seiten, nutzt sie in einer Antwort und vergisst sie; öffnet man einen neuen Chat, ist es wieder auf seinem Cutoff. Schlimmer noch: Die Suche muss vom Modell selbst ausgelöst werden, mit denselben Gewichten, die die veraltete Tatsache tragen. So landen Fehler dort, wo das Modell sich am sichersten fühlt. Die Seite zitiert eine Messung von über 2.000 Aufrufen über 16 Modelle, jedem mit einem Web-Suchwerkzeug ausgestattet: Frontier-Modelle entschieden fast immer richtig, schwächere gaben geklärte Fakten an, die sich geändert hatten, und suchten im Web nach Dingen wie dem Siedepunkt von Wasser.

Die Nutzung verschiebt sich schneller als die Benchmarks

Während die Labors um Veröffentlichungen rennen, erzählen die Nutzungsdaten eine andere Geschichte darüber, zu welchen Modellen Entwickler tatsächlich greifen. Chinesische KI-Modelle stiegen 2026 von einem kleinen Anteil zu einer Mehrheit auf zwei großen Entwicklerplattformen, berichtet CNBC unter Berufung auf Nutzungsdaten, die dem Sender vorlagen. Auf OpenRouter entfielen in der Woche des 14. September 57 bis 67 Prozent der genutzten Token auf chinesische Modelle, gegenüber 6 bis 13 Prozent im Februar. Auf Vercel stieg ihr Anteil im August auf 55 Prozent, von 11 Prozent im Januar.

Die Übernahme konzentriert sich auf das, was OpenRouter als Globalen Süden definiert, 82 Länder in Mittel- und Südamerika, Afrika und Asien. Mehr als zwei Drittel der Token, die diese Unternehmen verbrauchen, gehen an chinesische Modelle, berichtete CNBC. Etwa die Hälfte der Token auf OpenRouter wird von Unternehmen in den USA genutzt.

Der Preis ist der Treiber, sagen Personen, mit denen CNBC sprach. Peter Walker, Leiter der Analysen bei OpenRouter, sagte dem Sender, chinesische Open-Source-Modelle, die dieses Jahr erschienen, "können glaubhaft in fortgeschrittenen agentischen Anwendungsfällen bestehen, besonders beim Coding, was Ende 2025 schlicht nicht stimmte". Sie seien zudem "unglaublich kosteneffizient im Vergleich zu den meisten Modellen amerikanischer Labors", sagte er. Harpreet Arora, Leiter der agentischen Infrastruktur bei Vercel, sagte CNBC, sobald ein Modell die Qualitätslatte für eine Aufgabe erreiche, werde der Preisunterschied überzeugend, wobei Unternehmen für kompliziertere Aufgaben weiterhin Frontier-Modelle aus den USA wollen.

Anfang dieser Woche kündigten OpenAI und Anthropic beide neue, günstigere Modelle an, berichtete CNBC. Dianne Penn, Leiterin des Produktmanagements für Forschung und Labors bei Anthropic, sagte dem Sender, das Unternehmen versuche, die Antworten seiner Modelle "effizienter zu machen, sodass je nach Aufwandsstufe weniger Token verbraucht werden".

Washington beobachtet die Token-Zahlen

Die Verschiebung erregt in Washington Aufmerksamkeit, wo zwei Ausschüsse des US-Repräsentantenhauses die Auswirkungen der wachsenden Verbreitung chinesischer Modelle untersuchen, berichtete CNBC. Die USA haben chinesischen KI-Unternehmen durch Exportkontrollen den Kauf der fortschrittlichsten Chips untersagt; Washington sorgt sich, dass sie über Datenzentren im Ausland remote auf Nvidia-Chips zugreifen, und über "Destillation", bei der neue Modelle ältere, etabliertere nachahmen.

Chinesische KI stelle "echte wirtschaftliche und sicherheitspolitische Risiken für die Vereinigten Staaten" dar, sagte Daniel Remler, Senior Fellow im Programm für Technologie und nationale Sicherheit bei CNAS, zu CNBC. "Die letzte Sorge ist, dass die Integration chinesischer KI-Modelle Länder in eine chinesische technologische Einflusssphäre zieht, die sich zu einer geopolitischen Ausrichtung verhärtet", sagte er. Remler fügte hinzu, besonders in Südostasien sei eine erhebliche Verbreitung möglich, und "überall von Lagos über São Paulo bis Jakarta, wo Unternehmer und Regierungen billige, offene Modelle suchen, wird man zuerst auf chinesische KI schauen".

Nvidia versucht, diese Rechnung mit Software statt mit Chips zu ändern. Das Unternehmen bereitet ein kostenloses Modell vor, das voraussichtlich Nemotron 4 heißen soll und bis Ende des Jahres erscheinen soll, gerichtet an Käufer, die bereits Nvidia-Hardware betreiben, sagte Marc Einstein, Analyst bei Counterpoint Research, zu Rest of World. Kaum ein Land passt besser zu dieser Beschreibung als die VAE, deren Flaggschiff-Datenzentrum mit 400.000 Nvidia-Chips laufen soll, berichtete die Publikation. Nvidia hat zudem zugestimmt, fast 13 Milliarden US-Dollar für den Kauf von Hugging Face zu zahlen, der Plattform, auf der Entwickler Modelle teilen und herunterladen, laut Rest of World.

Der Kontext dieser Ausgaben: Frühere Versionen der US-KI-Modelle lagen weit hinter den kostenlosen Modellen Chinas zurück, die dieses Jahr rund 2 Milliarden Mal heruntergeladen wurden, weit vor jedem westlichen Rivalen, laut einem im August von Hugging Face veröffentlichten Bericht, den Rest of World zitiert. Regierungen, die eigene Modelle bauen, starten meist von einem kostenlosen Modell von Meta oder Alibaba. Einsteins Aussage zufolge soll Nvidias Ausgabe Nemotron zur Basis machen, die sie stattdessen wählen.

Was die Benchmarks übersehen

Nichts davon löst das zugrunde liegende Messproblem. Die Benchmark-Werte eines Modells sagen nichts darüber, ob es weiß, was nach seinem Cutoff geschah. Die Seite stale.jock.pl schlägt eine einfache Prüfung vor: ein Modell direkt nach seinem Trainings-Cutoff fragen. Ein wohlerzogenes Modell antwortet oder sagt, es sei unsicher; eines, das ein selbstbewusstes Datum erfindet, hat etwas Nützliches über sich verraten, argumentiert die Seite, und ergänzt, die Antwort sollte gegen den Tracker geprüft werden, weil ein Modell eine schlechte Quelle über Modelle ist.

Die Seite liefert außerdem einen maschinenlesbaren Export, models.json, mit Veröffentlichungsdatum, veröffentlichtem Cutoff und einem Quellenlink für alle 20 Modelle, und schlägt vor, einen Agenten über die AGENTS.md- oder CLAUDE.md-Anweisungsdatei, die der Agent ohnehin liest, darauf zu richten. Der Export wird neu erzeugt, wenn die Seite neu erzeugt wird, sodass ein Agent die heutigen Daten liest statt jener, die in seine Gewichte eingebacken sind.

Das ist ein Behelf, keine Lösung. Die Labors kontrollieren, was sie offenlegen, und die Hälfte der aktuellen Modelle im Tracker trägt weiterhin keinen veröffentlichten Cutoff. Solange sich das nicht ändert, benotet jeder, der Modelle allein anhand von Benchmarks vergleicht, eine Momentaufnahme, die schon bei ihrer Auslieferung veraltet war.

Kommentare 0

Quellen

3
  1. 01Show HN: How Stale Is Your AI? Release age and training cutoff for 20 modelsEN
  2. 02Chinese AI models surge in global popularity — and Washington is worriedEN
  3. 03Nvidia's free AI model could push the UAE closer to the U.S.EN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.