Ein Release-Datum ist kein Trainingsstichtag: wie veraltet 20 KI-Modelle schon sind
Zehn von 20 aktuellen KI-Modellen haben einen Trainingsstichtag, den ihr Labor auch veröffentlicht. Das zeigt ein Tracker, der am 16. September online ging. Die Lücke zwischen Auslieferung und Stichtag nennt kaum eine Launch-Meldung.

Die Seite stale.jock.pl führt zu jedem Modell zwei Daten: den Tag, an dem das Labor es ausgeliefert hat, und den Tag, an dem es aufhörte zu lesen. Beide Zähler laufen live weiter. Das zweite Datum entscheidet, was ein Modell wirklich weiß.
GPT-6 Astra etwa kam am 3. September 2026 von OpenAI auf den Markt. Seine Trainingsdaten enden am 30. April 2026. Am Launch-Tag lag das Modell bei allem, was danach passierte, schon vier Monate zurück. Es wird weiter zurückfallen, denn an den Gewichten ändert sich nichts, wenn sich die Welt ändert. Der Tracker zeigt dasselbe Muster in der ganzen Reihe: Llama 4 von Meta kam am 5. April 2025 mit einem Stichtag August 2024, Claude Sonnet 5 von Anthropic kam am 30. Juni 2026 mit einem Stichtag Januar 2026, GPT-6 Sol kam am 22. September 2026 mit einem Stichtag 20. April 2026. Jeder Name auf der Seite verlinkt laut der Website auf das Labordokument, aus dem das Datum stammt.
Die Hälfte der Liste ist leer.
Zehn der 20 Modelle tragen einen veröffentlichten Stichtag. Die anderen zehn, darunter Mistral Large 3, Qwen3.8-Max, DeepSeek V4-Pro und Muse Glimmer, zeigen keinen. Die geprüften Herstellerquellen belegen keinen, heißt es auf der Seite. Das ist kein Beweis, dass ein Labor nie einen veröffentlicht hat. Es beweist nur, dass der Tracker keinen finden konnte. Für alle, die Modelle nach Aktualität vergleichen wollen, ist das ein anderer und unangenehmerer Befund.
Suche schließt die Lücke nicht
Der naheliegende Einwand: Modelle durchsuchen heute das Web, der Stichtag zählt also weniger. Der Autor des Trackers weist das zurück. Die Suche liest ein paar Seiten für eine Antwort und vergisst sie wieder, argumentiert die Seite, also beginnt ein neuer Chat wieder im April. Schlimmer noch: Die Suche muss das Modell selbst auslösen, mit denselben Gewichten, die den veralteten Fakt enthalten. Die Fehler landen also genau dort, wo das Modell am sichersten klingt. Die Seite nennt einen Test mit über 2.000 Aufrufen über 16 Modelle, jedes mit einem Web-Suchwerkzeug ausgestattet: Frontier-Modelle entschieden fast jedes Mal richtig, schwächere nannten geänderte Fakten ohne nachzusehen und durchsuchten das Web nach Dingen wie dem Siedepunkt von Wasser. In einem Beispiel nannten fünf Modelle einen toten Mann als König von Norwegen.
Darin steckt ein unangenehmer methodischer Punkt. Ein Modell nach seinem eigenen Trainingsstichtag zu fragen, ist ein schlechter Zeuge, heißt es auf der Seite, denn eines, das ein sicheres Datum erfindet, hat etwas Nützliches über sich selbst verraten. Die empfohlene Prüfung ist extern.
Der Tracker liefert dieselben Daten als models.json, mit Release-Datum, veröffentlichtem Stichtag und einem Quellenlink pro Modell. Er schlägt vor, ein paar Zeilen in die AGENTS.md oder CLAUDE.md eines Agenten einzufügen, damit der Agent die Datei abruft, bevor er ein Modell oder eine Version als aktuell bezeichnet. Die Datei wird neu erzeugt, wenn die Seite neu erzeugt wird, sodass der Agent die heutigen Daten liest statt der in seine Gewichte eingebackenen. Die Liste der 20 Modelle umfasst 8 Labore, und 5 dieser Labore haben einen veröffentlichten Stichtag für mindestens ein Modell auf der Seite: Anthropic, Google DeepMind, Meta, OpenAI und xAI.
Für Benchmark-Beobachter ist die praktische Folge einfach. Eine Rangliste, die Modelle mit Wochen Abstand vergleicht, vergleicht auch Modelle, die Monate auseinander trainiert wurden, und das Delta steht nicht im Ergebnis.
Quellen
1Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.