Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Ein Release-Datum ist kein Trainingsstichtag: wie veraltet 20 KI-Modelle schon sind

Zehn von 20 aktuellen KI-Modellen haben einen Trainingsstichtag, den ihr Labor auch veröffentlicht. Das zeigt ein Tracker, der am 16. September online ging. Die Lücke zwischen Auslieferung und Stichtag nennt kaum eine Launch-Meldung.

KI & ModelleAnalyseKatrin HoffmannVeröffentlicht: 27. September 20263 Min. LesezeitQuellen 1
Ein Release-Datum ist kein Trainingsstichtag: wie veraltet 20 KI-Modelle schon sind

Die Seite stale.jock.pl führt zu jedem Modell zwei Daten: den Tag, an dem das Labor es ausgeliefert hat, und den Tag, an dem es aufhörte zu lesen. Beide Zähler laufen live weiter. Das zweite Datum entscheidet, was ein Modell wirklich weiß.

GPT-6 Astra etwa kam am 3. September 2026 von OpenAI auf den Markt. Seine Trainingsdaten enden am 30. April 2026. Am Launch-Tag lag das Modell bei allem, was danach passierte, schon vier Monate zurück. Es wird weiter zurückfallen, denn an den Gewichten ändert sich nichts, wenn sich die Welt ändert. Der Tracker zeigt dasselbe Muster in der ganzen Reihe: Llama 4 von Meta kam am 5. April 2025 mit einem Stichtag August 2024, Claude Sonnet 5 von Anthropic kam am 30. Juni 2026 mit einem Stichtag Januar 2026, GPT-6 Sol kam am 22. September 2026 mit einem Stichtag 20. April 2026. Jeder Name auf der Seite verlinkt laut der Website auf das Labordokument, aus dem das Datum stammt.

Die Hälfte der Liste ist leer.

Zehn der 20 Modelle tragen einen veröffentlichten Stichtag. Die anderen zehn, darunter Mistral Large 3, Qwen3.8-Max, DeepSeek V4-Pro und Muse Glimmer, zeigen keinen. Die geprüften Herstellerquellen belegen keinen, heißt es auf der Seite. Das ist kein Beweis, dass ein Labor nie einen veröffentlicht hat. Es beweist nur, dass der Tracker keinen finden konnte. Für alle, die Modelle nach Aktualität vergleichen wollen, ist das ein anderer und unangenehmerer Befund.

Suche schließt die Lücke nicht

Der naheliegende Einwand: Modelle durchsuchen heute das Web, der Stichtag zählt also weniger. Der Autor des Trackers weist das zurück. Die Suche liest ein paar Seiten für eine Antwort und vergisst sie wieder, argumentiert die Seite, also beginnt ein neuer Chat wieder im April. Schlimmer noch: Die Suche muss das Modell selbst auslösen, mit denselben Gewichten, die den veralteten Fakt enthalten. Die Fehler landen also genau dort, wo das Modell am sichersten klingt. Die Seite nennt einen Test mit über 2.000 Aufrufen über 16 Modelle, jedes mit einem Web-Suchwerkzeug ausgestattet: Frontier-Modelle entschieden fast jedes Mal richtig, schwächere nannten geänderte Fakten ohne nachzusehen und durchsuchten das Web nach Dingen wie dem Siedepunkt von Wasser. In einem Beispiel nannten fünf Modelle einen toten Mann als König von Norwegen.

Darin steckt ein unangenehmer methodischer Punkt. Ein Modell nach seinem eigenen Trainingsstichtag zu fragen, ist ein schlechter Zeuge, heißt es auf der Seite, denn eines, das ein sicheres Datum erfindet, hat etwas Nützliches über sich selbst verraten. Die empfohlene Prüfung ist extern.

Der Tracker liefert dieselben Daten als models.json, mit Release-Datum, veröffentlichtem Stichtag und einem Quellenlink pro Modell. Er schlägt vor, ein paar Zeilen in die AGENTS.md oder CLAUDE.md eines Agenten einzufügen, damit der Agent die Datei abruft, bevor er ein Modell oder eine Version als aktuell bezeichnet. Die Datei wird neu erzeugt, wenn die Seite neu erzeugt wird, sodass der Agent die heutigen Daten liest statt der in seine Gewichte eingebackenen. Die Liste der 20 Modelle umfasst 8 Labore, und 5 dieser Labore haben einen veröffentlichten Stichtag für mindestens ein Modell auf der Seite: Anthropic, Google DeepMind, Meta, OpenAI und xAI.

Für Benchmark-Beobachter ist die praktische Folge einfach. Eine Rangliste, die Modelle mit Wochen Abstand vergleicht, vergleicht auch Modelle, die Monate auseinander trainiert wurden, und das Delta steht nicht im Ergebnis.

Kommentare 0

Quellen

1
  1. 01How stale is your AI? Release age and training cutoff for 20 modelsEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.