Was die zwei Daten eines Modells darüber verraten, wie aktuell es wirklich ist
Zehn von 20 aktuellen KI-Modellen kommen ohne veröffentlichten Trainings-Cutoff auf den Markt. Das zeigt ein Tracker, der für Modelle aus acht Labors sowohl das Veröffentlichungsdatum als auch den Cutoff erfasst.

Die Seite heißt "How stale is your AI?" und erschien am 16. September auf Hacker News. Sie führt zwei Daten für 20 Modelle aus acht Labors, Veröffentlichungsdatum und Trainings-Cutoff, und zählt ab jedem live hoch. Die Zähler brauchen JavaScript. Die Daten nicht.
Der Unterschied ist größer, als er klingt. Das Veröffentlichungsdatum ist der Tag, an dem das Labor das Modell ausgeliefert hat. Es steht in der Startberichterstattung. Der Trainings-Cutoff ist der Tag, an dem das Modell aufgehört hat zu lesen. Ein Modell kann im September erscheinen und trotzdem im April aufgehört haben zu lesen. Dann ist es am Tag seines Starts fünf Monate zurück.
GPT-6 Astra etwa, von OpenAI am 3. September 2026 veröffentlicht, mit einem Cutoff vom 30. April 2026. Oder Claude Opus 5.5, veröffentlicht am 22. September 2026, Cutoff Juni 2026. Die Daten des Trackers führen Llama 4 von Meta mit 5. April 2025 und einem Cutoff von August 2024 sowie Gemini 3.1 Pro von Google DeepMind mit 19. Februar 2026 und einem Cutoff von Januar 2025.
Zehn der 20 Modelle tragen einen Cutoff, den das Labor tatsächlich veröffentlicht. Fünf der acht Labors haben für mindestens ein Modell auf der Seite einen Cutoff veröffentlicht: Anthropic, Google DeepMind, Meta, OpenAI und xAI. Ein leerer Eintrag bedeutet, dass die geprüften Herstellerquellen für dieses Modell keinen Cutoff belegen konnten. Es ist kein Beweis, dass das Labor nie einen veröffentlicht hat, schreibt die Seite.
Warum die Suche das nicht löst
Suchwerkzeuge überdecken die Lücke. Sie schließen sie nie, argumentiert die Seite, denn eine Suche wird vom Modell selbst ausgelöst, mit denselben Gewichten, die den veralteten Fakt tragen. Wenn ein Modell sucht, liest es ein paar Seiten, nutzt sie in dieser einen Antwort und vergisst sie. Öffne einen neuen Chat, und es ist wieder April.
Die Seite stützt das mit einem Test: mehr als 2.000 Abrufe über 16 Modelle, jedes mit einem Web-Suchwerkzeug ausgestattet. Die Frontier-Modelle entschieden fast jedes Mal richtig, schreibt die Seite. Schwächere nannten gesicherte Fakten, die sich geändert hatten, ohne nachzusehen, und suchten im Web nach Dingen wie dem Siedepunkt von Wasser.
Ich gab 16 KI-Modellen einen Suchknopf und fragte, wer der König von Norwegen ist. Fünf nannten einen Toten.
Die Seite nennt noch ein zweites Problem, das schwerer zu testen ist: Ein Modell ist eine schlechte Quelle über Modelle. Frag eines nach seinem eigenen Trainings-Cutoff. Ein wohlerzogenes Modell antwortet oder sagt, dass es nicht sicher ist. Eines, das ein selbstbewusstes Datum erfindet, hat gerade etwas Nützliches über sich selbst verraten.
Agenten lesen ihre eigenen veralteten Fakten
Die Seite liefert einen maschinenlesbaren Export, models.json, mit Veröffentlichungsdatum, veröffentlichtem Cutoff und einem Quellenlink für jedes der 20 Modelle. Sie liefert außerdem fertigen Text zum Einfügen für die AGENTS.md- oder CLAUDE.md-Datei, die ein Agent ohnehin liest. Darin steht die Anweisung, den Export abzurufen, bevor er irgendein Modell, eine Version oder ein Datum als aktuell bezeichnet. Das Argument ist einfach: Das Wissen des Agenten über Modelle endet an seinem eigenen Cutoff, und eine falsche Antwort klingt trotzdem selbstsicher.
Die Daten sind nicht das letzte Wort darüber, welches Modell das beste ist. Sie sind eine Prüfung einer einzigen Behauptung, der Aktualität, die Benchmarks und Startbeiträge selten behandeln. Die Seite schreibt, der Export werde neu erzeugt, wann immer die Seite es wird. So liest ein Agent die heutigen Daten statt jener, die in seine Gewichte eingebacken sind.
Zwei Einschränkungen sollte man behalten. Zehn Modelle haben auf der Seite keinen veröffentlichten Cutoff, ihre Veraltung lässt sich aus dieser Quelle allein also nicht messen. Und der Suchtest stammt vom Autor selbst und lief in einer Größenordnung, die die Seite nicht pro Modell aufschlüsselt. Behandle ihn als Signal, nicht als Rangliste.
Was die Seite belegt, ist eine Gewohnheit: Bevor man das Wissen eines Modells als aktuell zitiert, suche das Datum, an dem es aufgehört hat zu lesen. Das Veröffentlichungsdatum verrät es nicht.
Quellen
1Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.