Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Was die zwei Daten eines Modells darüber verraten, wie aktuell es wirklich ist

Zehn von 20 aktuellen KI-Modellen kommen ohne veröffentlichten Trainings-Cutoff auf den Markt. Das zeigt ein Tracker, der für Modelle aus acht Labors sowohl das Veröffentlichungsdatum als auch den Cutoff erfasst.

KI & ModelleErklärtKatrin HoffmannVeröffentlicht: 27. September 20263 Min. LesezeitQuellen 1
Was die zwei Daten eines Modells darüber verraten, wie aktuell es wirklich ist

Die Seite heißt "How stale is your AI?" und erschien am 16. September auf Hacker News. Sie führt zwei Daten für 20 Modelle aus acht Labors, Veröffentlichungsdatum und Trainings-Cutoff, und zählt ab jedem live hoch. Die Zähler brauchen JavaScript. Die Daten nicht.

Der Unterschied ist größer, als er klingt. Das Veröffentlichungsdatum ist der Tag, an dem das Labor das Modell ausgeliefert hat. Es steht in der Startberichterstattung. Der Trainings-Cutoff ist der Tag, an dem das Modell aufgehört hat zu lesen. Ein Modell kann im September erscheinen und trotzdem im April aufgehört haben zu lesen. Dann ist es am Tag seines Starts fünf Monate zurück.

GPT-6 Astra etwa, von OpenAI am 3. September 2026 veröffentlicht, mit einem Cutoff vom 30. April 2026. Oder Claude Opus 5.5, veröffentlicht am 22. September 2026, Cutoff Juni 2026. Die Daten des Trackers führen Llama 4 von Meta mit 5. April 2025 und einem Cutoff von August 2024 sowie Gemini 3.1 Pro von Google DeepMind mit 19. Februar 2026 und einem Cutoff von Januar 2025.

Zehn der 20 Modelle tragen einen Cutoff, den das Labor tatsächlich veröffentlicht. Fünf der acht Labors haben für mindestens ein Modell auf der Seite einen Cutoff veröffentlicht: Anthropic, Google DeepMind, Meta, OpenAI und xAI. Ein leerer Eintrag bedeutet, dass die geprüften Herstellerquellen für dieses Modell keinen Cutoff belegen konnten. Es ist kein Beweis, dass das Labor nie einen veröffentlicht hat, schreibt die Seite.

Warum die Suche das nicht löst

Suchwerkzeuge überdecken die Lücke. Sie schließen sie nie, argumentiert die Seite, denn eine Suche wird vom Modell selbst ausgelöst, mit denselben Gewichten, die den veralteten Fakt tragen. Wenn ein Modell sucht, liest es ein paar Seiten, nutzt sie in dieser einen Antwort und vergisst sie. Öffne einen neuen Chat, und es ist wieder April.

Die Seite stützt das mit einem Test: mehr als 2.000 Abrufe über 16 Modelle, jedes mit einem Web-Suchwerkzeug ausgestattet. Die Frontier-Modelle entschieden fast jedes Mal richtig, schreibt die Seite. Schwächere nannten gesicherte Fakten, die sich geändert hatten, ohne nachzusehen, und suchten im Web nach Dingen wie dem Siedepunkt von Wasser.

Ich gab 16 KI-Modellen einen Suchknopf und fragte, wer der König von Norwegen ist. Fünf nannten einen Toten.

Die Seite nennt noch ein zweites Problem, das schwerer zu testen ist: Ein Modell ist eine schlechte Quelle über Modelle. Frag eines nach seinem eigenen Trainings-Cutoff. Ein wohlerzogenes Modell antwortet oder sagt, dass es nicht sicher ist. Eines, das ein selbstbewusstes Datum erfindet, hat gerade etwas Nützliches über sich selbst verraten.

Agenten lesen ihre eigenen veralteten Fakten

Die Seite liefert einen maschinenlesbaren Export, models.json, mit Veröffentlichungsdatum, veröffentlichtem Cutoff und einem Quellenlink für jedes der 20 Modelle. Sie liefert außerdem fertigen Text zum Einfügen für die AGENTS.md- oder CLAUDE.md-Datei, die ein Agent ohnehin liest. Darin steht die Anweisung, den Export abzurufen, bevor er irgendein Modell, eine Version oder ein Datum als aktuell bezeichnet. Das Argument ist einfach: Das Wissen des Agenten über Modelle endet an seinem eigenen Cutoff, und eine falsche Antwort klingt trotzdem selbstsicher.

Die Daten sind nicht das letzte Wort darüber, welches Modell das beste ist. Sie sind eine Prüfung einer einzigen Behauptung, der Aktualität, die Benchmarks und Startbeiträge selten behandeln. Die Seite schreibt, der Export werde neu erzeugt, wann immer die Seite es wird. So liest ein Agent die heutigen Daten statt jener, die in seine Gewichte eingebacken sind.

Zwei Einschränkungen sollte man behalten. Zehn Modelle haben auf der Seite keinen veröffentlichten Cutoff, ihre Veraltung lässt sich aus dieser Quelle allein also nicht messen. Und der Suchtest stammt vom Autor selbst und lief in einer Größenordnung, die die Seite nicht pro Modell aufschlüsselt. Behandle ihn als Signal, nicht als Rangliste.

Was die Seite belegt, ist eine Gewohnheit: Bevor man das Wissen eines Modells als aktuell zitiert, suche das Datum, an dem es aufgehört hat zu lesen. Das Veröffentlichungsdatum verrät es nicht.

Kommentare 0

Quellen

1
  1. 01How stale is your AI? Release age and training cutoff for 20 modelsEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.