Modell-Tracker werden mehr, während Release-Daten und Trainingsstichtage auseinanderlaufen
Ein am 16. September veröffentlichter Tracker listet 20 aktuelle KI-Modelle aus 8 Labors auf. Er zeigt die Lücke zwischen dem Tag, an dem ein Modell erscheint, und dem Tag, an dem es aufgehört hat zu lesen. Nur 10 der 20 tragen einen Trainingsstichtag, den ihr Labor tatsächlich veröffentlicht.

Die Seite stale.jock.pl führt pro Modell zwei Daten: das Veröffentlichungsdatum, an dem das Labor das Modell ausgeliefert hat, und den Trainingsstichtag, an dem es aufgehört hat zu lesen. Beide Zähler laufen live hoch. Der Autor sagt es selbst deutlich: Ein Modell kann im September erscheinen und trotzdem im April aufgehört haben zu lesen. Am Marktstart liegt es damit fünf Monate zurück.
Die Liste ist konkret. Llama 4 erschien am 5. April 2025 mit einem Stichtag im August 2024. Claude Haiku 4.5 erschien am 15. Oktober 2025 und endet im Juli 2025. Gemini 3.1 Pro erschien am 19. Februar 2026 mit einem Stichtag im Januar 2025, dreizehn Monate zurück. GPT-6 Astra erschien am 3. September 2026 und endet am 30. April 2026. GPT-6 Sol vom 22. September 2026 endet am 20. April 2026, GPT-6 Luna vom selben Tag am 18. Mai 2026. Claude Opus 5.5, ebenfalls vom 22. September, endet im Juni 2026.
Die Hälfte der Modelle hat keinen veröffentlichten Stichtag
Zehn Modelle bleiben leer. Fünf der acht Labore, Anthropic, Google DeepMind, Meta, OpenAI und xAI, haben für mindestens ein Modell auf der Seite einen veröffentlichten Stichtag. Zu den Lücken gehören die gesamte gezeigte Mistral-Reihe (Large 3, Small 4, Medium 3.5), Qwen3.8-Max und Qwen3.8-Flash von Alibaba, Metas Muse Glimmer und Muse Spark 1.3, DeepSeek V4-Pro und V4.1-Flash sowie Gemini 3.8 Flash. Die Seite ist vorsichtig damit, was eine Lücke bedeutet: Die geprüften Anbieterquellen ergaben keinen Stichtag. Das ist kein Beweis dafür, dass das Labor nie einen veröffentlicht hat.
Der Autor hat außerdem einen Suchtest gefahren: über 2.000 Abfragen über 16 Modelle, jeweils mit einem Websuche-Werkzeug. Frontier-Modelle entschieden fast jedes Mal richtig, so die Seite. Schwächere Modelle nannten gesicherte Fakten, die sich geändert hatten, ohne nachzuprüfen, und suchten im Web nach Dingen wie dem Siedepunkt von Wasser. Im selben Test nannten fünf Modelle einen Toten als König von Norwegen.
Auch die Suche muss vom Modell ausgelöst werden, mit denselben Gewichten, die den veralteten Fakt tragen. So landen die Fehler genau dort, wo sich das Modell am sichersten fühlt.
Das ist das Argument für den Export. Die Seite bietet models.json mit Veröffentlichungsdatum, veröffentlichtem Stichtag und einem Quellenlink pro Modell an und schlägt vor, ein paar Zeilen in die AGENTS.md oder CLAUDE.md einzufügen, die ein Agent ohnehin liest. Die Anweisung lautet, die Datei abzurufen, bevor irgendein Modell, eine Version oder ein Datum als aktuell bezeichnet wird. Alles mit angehängtem Datum gilt als ungeprüft, bis es kontrolliert wurde. Die Datei wird neu erzeugt, wenn die Seite neu erzeugt wird.
Benchmarks bewegen sich, die Daten nicht
Das ist nicht der einzige Versuch, Modellfakten zu überprüfen. Ein separates Show-HN-Projekt, Cactus Needle 3, am 18. September veröffentlicht, bewirbt 8 bis 29 MB große Automatisierungsmodelle für winzige Geräte. Es behauptet, ein 4-schichtiges Subnetz könne DeepSeek V4 Flash erreichen, wenn es für eine Epoche abgestimmt wird. CUA-S1, am 19. September gepostet, ist eine frühe reine Quellen-Forschungsveröffentlichung kleiner Entscheidungsmodelle für Computernutzung, mit separat auf Hugging Face gehosteten Gewichten und MIT-lizenziertem Quellcode.
Keines dieser Projekte klärt die Benchmark-Frage. Ein Tracker sagt, wann ein Modell aufgehört hat zu lesen. Er sagt nicht, ob das Modell etwas taugt. Der Unterschied zählt, weil Release-Ankündigungen und Benchmark-Behauptungen auf verschiedenen Uhren eintreffen. Das Stichtagsdatum ist die eine Information, die ein Labor veröffentlichen kann, ohne über Methodik zu streiten.
Der Rat der Seite selbst ist zirkulär, und sie gibt es zu: Fragen Sie das Modell direkt nach seinem Trainingsstichtag. Ein wohlerzogenes Modell antwortet oder sagt, dass es unsicher ist. Eines, das ein sicheres Datum erfindet, hat etwas Nützliches über sich selbst verraten. Dann prüfen Sie die Antwort, denn ein Modell ist eine schlechte Quelle über Modelle.
Quellen
3- 01How stale is your AI? Release age and training cutoff for 20 modelsEN
- 02Needle 3 - 8-29 MB foundation model for tiny devicesEN
- 03trycua/cua: Scale computer-use 2.0EN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.