Les nouveaux modèles d'IA dépassent leurs propres données d'entraînement
Dix des 20 modèles d'IA actuels recensés par le tracker stale.jock.pl affichent une date limite d'entraînement que leur laboratoire publie vraiment. Plusieurs sont sortis des mois après la date annoncée dans leur propre communiqué de lancement.

Le site, signalé sur Hacker News le 16 septembre, suit deux dates par modèle : le jour où le laboratoire l'a livré et le jour où il a cessé de lire. Il recense 20 modèles chez 8 laboratoires et fait défiler chaque compteur en direct dans le navigateur.
L'écart, voilà l'histoire. GPT-6 Astra, sorti par OpenAI le 3 septembre 2026, a une date limite d'entraînement au 30 avril 2026. Son frère GPT-6 Sol est sorti le 22 septembre avec une limite au 20 avril, et GPT-6 Luna le même jour avec une limite au 18 mai. Claude Opus 5.5 d'Anthropic, sorti le 22 septembre, s'arrête à juin 2026. Claude Sonnet 5, sorti le 30 juin, a cessé de lire en janvier.
Pour la moitié de la liste, la réponse est simplement inconnue. Large 3, Small 4 et Medium 3.5 de Mistral AI, Qwen3.8-Max et Qwen3.8-Flash d'Alibaba, Muse Glimmer et Muse Spark 1.3 de Meta, V4-Pro et V4.1-Flash de DeepSeek, ainsi que Gemini 3.8 Flash de Google DeepMind n'affichent aucune date limite établie. La page reste prudente sur ce que cela signifie : une case vide correspond à ce que les sources vérifiées des fournisseurs n'ont pas permis d'établir, et non à la preuve qu'un laboratoire n'en a jamais publié.
Pourquoi la date compte plus que le numéro de version
Le site ne mâche pas ses mots. Un modèle peut sortir en septembre et avoir cessé de lire en avril. Le jour de son lancement, il a donc cinq mois de retard, avant même qu'on lui tape une invite.
Les outils de recherche n'y remédient pas, selon la page. Quand un modèle cherche, il lit quelques pages, s'en sert dans une réponse et oublie. Ouvrez une nouvelle conversation : la date limite revient. La décision de lancer une recherche repose aussi sur les mêmes poids qui portent le fait périmé. Les ratés surviennent donc là où le modèle est le plus confiant. La page indique avoir mesuré cela sur 2 000 appels répartis sur 16 modèles, chacun doté d'un outil de recherche web. Les modèles de pointe décidaient correctement presque à chaque fois. Les plus faibles énonçaient des faits établis qui avaient changé, et cherchaient sur le web le point d'ébullition de l'eau.
J'ai donné un bouton de recherche à 16 modèles d'IA et demandé qui est le roi de Norvège. Cinq ont nommé un mort.
C'est la formule du site, et l'illustration la plus claire du problème. Un modèle qui ignore qu'un monarque est mort ne décidera pas de vérifier de façon fiable.
Le contournement vise les agents, pas les humains
La page publie les mêmes données sous forme de models.json, avec la date de sortie, la date limite publiée et un lien source par modèle. Elle suggère de coller un court bloc d'instructions dans un fichier AGENTS.md ou CLAUDE.md pour qu'un agent le récupère avant de désigner un modèle comme actuel.
Du côté des laboratoires, les dates limites publiées sont inégales. Cinq des huit laboratoires, Anthropic, Google DeepMind, Meta, OpenAI et xAI, ont une date limite publiée pour au moins un modèle de la liste. Dix des 20 modèles en portent une. Les autres non.
La page propose aussi un autotest sommaire : demandez au modèle sa propre date limite d'entraînement. Celui qui répond, ou admet son incertitude, se comporte correctement. Celui qui invente une date avec assurance vous a appris quelque chose. Le site prévient qu'un modèle est une mauvaise source sur les modèles : mieux vaut vérifier la réponse dans le tableau que lui faire confiance.
Sources
1Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.