Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les trackers de modèles se multiplient, les dates de sortie et les coupures divergent

Un tracker publié le 16 septembre recense 20 modèles d'IA actuels issus de 8 laboratoires. Il montre l'écart entre le jour où un modèle sort et le jour où il a cessé de lire. Sur les 20, seuls 10 affichent une coupure d'entraînement que leur laboratoire publie réellement.

IA & modèlesAnalyseCamille RousseauPublié le: 27 septembre 20263 min de lectureSources 3
Les trackers de modèles se multiplient, les dates de sortie et les coupures divergent

La page stale.jock.pl retient deux dates par modèle : la date de sortie, quand le laboratoire l'a livré, et la coupure d'entraînement, quand il a cessé de lire. Deux compteurs avancent en direct à partir de ces dates. L'auteur le dit sans détour : un modèle peut sortir en septembre et avoir cessé de lire en avril. Le jour de son lancement, il a donc cinq mois de retard.

La liste est précise. Llama 4 est sorti le 5 avril 2025 avec une coupure d'août 2024. Claude Haiku 4.5 est sorti le 15 octobre 2025 et s'arrête à juillet 2025. Gemini 3.1 Pro est sorti le 19 février 2026 avec une coupure de janvier 2025, treize mois de retard. GPT-6 Astra est sorti le 3 septembre 2026 et s'arrête au 30 avril 2026. GPT-6 Sol, du 22 septembre 2026, s'arrête au 20 avril 2026. GPT-6 Luna, le même jour, s'arrête au 18 mai 2026. Claude Opus 5.5, également du 22 septembre, s'arrête à juin 2026.

La moitié du rayon n'a aucune coupure publiée

Dix modèles portent une case vide. Cinq des huit laboratoires, Anthropic, Google DeepMind, Meta, OpenAI et xAI, ont une coupure publiée pour au moins un modèle de la page. Les cases vides couvrent toute la gamme Mistral présentée (Large 3, Small 4, Medium 3.5), Qwen3.8-Max et Qwen3.8-Flash d'Alibaba, Muse Glimmer et Muse Spark 1.3 de Meta, DeepSeek V4-Pro et V4.1-Flash, ainsi que Gemini 3.8 Flash. La page précise ce que signifie une case vide : les sources vérifiées chez les fournisseurs n'ont pas établi de coupure. Cela ne prouve pas que le laboratoire n'en a jamais publié.

L'auteur a aussi mené un test de recherche : plus de 2 000 appels sur 16 modèles, chacun doté d'un outil de recherche web. Les modèles de frontière ont tranché correctement presque à chaque fois, indique la page. Les plus faibles ont énoncé des faits établis qui avaient changé, sans vérifier, et ont cherché sur le web des choses comme le point d'ébullition de l'eau. Dans le même test, cinq modèles ont désigné un homme mort comme roi de Norvège.

La recherche doit aussi être déclenchée par le modèle, avec les mêmes poids qui portent le fait périmé. Les erreurs tombent donc exactement là où le modèle se sent le plus sûr.

C'est l'argument en faveur de l'export. La page propose models.json avec la date de sortie, la coupure publiée et un lien source par modèle. Elle suggère de coller quelques lignes dans l'AGENTS.md ou le CLAUDE.md qu'un agent lit déjà. La consigne : récupérer le fichier avant de présenter un modèle, une version ou une date comme actuels, et traiter tout ce qui porte une date comme non vérifié tant que ce n'est pas contrôlé. Le fichier est régénéré en même temps que la page.

Les benchmarks bougent, les dates non

Ce n'est pas la seule tentative pour surveiller les faits sur les modèles. Un autre projet Show HN, Cactus Needle 3, publié le 18 septembre, propose des modèles d'automatisation de 8 à 29 MB pour de petits appareils. Il affirme qu'un sous-réseau à 4 couches peut égaler DeepSeek V4 Flash lorsqu'il est ajusté sur une époque. CUA-S1, publié le 19 septembre, est une première version de recherche, source uniquement, de petits modèles de décision pour l'usage informatique. Ses poids sont hébergés séparément sur Hugging Face et sa source est sous licence MIT.

Aucun de ces projets ne tranche la question des benchmarks. Un tracker vous dit quand un modèle a cessé de lire. Il ne vous dit pas si le modèle est bon. La distinction compte : les annonces de sortie et les affirmations de benchmark arrivent sur des horloges différentes. La date de coupure reste la seule métadonnée qu'un laboratoire peut publier sans débattre de méthodologie.

Le conseil de la page est circulaire, et elle l'admet : demandez directement au modèle sa coupure d'entraînement. Un modèle bien élevé répond ou dit qu'il n'est pas sûr. Un modèle qui invente une date avec assurance vous a appris quelque chose d'utile sur lui-même. Vérifiez ensuite la réponse, car un modèle est une mauvaise source sur les modèles.

Commentaires 0

Sources

3
  1. 01How stale is your AI? Release age and training cutoff for 20 modelsEN
  2. 02Needle 3 - 8-29 MB foundation model for tiny devicesEN
  3. 03trycua/cua: Scale computer-use 2.0EN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.