Les sorties de modèles d'IA s'accélèrent, les benchmarks décrochent
Dix des 20 modèles suivis par stale.jock.pl sortent sans date limite d'entraînement publiée. La semaine du 14 septembre, les modèles chinois ont capté 57 % à 67 % des tokens sur OpenRouter.

Six modèles sont sortis entre le 1er et le 22 septembre 2026, d'après le traqueur stale.jock.pl. Le site recense les dates de sortie et les dates limites d'entraînement de 20 modèles actuels, répartis entre huit laboratoires. OpenAI en a livré trois à elle seule le 22 septembre : GPT-6 Sol, GPT-6 Luna et Claude Opus 5.5 d'Anthropic le même jour, selon le tableau du traqueur et les gros titres récents. Le calendrier des modèles de pointe se compte désormais en jours, plus en trimestres.
L'instrument qui sert à les juger, lui, ne suit pas le rythme. Les dates limites d'entraînement, celles auxquelles un modèle a cessé de lire, ne sont publiées que pour la moitié des modèles de la liste. Cinq des huit laboratoires, Anthropic, Google DeepMind, Meta, OpenAI et xAI, publient une date limite pour au moins un modèle, indique le traqueur. Une entrée vide signifie que les sources vérifiées chez les fournisseurs n'ont pas établi de date limite, pas qu'il n'en existe aucune.
L'écart entre livrer et savoir
Le traqueur le dit sans détour : deux dates décident de l'actualité réelle d'un modèle. La date de sortie est celle où le laboratoire l'a livré. La date limite d'entraînement est celle où il a cessé de lire. GPT-6 Astra, sorti le 3 septembre 2026, a une date limite au 30 avril 2026, selon la page : environ quatre mois de retard le jour de son lancement. Claude Fable 5.1, sorti le 1er septembre 2026, porte une date limite de juin 2026. Gemini 3.1 Pro, sorti le 19 février 2026, a cessé de lire en janvier 2025, plus d'un an avant sa sortie.
Un modèle peut sortir en septembre et avoir cessé de lire en avril, ce qui veut dire qu'il a cinq mois de retard le jour de son lancement.
Cet écart compte d'autant plus que les cycles de sortie se resserrent. Mistral AI a livré Mistral Large 3 le 2 décembre 2025, Mistral Small 4 le 16 mars 2026 et Mistral Medium 3.5 le 28 avril 2026, aucun avec une date limite publiée, selon le traqueur. Qwen3.8-Max d'Alibaba (3 août 2026), Qwen3.8-Flash (26 août 2026), V4-Pro de DeepSeek (13 août 2026) et V4.1-Flash (10 septembre 2026) figurent aussi sans date limite publiée. Il en va de même pour Muse Glimmer et Muse Spark 1.3 de Meta, et pour Gemini 3.8 Flash de Google DeepMind.
Les outils de recherche ne comblent pas l'écart, soutient la page. Un modèle qui fait une recherche web lit quelques pages, les utilise dans une réponse et les oublie. Ouvrez une nouvelle conversation : il revient à sa date limite. Pire, la recherche doit être déclenchée par le modèle lui-même, avec les mêmes poids qui portent le fait périmé. Les erreurs tombent donc là où le modèle se sent le plus sûr. La page cite une mesure de plus de 2 000 appels sur 16 modèles, chacun disposant d'un outil de recherche web : les modèles de pointe ont tranché correctement presque à chaque fois, tandis que les plus faibles énonçaient des faits établis qui avaient changé et cherchaient sur le web des choses comme le point d'ébullition de l'eau.
L'usage bouge plus vite que les benchmarks
Pendant que les laboratoires se pressent de livrer, les données d'usage racontent une autre histoire : celle des modèles que les développeurs vont réellement chercher. Les modèles d'IA chinois sont passés d'une petite part d'usage à une majorité sur deux grandes plateformes pour développeurs en 2026, selon CNBC, qui cite des données d'usage partagées avec la chaîne. Sur OpenRouter, ils ont représenté 57 % à 67 % des tokens utilisés la semaine du 14 septembre, contre 6 % à 13 % en février. Sur Vercel, leur part est montée à 55 % en août, contre 11 % en janvier.
L'adoption se concentre dans ce qu'OpenRouter appelle le Sud global : 82 pays d'Amérique centrale et du Sud, d'Afrique et d'Asie. Plus des deux tiers des tokens utilisés par ces entreprises vont à des modèles chinois, rapporte CNBC. Environ la moitié des tokens sur OpenRouter sont consommés par des entreprises aux États-Unis.
Le prix est le moteur, selon les personnes interrogées par CNBC. Peter Walker, responsable des analyses chez OpenRouter, a déclaré à la chaîne que les modèles open source chinois sortis cette année « peuvent crédiblement fonctionner dans des cas d'usage agentiques avancés, surtout pour le codage, d'une manière qui n'était tout simplement pas vraie fin 2025 ». Ils sont aussi « incroyablement économiques comparés à la plupart des modèles des laboratoires américains », a-t-il dit. Harpreet Arora, responsable de l'infrastructure agentique chez Vercel, a déclaré à CNBC qu'une fois qu'un modèle atteint le seuil de qualité pour une tâche, l'écart de prix devient décisif, même si les entreprises veulent encore des modèles américains de pointe pour les tâches plus compliquées.
Plus tôt cette semaine, OpenAI et Anthropic ont toutes deux annoncé de nouveaux modèles moins chers, rapporte CNBC. Dianne Penn, responsable de la gestion produit, de la recherche et des laboratoires chez Anthropic, a déclaré à la chaîne que l'entreprise cherchait à rendre les réponses de ses modèles « plus efficaces, pour qu'ils utilisent moins de tokens selon votre réglage d'effort ».
Washington surveille les comptes de tokens
Ce basculement attire l'attention à Washington, où deux commissions de la Chambre des représentants enquêtent sur l'impact de l'adoption croissante des modèles chinois, selon CNBC. Les États-Unis ont interdit aux entreprises chinoises d'IA d'acheter les puces les plus avancées par des contrôles à l'exportation. Washington s'inquiète de leur accès à distance aux puces Nvidia via des centres de données à l'étranger, et de la « distillation », où de nouveaux modèles imitent des modèles plus anciens et plus établis.
L'IA chinoise représente « de vrais risques économiques et de sécurité pour les États-Unis », a déclaré Daniel Remler, chercheur principal au programme technologie et sécurité nationale du CNAS, à CNBC. « L'inquiétude ultime est que l'intégration des modèles d'IA chinois entraîne des pays dans une sphère d'influence technologique chinoise qui se durcit en alignement géopolitique », a-t-il dit. Remler ajoute que l'Asie du Sud-Est en particulier pourrait connaître une adoption importante, et que « partout de Lagos à São Paulo à Jakarta, là où les entrepreneurs et les gouvernements cherchent des modèles ouverts et bon marché, on se tournera d'abord vers l'IA chinoise ».
Nvidia tente de changer ce calcul par le logiciel plutôt que par les puces. L'entreprise prépare un modèle gratuit, qui devrait s'appeler Nemotron 4, attendu d'ici la fin de l'année, destiné aux acheteurs qui exploitent déjà du matériel Nvidia, a déclaré Marc Einstein, analyste chez Counterpoint Research, à Rest of World. Peu de pays correspondent mieux à cette description que les Émirats arabes unis, dont le centre de données phare tournera sur 400 000 puces Nvidia, rapporte la publication. Nvidia a aussi accepté de payer près de 13 milliards de dollars pour acheter Hugging Face, la plateforme où les développeurs partagent et téléchargent des modèles, selon Rest of World.
Le contexte de cette dépense : des versions antérieures des modèles d'IA américains sont restées loin derrière les modèles gratuits chinois, téléchargés environ 2 milliards de fois cette année, loin devant tout rival occidental, selon un rapport d'août de Hugging Face cité par Rest of World. Les gouvernements qui construisent leurs propres modèles partent surtout d'un modèle gratuit de Meta ou d'Alibaba. Pour Einstein, les dépenses de Nvidia visent à faire de Nemotron la base qu'ils choisiront à la place.
Ce que les benchmarks manquent
Rien de tout cela ne résout le problème de mesure de fond. Les scores d'un modèle aux benchmarks ne disent rien de ce qu'il sait de ce qui s'est passé après sa date limite. La page stale.jock.pl propose une vérification simple : demander directement à un modèle sa date limite d'entraînement. Un modèle bien élevé répond ou dit qu'il n'est pas sûr. Un modèle qui invente une date avec assurance vous a appris quelque chose d'utile sur lui-même, soutient la page. Elle ajoute que la réponse doit être recoupée avec le traqueur, car un modèle est une mauvaise source sur les modèles.
La page propose aussi un export lisible par machine, models.json, contenant la date de sortie, la date limite publiée et un lien source pour les 20 modèles. Elle suggère d'y pointer un agent via le fichier d'instructions AGENTS.md ou CLAUDE.md que l'agent lit déjà. L'export est régénéré en même temps que la page : un agent lit donc les dates du jour, pas celles inscrites dans ses poids.
C'est un pis-aller, pas une solution. Les laboratoires contrôlent ce qu'ils divulguent, et la moitié des modèles actuels du traqueur restent sans date limite publiée. Tant que cela ne change pas, quiconque compare des modèles sur les seuls benchmarks note un instantané déjà périmé au moment de sa sortie.
Sources
3- 01Show HN: How Stale Is Your AI? Release age and training cutoff for 20 modelsEN
- 02Chinese AI models surge in global popularity — and Washington is worriedEN
- 03Nvidia's free AI model could push the UAE closer to the U.S.EN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.