La date de sortie n'est pas l'essentiel : les coupures d'entraînement et l'adoption rebattent les repères des modèles d'IA
Dix des 20 modèles d'IA actuels recensés sur stale.jock.pl affichent une coupure d'entraînement que leur propre laboratoire publie. Sur OpenRouter, les modèles chinois sont passés de 6 % à 13 % des tokens en février 2026 à 57 % à 67 % pendant la semaine du 14 septembre. Aucun de ces deux chiffres n'apparaît dans un tableau de référence classique.

Un tableau de référence donne le score d'un modèle. Il ne dit pas quand ce modèle a cessé de lire. Entre la date de sortie affichée dans un billet de lancement et la coupure d'entraînement enfouie dans une fiche de modèle, l'écart compte parmi les chiffres les plus utiles qu'un acheteur puisse consulter. C'est la prémisse d'un petit outil publié le 16 septembre sur stale.jock.pl sous le titre « How stale is your AI? ».
La page recense 20 modèles actuels issus de 8 laboratoires. À chaque date de sortie, elle associe une coupure d'entraînement et un décompte depuis l'une et depuis l'autre. Dix des 20 ont une coupure que le laboratoire publie réellement. Cinq des huit laboratoires, Anthropic, Google DeepMind, Meta, OpenAI et xAI, en publient une pour au moins un modèle de la liste. Les autres sont marqués « Not established ». La page précise qu'il ne s'agit pas d'une preuve que le laboratoire n'en a jamais publié, seulement que les sources vérifiées chez les fournisseurs n'en ont pas fait apparaître.
Certains écarts sont importants.
GPT-6 Astra, publié par OpenAI le 3 septembre 2026, a une coupure d'entraînement au 30 avril 2026. Il avait donc déjà quatre mois de retard le jour de sa mise en ligne. Gemini 3.1 Pro, sorti le 19 février 2026, s'arrête à janvier 2025, soit plus d'un an d'écart. Claude Sonnet 5, sorti le 30 juin 2026, a une coupure de janvier 2026 ; Claude Opus 5.5, sorti le 22 septembre 2026, a une coupure de juin 2026. Llama 4 de Meta, sorti le 5 avril 2025, porte une coupure d'août 2024.
L'argument central de la page est qu'un outil de recherche ne règle pas le problème. Quand un modèle cherche sur le web, il lit quelques pages, s'en sert pour une seule réponse et oublie, écrit le site. La recherche doit en plus être déclenchée par le modèle lui-même, avec les mêmes poids qui contiennent l'information périmée. Les oublis se concentrent donc là où le modèle est le plus sûr de lui. L'auteur indique avoir fait tourner 16 modèles dans un outil de recherche web sur 2 000 appels. Les modèles de pointe décidaient de chercher correctement presque à chaque fois. Les plus faibles répondaient de mémoire à des questions tranchées après que la réponse avait changé, et cherchaient sur le web des choses comme le point d'ébullition de l'eau. Dans un exemple, cinq des 16 ont désigné un homme mort comme roi de Norvège.
Rien de tout cela n'est évalué par les pairs. La page est un projet Show HN, les chiffres viennent du banc d'essai de l'auteur, et la liste de modèles est un instantané plutôt qu'un recensement. Mais le fond du propos ne dépend pas de la solidité de l'expérience. Un modèle lancé en septembre avec une coupure d'avril se trompe sur septembre d'une manière qu'un score de référence ne montrera pas.
Un second signal, plus difficile à ignorer, est apparu la même semaine. Il porte sur les modèles que les gens utilisent réellement. CNBC rapporte le 26 septembre que les modèles chinois sont passés d'une petite part d'usage à une majorité sur deux passerelles de développeurs. Sur OpenRouter, ils représentaient 57 % à 67 % des tokens pendant la semaine du 14 septembre, contre 6 % à 13 % en février. Sur Vercel, leur part est montée à 55 % en août, contre 11 % en janvier.
Les chiffres d'OpenRouter couvrent des entreprises aux États-Unis, en Europe et dans ce qu'il définit comme le « Global South », 82 pays d'Amérique centrale et du Sud, d'Afrique et d'Asie. Vercel n'a pas fourni de répartition géographique. Le même rapport note que les modèles de pointe américains attirent toujours plus de dépenses globales : la part de tokens et la part de revenus pointent donc dans des directions différentes.
Peter Walker, responsable des analyses chez OpenRouter, a déclaré à CNBC que les modèles open source chinois sortis cette année « peuvent crédiblement fonctionner dans des cas d'usage agentiques avancés, en particulier pour le codage, d'une manière qui n'était tout simplement pas vraie fin 2025 », et qu'ils sont « incroyablement rentables comparés à la plupart des modèles des laboratoires américains ». Harpreet Arora, responsable de l'infrastructure agentique chez Vercel, résume le mécanisme simplement : une fois qu'un modèle atteint le seuil de qualité pour une tâche, la différence de prix devient déterminante.
Washington s'y intéresse. Deux commissions de la Chambre des représentants américaine enquêtent sur l'adoption croissante des modèles chinois. CNBC rapporte des inquiétudes sur l'accès à distance aux puces Nvidia via des centres de données à l'étranger et sur la distillation, où des modèles plus récents imitent des plus anciens. Daniel Remler, du Center for a New American Security, a déclaré à CNBC que « la préoccupation ultime est que l'intégration des modèles d'IA chinois entraîne des pays dans une sphère d'influence technologique chinoise qui se durcit en alignement géopolitique ».
Mettez les deux histoires côte à côte : la question des repères change de forme.
Un classement mesure un modèle sur un ensemble fixe de tâches le jour du test. Il ne mesure pas à quel point les connaissances du modèle se sont éloignées du présent, ni si quelqu'un peut se permettre de le faire tourner à grande échelle. La page stale.jock.pl soutient que les modèles sont de mauvaises sources sur eux-mêmes. Elle suggère de pointer un agent vers un fichier models.json lisible par machine avant qu'il ne présente un modèle, une version ou une date comme actuels. C'est une petite correction. Le problème plus large est que la preuve par défaut du secteur, le tableau de référence, reste muette sur la fraîcheur comme sur le prix.
Nvidia fait un pari proche, selon Rest of World. L'entreprise a dépensé 7 milliards de dollars le mois dernier pour une participation dans la start-up américaine de codage Poolside et une licence sur ses outils de construction de modèles, et a accepté de payer près de 13 milliards de dollars pour Hugging Face. Son propre modèle gratuit, qui devrait s'appeler Nemotron 4, est attendu d'ici la fin de l'année. Le rapport indique que les modèles ouverts américains précédents ont été distancés par les modèles gratuits chinois, téléchargés environ 2 milliards de fois cette année selon un rapport de Hugging Face d'août. Les dépenses de Nvidia visent à faire de Nemotron le socle que les gouvernements choisiront plutôt que celui de Meta ou d'Alibaba.
Les Émirats arabes unis sont le cas d'école. Leur centre de données phare tournera sur 400 000 puces Nvidia, et G42, l'entreprise d'IA soutenue par l'État, a rejoint l'alliance de Nvidia sur les modèles ouverts en juillet. Le Technology Innovation Institute, qui a construit Falcon, prend le parti inverse. « En tant que laboratoire qui construit des modèles, nous estimons que maintenir la diversité des perspectives en IA et préserver une pleine souveraineté technologique exige une base forte et locale », a déclaré à Rest of World Hakim Hacid, chercheur en chef du TII.
Aucun tableau de référence ne tranche entre ces deux positions. Un pays ou une entreprise qui choisit un modèle de base choisit une chaîne d'approvisionnement, une courbe de coûts et un rythme de mise à jour. La coupure publiée est l'un des rares chiffres solides disponibles sur ce dernier point.
Sources
3- 01Show HN: How stale is your AI? Release age and training cutoff for 20 modelsEN
- 02Chinese AI models surge in global popularity — and Washington is worriedEN
- 03Nvidia's free AI model could push the UAE closer to the U.S.EN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.