Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les poids ouverts réduisent l'écart : nouveaux classements, nouveau matériel et un accord sur les puces

Le 1er octobre, l'Artificial Analysis Intelligence Index, republié par The Open Weights, plaçait GLM-5.3 de Zhipu AI en tête de son tableau de 20 modèles à poids ouverts avec 44,8 points, devant Kimi K3 de Moonshot AI à 43,6. De nouvelles versions continuent d'arriver.

IA & modèlesAnalyseSophie LeclercPublié le: 30 septembre 20264 min de lectureSources 14
Les poids ouverts réduisent l'écart : nouveaux classements, nouveau matériel et un accord sur les puces

Le 1er octobre, l'Artificial Analysis Intelligence Index, republié par The Open Weights, plaçait GLM-5.3 de Zhipu AI en tête de son tableau de 20 modèles à poids ouverts avec 44,8 points, devant Kimi K3 de Moonshot AI à 43,6. De nouvelles versions continuent d'arriver.

Les classements ne concordent pas entre eux, et cela mérite d'être dit. Le tableau des poids ouverts de BenchLeader, mis à jour 12 heures avant publication, place Kimi K3 de Moonshot AI en tête à 66,2. Suivent GLM 5.3 max de Zhipu, deuxième à 64,7, et MiMo-V2.6-Pro de Xiaomi, troisième à 64,5. Le tableau de 94 modèles de BenchLM.ai classe pour sa part MiMo-V2.6-Pro premier avec un score BenchAlign v5.8 de 75,5, devant Qwen3.8 Max et MiMo-V2.6-Flash. LMMarketCap, qui a publié une mise à jour à 06:00 le 1er octobre, classe Qwen3.8 27B d'Alibaba premier parmi 175 modèles ouverts, Gemma 4 26B A4B et Gemma 4 31B de Google étant deuxièmes ex aequo.

Des panels différents, des gagnants différents. Le seul point commun aux quatre tableaux : les premières places reviennent à des laboratoires chinois et à Google, Nvidia, Meta et Mistral se trouvant plus bas.

Les dernières 72 heures ont aussi produit plusieurs nouveaux modèles ouverts qui ne figurent pas encore dans ces tableaux. Nvidia a publié Kumo Tabular le 29 septembre, un modèle de fondation pour la classification et la régression tabulaires. Il existe en trois tailles, de 28M à 215M de paramètres, a été pré-entraîné uniquement sur des données artificielles et est diffusé sous licence OpenMDW-1.1 pour un usage commercial. L'entreprise affirme qu'il occupe la première place sur TabArena, BeyondArena, TALENT et ScoringBench, et qu'il ne nécessite ni entraînement ni ingénierie de caractéristiques par tâche.

Fermion Research a publié Phonon-2 le 30 septembre, un modèle de reconnaissance vocale en anglais tenant dans un téléchargement de 164 Mo, dont l'encodeur stocke chaque poids sur environ 2,1 bits. L'entreprise indique une moyenne de 5,21 % d'erreur de mot sur les sept ensembles anglais de l'Open ASR Leaderboard. Tout modèle ouvert obtenant un meilleur score est au moins 5,8 fois plus grand, et une heure d'audio se transcrit en environ 20 secondes sur un MacBook Air. Les poids sont sous CC-BY-4.0, dérivés de Parakeet TDT 0.6B v3 de Nvidia. Bespoke Labs a publié Nimble le 30 septembre, un modèle de 9B construit sur Qwen3.5-9B qui renvoie des décisions typées avec probabilités plutôt que du texte libre. Son README précise que les exemples d'entraînement et de validation ont été publiés le 20 septembre, après avoir été omis de la première version.

Deux projets ouverts testent si la boucle d'entraînement elle-même peut être distribuée. Le dépôt coop de Commonsense AI, mis à jour le 30 septembre, décrit le pré-entraînement depuis zéro d'un modèle d'environ 145M de paramètres sur FineWeb-Edu. Des volontaires y exécutent des étapes AdamW locales sur du matériel donné et soumettent des pseudo-gradients sous forme de pull requests Hugging Face. Une tâche cron GitHub Actions sans état, toutes les cinq minutes, les agrège par une moyenne tronquée ou une médiane géométrique. L'étape 1, un modèle de 15M sur TinyStories, a dépassé son budget optimal selon Chinchilla. Séparément, PSSA, un modèle de langage non-transformer écrit en Rust sans framework de ML en dessous, affirme apprendre plus vite qu'un transformer à paramètres égaux et générer environ douze fois plus rapidement sur le même CPU.

Le côté commercial a aussi bougé. OpenAI et Synopsys ont annoncé le 30 septembre avoir signé un partenariat pluriannuel pour construire GPT-Synopsys, un modèle de conception et de vérification de puces qui piloterait directement les outils EDA de Synopsys. Il tournerait sur l'infrastructure d'OpenAI, les données clients ne servant pas à l'entraînement, et les revenus seraient partagés entre les deux. The Register a rapporté le 30 septembre qu'OpenAI accusait des individus liés à Moonshot AI d'une campagne de distillation commencée le 1er juillet. Les pics des 24 et 25 juillet ont atteint 16 000 requêtes provenant de plus de 4 000 utilisateurs, avec une activité connexe sur plus de 15 000 comptes, interrompue le 28 juillet. Moonshot n'a pas répondu à la demande de commentaire de The Register.

Les régulateurs tournent autour des mêmes laboratoires. La FTC a ouvert une enquête à l'échelle du secteur sur OpenAI, Anthropic et d'autres, a confirmé CNBC le 30 septembre. The Guardian a rapporté le même jour que l'agence prévoit des demandes formelles d'information et de témoignages, y compris auprès du groupe de recherche Metr. Ni OpenAI ni Anthropic n'ont commenté pour CNBC ; le New York Post a révélé l'enquête en premier. Le 29 septembre, une organisation à but non lucratif, Legal Advocates for Safe Science & Technology, a poursuivi OpenAI devant la Cour supérieure du comté de San Francisco au sujet du piratage de Hugging Face en juillet. Elle demande une injonction plutôt que des dommages-intérêts, selon Ars Technica, qui cite OpenAI qualifiant la plainte de « totalement dépourvue de fondement ».

Pour quiconque choisit aujourd'hui un modèle ouvert, la leçon pratique de cette semaine est qu'aucun classement ne tranche la question à lui seul. Les tableaux classent des ensembles de modèles différents, et un modèle vocal de 164 Mo ou un modèle tabulaire de 215M peuvent compter davantage pour un déploiement que celui qui occupe la première place.

Commentaires 0

Sources

14
  1. 01LLM Intelligence leaderboard - The Open WeightsEN
  2. 02Best open weights AI models ranked (2026) - BenchLeaderEN
  3. 03Open-Source LLM Leaderboard 2026: 94 Models Ranked - BenchLM.aiEN
  4. 04Best Open Source AI Models & LLM Leaderboard (2026) - LMMarketCapEN
  5. 05Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  6. 06Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  7. 07Nimble: Data, Model, Recipe for an Open Jev (From Bespoke Labs)EN
  8. 08Coop: A small language model pretrained by volunteersEN
  9. 09PSSA: A non-transformer language model written from scratch in RustEN
  10. 10OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
  11. 11Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
  12. 12FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
  13. 13US trade regulator opens investigation into AI giantsEN
  14. 14"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.