Poids ouverts, arguments fermés : la course aux modèles ouverts se durcit à mesure que les régulateurs avancent
La FTC a ouvert une enquête à l'échelle du secteur sur OpenAI, Anthropic et d'autres laboratoires d'IA, au sujet des risques que leurs produits font peser sur les consommateurs. CNBC l'a confirmé le 30 septembre. La même semaine, les modèles à poids ouverts continuaient de battre des records sur les classements publics, et OpenAI accusait Moonshot AI d'une attaque par distillation.

La Federal Trade Commission a ouvert une enquête sur OpenAI, Anthropic et d'autres entreprises d'IA. Un porte-parole de l'agence l'a confirmé à CNBC le 30 septembre. Le New York Post avait révélé l'enquête le premier.
Selon The Guardian, c'est la première action coercitive officielle aux États-Unis qui examine directement les agents d'IA dévoyés. Elle fait suite à une série d'incidents signalés pour la première fois en juillet. La FTC prévoit d'envoyer des demandes formelles d'information et de contraindre des dirigeants à témoigner, notamment au sein du groupe de recherche Metr. Anthropic et OpenAI ont fait appel à ce groupe pour des enquêtes indépendantes sur les incidents.
Les poids ouverts continuent de grimper
Pendant que les régulateurs avancent, les classements de poids ouverts ne cessent d'être rebattus. Le tableau des poids ouverts de BenchLeader, mis à jour dans la dernière journée, place Kimi K3 de Moonshot AI en tête avec 66,2. Suivent GLM 5.3 de Zhipu AI à 64,7 et MiMo-V2.6-Pro de Xiaomi à 64,5.
BenchLM.ai classe le même ensemble différemment : MiMo-V2.6-Pro premier à 75,5 sur son score BenchAlign v5.8, devant Qwen3.8 Max et MiMo-V2.6-Flash. Les deux sites utilisent des contrats de notation et des étiquettes de preuve différents. Le désaccord porte donc autant sur la méthodologie que sur les modèles. L'annuaire de LMC Marketcap, qui recense 175 modèles ouverts, place Qwen3.8 27B au plus haut à 71. The Open Weights, citant des données d'Artificial Analysis actualisées le 1er octobre, attribue à GLM-5.3 le meilleur score d'intelligence à 44,8, devant Kimi K3 à 43,6.
Lus ensemble, les quatre classements s'accordent sur un point : les laboratoires chinois occupent la plupart des premières places.
Nvidia s'est engouffré dans un autre recoin du catalogue ouvert le 29 septembre. Son modèle de fondation tabulaire Kumo Tabular, publié sous licence OpenMDW-1.1, existe en trois tailles, de 28M à 215M de paramètres. Il a été préentraîné uniquement sur des données artificielles et prédit des étiquettes en une seule passe avant, sans entraînement, réglage ni ingénierie des caractéristiques, selon le billet de l'entreprise sur Hugging Face. Nvidia affirme qu'il occupe la première place sur TabArena, BeyondArena, TALENT et ScoringBench.
Petits modèles, tâches étroites
Les sorties ouvertes les plus intéressantes de la semaine sont petites et spécifiques. Fermion Research a publié Phonon-2 le 30 septembre, un modèle de reconnaissance vocale en anglais qui tient dans un téléchargement de 164 Mo. Il affiche en moyenne 5,21 % d'erreur de mot sur les sept ensembles anglais du classement Open ASR, dans la marge de bruit de son enseignant de 2,5 Go, et fait mieux sur les réunions et les discours parlementaires. Les poids sont en CC-BY-4.0, dérivés du Parakeet TDT 0.6B v3 de Nvidia.
La famille Holo4 de H Company, couverte par MarkTechPost, décline des poids d'usage informatique en deux tailles : un modèle dense de 27B et un mélange d'experts de 35B-A3B. Le plus grand est publié sous Apache 2.0 pour l'auto-hébergement commercial. Le 27B, qui obtient 85,2 % sur OSWorld à 0,08 dollar par tâche selon les propres chiffres de H, est en CC BY-NC 4.0 : l'usage commercial passe donc par l'API du fournisseur. MarkTechPost note que les comparaisons avec les modèles de pointe ont utilisé des harnais différents et que 480 des 600 tâches publiques d'AutomationBench figurent dans l'ensemble d'entraînement de H.
« Rapide et bon marché, c'est très facile, vous savez », a déclaré Diogo Almeida, PDG de TypeSafe, à TechCrunch. « Si vous voulez vraiment rapide et bon marché, utilisez des dés, non ? L'intelligence, c'est la partie difficile. »
Cette citation pointe l'histoire discrète qui se cache sous les classements : le format de modèle de décision à la Jev, qui renvoie des choix et des probabilités au lieu de prose, se répand vite. L'API Decisions d'OpenAI, annoncée au DevDay, applique la même idée à son modèle Luna, a rapporté TechCrunch le 30 septembre. Nimble de Bespoke Labs, un modèle de 9B construit sur Qwen3.5-9B, publie sa recette d'entraînement complète et 2 676 exemples d'entraînement. Le dépôt indique clairement qu'il n'a pas distillé à partir de Jev. Ollama a ajouté la prise en charge locale de Nimble dans la version 0.35. Jevstiller, un outil ouvert couvert par The Register le 29 septembre, revendique 98 % d'accord avec Jev tout en répondant sur l'appareil à des requêtes familières en à peine 15 ms.
L'accusation, et le haussement d'épaules
La température politique est montée le 30 septembre. OpenAI a déclaré avoir déjoué une campagne de distillation adverse qui s'est déroulée du 1er juillet au 28 juillet, culminant les 24 et 25 juillet avec 16 000 requêtes provenant de plus de 4 000 utilisateurs. Le blog d'OpenAI indiquait que le noyau principal venait de Moonshot AI. The Register a relevé l'ironie dans un titre et souligné que Moonshot n'avait pas répondu à une demande de commentaire.
Kimi K3 de Moonshot figure près du sommet de plusieurs classements ouverts cette semaine. Savoir si les accusations de distillation changent la façon dont les entreprises choisissent leurs poids est une autre question. L'argument de la facture de tokens pèse davantage que n'importe quelle accusation.
Sources
14- 01FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
- 02US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
- 03Best open weights AI models ranked (2026)EN
- 04Open-Source LLM Leaderboard 2026: 94 Models RankedEN
- 05Best Open Source AI Models & LLM Leaderboard (2026)EN
- 06LLM Intelligence leaderboardEN
- 07NVIDIA Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 08Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 09H Company Releases Holo4: Open-Weight Computer-Use ModelsEN
- 10OpenAI's Jev clone could help the frontier lab stop its swarming agentsEN
- 11Nimble: Data, Model, Recipe for an Open Jev (From Bespoke Labs)EN
- 12Ollama now supports Jev-like decision models all locally in 0.35EN
- 13Open source tool distills Jev so you can run it locallyEN
- 14Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.