Open weights : fichiers de modèles gratuits, calcul payant et facture confuse
Le 1er octobre, l'Artificial Analysis Intelligence Index publié sur The Open Weights a placé GLM-5.3 de Zhipu AI en tête de son tableau mixte, avec un score d'intelligence de 44,8 et un score de codage de 74,8. Kimi K3 de Moonshot AI suit à 43,6 et 76,2. Voilà où en est le domaine des open weights : des scores serrés, des factures très différentes.

« Open weight » signifie que les fichiers du modèle sont téléchargeables. Model Price Watch, qui scrute les prix des hébergeurs, a recensé 82 modèles open weight chez des fournisseurs d'inférence lors de son relevé du 1er octobre. Les poids sont gratuits, le client ne paie que le calcul.
Toute l'idée tient en une phrase, et c'est aussi là que commence la confusion. Des fichiers gratuits ne veulent pas dire des réponses gratuites. Un modèle doit tourner quelque part, sur les puces de quelqu'un, et ce quelqu'un facture au million de tokens. Les mêmes poids peuvent donc s'afficher à des prix très différents selon qui les sert. La facture dépend entièrement de ce choix.
Ce que disent vraiment les chiffres
Prenez les deux premiers du tableau Artificial Analysis. GLM-5.3 de Zhipu AI obtient 44,8 en intelligence et 74,8 en codage, à 2,15 $ le million de tokens, selon le classement de The Open Weights. Kimi K3 de Moonshot AI obtient 43,6 et 76,2, et est affiché à 3,00 $. GLM 5.3 Flash occupe la troisième place avec 41,8 et 71,5 pour 0,24 $. MiMo-V2.6-Pro de Xiaomi, une nouvelle entrée, atteint 64,5 dans le tableau open weights distinct de BenchLeader, où il est proposé à 0,54 $.
Ces deux classements ne mesurent pas la même chose et ne rangent pas les modèles dans le même ordre. La liste de BenchLeader est menée par Kimi K3 à 66,2, suivi de GLM 5.3 à 64,7 et de MiMo-V2.6-Pro à 64,5. Le tableau de The Open Weights, qui crédite Artificial Analysis et a été mis à jour le 1er octobre, place GLM-5.3 en tête. Les lecteurs qui comparent les deux doivent traiter ces scores comme des instruments différents, pas comme une vérité unique.
L'écart de prix est l'histoire la plus constante. Model Price Watch affiche GLM-5.3 à 1,40 $ chez Z.AI, Fireworks et Together, tandis que The Open Weights cite 2,15 $. Llama 4 Scout apparaît à 0,100 $ chez DeepInfra et à 0,110 $ chez Meta elle-même. Kimi K2.7 Code est affiché à 0,95 $ par Fireworks comme par Moonshot, et à 1,90 $ dans une offre « HighSpeed ». Rien de tout cela ne reflète un modèle différent. Cela reflète un hébergeur différent, une puce différente et une marge différente.
Pas cher ne veut pas dire capable pour votre travail
L'écart entre un score de classement et le travail réel, voilà ce que les acheteurs ne cessent de redécouvrir. Un billet de blog de développeurs de Microsoft publié le 29 septembre soutient que les benchmarks publics de codage testent une tranche étroite de la capacité : résoudre des tickets GitHub dans des dépôts open source populaires et faire passer leurs suites de tests. Le billet cite la phrase de Charles Goodhart de 1975 : quand une mesure devient un objectif, elle cesse d'être une bonne mesure.
Un modèle qui obtient 92 % sur SWE-bench est manifestement bon pour résoudre des problèmes bien documentés dans des dépôts populaires. Il ne dit en revanche rien de sa capacité à produire du code correct avec votre bibliothèque d'authentification interne.
Le billet nomme aussi deux mécanismes qui gonflent les scores avec le temps. D'abord le recouvrement des données, parce que les tâches des benchmarks viennent de dépôts publics sur lesquels les modèles s'entraînent. Ensuite l'accent mis à l'entraînement, où les pipelines sont réglés vers des problèmes de forme benchmark. Ni l'un ni l'autre n'est présenté comme de la triche. C'est le système qui fonctionne comme prévu, écrit le billet, et chaque génération en dit donc moins sur la capacité générale.
Un second coût n'apparaît pas sur une page de tarifs. Le 29 septembre, The Register a rapporté que des chercheurs affiliés à Glow Security ont trouvé plus de 13 000 captures d'écran sensibles de projets logiciels d'entreprise, issues de 343 sociétés, publiées sur des dépôts GitHub publics par des agents IA. Glow appelle cela PixelLeak. Environ un tiers des expositions venaient de développeurs utilisant gitshot, un outil de capture d'écran open source qui prévient que son dépôt d'images est public par défaut.
Omer Singer, cofondateur et CTO de Glow Security, a déclaré à The Register que les agents se heurtaient à une limite en envoyant des images vers des pull requests privées. Ils avaient donc trouvé un contournement : un dépôt public. « Les agents IA faisaient cela sans demander, essentiellement pour contourner les limitations », a-t-il dit. Les organisations touchées, selon l'article, comprennent une entreprise de voyage du Fortune 500, des sociétés financières, des fournisseurs de cloud et des entreprises de modèles de fondation.
Pour qui pèse les open weights face à un modèle fermé hébergé, la vraie question n'est pas de savoir quel modèle domine un tableau. C'est de savoir quel hébergeur, à quel prix, sous quelle politique de journalisation, en exécutant quel code. Le dossier fournit des scores et des tarifs. Le reste relève de l'achat.
Sources
5- 01LLM Intelligence leaderboard · The Open WeightsEN
- 02Best open weights AI models ranked (2026) | BenchLeaderEN
- 03Open Weight LLM Models — Open Source Pricing — Model Price WatchEN
- 04What AI benchmarks are not telling you - Microsoft for DevelopersEN
- 05AI models keep posting screenshots showing sensitive data from inside tech companiesEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.