Modèles chinois ouverts : l'avantage sur les prix est réel, mais il ne suffit pas
Les modèles chinois à poids ouverts réduisent l'écart de performance à moindre coût. Mais le coût réel par tâche accomplie peut grimper, et l'écosystème américain garde la main sur le cloud et les données propriétaires.

En deux ans, les modèles chinois à poids ouverts ont changé le marché de l'intelligence artificielle. L'analyse de Banque Lombard Odier, reprise par CorCom, reconnaît qu'ils ont réduit l'écart de performance avec les alternatives occidentales à un coût nettement inférieur. Elle prévient aussi que leurs avantages sont en partie surestimés.
Le coût par tâche, pas par token
Le prix par token ne mesure pas le coût réel. La distillation et le choix du modèle le plus adapté à chaque tâche peuvent faire grimper la facture d'une activité terminée, et le temps qu'il faut pour la terminer. Une partie de l'économie initiale disparaît. En même temps, la baisse des prix élargit l'adoption au lieu de réduire la dépense globale. C'est le paradoxe de Jevons : une ressource moins chère se consomme en plus grande quantité.
Dans l'analyse, les États-Unis conservent une position solide grâce à l'infrastructure cloud et aux données propriétaires. Les modèles de frontière justifient toujours une prime de prix sur les tâches complexes. Côté matériel, la domination américaine dans les accélérateurs avancés reste le principal facteur d'avantage. La Chine compense par l'abondance d'énergie et par la vitesse à mettre en service la puissance de calcul disponible.
Un cas concret
L'exemple le plus récent vient de DeepSeek. Le modèle V4.1 Flash est monté le 10 septembre 2026 sur le réseau national des supercalculateurs chinois. On y accède via API depuis la page de service du modèle. Il adopte une architecture Mixture-of-Experts de 552 milliards de paramètres, avec une structure asymétrique Causal-Encoder-Decoder, 8 milliards de paramètres activés en entrée et 16 milliards en sortie. La fiche officielle annonce une mémoire de cache réduite à un quart des besoins en HBM et à un huitième de ceux sur SSD par rapport à la génération précédente. Le cache tient en 890 octets par token, le contexte va jusqu'à un million de tokens, et le tout sort sous licence MIT en formats de quantification FP8, BF16, GPTQ, AWG et GGUF.
« Le modèle le moins cher n'est pas celui qui coûte le moins par token, mais celui qui résout le problème du premier coup » : c'est la règle opérationnelle qui ressort de l'analyse.
Ce qu'il reste à faire
Pour les entreprises, la conséquence est méthodologique. Mieux vaut mesurer les coûts par résultat que par volume, évaluer le modèle sur la charge de travail précise plutôt que sur des benchmarks généraux, et préserver la portabilité entre fournisseurs pour ne pas se retrouver lié quand les prix changent. De ce point de vue, les modèles à poids ouverts font office d'assurance contre le risque de dépendance.
Sources
3- 01CorCom — AI, la Cina sfida i big USA sui prezzi ma l'ecosistema americano tieneIT
- 02IT之家 — DeepSeek V4.1 Flash sulla rete nazionale dei supercomputerZH
- 03DeepSeek — V4.1 Flash release notes (architettura, cache, licenza MIT)EN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.