Les modèles ouverts chinois captent la majorité des tokens sur deux passerelles de développeurs
En 2026, les modèles d'IA chinois sont passés d'une petite minorité à une majorité des tokens sur OpenRouter et Vercel, selon des données d'usage transmises à CNBC. Washington ouvre des enquêtes sur ce basculement.

Deux passerelles de développeurs qui orientent le trafic vers de nombreux fournisseurs de modèles envoient désormais la plupart de leurs tokens vers des laboratoires chinois. Sur OpenRouter, les modèles chinois ont représenté 57% à 67% des tokens utilisés dans la semaine du 14 septembre, contre 6% à 13% en février, selon des données d'usage transmises à CNBC. Sur Vercel, la part est montée à 55% en août, contre 11% en janvier. CNBC a publié ces chiffres le 26 septembre.
Ces nombres décrivent le routage, pas les scores aux benchmarks. Ils restent le signal d'adoption le plus clair publié ce trimestre.
Les données d'OpenRouter couvrent des entreprises aux États-Unis, en Europe et dans ce que la plateforme appelle le « Global South », soit 82 pays d'Amérique centrale et du Sud, d'Afrique et d'Asie. Vercel n'a pas précisé de répartition géographique pour son chiffre. Environ la moitié des tokens sur OpenRouter sont consommés par des entreprises aux États-Unis. La composition globale de la plateforme ne dépend donc pas d'une seule région.
Le prix, puis la capacité
Peter Walker, responsable des analyses chez OpenRouter, a déclaré à CNBC que les modèles open source chinois sortis cette année « peuvent réellement fonctionner dans des cas d'usage agentiques avancés, en particulier pour le code, ce qui n'était tout simplement pas vrai fin 2025 ». Il a ajouté qu'ils sont « extrêmement rentables comparés à la plupart des modèles des laboratoires américains ». Harpreet Arora, responsable de l'infrastructure agentique chez Vercel, dit la même chose en termes d'ordre : « Les modèles chinois deviennent assez capables pour plus de tâches à un coût bien plus faible. Une fois qu'un modèle atteint le seuil de qualité pour le travail, cet écart de prix devient décisif. » Arora précise aussi que les entreprises veulent toujours des modèles frontière américains pour certaines tâches plus difficiles. Cette réserve compte. Le rapport de CNBC note que les modèles frontière américains attirent toujours plus de dépenses globales, même là où la part de tokens s'est inversée. Le nombre de tokens récompense le travail bon marché et volumineux, comme la génération de code et les boucles d'agents. La dépense récompense les appels coûteux que les clients réservent aux tâches qu'ils ne peuvent pas se permettre de rater.
Dans le groupe « Global South » suivi par OpenRouter, plus des deux tiers des tokens, 67%, sont allés à des modèles chinois ces dernières semaines. Daniel Remler, chercheur senior au CNAS, a déclaré à CNBC que l'Asie du Sud-Est en particulier pourrait connaître une adoption importante en raison des liens économiques et culturels avec la Chine et d'une infrastructure numérique en croissance. « Partout, de Lagos à São Paulo à Jakarta, où les entrepreneurs et les gouvernements cherchent des modèles ouverts et bon marché, on se tournera d'abord vers l'IA chinoise », a-t-il dit.
Anthropic et OpenAI ont tous deux annoncé des modèles moins chers plus tôt cette semaine-là. Dianne Penn, qui dirige la gestion produit pour la recherche et les laboratoires chez Anthropic, a déclaré à CNBC que l'entreprise cherchait à rendre les réponses « plus efficaces, afin qu'elles utilisent moins de tokens selon votre réglage d'effort ».
Washington ouvre des dossiers
Deux commissions de la Chambre des représentants américaine enquêtent sur l'impact de l'adoption croissante des modèles chinois, selon le même rapport. Les préoccupations affichées sont la concurrence technologique, la sécurité et l'influence mondiale de Pékin. Les États-Unis ont tenté de protéger leur avance en interdisant aux entreprises chinoises d'IA d'acheter les puces les plus avancées via des contrôles à l'exportation. Washington s'inquiète aussi de l'accès à distance aux puces Nvidia via des centres de données à l'étranger, et de la « distillation », où de nouveaux modèles sont entraînés à imiter des modèles plus anciens et établis. Remler a formulé le risque en termes d'alignement plutôt que de performance brute. L'IA chinoise représente « de vrais risques économiques et de sécurité pour les États-Unis », a-t-il déclaré à CNBC, et « la préoccupation ultime est que l'intégration des modèles d'IA chinois entraîne des pays dans une sphère d'influence technologique chinoise qui se durcit en alignement géopolitique ». L'IA a été un sujet majeur lors de la rencontre cette semaine entre le président américain Donald Trump et le président chinois Xi Jinping, rapporte CNBC.
Les données d'adoption côtoient un autre ensemble d'affirmations sur la fraîcheur des modèles, plus difficile à vérifier et plus facile à rater. Une page Show HN publiée le 16 septembre, stale.jock.pl, liste les dates de sortie et les coupures d'entraînement de 20 modèles issus de 8 laboratoires, et compte en direct depuis chaque date. Elle indique que 10 des 20 modèles ont une coupure réellement publiée par leur laboratoire, et que 5 des 8 laboratoires, Anthropic, Google DeepMind, Meta, OpenAI et xAI, ont publié une coupure pour au moins un modèle de la liste. La page note qu'une case vide signifie que les sources vérifiées du fournisseur n'ont pas établi de coupure, pas la preuve qu'il n'en existe aucune.
Son propre exemple illustre le mieux l'écart. GPT-6 Astra, selon cette page, est sorti le 3 septembre 2026 avec des données d'entraînement s'arrêtant au 30 avril 2026, soit environ quatre mois de retard le jour du lancement. La même page rapporte un test où 16 modèles ont chacun reçu un outil de recherche web sur plus de 2 000 appels : les modèles frontière ont tranché correctement presque à chaque fois, tandis que les plus faibles énonçaient des faits établis qui avaient changé sans vérifier, et cherchaient sur le web des choses comme le point d'ébullition de l'eau.
C'est une mise en garde pour quiconque lit les chiffres d'adoption comme un verdict de qualité. La part de tokens mesure ce que les développeurs routent. Elle ne mesure pas si le modèle sait quel jour on est.
Trois autres sorties ce mois-ci pointent dans des directions différentes. Cactus Compute a publié Needle 3 le 18 septembre, une famille de modèles qu'elle décrit comme produisant des binaires CQ2-bit de 9 à 29 MB, avec un sous-réseau à 4 couches annoncé comme égalant DeepSeek V4 Flash lorsqu'il est ajusté sur des tâches aval pendant une époque ; l'entreprise dit s'être entraînée sur 360B tokens d'un jeu de données structuré propriétaire et rapporte 400 à 4 000 tokens/s en décodage sur un Raspberry Pi 5. Cua a publié CUA-S1 le 19 septembre, une sortie de recherche sous licence MIT, source uniquement, de petits modèles pour les décisions d'usage informatique, avec des poids hébergés séparément sur Hugging Face. Et le 21 septembre, un projet appelé mini-AGI a montré un modèle byte-level à apprentissage continu s'entraînant sur un seul GPU de 8 GB de VRAM, avec des poids pas encore publiés et une exécution à 7,14% de son corpus.
Aucun de ces trois projets ne déplace les chiffres d'OpenRouter ou de Vercel. Ils montrent où pousse le bas du marché : l'inférence locale sur appareil, les décisions bornées et les entraînements qui tiennent sur le matériel d'un seul développeur. Savoir si cela change la répartition des tokens est une question pour la prochaine série de chiffres des passerelles, pas pour celle-ci.
Sources
5- 01Chinese AI models surge in global popularity, and Washington is worriedEN
- 02How stale is your AI? Release age and training cutoff for 20 modelsEN
- 03Needle 3: 8-29 MB foundation model for tiny devicesEN
- 04CUA-S1: A System One Model for Computer UseEN
- 05mini-AGI: continual learning model trained on 8GB VRAMEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.