Calcul d'IA : après l'empilement de cartes, deux voies pour la Chine selon IDC
À l'AICC 2026, le rapport d'IDC découpe le déficit de calcul en deux axes : le plafond de capacité et le volume de production. D'ici 2030, ce déficit pourrait atteindre 380,9 milliards de dollars. Empiler des cartes ne suffit plus à couvrir les charges distinctes du Prefill et du Decode.

Pendant des années, la concurrence dans le calcul d'IA s'est résumée à un mot : empiler. Des cartes, des baies, des générateurs. À l'AICC 2026, le rapport d'IDC « Évaluation du développement du calcul d'IA en Chine 2026 » découpe le problème en deux niveaux : le plafond d'intelligence et le volume d'intelligence.
La demande, d'abord. Le rapport indique qu'en 2030, les tâches d'inférence d'IA dans le monde augmenteront de 4 000 billions par an. La consommation de tokens d'une tâche multi-tours passe de quelques dizaines à plusieurs centaines de milliers. La coordination multi-agents amplifie ces deux facteurs. Selon IDC, de cette année à 2030, le taux de croissance annuel composé de la consommation mondiale de tokens atteindra 4 823 %.
L'offre ne suit pas. Le taux de satisfaction de la demande mondiale de calcul d'IA baisse depuis 2024 : de 79 %, il devrait tomber à 71 % en 2027. Même si la chaîne d'approvisionnement des semi-conducteurs se détend, il ne remonterait qu'à environ 77 % en 2030. Le déficit absolu de calcul atteindra alors 380,9 milliards de dollars, près de dix fois le niveau de 2024.
Pourquoi empiler des cartes ne suffit-il plus ? Parce que les charges d'inférence de l'ère des agents sont hétérogènes. Le Prefill est une tâche massivement parallèle et dense en calcul. Le Decode traite les tokens en série et dépend de la bande passante mémoire. L'Attention accède sans cesse à un KV Cache en croissance. Le MoE ajoute le calcul sparse et le routage à grande échelle. Empiler un seul type de calcul finit par déséquilibrer les ratios de ressources.
Les fabricants de matériel répondent par deux voies. La première mise sur la capacité. Le serveur AI à super-nœud YuanNao SD200 Ultra passe de 64 à 128 puces par machine, et la mémoire vidéo comme le stockage extensible atteignent 8 To et 64 To. La firme annonce qu'une seule machine peut héberger et exécuter Kimi K3 à 2 800 milliards de paramètres, voire déployer un modèle à 10 000 milliards de paramètres. L'adressage unifié et les liaisons symétriques directes réduisent la latence All to All à 0,69 microseconde. Des super-opérateurs divisent par dix le nombre d'opérateurs. La firme annonce une performance d'inférence plus de 3 fois supérieure sur Kimi K3.
La seconde mise sur le volume. Le groupe de calcul hétérogène YuanNao HC2000 utilise le refroidissement liquide intégral et une alimentation à fort débit. Chaque armoire fournit plus de 300 kilowatts et peut accueillir jusqu'à 256 cartes d'accélération AI. La densité de calcul y est quatre fois supérieure à celle d'une armoire refroidie par air, et la bande passante agrégée atteint 200 Tbps dans l'armoire. Le système répartit les puces selon l'étape d'inférence : le Prefill sur des puces à fort calcul, le Decode sur des puces à grande capacité HBM.
Ces deux voies partagent un prérequis : mieux utiliser le calcul disponible. L'article DSec publié par DeepSeek va dans le même sens. L'entraînement d'agents exige de créer chaque seconde un grand nombre de bacs à sable, ce qui pèse bien plus sur l'ordonnancement du cluster que le pré-entraînement classique. Pour le calcul intelligent chinois, la prochaine compétition ne portera pas sur le nombre de cartes, mais sur la finesse de l'ordonnancement des ressources hétérogènes.
Sources
2Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.