Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Calcul d'IA : après l'empilement de cartes, deux voies pour la Chine selon IDC

À l'AICC 2026, le rapport d'IDC découpe le déficit de calcul en deux axes : le plafond de capacité et le volume de production. D'ici 2030, ce déficit pourrait atteindre 380,9 milliards de dollars. Empiler des cartes ne suffit plus à couvrir les charges distinctes du Prefill et du Decode.

IA & modèlesAnalyseSophie LeclercPublié le: 23 septembre 20267 min de lectureSources 2
Calcul d'IA : après l'empilement de cartes, deux voies pour la Chine selon IDC

Pendant des années, la concurrence dans le calcul d'IA s'est résumée à un mot : empiler. Des cartes, des baies, des générateurs. À l'AICC 2026, le rapport d'IDC « Évaluation du développement du calcul d'IA en Chine 2026 » découpe le problème en deux niveaux : le plafond d'intelligence et le volume d'intelligence.

La demande, d'abord. Le rapport indique qu'en 2030, les tâches d'inférence d'IA dans le monde augmenteront de 4 000 billions par an. La consommation de tokens d'une tâche multi-tours passe de quelques dizaines à plusieurs centaines de milliers. La coordination multi-agents amplifie ces deux facteurs. Selon IDC, de cette année à 2030, le taux de croissance annuel composé de la consommation mondiale de tokens atteindra 4 823 %.

L'offre ne suit pas. Le taux de satisfaction de la demande mondiale de calcul d'IA baisse depuis 2024 : de 79 %, il devrait tomber à 71 % en 2027. Même si la chaîne d'approvisionnement des semi-conducteurs se détend, il ne remonterait qu'à environ 77 % en 2030. Le déficit absolu de calcul atteindra alors 380,9 milliards de dollars, près de dix fois le niveau de 2024.

Pourquoi empiler des cartes ne suffit-il plus ? Parce que les charges d'inférence de l'ère des agents sont hétérogènes. Le Prefill est une tâche massivement parallèle et dense en calcul. Le Decode traite les tokens en série et dépend de la bande passante mémoire. L'Attention accède sans cesse à un KV Cache en croissance. Le MoE ajoute le calcul sparse et le routage à grande échelle. Empiler un seul type de calcul finit par déséquilibrer les ratios de ressources.

Les fabricants de matériel répondent par deux voies. La première mise sur la capacité. Le serveur AI à super-nœud YuanNao SD200 Ultra passe de 64 à 128 puces par machine, et la mémoire vidéo comme le stockage extensible atteignent 8 To et 64 To. La firme annonce qu'une seule machine peut héberger et exécuter Kimi K3 à 2 800 milliards de paramètres, voire déployer un modèle à 10 000 milliards de paramètres. L'adressage unifié et les liaisons symétriques directes réduisent la latence All to All à 0,69 microseconde. Des super-opérateurs divisent par dix le nombre d'opérateurs. La firme annonce une performance d'inférence plus de 3 fois supérieure sur Kimi K3.

La seconde mise sur le volume. Le groupe de calcul hétérogène YuanNao HC2000 utilise le refroidissement liquide intégral et une alimentation à fort débit. Chaque armoire fournit plus de 300 kilowatts et peut accueillir jusqu'à 256 cartes d'accélération AI. La densité de calcul y est quatre fois supérieure à celle d'une armoire refroidie par air, et la bande passante agrégée atteint 200 Tbps dans l'armoire. Le système répartit les puces selon l'étape d'inférence : le Prefill sur des puces à fort calcul, le Decode sur des puces à grande capacité HBM.

Ces deux voies partagent un prérequis : mieux utiliser le calcul disponible. L'article DSec publié par DeepSeek va dans le même sens. L'entraînement d'agents exige de créer chaque seconde un grand nombre de bacs à sable, ce qui pèse bien plus sur l'ordonnancement du cluster que le pré-entraînement classique. Pour le calcul intelligent chinois, la prochaine compétition ne portera pas sur le nombre de cartes, mais sur la finesse de l'ordonnancement des ressources hétérogènes.

Commentaires 0

Sources

2
  1. 01AI 算力之争不靠堆卡!浪潮信息捅破智算能力天花板ZH
  2. 02DeepSeek 新论文公开 Agent 训练,梁文锋署名ZH

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.