Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Puissance de calcul : les fournisseurs chinois misent sur le logiciel

« Une carte et demie 6000D bat une B300 » : c'est la formule d'un fournisseur chinois de cloud de calcul pour résumer l'optimisation de l'inférence. Inspur évoque de son côté une lacune de 381 milliards de dollars d'ici 2030.

ÉconomieAnalyseDr Hélène FontainePublié le: 26 septembre 20265 min de lectureSources 2
Puissance de calcul : les fournisseurs chinois misent sur le logiciel

Dans le débat sur le coût de l'IA, le prix des cartes graphiques domine. Le fournisseur chinois d'infrastructure METASTONE affirme que les plus grandes réserves se trouvent ailleurs, dans le logiciel. L'entreprise a optimisé la prise en charge du modèle DeepSeek-V4.1-Flash pour qu'il tourne sur huit cartes reliées uniquement par PCIe, sans bus rapide entre processeurs.

QbitAI décrit le résultat : le débit d'entrée est passé de 1932 à 13 274 tokens par seconde, soit 6,87 fois plus. L'entreprise a complété le noyau de calcul, reconstruit la communication entre cartes et réutilisé le cache de contexte. Elle résume la chose par la formule « une carte et demie 6000D bat une B300 » : un matériel moins cher et plus lent l'emporte sur un matériel plus cher si le traitement est bien agencé. La société gère plus de 20 000 P de puissance de calcul dans une quinzaine de centres et annonce une disponibilité de service supérieure à 99,95 pour cent.

La deuxième voix vient d'Inspur, qui s'est appuyé sur les données d'IDC lors de la conférence AICC 2026. Selon elles, la demande mondiale de puissance de calcul pour l'IA sera couverte à 79 pour cent en 2024, à 71 pour cent en 2027 et à environ 77 pour cent en 2030. L'écart entre les besoins et l'offre atteindra 380,9 milliards de dollars, dix fois plus qu'en 2024. La consommation de tokens doit croître à un rythme supérieur à 48 fois par an en glissement cumulé, et les tâches d'inférence atteindre 4000 billions par an en 2030.

Inspur répond à cela par le matériel. Le système SD200 Ultra réunit 128 puces, 8 TB de mémoire et 64 TB d'espace disque dans une seule machine. Il doit ainsi prendre en charge des modèles d'un billion de paramètres sans les répartir sur plusieurs baies. La latence de communication tous vers tous a été réduite à 0,69 microseconde.

Pour les acheteurs de puissance de calcul, le prix par token cesse donc d'être fonction du seul prix du matériel. Il dépend de plus en plus de la façon dont le fournisseur sait exploiter ce qu'il possède déjà, et cela change les règles des appels d'offres pour les services cloud.

La conclusion est pratique. Puisqu'un gain de débit de plusieurs fois a été obtenu par la seule réécriture de la gestion du cache et par la répartition du travail entre les puces disponibles, la décision d'acheter une nouvelle génération de matériel devrait être précédée d'un audit du logiciel. Le fournisseur capable de montrer des valeurs mesurées sur la même infrastructure vend aujourd'hui non pas de la puissance de calcul, mais une économie. C'est aussi la façon la plus simple dont les opérateurs chinois de centres de données répondent aux restrictions à l'exportation : là où l'on ne peut pas acheter les cartes les plus puissantes, c'est avant tout l'efficacité de ce qui est déjà installé en salle serveur qui compte.

Commentaires 0

Sources

2
  1. 01PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍ZH
  2. 02AI算力之争不靠堆卡!浪潮信息捅破智算能力天花板ZH

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Dr Hélène Fontaine

Dr Hélène Fontaine

Économie, business et monde

Hélène Fontaine suit l'économie des entreprises, la conjoncture et l'international pour FLASH24. Elle croise les dépôts comptables, les rapports trimestriels et les indices d'activité, et ne retient un chiffre qu'après l'avoir comparé à sa source d'origine. Elle interroge chefs d'entreprise, économistes et syndicats, et attend chaque mois les publications de l'INSEE et de la BCE pour recouper ses tableaux. Cette rigueur vient aussi de son intérêt personnel pour la comptabilité des entreprises technologiques et les vélos cargo, deux sujets qu'elle traite avec la même méthode. Elle ne publie pas un chiffre sans avoir vérifié son calcul.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.