Puissance de calcul : les fournisseurs chinois misent sur le logiciel
« Une carte et demie 6000D bat une B300 » : c'est la formule d'un fournisseur chinois de cloud de calcul pour résumer l'optimisation de l'inférence. Inspur évoque de son côté une lacune de 381 milliards de dollars d'ici 2030.

Dans le débat sur le coût de l'IA, le prix des cartes graphiques domine. Le fournisseur chinois d'infrastructure METASTONE affirme que les plus grandes réserves se trouvent ailleurs, dans le logiciel. L'entreprise a optimisé la prise en charge du modèle DeepSeek-V4.1-Flash pour qu'il tourne sur huit cartes reliées uniquement par PCIe, sans bus rapide entre processeurs.
QbitAI décrit le résultat : le débit d'entrée est passé de 1932 à 13 274 tokens par seconde, soit 6,87 fois plus. L'entreprise a complété le noyau de calcul, reconstruit la communication entre cartes et réutilisé le cache de contexte. Elle résume la chose par la formule « une carte et demie 6000D bat une B300 » : un matériel moins cher et plus lent l'emporte sur un matériel plus cher si le traitement est bien agencé. La société gère plus de 20 000 P de puissance de calcul dans une quinzaine de centres et annonce une disponibilité de service supérieure à 99,95 pour cent.
La deuxième voix vient d'Inspur, qui s'est appuyé sur les données d'IDC lors de la conférence AICC 2026. Selon elles, la demande mondiale de puissance de calcul pour l'IA sera couverte à 79 pour cent en 2024, à 71 pour cent en 2027 et à environ 77 pour cent en 2030. L'écart entre les besoins et l'offre atteindra 380,9 milliards de dollars, dix fois plus qu'en 2024. La consommation de tokens doit croître à un rythme supérieur à 48 fois par an en glissement cumulé, et les tâches d'inférence atteindre 4000 billions par an en 2030.
Inspur répond à cela par le matériel. Le système SD200 Ultra réunit 128 puces, 8 TB de mémoire et 64 TB d'espace disque dans une seule machine. Il doit ainsi prendre en charge des modèles d'un billion de paramètres sans les répartir sur plusieurs baies. La latence de communication tous vers tous a été réduite à 0,69 microseconde.
Pour les acheteurs de puissance de calcul, le prix par token cesse donc d'être fonction du seul prix du matériel. Il dépend de plus en plus de la façon dont le fournisseur sait exploiter ce qu'il possède déjà, et cela change les règles des appels d'offres pour les services cloud.
La conclusion est pratique. Puisqu'un gain de débit de plusieurs fois a été obtenu par la seule réécriture de la gestion du cache et par la répartition du travail entre les puces disponibles, la décision d'acheter une nouvelle génération de matériel devrait être précédée d'un audit du logiciel. Le fournisseur capable de montrer des valeurs mesurées sur la même infrastructure vend aujourd'hui non pas de la puissance de calcul, mais une économie. C'est aussi la façon la plus simple dont les opérateurs chinois de centres de données répondent aux restrictions à l'exportation : là où l'on ne peut pas acheter les cartes les plus puissantes, c'est avant tout l'efficacité de ce qui est déjà installé en salle serveur qui compte.
Sources
2Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.