1,5 carte pour une B300 : comment le PCIe a livré 6,87 fois plus de débit
L'opérateur chinois METASTONE a fait passer le débit de DeepSeek-V4.1-Flash de 1932 à 13274 tokens par seconde sur huit cartes PCIe. Le modèle n'a pas changé : seuls des correctifs dans la pile logicielle.

La course à l'IA ne se joue plus sur « qui achète le meilleur matériel » mais sur « qui exploite le mieux ce qu'il possède déjà ». Le portail chinois qbitai a décrit les travaux de la société METASTONE. L'équipe a pris huit cartes graphiques reliées uniquement par un bus PCIe, sans interconnexion rapide entre cartes. Sur DeepSeek-V4.1-Flash, elle a obtenu une accélération difficile à qualifier de cosmétique.
Le point de départ était une configuration communautaire ordinaire. Sur le même matériel, le débit d'entrée atteignait 1932 tokens par seconde. Première étape : l'ajout des noyaux de calcul manquants, le remplacement d'un noyau FP8 lent et l'élargissement du périmètre du chemin de communication rapide. Le débit est monté à 5850 tokens par seconde. La deuxième étape a fusionné les opérateurs d'attention, superposé les calculs à la communication et appliqué des stratégies de parallélisme distinctes à la phase préalable et à la génération. Résultat : 13274 tokens par seconde. Au total, 6,87 fois plus, avec un contexte allant jusqu'à un million de tokens.
La même méthode, d'autres modèles
METASTONE indique que la même approche fonctionne plus largement. Sur DeepSeek-V4-Flash, le débit d'entrée est passé de 14546 à 22584 tokens par seconde, soit 1,55 fois. Pour GLM5.3, le bond a été de 3236,78 à 6222,72 tokens par seconde (1,92 fois). La latence P95 du premier token est tombée de 141,6 à 46,6 secondes, et le contexte pris en charge est passé de 270 mille à 1,05 million de tokens. L'entreprise soutient aussi que sa méthodologie tient sur les accélérateurs chinois, qui, comme les cartes PCIe, ne figurent pas dans les matrices de support officielles des frameworks courants.
En arrière-plan, il y a la logistique de l'opérateur. Selon ses propres données, METASTONE gère plus de 20 000 P de puissance de calcul, exploite une quinzaine de centres de calcul pour l'IA et deux centres nationaux de supercalcul. L'entreprise annonce une disponibilité des clusters à un niveau de SLA supérieur à 99,95 pour cent. Son équipe compterait à son actif trois prix Gordon Bell.
Ce qui reste comme écart face au haut de gamme
La comparaison honnête est moins spectaculaire que le titre sur un gain de sept fois. Au même point de charge, la carte B300 atteignait environ 4,9 à 5,6 fois le débit d'entrée de la machine à huit cartes PCIe. Dans les tâches de génération vidéo à partir d'une image, l'avantage se réduisait à 1,5 à 1,7 machine pour une carte B300, lorsqu'on ajoutait en plus du LoRA. Autrement dit : les cartes bon marché ne rattraperont pas le matériel haut de gamme, mais l'écart cesse d'être un gouffre.
Une carte que personne n'a inscrite dans la matrice de support d'un framework ne perd pas sa puissance : elle la perd au profit de réglages par défaut et prudents.
Pour un lecteur hors de Chine, la conclusion est pratique. La plupart des déploiements sur matériel propre tournent sur des serveurs vLLM ou SGLang, avec des cartes qui ne sont pas des haut de gamme. La valeur ajoutée n'est pas une carte de plus, mais l'ingénierie : des noyaux corrects, une communication adaptée au débit réel de la liaison et des stratégies de parallélisme différentes pour la phase préalable et pour la génération. DeepSeek-V4.1-Flash, avec ses 552 milliards de paramètres et son architecture MoE, disponible sous licence MIT, est aujourd'hui un bon terrain d'essai pour ce type d'expériences. Le modèle lui-même a un KV cache de 890 octets par token, soit environ quatre fois moins que le V4-Flash.
Sources
3- 01量子位 (qbitai): PCIe显卡被低估了 — 内核补齐+通信重构ZH
- 02DeepSeek-V4.1-Flash – model cardEN
- 03Artificial Analysis: DeepSeek V4.1 FlashEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.