Huit cartes PCIe et un débit 6,87 fois supérieur : le logiciel rattrape le matériel
La société chinoise METASTONE a fait passer le débit d'entrée de V4.1-Flash, sur huit cartes PCIe, de 1932 à 13274 tokens par seconde, sans toucher au modèle ni au matériel.

Qu'un modèle démarre ne dit rien de son débit réel. L'écart entre les deux dépasse aujourd'hui celui qui sépare deux générations de cartes. Le portail chinois QbitAI raconte le cas de METASTONE, une société qui ne fait que de l'optimisation, sans modifier la structure du modèle ni le matériel.
Le point de départ est un problème classique : des cartes sans liaison rapide entre elles, absentes de la matrice de support officielle des grands frameworks. Le framework ne renvoie aucune erreur. Il contourne en silence les chemins accélérés et retombe sur des implémentations génériques, plus lentes. Sur huit cartes PCIe uniquement, dans la version de base du jour de la sortie, V4.1-Flash atteignait 1932 tokens par seconde en entrée. Les ingénieurs ont complété les noyaux manquants, réparé le chemin de prétraitement rapide de l'attention creuse, remplacé le noyau FP8 lent de l'opération GEMM dense et élargi la portée de la communication rapide IPC via PCIe. Le débit est monté à 5850 tokens par seconde. C'est la première étape, baptisée « coordination du modèle et du matériel ».
Deuxième étape : communication, mémoire, cache
Le vrai travail commence ensuite. Les ingénieurs ont fusionné les opérateurs d'attention et de projection, puis caché les calculs dans les intervalles de la communication collective. Ils ont réécrit la logique de communication en fonction du débit réel du PCIe. Ils ont aussi réglé séparément les stratégies de parallélisme pour la phase de prétraitement et pour la phase de génération. Ils ont enfin ajusté en dynamique la répartition de la mémoire statique, la capacité du cache KV et le mécanisme de réutilisation de la mémoire. Le débit d'entrée est passé de 5850 à 13274 tokens par seconde, soit 6,87 fois au total, avec un contexte conservé jusqu'à un million de tokens.
La même méthode fonctionne sur d'autres modèles. Sur DeepSeek-V4-Flash, le débit d'entrée est passé de 14546 à 22584 tokens par seconde (1,55 fois). Sur GLM5.3, il est passé de 3236,78 à 6222,72 (1,92 fois). Dans le même temps, la latence P95 du premier token tombait de 141,6 secondes à 46,6 secondes et la limite de contexte passait de 270 mille à 1,05 million de tokens. La première étape seule apportait déjà, sur plusieurs modèles, des gains de l'ordre de 20 à 33 pour cent.
Ce que cela représente face au matériel haut de gamme
Les auteurs montrent honnêtement le point de comparaison. À niveau de concurrence égal, la carte B300 offre un débit d'entrée environ 4,9 à 5,6 fois supérieur à celui de cette machine à huit cartes, comparaison faite sur DeepSeek-V4-Flash. Pour GLM-5.3, le rapport va de 3,5 à 4,7 fois. L'écart ne disparaît pas, mais il est nettement plus faible que ne le laisserait croire la seule comparaison des spécifications. En génération vidéo, sur le modèle MiniMax H3, une vidéo de 15 secondes produite à partir d'une image de référence a été accélérée de 2,48 fois. La méthode a aussi été testée sur des cartes GPU chinoises, où il fallait activer explicitement l'attention creuse NSA et désactiver les mécanismes écrits pour les plateformes NVIDIA et AMD.
Voilà de quoi nourrir les comparaisons où compte non pas la spécification de pointe, mais le coût de production d'un token sur le matériel réellement installé en salle serveur.
Sources
2- 01PCIe 显卡被低估了!DeepSeek 推理吞吐翻近 7 倍 (量子位)ZH
- 02DeepSeek V4.1 Flash — prędkość i opóźnienie (Artificial Analysis)EN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.