DeepSeek-V4.1-Flash : un débit presque sept fois plus élevé sur des GPU PCIe
Une équipe chinoise annonce un bond de débit pour DeepSeek-V4.1-Flash sur un système PCIe sans NVLink. Le cas montre la part de performance qui tient au logiciel.

Le 24 septembre 2026, le portail QbitAI a publié un retour d'expérience sur la société chinoise METASTONE. L'équipe a fait tourner DeepSeek-V4.1-Flash sur huit GPU reliés uniquement par PCIe, sans NVLink. Ces modèles sont pourtant conçus d'ordinaire pour une liaison rapide entre cartes.
Valeur de départ et valeur finale
Les auteurs citent une valeur standard au jour zéro de 1 932 tokens par seconde en débit d'entrée. Une première passe a corrigé des kernels, choisi un chemin plus rapide pour le prétraitement fondé sur la sparse attention, remplacé des cœurs FP8 dense GEMM et accéléré le chemin PCIe-IPC. Le système atteignait déjà 5 850 tokens par seconde. D'autres optimisations ont suivi : fusion d'opérateurs d'attention, brouillons plus courts lors du décodage spéculatif, recouvrement du calcul et de la communication, paramètres mémoire. Le système est arrivé à 13 274 tokens par seconde, soit environ 6,87 fois la valeur de départ. Selon le rapport, la longueur de contexte jusqu'à un million de tokens a pu être maintenue.
Des mesures comparatives montrent qu'il ne s'agit pas d'un résultat isolé. DeepSeek-V4-Flash est passé de 14 546 à 22 584 tokens par seconde en débit d'entrée, soit un facteur de 1,55. Le modèle GLM 5.3 est passé de 3 236,78 à 6 222,72 tokens par seconde.
Pourquoi cela compte pour l'Allemagne
Le rapport a deux niveaux. Le premier est technique : les modèles qui tournent sur du matériel sans interconnexion rapide perdent une grande partie de leur avance non pas à cause du matériel, mais à cause des chemins mémoire et de communication. Qui optimise ces chemins gagne des facteurs, pas des points de pourcentage.
Le second niveau concerne l'exploitation. DeepSeek-V4.1-Flash a été publié le 10 septembre 2026. Il compte 552 milliards de paramètres en architecture mixture-of-experts et active 8 milliards de paramètres en prefill ainsi que 16 milliards en decode. Le KV-Cache est de 890 octets par token, soit environ un quart de la valeur de V4-Flash. Le modèle est sous licence MIT, traite des images jusqu'à 384 tokens par image et peut être servi via vLLM, SGLang ou TensorRT ; FP8, BF16, GPTQ, AWQ et GGUF sont pris en charge.
METASTONE indique gérer plus de 20 000 pétaflops de puissance de calcul et exploiter plus de dix centres de données intelligents ainsi que deux centres nationaux de supercalcul ; trois prix Gordon Bell sont cités comme référence. Pour l'inférence locale, le vrai message du rapport est le déplacement de la valeur ajoutée : ce n'est pas l'achat de nouveau matériel qui décide, mais la capacité à maîtriser la hiérarchie mémoire et la concurrence pour un modèle donné.
Six fois plus rapide sans nouveau matériel : l'écart entre 1 932 et 13 274 tokens par seconde est du logiciel.
Sources
2- 01量子位 (QbitAI): 8卡PCIe纯软优化, DeepSeek-V4.1-Flash 吞吐提升 6.87 倍ZH
- 02Hugging Face: DeepSeek-V4.1-Flash model card (552B MoE, MIT, 1M context)EN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.