KV cache à 890 octets par token : comment DeepSeek a comprimé la mémoire d'attention
La fiche du modèle annonce 890 octets de cache par token, environ quatre fois moins que le V4-Flash, et un besoin en HBM ramené au quart de la génération précédente.

Le chiffre le plus intéressant de la fiche technique du DeepSeek-V4.1-Flash ne porte pas sur les paramètres, mais sur la mémoire. Le KV cache global y occupe 890 octets par token, soit environ le quart de ce qu'il consomme sur le DeepSeek-V4-Flash. Le communiqué de l'éditeur décrit le même effet côté infrastructure : le besoin en mémoire HBM tombe au quart, celui en disques SSD au huitième par rapport à la génération précédente.
Dans les tâches agentiques, le modèle relit de longs contextes plusieurs fois. Les succès du cache pèsent lourd dans la facture, et le KV cache doit bien être stocké quelque part. Quand le contexte atteint des centaines de milliers de tokens, le cache n'est plus un détail d'implémentation : il devient la principale limite de débit et de coût du serveur.
Trois mécanismes au lieu d'une astuce
La compression repose sur plusieurs méthodes indépendantes. La première est le SWA Bounded Replay. Les états manquants de la fenêtre d'attention sont reconstruits en rejouant uniquement les derniers tokens de la fenêtre. Inutile donc de les écrire durablement sur SSD : la trace KV persistante tombe à environ un huitième de son état antérieur.
La deuxième est la Comprossed Sparse Attention 2 (CSA2). Elle attribue à chaque couche d'attention l'un de trois modes : Full, Reindex ou Reuse. Les couches partagent alors le KV principal et la clé de l'indexeur, et les index d'attention sparse sont réutilisés. Dans le décodeur, l'indexeur sparse hiérarchique limite les couches d'indexation profondes à un vivier de candidats construit par la première couche en mode Full. Le coût d'indexation cesse dès lors de croître avec la longueur du contexte.
La troisième est le stockage du KV principal au format FP4 : des valeurs en représentation E2M1 avec une échelle E4M3 pour 16 canaux. Ces trois éléments réunis donnent les 890 octets par token.
Ce que cela change en pratique
Une empreinte KV plus faible signifie que le même serveur héberge davantage de sessions parallèles et des contextes plus longs, et que moins de données circulent entre la mémoire et le disque. Le communiqué de l'éditeur promet explicitement des coûts d'exploitation plus bas et un transfert des économies aux utilisateurs, avec un mécanisme de tarifs en heures pleines et en heures creuses. DeepSeek présente cela comme « pushing the limits of KV cache compression » : une course non pas à celui qui a le plus de paramètres, mais à celui qui maintient le moins cher la mémoire du contexte long.
Le portail chinois IT之家 souligne que côté déploiements, le V4.1-Flash est notamment entré dans le réseau national de supercalculateurs. Y réduire le besoin en HBM et en SSD conditionne la prise en charge de nombreux utilisateurs simultanés.
Sources
4- 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
- 02DeepSeek V4.1-Flash — komunikat wydaniaEN
- 03DeepSeek V4.1 Flash 模型上线国家超算互联网 (IT之家)ZH
- 04DeepSeek V4.1 Flash — dane wydania i benchmarki (Artificial Analysis)EN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.