Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

KV cache à 890 octets par token : comment DeepSeek a comprimé la mémoire d'attention

La fiche du modèle annonce 890 octets de cache par token, environ quatre fois moins que le V4-Flash, et un besoin en HBM ramené au quart de la génération précédente.

IA & modèlesExpliquéSophie LeclercPublié le: 26 septembre 20265 min de lectureSources 4
KV cache à 890 octets par token : comment DeepSeek a comprimé la mémoire d'attention

Le chiffre le plus intéressant de la fiche technique du DeepSeek-V4.1-Flash ne porte pas sur les paramètres, mais sur la mémoire. Le KV cache global y occupe 890 octets par token, soit environ le quart de ce qu'il consomme sur le DeepSeek-V4-Flash. Le communiqué de l'éditeur décrit le même effet côté infrastructure : le besoin en mémoire HBM tombe au quart, celui en disques SSD au huitième par rapport à la génération précédente.

Dans les tâches agentiques, le modèle relit de longs contextes plusieurs fois. Les succès du cache pèsent lourd dans la facture, et le KV cache doit bien être stocké quelque part. Quand le contexte atteint des centaines de milliers de tokens, le cache n'est plus un détail d'implémentation : il devient la principale limite de débit et de coût du serveur.

Trois mécanismes au lieu d'une astuce

La compression repose sur plusieurs méthodes indépendantes. La première est le SWA Bounded Replay. Les états manquants de la fenêtre d'attention sont reconstruits en rejouant uniquement les derniers tokens de la fenêtre. Inutile donc de les écrire durablement sur SSD : la trace KV persistante tombe à environ un huitième de son état antérieur.

La deuxième est la Comprossed Sparse Attention 2 (CSA2). Elle attribue à chaque couche d'attention l'un de trois modes : Full, Reindex ou Reuse. Les couches partagent alors le KV principal et la clé de l'indexeur, et les index d'attention sparse sont réutilisés. Dans le décodeur, l'indexeur sparse hiérarchique limite les couches d'indexation profondes à un vivier de candidats construit par la première couche en mode Full. Le coût d'indexation cesse dès lors de croître avec la longueur du contexte.

La troisième est le stockage du KV principal au format FP4 : des valeurs en représentation E2M1 avec une échelle E4M3 pour 16 canaux. Ces trois éléments réunis donnent les 890 octets par token.

Ce que cela change en pratique

Une empreinte KV plus faible signifie que le même serveur héberge davantage de sessions parallèles et des contextes plus longs, et que moins de données circulent entre la mémoire et le disque. Le communiqué de l'éditeur promet explicitement des coûts d'exploitation plus bas et un transfert des économies aux utilisateurs, avec un mécanisme de tarifs en heures pleines et en heures creuses. DeepSeek présente cela comme « pushing the limits of KV cache compression » : une course non pas à celui qui a le plus de paramètres, mais à celui qui maintient le moins cher la mémoire du contexte long.

Le portail chinois IT之家 souligne que côté déploiements, le V4.1-Flash est notamment entré dans le réseau national de supercalculateurs. Y réduire le besoin en HBM et en SSD conditionne la prise en charge de nombreux utilisateurs simultanés.

Commentaires 0

Sources

4
  1. 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
  2. 02DeepSeek V4.1-Flash — komunikat wydaniaEN
  3. 03DeepSeek V4.1 Flash 模型上线国家超算互联网 (IT之家)ZH
  4. 04DeepSeek V4.1 Flash — dane wydania i benchmarki (Artificial Analysis)EN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.