KV cache da 890 byte per token: come DeepSeek ha compresso la memoria dell'attenzione
La scheda del modello indica 890 byte di cache per token, circa quattro volte meno di V4-Flash, e un fabbisogno di HBM pari a un quarto della generazione precedente.

Il numero più interessante nella scheda di DeepSeek-V4.1-Flash non riguarda i parametri, ma la memoria. La KV cache globale occupa 890 byte per token, circa un quarto rispetto a DeepSeek-V4-Flash. Il comunicato dell'azienda racconta lo stesso effetto dal lato dell'infrastruttura: il fabbisogno di memoria HBM scende a un quarto e quello di SSD a un ottavo rispetto alla generazione precedente.
Nei task agentici il modello legge contesti lunghi più volte. I cache hit pesano per buona parte del conto e la KV cache deve stare fisicamente da qualche parte. Quando il contesto arriva a centinaia di migliaia di token, la cache smette di essere un dettaglio implementativo e diventa il limite principale di throughput e di costo del server.
Tre meccanismi al posto di un solo trucco
La compressione è arrivata da metodi indipendenti. Il primo è SWA Bounded Replay: gli stati mancanti della finestra di attenzione vengono ricostruiti ripetendo solo gli ultimi token della finestra. Non serve salvarli in modo permanente su SSD, e la traccia KV persistente scende a circa un ottavo rispetto allo stato precedente alla modifica.
Il secondo è Comprossed Sparse Attention 2 (CSA2), che assegna a ogni layer di attenzione uno di tre modi: Full, Reindex o Reuse. Così i layer condividono la KV principale e la chiave dell'indicizzatore, e gli indici dell'attenzione sparsa vengono riutilizzati. Nel decoder l'indicizzatore sparso gerarchico limita i layer di indicizzazione più profondi al pool di candidati costruito dal primo layer in modalità Full. Il costo di indicizzazione smette così di crescere con la lunghezza del contesto.
Il terzo è la memorizzazione della KV principale in formato FP4: valori in rappresentazione E2M1 con una scala E4M3 ogni 16 canali. Solo questi tre elementi insieme danno 890 byte per token.
Cosa cambia in pratica
Una traccia KV più piccola significa che sullo stesso server entrano più sessioni in parallelo e contesti più lunghi, e che bisogna spostare meno dati tra memoria e disco. Nel comunicato dell'azienda compare esplicitamente la promessa di costi di gestione più bassi e di un risparmio girato agli utenti, insieme al meccanismo di prezzi di punta e fuori punta. DeepSeek lo descrive come "pushing the limits of KV cache compression": una corsa non a chi ha più parametri, ma a chi mantiene a minor costo la memoria del contesto lungo.
Il portale cinese IT之家 fa notare che sul fronte delle implementazioni V4.1-Flash è arrivato tra l'altro nella rete nazionale dei supercomputer, dove limitare il fabbisogno di HBM e SSD è la condizione per servire molti utenti contemporaneamente.
Fonti
4- 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
- 02DeepSeek V4.1-Flash — komunikat wydaniaEN
- 03DeepSeek V4.1 Flash 模型上线国家超算互联网 (IT之家)ZH
- 04DeepSeek V4.1 Flash — dane wydania i benchmarki (Artificial Analysis)EN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.