Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

KV cache da 890 byte per token: come DeepSeek ha compresso la memoria dell'attenzione

La scheda del modello indica 890 byte di cache per token, circa quattro volte meno di V4-Flash, e un fabbisogno di HBM pari a un quarto della generazione precedente.

IA e modelliSpiegatoGiulia FerrariPubblicato: 26 settembre 20265 min di letturaFonti 4
KV cache da 890 byte per token: come DeepSeek ha compresso la memoria dell'attenzione

Il numero più interessante nella scheda di DeepSeek-V4.1-Flash non riguarda i parametri, ma la memoria. La KV cache globale occupa 890 byte per token, circa un quarto rispetto a DeepSeek-V4-Flash. Il comunicato dell'azienda racconta lo stesso effetto dal lato dell'infrastruttura: il fabbisogno di memoria HBM scende a un quarto e quello di SSD a un ottavo rispetto alla generazione precedente.

Nei task agentici il modello legge contesti lunghi più volte. I cache hit pesano per buona parte del conto e la KV cache deve stare fisicamente da qualche parte. Quando il contesto arriva a centinaia di migliaia di token, la cache smette di essere un dettaglio implementativo e diventa il limite principale di throughput e di costo del server.

Tre meccanismi al posto di un solo trucco

La compressione è arrivata da metodi indipendenti. Il primo è SWA Bounded Replay: gli stati mancanti della finestra di attenzione vengono ricostruiti ripetendo solo gli ultimi token della finestra. Non serve salvarli in modo permanente su SSD, e la traccia KV persistente scende a circa un ottavo rispetto allo stato precedente alla modifica.

Il secondo è Comprossed Sparse Attention 2 (CSA2), che assegna a ogni layer di attenzione uno di tre modi: Full, Reindex o Reuse. Così i layer condividono la KV principale e la chiave dell'indicizzatore, e gli indici dell'attenzione sparsa vengono riutilizzati. Nel decoder l'indicizzatore sparso gerarchico limita i layer di indicizzazione più profondi al pool di candidati costruito dal primo layer in modalità Full. Il costo di indicizzazione smette così di crescere con la lunghezza del contesto.

Il terzo è la memorizzazione della KV principale in formato FP4: valori in rappresentazione E2M1 con una scala E4M3 ogni 16 canali. Solo questi tre elementi insieme danno 890 byte per token.

Cosa cambia in pratica

Una traccia KV più piccola significa che sullo stesso server entrano più sessioni in parallelo e contesti più lunghi, e che bisogna spostare meno dati tra memoria e disco. Nel comunicato dell'azienda compare esplicitamente la promessa di costi di gestione più bassi e di un risparmio girato agli utenti, insieme al meccanismo di prezzi di punta e fuori punta. DeepSeek lo descrive come "pushing the limits of KV cache compression": una corsa non a chi ha più parametri, ma a chi mantiene a minor costo la memoria del contesto lungo.

Il portale cinese IT之家 fa notare che sul fronte delle implementazioni V4.1-Flash è arrivato tra l'altro nella rete nazionale dei supercomputer, dove limitare il fabbisogno di HBM e SSD è la condizione per servire molti utenti contemporaneamente.

Commenti 0

Fonti

4
  1. 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
  2. 02DeepSeek V4.1-Flash — komunikat wydaniaEN
  3. 03DeepSeek V4.1 Flash 模型上线国家超算互联网 (IT之家)ZH
  4. 04DeepSeek V4.1 Flash — dane wydania i benchmarki (Artificial Analysis)EN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.