Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

890 byte per token: come DeepSeek comprime la KV Cache

Il costo dei contesti lunghi si ferma spesso sulla memoria, non sui pesi. DeepSeek V4.1 Flash comprime la KV Cache a circa 890 byte per token. Il fabbisogno di HBM scende a un quarto rispetto alla generazione precedente, quello di SSD a un ottavo.

IA e modelliSpiegatoChiara RomanoPubblicato: 12 settembre 20265 min di letturaFonti 3
890 byte per token: come DeepSeek comprime la KV Cache

Quando un modello elabora documenti lunghi deve conservare la Key e la Value dell'attenzione per ogni token del contesto. Questo risultato intermedio è la KV Cache. Cresce in modo lineare con la lunghezza del contesto e determina quante sessioni lunghe possono girare insieme su una singola scheda. È anche il motivo per cui il costo dei contesti lunghi si ferma sulla memoria e non sui pesi.

Quanto spazio occupa la KV Cache si può calcolare con un modello pubblico. Secondo la configurazione pubblica di Qwen3-8B, in BF16 o FP16, con 2 byte per valore, ogni token corrisponde a 147456 byte di dati KV, circa 147KB. Il calcolo è 2 copie K/V per 36 layer per 8 teste KV per 128 dimensioni per testa per 2 byte. Non sono ancora inclusi costi aggiuntivi come la gestione della cache.

DeepSeek su V4.1 Flash ha lavorato sulla compressione. Il confronto ufficiale è questo: rispetto alla generazione precedente il fabbisogno di HBM scende a un quarto e quello di SSD a un ottavo; rispetto al modello di prima generazione la KV Cache è già 437 volte più piccola. Incrociando i dati ufficiali con diverse descrizioni, la KV Cache di V4.1 Flash è di circa 890 byte per token.

Perché fissare questo numero? Perché il costo degli hit in cache pesa molto nei task di tipo Agent. Un task di coding agent rilegge codice, cerca materiale e lancia test, e la storia si accumula. Quando la memoria video non basta, il sistema cancella parte della cache. Al giro successivo deve rifare la Prefill, e il tempo che l'utente aspetta per il primo token si allunga.

La via d'uscita ingegneristica è la stratificazione. I dati in fase di generazione restano in HBM, quelli che potrebbero essere riusati a breve finiscono nella DDR lato CPU, quelli non toccati da più tempo scendono su SSD o su storage remoto. Il KV Offloading di vLLM, per esempio, supporta lo scarico dei blocchi di cache nella memoria della CPU e la configurazione di un livello di storage secondario. Il recupero passa attraverso il livello di cache lato CPU.

Quindi 890 byte non è solo un numero. Significa che la stessa memoria video può reggere più sessioni lunghe in parallelo, e significa anche che i team che gestiscono servizi di inferenza in proprio comprano meno schede. Per chi si occupa di acquisti e operations, la dimensione della KV Cache è ormai importante quanto l'efficacia del modello e merita di entrare nella lista dei criteri di scelta.

Commenti 0

Fonti

3
  1. 01DeepSeek-V4.1-Flash 模型卡EN
  2. 02DeepSeek V4.1 Flash:更少缓存,更省成本ZH
  3. 03把记忆交给 CPU,大模型会变快ZH

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.