DeepSeek V4.1 Flash: 552 miliardi di parametri e un encoder-decoder asimmetrico
Il 10 settembre 2026 DeepSeek ha rilasciato DeepSeek-V4.1-Flash, un modello Mixture-of-Experts multimodale da 552 miliardi di parametri. Ne attiva 8 miliardi per token in ingresso e 16 miliardi in uscita. È un cambio di architettura, non solo di scala.

Il 10 settembre 2026 DeepSeek ha rilasciato DeepSeek-V4.1-Flash, un modello Mixture-of-Experts multimodale con 552 miliardi di parametri di base e una finestra di contesto fino a un milione di token. Non è un aggiornamento di routine: cambiano l'architettura e il modo in cui si calcola la cache dell'attenzione. Secondo la scheda del modello, V4.1-Flash attiva appena 8 miliardi di parametri per token in prefill e 16 miliardi in decode.
Costi distribuiti in modo diseguale, di proposito
Al centro della costruzione c'è l'architettura Causal Encoder-Decoder (CED): un Transformer a 40 strati, diviso in 20 strati di encoder causale e 20 di decoder. Nei modelli classici ogni strato del decoder calcola il proprio stato nascosto. Qui la KV cache globale del decoder è proiettata dagli stati nascosti finali dell'encoder. L'asimmetria tra 8 e 16 miliardi è voluta. I carichi agentici consistono soprattutto nella lettura di contesti lunghi, quindi il produttore ha ottimizzato prima di tutto l'ingresso.
Lo strato MoE ha 1 esperto condiviso e 384 esperti instradati, dei quali 6 vengono scelti per token. La scheda del modello elenca poi altre componenti: Single-Pass mHC, cioè la miscelazione modificata del flusso residuo con il kernel Mega-mHC; Engram, una memoria condizionale da 196 miliardi di parametri interrogata di rado tramite ricerca per token; e DSpark, la decodifica speculativa con generazione semi-autoregressiva della bozza e verifica guidata da una pianificazione di confidenza.
45.000 miliardi di token e la visione fin dal primo passo
Il modello è stato addestrato da zero su un corpus multimodale di 45.000 miliardi di token. L'attenzione rada è stata addestrata con sequenze da 64.000 token, e il contesto è stato portato a 1 milione di token solo alla tappa dei 34.000 miliardi, cioè dopo la maggior parte dell'addestramento. Dopo il pre-addestramento è arrivata la ricetta standard SFT, poi l'apprendimento per rinforzo e infine la distillazione on-policy. Il produttore sottolinea che i cambiamenti non hanno riguardato gli algoritmi, ma i dati: su larga scala sono stati sintetizzati automaticamente compiti e ambienti agentici.
L'ingresso visivo è gestito dall'encoder DeepSeek-ViT, addestrato da zero con 2D-RoPE e downsampling 3×3 pixel-unshuffle, più un proiettore MLP a due strati. Immagini e testo arrivano nello stesso spazio fin dall'inizio del pre-addestramento. Non è un adattatore agganciato dopo.
La scheda del modello su Hugging Face registra 621.396 download nell'ultimo mese e la licenza MIT. Sono state preparate varianti di deployment per vLLM, SGLang, TensorRT e Docker Model Runner, oltre alle quantizzazioni FP8, BF16, GPTQ, AWG e GGUF. Il portale cinese IT之家 richiama lo stesso punto della scheda: negli scenari agentici è proprio sugli accessi alla cache che si accumula la maggior parte del costo, quindi comprimere meglio la KV cache si traduce direttamente nel costo del compito. DeepSeek ha annunciato anche il ritiro dei più vecchi deepseek-v4-flash e deepseek-v4-flash-vision-exp, con le richieste destinate a V4-Pro dirottate su V4.1-Flash alle sue tariffe.
Fonti
3- 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
- 02DeepSeek V4.1-Flash — komunikat wydaniaEN
- 03DeepSeek 计划 9 月 10 日前后发布 V4.1 Flash 模型 (IT之家)ZH
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.