Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

DeepSeek V4.1 Flash: 552 miliardi di parametri e un encoder-decoder asimmetrico

Il 10 settembre 2026 DeepSeek ha rilasciato DeepSeek-V4.1-Flash, un modello Mixture-of-Experts multimodale da 552 miliardi di parametri. Ne attiva 8 miliardi per token in ingresso e 16 miliardi in uscita. È un cambio di architettura, non solo di scala.

IA e modelliAnalisiGiulia FerrariPubblicato: 26 settembre 20265 min di letturaFonti 3
DeepSeek V4.1 Flash: 552 miliardi di parametri e un encoder-decoder asimmetrico

Il 10 settembre 2026 DeepSeek ha rilasciato DeepSeek-V4.1-Flash, un modello Mixture-of-Experts multimodale con 552 miliardi di parametri di base e una finestra di contesto fino a un milione di token. Non è un aggiornamento di routine: cambiano l'architettura e il modo in cui si calcola la cache dell'attenzione. Secondo la scheda del modello, V4.1-Flash attiva appena 8 miliardi di parametri per token in prefill e 16 miliardi in decode.

Costi distribuiti in modo diseguale, di proposito

Al centro della costruzione c'è l'architettura Causal Encoder-Decoder (CED): un Transformer a 40 strati, diviso in 20 strati di encoder causale e 20 di decoder. Nei modelli classici ogni strato del decoder calcola il proprio stato nascosto. Qui la KV cache globale del decoder è proiettata dagli stati nascosti finali dell'encoder. L'asimmetria tra 8 e 16 miliardi è voluta. I carichi agentici consistono soprattutto nella lettura di contesti lunghi, quindi il produttore ha ottimizzato prima di tutto l'ingresso.

Lo strato MoE ha 1 esperto condiviso e 384 esperti instradati, dei quali 6 vengono scelti per token. La scheda del modello elenca poi altre componenti: Single-Pass mHC, cioè la miscelazione modificata del flusso residuo con il kernel Mega-mHC; Engram, una memoria condizionale da 196 miliardi di parametri interrogata di rado tramite ricerca per token; e DSpark, la decodifica speculativa con generazione semi-autoregressiva della bozza e verifica guidata da una pianificazione di confidenza.

45.000 miliardi di token e la visione fin dal primo passo

Il modello è stato addestrato da zero su un corpus multimodale di 45.000 miliardi di token. L'attenzione rada è stata addestrata con sequenze da 64.000 token, e il contesto è stato portato a 1 milione di token solo alla tappa dei 34.000 miliardi, cioè dopo la maggior parte dell'addestramento. Dopo il pre-addestramento è arrivata la ricetta standard SFT, poi l'apprendimento per rinforzo e infine la distillazione on-policy. Il produttore sottolinea che i cambiamenti non hanno riguardato gli algoritmi, ma i dati: su larga scala sono stati sintetizzati automaticamente compiti e ambienti agentici.

L'ingresso visivo è gestito dall'encoder DeepSeek-ViT, addestrato da zero con 2D-RoPE e downsampling 3×3 pixel-unshuffle, più un proiettore MLP a due strati. Immagini e testo arrivano nello stesso spazio fin dall'inizio del pre-addestramento. Non è un adattatore agganciato dopo.

La scheda del modello su Hugging Face registra 621.396 download nell'ultimo mese e la licenza MIT. Sono state preparate varianti di deployment per vLLM, SGLang, TensorRT e Docker Model Runner, oltre alle quantizzazioni FP8, BF16, GPTQ, AWG e GGUF. Il portale cinese IT之家 richiama lo stesso punto della scheda: negli scenari agentici è proprio sugli accessi alla cache che si accumula la maggior parte del costo, quindi comprimere meglio la KV cache si traduce direttamente nel costo del compito. DeepSeek ha annunciato anche il ritiro dei più vecchi deepseek-v4-flash e deepseek-v4-flash-vision-exp, con le richieste destinate a V4-Pro dirottate su V4.1-Flash alle sue tariffe.

Commenti 0

Fonti

3
  1. 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
  2. 02DeepSeek V4.1-Flash — komunikat wydaniaEN
  3. 03DeepSeek 计划 9 月 10 日前后发布 V4.1 Flash 模型 (IT之家)ZH

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.