DeepSeek V4.1 Flash: 552 miliardi di parametri, multimodale nativo e prezzi ridotti
Il 10 settembre 2026 DeepSeek ha rilasciato V4.1 Flash, un MoE da 552 miliardi di parametri che in input ne attiva 8 miliardi e riduce il fabbisogno di HBM per il KV Cache a un quarto rispetto alla generazione precedente.

Il 10 settembre 2026 DeepSeek ha rilasciato V4.1 Flash. L'azienda lo presenta come il modello più piccolo della nuova serie di architetture e ha aggiunto la comprensione visiva multimodale nativa. Il modello è già sull'API DeepSeek: basta cambiare il nome in deepseek-flash.
V4.1 Flash è un MoE da 552 miliardi di parametri con architettura Causal-Encoder-Decoder. Input e output non sono simmetrici: in input si attivano 8 miliardi di parametri, in output 16 miliardi. Secondo l'azienda la nuova struttura serve ad alzare il tetto delle capacità, accelerare l'inferenza e aumentare il throughput. Potrà essere estesa a modelli più grandi.
La cache è l'altro punto dell'aggiornamento. Rispetto alla generazione precedente, il KV Cache di V4.1 Flash riduce il fabbisogno di HBM a un quarto e quello di SSD a un ottavo. L'azienda spiega che negli scenari con agenti la voce della cache hit pesa molto, e che comprimere il KV Cache abbassa il costo di questi task. C'è anche una curva di lungo periodo: rispetto al primo modello, il KV Cache è già 437 volte più piccolo.
Cambiano anche i prezzi. Nelle ore di bassa domanda l'input con cache hit costa 0,02 yuan per milione di token, l'input senza cache hit 1 yuan e l'output 4 yuan. Nelle ore di punta i prezzi raddoppiano. Le nuove tariffe valgono dal 10 settembre 2026 alle 12.
Sul fronte open source i pesi sono pubblicati con licenza MIT. L'azienda dice che sosterrà la community nell'adattamento dell'inferenza e proverà varie strade per ampliare il deployment. Chi ha esigenze su larga scala e le risorse necessarie può contattare il team.
Annunciato anche il destino delle versioni precedenti. V4 Flash e V4 Flash Vision Exp sono stati dismessi e, per compatibilità, i nomi deepseek-v4-flash e deepseek-v4-flash-vision-exp vengono per ora instradati su V4.1 Flash. È prevista la dismissione graduale di V4 Pro: dopo un certo periodo le richieste andranno tutte su V4.1 Flash, fatturate al suo prezzo. I partner WorkBuddy (incluso CodeBuddy) e OpenCode sono già integrati del tutto.
Sul deployment, V4.1 Flash supporta i framework di inferenza principali come vLLM, SGLang e TensorRT, offre formati di quantizzazione FP8, BF16, GPTQ, AWG e GGUF e arriva a 1 milione di token di contesto. I team possono quindi adottare il modello sullo stack di inferenza che già usano, con modifiche contenute.
Fonti
3- 01DeepSeek V4.1 Flash:更强、更快、更普惠ZH
- 02DeepSeek-V4.1-Flash ReleaseEN
- 03DeepSeek V4.1 Flash 模型今日发布,V4 Pro 服务推迟到 9 月 14 日下线ZH
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.