Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

DeepSeek V4.1 Flash: 552 miliardi di parametri, multimodale nativo e prezzi ridotti

Il 10 settembre 2026 DeepSeek ha rilasciato V4.1 Flash, un MoE da 552 miliardi di parametri che in input ne attiva 8 miliardi e riduce il fabbisogno di HBM per il KV Cache a un quarto rispetto alla generazione precedente.

IA e modelliNotiziaChiara RomanoPubblicato: 10 settembre 20265 min di letturaFonti 3
DeepSeek V4.1 Flash: 552 miliardi di parametri, multimodale nativo e prezzi ridotti

Il 10 settembre 2026 DeepSeek ha rilasciato V4.1 Flash. L'azienda lo presenta come il modello più piccolo della nuova serie di architetture e ha aggiunto la comprensione visiva multimodale nativa. Il modello è già sull'API DeepSeek: basta cambiare il nome in deepseek-flash.

V4.1 Flash è un MoE da 552 miliardi di parametri con architettura Causal-Encoder-Decoder. Input e output non sono simmetrici: in input si attivano 8 miliardi di parametri, in output 16 miliardi. Secondo l'azienda la nuova struttura serve ad alzare il tetto delle capacità, accelerare l'inferenza e aumentare il throughput. Potrà essere estesa a modelli più grandi.

La cache è l'altro punto dell'aggiornamento. Rispetto alla generazione precedente, il KV Cache di V4.1 Flash riduce il fabbisogno di HBM a un quarto e quello di SSD a un ottavo. L'azienda spiega che negli scenari con agenti la voce della cache hit pesa molto, e che comprimere il KV Cache abbassa il costo di questi task. C'è anche una curva di lungo periodo: rispetto al primo modello, il KV Cache è già 437 volte più piccolo.

Cambiano anche i prezzi. Nelle ore di bassa domanda l'input con cache hit costa 0,02 yuan per milione di token, l'input senza cache hit 1 yuan e l'output 4 yuan. Nelle ore di punta i prezzi raddoppiano. Le nuove tariffe valgono dal 10 settembre 2026 alle 12.

Sul fronte open source i pesi sono pubblicati con licenza MIT. L'azienda dice che sosterrà la community nell'adattamento dell'inferenza e proverà varie strade per ampliare il deployment. Chi ha esigenze su larga scala e le risorse necessarie può contattare il team.

Annunciato anche il destino delle versioni precedenti. V4 Flash e V4 Flash Vision Exp sono stati dismessi e, per compatibilità, i nomi deepseek-v4-flash e deepseek-v4-flash-vision-exp vengono per ora instradati su V4.1 Flash. È prevista la dismissione graduale di V4 Pro: dopo un certo periodo le richieste andranno tutte su V4.1 Flash, fatturate al suo prezzo. I partner WorkBuddy (incluso CodeBuddy) e OpenCode sono già integrati del tutto.

Sul deployment, V4.1 Flash supporta i framework di inferenza principali come vLLM, SGLang e TensorRT, offre formati di quantizzazione FP8, BF16, GPTQ, AWG e GGUF e arriva a 1 milione di token di contesto. I team possono quindi adottare il modello sullo stack di inferenza che già usano, con modifiche contenute.

Commenti 0

Fonti

3
  1. 01DeepSeek V4.1 Flash:更强、更快、更普惠ZH
  2. 02DeepSeek-V4.1-Flash ReleaseEN
  3. 03DeepSeek V4.1 Flash 模型今日发布,V4 Pro 服务推迟到 9 月 14 日下线ZH

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.