DeepSeek-V4.1-Flash: throughput quasi sette volte maggiore su GPU PCIe
Un team cinese riferisce per DeepSeek-V4.1-Flash un balzo di throughput su un sistema PCIe senza NVLink. Il caso mostra quanta potenza stia nel software.

Quanta potenza stia nel software lo dimostra un resoconto pubblicato il 24 settembre 2026 dal portale QbitAI sull'azienda cinese METASTONE. Il team ha fatto girare DeepSeek-V4.1-Flash su un sistema di otto GPU collegate soltanto via PCIe, senza NVLink e quindi senza l'accoppiamento veloce per cui modelli simili vengono di norma progettati.
Valore di partenza e risultato finale
Come riferimento gli autori indicano un valore standard del giorno zero di 1.932 token al secondo per il throughput in ingresso. Dopo un primo passaggio con correzioni al kernel, una scelta di percorso più rapida per il pre-processing basato su sparse attention, kernel FP8 dense GEMM sostituiti e un percorso PCIe IPC accelerato si erano già raggiunti 5.850 token al secondo. Poi sono arrivate altre ottimizzazioni: la fusione degli operatori di attention, bozze più brevi nella decodifica speculativa, calcolo e comunicazione sovrapposti e parametri di memoria. Così il sistema ha toccato 13.274 token al secondo, circa 6,87 volte il valore iniziale. Secondo il resoconto, la lunghezza di contesto fino a un milione di token è stata mantenuta.
Le misurazioni di confronto mostrano che non si tratta di un caso isolato. DeepSeek-V4-Flash è passato da 14.546 a 22.584 token al secondo nel throughput in ingresso, un fattore di 1,55. Il modello GLM 5.3 è migliorato da 3.236,78 a 6.222,72 token al secondo.
Perché è rilevante per la Germania
Il resoconto ha due livelli. Il primo è tecnico: i modelli che girano su hardware senza interconnessione veloce perdono gran parte del loro vantaggio non per colpa dell'hardware, ma dei percorsi di memoria e comunicazione. Chi ottimizza quei percorsi guadagna fattori, non punti percentuali.
Il secondo livello riguarda l'esercizio. DeepSeek-V4.1-Flash è stato pubblicato il 10 settembre 2026, conta 552 miliardi di parametri in architettura mixture-of-experts e ne attiva 8 miliardi nel prefill e 16 miliardi nel decode. La KV-cache è di 890 byte per token, circa un quarto del valore di V4-Flash. Il modello è sotto licenza MIT, elabora immagini fino a 384 token per immagine e si può servire con vLLM, SGLang o TensorRT; sono supportati FP8, BF16, GPTQ, AWQ e GGUF.
METASTONE dichiara per sé più di 20.000 petaflops di potenza di calcolo gestita, la gestione di oltre dieci data center intelligenti e due centri nazionali di supercalcolo; tre premi Gordon Bell vengono citati come riferimento. Per l'inferenza locale il messaggio del resoconto è lo spostamento del valore: non decide l'acquisto di nuovo hardware, ma la capacità di padroneggiare gerarchia di memoria e concorrenza per un modello concreto.
Sei volte più veloce senza nuovo hardware: la differenza tra 1.932 e 13.274 token al secondo è software.
Fonti
2- 01量子位 (QbitAI): 8卡PCIe纯软优化, DeepSeek-V4.1-Flash 吞吐提升 6.87 倍ZH
- 02Hugging Face: DeepSeek-V4.1-Flash model card (552B MoE, MIT, 1M context)EN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.