Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

DeepSeek-V4.1-Flash: throughput quasi sette volte maggiore su GPU PCIe

Un team cinese riferisce per DeepSeek-V4.1-Flash un balzo di throughput su un sistema PCIe senza NVLink. Il caso mostra quanta potenza stia nel software.

TecnologiaAnalisiGiulia FerrariPubblicato: 24 settembre 20266 min di letturaFonti 2
DeepSeek-V4.1-Flash: throughput quasi sette volte maggiore su GPU PCIe

Quanta potenza stia nel software lo dimostra un resoconto pubblicato il 24 settembre 2026 dal portale QbitAI sull'azienda cinese METASTONE. Il team ha fatto girare DeepSeek-V4.1-Flash su un sistema di otto GPU collegate soltanto via PCIe, senza NVLink e quindi senza l'accoppiamento veloce per cui modelli simili vengono di norma progettati.

Valore di partenza e risultato finale

Come riferimento gli autori indicano un valore standard del giorno zero di 1.932 token al secondo per il throughput in ingresso. Dopo un primo passaggio con correzioni al kernel, una scelta di percorso più rapida per il pre-processing basato su sparse attention, kernel FP8 dense GEMM sostituiti e un percorso PCIe IPC accelerato si erano già raggiunti 5.850 token al secondo. Poi sono arrivate altre ottimizzazioni: la fusione degli operatori di attention, bozze più brevi nella decodifica speculativa, calcolo e comunicazione sovrapposti e parametri di memoria. Così il sistema ha toccato 13.274 token al secondo, circa 6,87 volte il valore iniziale. Secondo il resoconto, la lunghezza di contesto fino a un milione di token è stata mantenuta.

Le misurazioni di confronto mostrano che non si tratta di un caso isolato. DeepSeek-V4-Flash è passato da 14.546 a 22.584 token al secondo nel throughput in ingresso, un fattore di 1,55. Il modello GLM 5.3 è migliorato da 3.236,78 a 6.222,72 token al secondo.

Perché è rilevante per la Germania

Il resoconto ha due livelli. Il primo è tecnico: i modelli che girano su hardware senza interconnessione veloce perdono gran parte del loro vantaggio non per colpa dell'hardware, ma dei percorsi di memoria e comunicazione. Chi ottimizza quei percorsi guadagna fattori, non punti percentuali.

Il secondo livello riguarda l'esercizio. DeepSeek-V4.1-Flash è stato pubblicato il 10 settembre 2026, conta 552 miliardi di parametri in architettura mixture-of-experts e ne attiva 8 miliardi nel prefill e 16 miliardi nel decode. La KV-cache è di 890 byte per token, circa un quarto del valore di V4-Flash. Il modello è sotto licenza MIT, elabora immagini fino a 384 token per immagine e si può servire con vLLM, SGLang o TensorRT; sono supportati FP8, BF16, GPTQ, AWQ e GGUF.

METASTONE dichiara per sé più di 20.000 petaflops di potenza di calcolo gestita, la gestione di oltre dieci data center intelligenti e due centri nazionali di supercalcolo; tre premi Gordon Bell vengono citati come riferimento. Per l'inferenza locale il messaggio del resoconto è lo spostamento del valore: non decide l'acquisto di nuovo hardware, ma la capacità di padroneggiare gerarchia di memoria e concorrenza per un modello concreto.

Sei volte più veloce senza nuovo hardware: la differenza tra 1.932 e 13.274 token al secondo è software.

Commenti 0

Fonti

2
  1. 01量子位 (QbitAI): 8卡PCIe纯软优化, DeepSeek-V4.1-Flash 吞吐提升 6.87 倍ZH
  2. 02Hugging Face: DeepSeek-V4.1-Flash model card (552B MoE, MIT, 1M context)EN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.