Otto schede PCIe e una portata 6,87 volte superiore: il software colma il divario con l'hardware
L'azienda cinese METASTONE ha portato la portata in ingresso di V4.1-Flash su otto schede PCIe da 1932 a 13274 token al secondo, senza cambiare il modello né l'hardware.

La differenza tra «il modello si avvia» e «il modello eroga una portata sensata» oggi può essere più grande della differenza tra generazioni di schede. Il portale cinese QbitAI racconta il caso di METASTONE, azienda che si occupa solo di ottimizzazione, senza toccare la struttura del modello e senza cambiare l'hardware.
Il punto di partenza è il problema tipico delle schede prive di un collegamento veloce tra loro e assenti dalla matrice ufficiale di supporto dei principali framework. Il framework non segnala errori: salta in silenzio i percorsi accelerati e ripiega sulle implementazioni lente e generiche. Su otto schede PCIe-only, nella versione base del giorno di lancio, V4.1-Flash raggiungeva una portata in ingresso di 1932 token al secondo. Il gruppo ha aggiunto i kernel mancanti, riparato il percorso di preelaborazione veloce dell'attenzione sparsa, sostituito il kernel FP8 lento per l'operazione densa GEMM e ampliato la portata della comunicazione veloce IPC su PCIe. Il risultato è salito a 5850 token al secondo. È la prima fase, chiamata «coordinamento di modello e hardware».
La seconda fase: comunicazione, memoria, cache
Solo dopo comincia il lavoro vero. Gli ingegneri hanno unito gli operatori di attenzione e di proiezione e hanno nascosto i calcoli nelle fessure della comunicazione collettiva. Hanno riscritto la logica di comunicazione in base alla portata reale del PCIe e messo a punto separatamente le strategie di parallelismo per la fase iniziale e per la fase di generazione. Alla fine hanno regolato dinamicamente le quote di memoria statica, la capacità della KV cache e il meccanismo di riuso della memoria. La portata in ingresso è salita da 5850 a 13274 token al secondo, cioè 6,87 volte in totale, mantenendo un contesto fino a un milione di token.
La stessa metodologia funziona anche su altri modelli. Per DeepSeek-V4-Flash la portata in ingresso è cresciuta da 14546 a 22584 token al secondo (1,55 volte), per GLM5.3 da 3236,78 a 6222,72 (1,92 volte). La latenza P95 del primo token è scesa da 141,6 secondi a 46,6 secondi e il limite di contesto si è allargato da 270 mila a 1,05 milioni di token. La sola prima fase dava su diversi modelli incrementi nell'ordine del 20-33 per cento.
Quanto vale rispetto all'hardware di vertice
Gli autori mostrano con onestà il termine di paragone. Allo stesso livello di concorrenza la scheda B300 ha una portata in ingresso circa 4,9-5,6 volte superiore a quella della macchina a otto schede (confronto su DeepSeek-V4-Flash), mentre per GLM-5.3 il rapporto è di 3,5-4,7 volte. La distanza non sparisce, ma è chiaramente minore di quanto suggerirebbe il solo confronto delle specifiche. Nella generazione video, sul modello MiniMax H3, un video di 15 secondi da un'immagine di riferimento è diventato 2,48 volte più veloce. La metodologia è stata verificata anche su schede GPU cinesi, dove è stato necessario attivare esplicitamente l'attenzione sparsa NSA e disattivare i meccanismi scritti per le piattaforme NVIDIA e AMD.
È un buon contesto per i confronti in cui conta non la specifica di picco, ma il costo di produzione di un singolo token su hardware che sta davvero in sala server.
Fonti
2- 01PCIe 显卡被低估了!DeepSeek 推理吞吐翻近 7 倍 (量子位)ZH
- 02DeepSeek V4.1 Flash — prędkość i opóźnienie (Artificial Analysis)EN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.