1,5 schede per una B300: come dal PCIe si è arrivati a 6,87 volte il throughput
L'operatore cinese METASTONE ha portato il throughput di DeepSeek-V4.1-Flash da 1932 a 13274 token al secondo su otto schede PCIe. Nessun cambio di modello: solo correzioni allo stack software.

La corsa all'AI non si gioca più su chi compra l'hardware migliore, ma su chi sfrutta meglio quello che ha già. Il portale cinese qbitai ha raccontato il lavoro di METASTONE. L'azienda ha preso otto schede grafiche collegate soltanto dal bus PCIe, senza una maglia veloce tra le schede. Sul modello DeepSeek-V4.1-Flash ha ottenuto un'accelerazione difficile da liquidare come cosmetica.
Il punto di partenza era un normale set di avvio comunitario. Sullo stesso hardware il throughput in ingresso era di 1932 token al secondo. La prima fase di ottimizzazione ha aggiunto i kernel di calcolo mancanti, sostituito il kernel FP8 lento e ampliato il percorso rapido di comunicazione: il risultato è salito a 5850 token al secondo. La seconda fase ha fuso gli operatori di attenzione, sovrapposto i calcoli alla comunicazione e separato le strategie di parallelismo per la fase iniziale e per la generazione. Così si è arrivati a 13274 token al secondo, 6,87 volte tanto, con un contesto fino a un milione di token.
Lo stesso metodo, altri modelli
METASTONE sostiene che il procedimento funziona su scala più ampia. Sul modello DeepSeek-V4-Flash il throughput in ingresso è cresciuto da 14546 a 22584 token al secondo, cioè 1,55 volte. Con GLM5.3 il salto è stato da 3236,78 a 6222,72 token al secondo (1,92 volte), la latenza P95 del primo token è scesa da 141,6 a 46,6 secondi e il contesto gestito è passato da 270 mila a 1,05 milioni di token. L'azienda aggiunge che la metodologia regge anche sugli acceleratori cinesi. Anche loro, come le schede PCIe, non compaiono nelle matrici ufficiali di supporto dei framework più diffusi.
Sullo sfondo c'è la logistica dell'operatore. Secondo i propri dati METASTONE gestisce oltre 20 000 P di potenza di calcolo, conduce una dozzina di centri di calcolo per l'AI e due centri nazionali di supercalcolo, e dichiara una disponibilità dei cluster a livello di SLA superiore al 99,95 per cento. Il team avrebbe vinto tre premi Gordon Bell.
Quanto manca ancora al vertice
Un confronto onesto è meno spettacolare del titolo su un aumento di sette volte. Nello stesso punto di carico la scheda B300 raggiungeva un throughput in ingresso da 4,9 a 5,6 volte superiore a quello della macchina a otto schede su PCIe. Nei compiti di generazione video da una singola immagine il vantaggio si riduceva a 1,5-1,7 macchine per una scheda B300, quando si usava in aggiunta LoRA. In altre parole: le schede economiche non raggiungono l'hardware di vertice, ma la differenza smette di essere un abisso.
Una scheda che nessuno ha inserito nella matrice di supporto del framework non perde potenza: la perde a favore delle impostazioni predefinite e prudenti.
Per chi osserva fuori dalla Cina la conclusione è pratica. La maggior parte delle implementazioni su hardware proprio sono server vLLM o SGLang su schede che non sono di vertice. Il valore aggiunto non è un'altra scheda, ma l'ingegneria: kernel corretti, comunicazione adattata al throughput reale del collegamento e strategie di parallelismo diverse per la fase iniziale e la generazione. DeepSeek-V4.1-Flash, con 552 miliardi di parametri e architettura MoE, disponibile con licenza MIT, è oggi un buon banco di prova per esperimenti di questo tipo. Tanto più che il modello stesso ha una KV cache di 890 byte per token, circa quattro volte più piccola di quella di V4-Flash.
Fonti
3- 01量子位 (qbitai): PCIe显卡被低估了 — 内核补齐+通信重构ZH
- 02DeepSeek-V4.1-Flash – model cardEN
- 03Artificial Analysis: DeepSeek V4.1 FlashEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.