Per i fornitori cinesi di potenza di calcolo conta il software
«Una scheda e mezza 6000D batte una B300»: così un fornitore cinese di cloud computing riassume l'ottimizzazione dell'inferenza. Inspur parla invece di un divario di potenza di calcolo da 381 miliardi di dollari entro il 2030.

Nel dibattito sui costi dell'AI domina il prezzo delle schede grafiche. Il fornitore cinese di infrastrutture METASTONE sostiene che le riserve maggiori stiano nel software. L'azienda ha ottimizzato la gestione del modello DeepSeek-V4.1-Flash per farlo girare su otto schede collegate soltanto via PCIe, senza un bus veloce tra processori.
QbitAI descrive così l'effetto: la capacità di elaborazione in ingresso è passata da 1932 a 13 274 token al secondo, ossia 6,87 volte tanto. La chiave è stato completare il kernel di calcolo e ricostruire la comunicazione tra le schede, oltre al riutilizzo della cache di contesto. L'azienda riassume il risultato dicendo che «una scheda e mezza 6000D batte una B300»: hardware più economico e più lento vince su quello più costoso, se l'elaborazione è organizzata bene. La società gestisce oltre 20 000 P di potenza di calcolo in una dozzina di data center e dichiara una disponibilità del servizio superiore al 99,95 per cento.
La seconda voce arriva da Inspur, che alla conferenza AICC 2026 si è basata sui dati IDC. Secondo questi ultimi, la domanda mondiale di potenza di calcolo per l'AI sarà soddisfatta al 79 per cento nel 2024, al 71 per cento nel 2027 e a circa il 77 per cento nel 2030. Il divario tra necessità e offerta raggiungerà 380,9 miliardi di dollari, dieci volte tanto rispetto al 2024. Il consumo di token crescerà a un ritmo superiore a 48 volte su base annua in termini cumulativi. Le attività di inferenza arriveranno a 4000 bilioni all'anno nel 2030.
Inspur risponde con l'hardware. Il sistema SD200 Ultra ospita 128 chip, 8 TB di memoria e 64 TB di spazio su disco in un'unica macchina. Così si dovrebbero gestire modelli da mille miliardi di parametri senza suddividerli su più armadi. La latenza di comunicazione tutti-a-tutti è stata ridotta a 0,69 microsecondi.
Per chi compra potenza di calcolo, il prezzo per token smette di essere funzione soltanto del prezzo dell'hardware. A deciderlo è sempre più spesso l'efficienza con cui il fornitore riesce a sfruttare ciò che ha già. Questo cambia le regole delle gare per i servizi cloud.
La conclusione per chi compra è pratica. Se un aumento di più volte della capacità di elaborazione è arrivato solo riscrivendo la gestione della cache e distribuendo il lavoro tra i chip disponibili, la decisione di acquistare una nuova generazione di hardware dovrebbe essere preceduta da un audit del software. Il fornitore che sa mostrare valori misurati sulla stessa infrastruttura vende oggi non potenza di calcolo, ma risparmio. È anche il modo più semplice con cui gli operatori cinesi dei data center rispondono alle restrizioni sulle esportazioni: dove non si possono comprare le schede più potenti, conta soprattutto l'efficienza di ciò che è già in sala server.
Fonti
2Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.