La corsa al calcolo non è più una questione di schede: le due strade dell'AI cinese secondo IDC
All'AICC 2026 il rapporto IDC divide il deficit di calcolo in due voci, tetto di capacità e scala produttiva: entro il 2030 il divario assoluto potrebbe arrivare a 380,9 miliardi di dollari. Accumulare schede non basta più a coprire i carichi diversi di Prefill e Decode.

Per anni la competizione sul calcolo per l'AI ha avuto una sola parola d'ordine: accumulare. Schede, rack, generatori. All'AICC 2026 il rapporto «Valutazione dello sviluppo della potenza di calcolo per l'intelligenza artificiale in Cina 2026», pubblicato da IDC, divide il problema in due livelli: tetto di intelligenza e scala di intelligenza.
Prima la domanda. Il rapporto indica che entro il 2030 i compiti globali di inferenza AI cresceranno di 4.000.000.000.000.000 di unità all'anno. Il consumo di Token di un singolo compito multi-turno è passato da qualche decina a diverse centinaia di migliaia. La collaborazione tra più agenti amplifica entrambi i fattori. Secondo i dati IDC, da quest'anno al 2030 il tasso di crescita composto del consumo globale di Token raggiungerà 4.823%.
L'offerta non tiene il passo. Il rapporto rileva che il tasso di soddisfazione della domanda globale di calcolo AI è sceso dal 79% del 2024 e che nel 2027 scenderà al 71%. Anche se la pressione sulla catena di fornitura dei semiconduttori si allentasse, nel 2030 si recupererebbe solo intorno al 77%. Entro il 2030 il divario di calcolo in valore assoluto arriverà a 380.900.000.000 di dollari, quasi dieci volte il livello del 2024.
Perché accumulare schede non funziona più? I carichi di inferenza dell'era degli agenti sono eterogenei. Prefill è un compito ad alto parallelismo e alta densità di calcolo. Decode elabora Token in serie e consuma più banda di memoria. Attention accede di continuo a una KV Cache in crescita. MoE ha calcolo sparso e pianificazione di routing su larga scala. Accumulare lo stesso tipo di calcolo porta facilmente a uno squilibrio nelle proporzioni delle risorse.
I produttori di hardware rispondono su due strade. Una è quella della capacità, per esempio il server AI supernodo Yuanbrain SD200 Ultra: il numero di chip per macchina passa da 64 a 128, la memoria video e lo storage espandibile salgono a 8TB e 64TB. L'azienda dichiara che una singola macchina può ospitare e far girare Kimi K3 da 2.800.000.000.000 di parametri, fino a modelli da 10.000.000.000.000 di parametri. Con indirizzamento unificato e connessione diretta simmetrica riduce la latenza di comunicazione All to All a 0,69 microsecondi e con super operatori taglia il numero di operatori a un decimo. L'azienda dichiara una performance di inferenza su Kimi K3 superiore di oltre 3 volte.
L'altra è quella della capienza, per esempio il gruppo di calcolo eterogeneo Yuanbrain HC2000: raffreddamento interamente a liquido e alimentazione ad alto flusso, con oltre 300 kilowatt di potenza per armadio, fino a 256 schede di accelerazione AI, densità di calcolo 4 volte quella di un armadio raffreddato ad aria e banda aggregata interna di 200Tbps. Fa lavorare chip diversi per fase di inferenza: Prefill con chip ad alta potenza di calcolo, Decode con chip HBM ad alta capacità.
Le due strade hanno una premessa comune: il calcolo va usato più a fondo. Anche il paper DSec pubblicato da DeepSeek punta nella stessa direzione. L'addestramento degli agenti richiede di creare ogni secondo molti sandbox, con una pressione sulla pianificazione del cluster molto superiore al pre-addestramento tradizionale. Per il calcolo intelligente cinese la competizione che viene non è più solo su chi ha più schede, ma su chi sa pianificare le risorse eterogenee in modo più fine.
Fonti
2Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.