Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

La corsa al calcolo non è più una questione di schede: le due strade dell'AI cinese secondo IDC

All'AICC 2026 il rapporto IDC divide il deficit di calcolo in due voci, tetto di capacità e scala produttiva: entro il 2030 il divario assoluto potrebbe arrivare a 380,9 miliardi di dollari. Accumulare schede non basta più a coprire i carichi diversi di Prefill e Decode.

IA e modelliAnalisiGiulia FerrariPubblicato: 23 settembre 20267 min di letturaFonti 2
La corsa al calcolo non è più una questione di schede: le due strade dell'AI cinese secondo IDC

Per anni la competizione sul calcolo per l'AI ha avuto una sola parola d'ordine: accumulare. Schede, rack, generatori. All'AICC 2026 il rapporto «Valutazione dello sviluppo della potenza di calcolo per l'intelligenza artificiale in Cina 2026», pubblicato da IDC, divide il problema in due livelli: tetto di intelligenza e scala di intelligenza.

Prima la domanda. Il rapporto indica che entro il 2030 i compiti globali di inferenza AI cresceranno di 4.000.000.000.000.000 di unità all'anno. Il consumo di Token di un singolo compito multi-turno è passato da qualche decina a diverse centinaia di migliaia. La collaborazione tra più agenti amplifica entrambi i fattori. Secondo i dati IDC, da quest'anno al 2030 il tasso di crescita composto del consumo globale di Token raggiungerà 4.823%.

L'offerta non tiene il passo. Il rapporto rileva che il tasso di soddisfazione della domanda globale di calcolo AI è sceso dal 79% del 2024 e che nel 2027 scenderà al 71%. Anche se la pressione sulla catena di fornitura dei semiconduttori si allentasse, nel 2030 si recupererebbe solo intorno al 77%. Entro il 2030 il divario di calcolo in valore assoluto arriverà a 380.900.000.000 di dollari, quasi dieci volte il livello del 2024.

Perché accumulare schede non funziona più? I carichi di inferenza dell'era degli agenti sono eterogenei. Prefill è un compito ad alto parallelismo e alta densità di calcolo. Decode elabora Token in serie e consuma più banda di memoria. Attention accede di continuo a una KV Cache in crescita. MoE ha calcolo sparso e pianificazione di routing su larga scala. Accumulare lo stesso tipo di calcolo porta facilmente a uno squilibrio nelle proporzioni delle risorse.

I produttori di hardware rispondono su due strade. Una è quella della capacità, per esempio il server AI supernodo Yuanbrain SD200 Ultra: il numero di chip per macchina passa da 64 a 128, la memoria video e lo storage espandibile salgono a 8TB e 64TB. L'azienda dichiara che una singola macchina può ospitare e far girare Kimi K3 da 2.800.000.000.000 di parametri, fino a modelli da 10.000.000.000.000 di parametri. Con indirizzamento unificato e connessione diretta simmetrica riduce la latenza di comunicazione All to All a 0,69 microsecondi e con super operatori taglia il numero di operatori a un decimo. L'azienda dichiara una performance di inferenza su Kimi K3 superiore di oltre 3 volte.

L'altra è quella della capienza, per esempio il gruppo di calcolo eterogeneo Yuanbrain HC2000: raffreddamento interamente a liquido e alimentazione ad alto flusso, con oltre 300 kilowatt di potenza per armadio, fino a 256 schede di accelerazione AI, densità di calcolo 4 volte quella di un armadio raffreddato ad aria e banda aggregata interna di 200Tbps. Fa lavorare chip diversi per fase di inferenza: Prefill con chip ad alta potenza di calcolo, Decode con chip HBM ad alta capacità.

Le due strade hanno una premessa comune: il calcolo va usato più a fondo. Anche il paper DSec pubblicato da DeepSeek punta nella stessa direzione. L'addestramento degli agenti richiede di creare ogni secondo molti sandbox, con una pressione sulla pianificazione del cluster molto superiore al pre-addestramento tradizionale. Per il calcolo intelligente cinese la competizione che viene non è più solo su chi ha più schede, ma su chi sa pianificare le risorse eterogenee in modo più fine.

Commenti 0

Fonti

2
  1. 01AI 算力之争不靠堆卡!浪潮信息捅破智算能力天花板ZH
  2. 02DeepSeek 新论文公开 Agent 训练,梁文锋署名ZH

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.