Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Per i fornitori cinesi di potenza di calcolo conta il software

«Una scheda e mezza 6000D batte una B300»: così un fornitore cinese di cloud computing riassume l'ottimizzazione dell'inferenza. Inspur parla invece di un divario di potenza di calcolo da 381 miliardi di dollari entro il 2030.

EconomiaAnalisiDott. Elena RicciPubblicato: 26 settembre 20265 min di letturaFonti 2
Per i fornitori cinesi di potenza di calcolo conta il software

Nel dibattito sui costi dell'AI domina il prezzo delle schede grafiche. Il fornitore cinese di infrastrutture METASTONE sostiene che le riserve maggiori stiano nel software. L'azienda ha ottimizzato la gestione del modello DeepSeek-V4.1-Flash per farlo girare su otto schede collegate soltanto via PCIe, senza un bus veloce tra processori.

QbitAI descrive così l'effetto: la capacità di elaborazione in ingresso è passata da 1932 a 13 274 token al secondo, ossia 6,87 volte tanto. La chiave è stato completare il kernel di calcolo e ricostruire la comunicazione tra le schede, oltre al riutilizzo della cache di contesto. L'azienda riassume il risultato dicendo che «una scheda e mezza 6000D batte una B300»: hardware più economico e più lento vince su quello più costoso, se l'elaborazione è organizzata bene. La società gestisce oltre 20 000 P di potenza di calcolo in una dozzina di data center e dichiara una disponibilità del servizio superiore al 99,95 per cento.

La seconda voce arriva da Inspur, che alla conferenza AICC 2026 si è basata sui dati IDC. Secondo questi ultimi, la domanda mondiale di potenza di calcolo per l'AI sarà soddisfatta al 79 per cento nel 2024, al 71 per cento nel 2027 e a circa il 77 per cento nel 2030. Il divario tra necessità e offerta raggiungerà 380,9 miliardi di dollari, dieci volte tanto rispetto al 2024. Il consumo di token crescerà a un ritmo superiore a 48 volte su base annua in termini cumulativi. Le attività di inferenza arriveranno a 4000 bilioni all'anno nel 2030.

Inspur risponde con l'hardware. Il sistema SD200 Ultra ospita 128 chip, 8 TB di memoria e 64 TB di spazio su disco in un'unica macchina. Così si dovrebbero gestire modelli da mille miliardi di parametri senza suddividerli su più armadi. La latenza di comunicazione tutti-a-tutti è stata ridotta a 0,69 microsecondi.

Per chi compra potenza di calcolo, il prezzo per token smette di essere funzione soltanto del prezzo dell'hardware. A deciderlo è sempre più spesso l'efficienza con cui il fornitore riesce a sfruttare ciò che ha già. Questo cambia le regole delle gare per i servizi cloud.

La conclusione per chi compra è pratica. Se un aumento di più volte della capacità di elaborazione è arrivato solo riscrivendo la gestione della cache e distribuendo il lavoro tra i chip disponibili, la decisione di acquistare una nuova generazione di hardware dovrebbe essere preceduta da un audit del software. Il fornitore che sa mostrare valori misurati sulla stessa infrastruttura vende oggi non potenza di calcolo, ma risparmio. È anche il modo più semplice con cui gli operatori cinesi dei data center rispondono alle restrizioni sulle esportazioni: dove non si possono comprare le schede più potenti, conta soprattutto l'efficienza di ciò che è già in sala server.

Commenti 0

Fonti

2
  1. 01PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍ZH
  2. 02AI算力之争不靠堆卡!浪潮信息捅破智算能力天花板ZH

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Dott. Elena Ricci

Dott. Elena Ricci

Economia, business e mondo

Elena Ricci segue per FLASH24 economia, mondo e congiuntura, partendo dai dati grezzi di Eurostat, FMI e istituti nazionali, e non manda in pagina una cifra senza averla ricontrollata almeno due volte. Per la desk congiuntura confronta trimestre su trimestre i bilanci delle principali aziende tecnologiche e verifica le serie storiche su almeno due fonti indipendenti. Attende le pubblicazioni mensili di inflazione e ordini industriali, e nel frattempo sente analisti e uffici studi per capire dove sta andando il ciclo. Lo stesso interesse per i numeri delle big tech la porta a usare una cargo bike per gli spostamenti in città: peso, consumi e costi di gestione li misura come farebbe con un conto aziendale. Non pubblica stime non riconciliate con i documenti originali.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.