Cosa sono gli acceleratori AI? Dentro i chip che eseguono l'inferenza nei datacenter
Gli acceleratori AI sono i chip specializzati che nei rack dei datacenter affiancano le normali CPU e svolgono la matematica matriciale dietro i chatbot e i generatori di immagini. Come sono costruiti, e chi può costruirli, è più interessante di quanto suggeriscano le sigle.

Ogni grande modello linguistico che avete usato è stato quasi certamente servito da un chip che non è una CPU. È un acceleratore: silicio progettato per fare un solo tipo di aritmetica, la moltiplicazione di matrici, molto in fretta. Il resto della macchina esiste per tenerlo rifornito. Questa divisione del lavoro spiega gran parte dei sommovimenti recenti nel mercato dei datacenter. Spiega anche perché aziende che un tempo vendevano core CPU, memoria o packaging ora discutano di teraFLOPS, larghezza di banda della memoria e di quanti banchi stanno su un die DRAM.
Il blocco di base, e perché ora SiFive ne vende uno
SiFive ha passato anni a concedere in licenza core CPU RISC-V che altre aziende collegavano ai propri motori AI. Secondo The Register, almeno alcune delle tensor processing unit di Google usano i core X280 di SiFive per gestire gli acceleratori di machine learning e tenere rifornite le unità di moltiplicazione matriciale. John Ronco, SVP e GM di SiFive UK, ha dichiarato alla testata che i progetti di SiFive sono alla base anche dei core CPU nell'acceleratore Blackhole di Tenstorrent.
A settembre 2024 l'azienda ha cambiato posizione. Ha annunciato la serie Intelligence XM, un cluster acceleratore AI concedibile in licenza e non più solo la parte CPU. Il cluster di base contiene quattro core CPU RISC-V Intelligence X collegati a un motore di matematica matriciale sviluppato internamente. Ogni cluster supporta fino a 1TB/sec di larghezza di banda della memoria. Secondo quanto riportato da The Register, dovrebbe offrire fino a 16 TOPS di INT8 o 8 teraFLOPS di BF16 per gigahertz.
"Per alcuni clienti, fare hardware proprio resta la scelta giusta", ha detto Ronco. "Ma altri volevano da SiFive qualcosa di più simile a un unico fornitore."
Il dato per gigahertz sembra strano a prima vista. È un blocco costruttivo, non un chip. The Register osserva che SiFive si aspetta che la maggior parte dei chip basati sul progetto giri intorno a 1GHz, e che Ronco prevede da quattro a otto cluster per chip. Con otto cluster e 1GHz si arriva a 64 teraFLOPS di BF16. Le slide del prodotto indicano che 512 cluster sono possibili. Secondo i calcoli di The Register si arriverebbe a circa quattro petaFLOPS di calcolo matriciale BF16, sopra i 2,5 petaFLOPS che Nvidia dichiara per le sue GPU Blackwell nella configurazione di punta. Sono numeri teorici. Le prestazioni reali dipendono dal clock, dal budget di potenza e raffreddamento, dal nodo di processo e da cos'altro condivide il die. SiFive dice anche che pubblicherà un'implementazione di riferimento open source della sua SiFive Kernel Library per abbassare la barriera all'adozione di RISC-V.
L'inferenza è un problema di memoria prima che di matematica
I fornitori di acceleratori parlano oggi meno di potenza di calcolo pura e più di memoria, perché è lì che l'inferenza rallenta davvero. d-Matrix ha usato la presentazione a Hot Chips 2026 per esporre l'aritmetica: i pesi dei modelli continuano a crescere, e la KV cache scala con la lunghezza del contesto moltiplicata per la dimensione del batch. ServeTheHome riporta l'esempio di d-Matrix di 64 utenti a 1M di contesto che producono circa 935GB di KV cache. Sia la capacità sia la larghezza di banda diventano problemi, ed entrambe continuano a crescere.
La SRAM centra l'obiettivo di banda ma non contiene quasi nulla, circa 4GB per una coppia di schede Corsair a circa 300 TB/s e 1ns di latenza, secondo ServeTheHome. Una cella SRAM 6T è circa 10 volte più grande di una cella DRAM. La HBM risolve la capacità ma sbatte contro un tetto pratico di banda intorno a 20 TB/s per pacchetti HBM4 come Vera Rubin di Nvidia e Instinct MI455 di AMD. La banda HBM ha però un costo in potenza: a 2,4 pJ/bit, spingere 100 TB/s attraverso la HBM consuma circa 1,92 kW prima del traffico di fabric.
La risposta di d-Matrix è impilare il calcolo direttamente sui die DRAM. L'azienda dice che uno stack 1-Hi con la logica sopra, a non più di 0,5 W/mm2, può essere raffreddato a liquido e mantenere la DRAM sotto i 100C. L'IO verticale 3D si aggira intorno a 0,3-0,4 pJ, circa 10 volte meno della HBM. La sua implementazione Raptor mette un die logico TSMC N4 su un die DRAM 3D usando un impilamento faccia a faccia da 36um. Una scala di 72 schede è dimensionata per ospitare un modello di frontiera come Kimi K3 a 1M di contesto, con 32GB per scheda usando pesi a 4 bit e una KV cache a 8 bit. Il dettaglio ingegneristico conta perché mostra quanto della progettazione di un acceleratore riguardi ormai il movimento dei dati e non le unità multiply-accumulate. Il die di d-Matrix ha 840 banchi, 768 dopo le riserve, su 256 canali, cioè 3 banchi per canale. Consegnare un flit da 128B da banchi da 32B richiede quindi due accessi e preleva 192B, sprecando circa il 33 percento della banda vicino a 33 TB/s. Lo stream blocking lo recupera condividendo un accesso parziale da 32B tra tre flit.
Il packaging, non solo il silicio
C'è un secondo vincolo che non ha nulla a che fare con il progetto del chip. Tom's Hardware ha riportato a marzo 2026 che Nittobo, azienda giapponese, controlla circa il 90 percento dell'offerta globale di T-glass, un tessuto di fibra di vetro a basso CTE usato nel core organico dei substrati per IC. Ogni package avanzato per chip AI lo contiene. La domanda supera l'offerta.
I numeri sono brutali. Nittobo sta triplicando la capacità del suo impianto di Fukushima, ma la nuova offerta non arriverà sul mercato prima della metà del 2027. I prezzi sono saliti del 20-30 percento, e i tempi di consegna per materiali a valle come i laminati rivestiti di rame sono passati dalle normali 8-10 settimane a oltre 20. Secondo dati di Nvidia citati da Tom's Hardware, le dimensioni degli interposer sono cresciute da 814mm2 per Hopper a 1.700mm2 per Blackwell, un aumento del 109 percento, con Rubin e Feynman destinati a salire ancora.
"Con l'offerta di T-glass ancora più limitata, i fornitori non comunicano più i tempi di consegna", ha detto Bill Ho, analista di Yuanta.
Nittobo sta raddoppiando la capacità di filato grezzo nel suo impianto a Taiwan e ha stretto un accordo di collaborazione con Nanya Plastics per esternalizzare parte della tessitura. Entro il 2027, circa il 20 percento del tessuto di vetro di Nittobo dovrebbe essere tessuto da Nanya, secondo Tom's Hardware. Bank of America stima che il segmento materiali elettronici di Nittobo quasi raddoppierà le vendite da 40,9 miliardi di yen nel 2025 a 87,7 miliardi di yen entro marzo 2028, con margini operativi vicini al 48 percento.
Chi sta effettivamente consegnando
Mentre si discute di tutto questo, alcune startup mettono silicio davanti al pubblico. Rebellions ha mostrato il suo acceleratore REBEL-Quad in funzione a Hot Chips 2025, secondo ServeTheHome: quattro ASIC di calcolo, quattro siti HBM3E per 144GB di memoria, costruiti su Samsung SF4X e CoWoS-S, con UCIe-A come interconnect per chiplet e un'interfaccia dual PCIe Gen5 x16. L'azienda ha eseguito una demo dal vivo di Llama 3.3 70B su una scheda di sviluppo a 35,5 msec di media per token di output. ServeTheHome ha osservato che molte aziende di acceleratori non arrivano mai a una demo pubblica funzionante.
Sul lato client, Draw Things ha riportato che Metal FlashAttention v2.5 con Neural Accelerators offre prestazioni fino a 4,6 volte migliori sull'M5 di Apple rispetto all'M4, con miglioramenti grezzi da 3,6 a 5,5 volte e guadagni end-to-end da 3,3 a 4,6 volte su un iPad M5. Il software è in anteprima: il supporto BF16 era inizialmente disattivato per bug irrisolti e gli shader richiedono più tempo per essere specializzati. Le misurazioni sono state fatte con un cuscinetto di ghiaccio sotto l'iPad per il massimo raffreddamento, il che dice tanto sul margine termico quanto sul chip.
Niente di tutto questo stabilisce quale architettura vincerà. Mostra però che l'acceleratore per datacenter non è più un'unica categoria di prodotto. È uno stack di core CPU, motori matriciali, tecnologia di memoria, materiali di packaging e librerie software, ognuno con il proprio collo di bottiglia e i propri tempi di consegna.
Fonti
5- 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
- 02Shortages of crucial chip packaging material threatens AI accelerator supplyEN
- 03d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 04Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 05Metal FlashAttention v2.5 with Neural Accelerators on the Apple M5 ChipEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.