Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Come nascono gli acceleratori AI: packaging, memoria e colli di bottiglia del progetto

La corsa agli acceleratori AI non riguarda più solo chi riesce a stampare il die logico più veloce. Tre storie di filiera del 2026 mostrano che i vincoli stanno nel materiale, nello stack di memoria e nel flusso di lavoro ingegneristico attorno al chip.

TecnologiaSpiegatoGiulia FerrariPubblicato: 27 settembre 20267 min di letturaFonti 4
Come nascono gli acceleratori AI: packaging, memoria e colli di bottiglia del progetto

Di solito gli acceleratori AI si raccontano con la potenza di calcolo. Le GPU di Nvidia, Maia di Microsoft, Raptor di d-Matrix: i numeri che si citano sono teraflop, transistor e larghezza di banda della memoria. La storia più difficile è quella che sta attorno a quel silicio. Nel 2026 si è fatta affollata.

Tre report separati, di Tom's Hardware, ServeTheHome e The Next Platform, descrivono tre strozzature diverse. Un tessuto di vetro speciale sta dentro ogni package avanzato. Un'architettura di memoria scambia capacità con larghezza di banda. Una pipeline ingegneristica viene ricostruita attorno ad agenti AI.

Una quota del 90% in un materiale che quasi nessuno ha mai sentito nominare

La prima strozzatura è un materiale chiamato T-glass. Secondo Tom's Hardware, un'azienda giapponese chiamata Nittobo ne controlla circa il 90% dell'offerta globale. Il T-glass è un tessuto di fibra di vetro a basso CTE usato nel core organico dei substrati IC, lo strato di interconnessione tra un chip e il suo circuito stampato. Tiene stabili le dimensioni dei package grandi e ad alta dissipazione mentre diventano più densi.

La cosa pesa di più man mano che i processori AI crescono. Tom's Hardware cita dati Nvidia: gli interposer passano da 814mm² per Hopper a 1.700mm² per Blackwell, un aumento del 109%, e le generazioni in arrivo, Rubin e Feynman, salgono ancora. Ogni generazione consuma più T-glass per unità. Una nuova linea di T-glass non si avvia in fretta. Servono forni elettrici di fusione specializzati che lavorano tra 1.600 e 1.700°C, più anni di investimenti e competenza per fondere vetro ricco di silice, filarlo in filato e tesserlo in tessuto ultraleggero.

I numeri mostrano già la stretta. Tom's Hardware riporta che i prezzi sono saliti tra il 20 e il 30%, mentre i tempi di consegna per materiali a valle come i laminati rivestiti in rame si sono allungati dalle normali 8-10 settimane a oltre 20. "Con l'offerta di T-glass ancora più vincolata, i fornitori non forniscono più tempi di consegna", ha detto Bill Ho, analista di Yuanta, nell'articolo.

Nittobo sta triplicando la capacità nel suo impianto di Fukushima, ma la nuova offerta non arriverà sul mercato prima della metà del 2027. Sta anche raddoppiando la capacità di filato grezzo nel suo impianto a Taiwan e importando filato in Giappone per la produzione del tessuto. L'azienda ha stretto un accordo di collaborazione con Nanya Plastics per esternalizzare parte della tessitura: entro il 2027, circa il 20% del tessuto di vetro di Nittobo dovrebbe essere tessuto da Nanya, secondo quanto dichiarato dall'azienda. Collaborare con un concorrente è di per sé un segnale di quanto sia stretto il mercato.

Bilal Hachemi, analista di Yole Group che segue la filiera dei substrati IC, ha detto a Tom's Hardware Premium che sostituire il T-glass non è facile perché "ha valori dielettrici e di CTE specifici che funzionano meglio per i chip AI, soprattutto per il core organico". Ha anche indicato i margini sottili del settore: "Qualsiasi aumento della domanda di materiali build-up, materiale ABF o T-glass può causare una potenziale carenza, perché va contro le basi di questo settore", ha detto.

Bank of America stima che il segmento materiali elettronici di Nittobo quasi raddoppierà le vendite da ¥40,9 miliardi (266 milioni di dollari) nel 2025 a ¥87,7 miliardi entro marzo 2028, con margini operativi vicini al 48%. "La domanda di tessuto T-glass sembra destinata a crescere più del previsto", ha detto Takashi Enomoto, analista di ricerca di Bank of America, nello stesso pezzo.

Il dettaglio più eclatante è forse chi sta bussando alla porta. Hachemi ha detto che vedere Nvidia rivolgersi direttamente a un fornitore di materiali a monte come Nittobo è senza precedenti. "Per la prima volta vediamo Nvidia, il cliente finale, contattare i fornitori di materiali a monte per assicurarsi la capacità e garantire di ottenerla", ha detto. La preoccupazione che segue è diretta: una volta che il maggiore acquirente si blocca la sua quota, i compratori di chip rivali si contendono ciò che resta.

La memoria è l'altro muro

La seconda strozzatura è dentro il package dell'acceleratore. All'Hot Chips 2026, d-Matrix ha presentato il suo acceleratore Raptor 3D-DRAM per l'inferenza generativa, e il resoconto di ServeTheHome espone chiaramente i compromessi. I pesi dei modelli continuano a crescere, e la KV cache scala con la lunghezza del contesto moltiplicata per la dimensione del batch. ServeTheHome fa l'esempio di 64 utenti a 1M di contesto, che può significare circa 935 GB di KV cache. È insieme un problema di capacità e di larghezza di banda.

La SRAM raggiunge l'obiettivo di banda ma non tiene quasi nulla: una coppia di schede acceleratore Corsair SRAM arriva a circa 300 TB/s con circa 1 ns di latenza, eppure contiene solo circa 4 GB. La HBM risolve la capacità ma fatica sulla banda, con d-Matrix che cita un tetto pratico attorno ai 20 TB/s per package HBM4 come Vera Rubin di Nvidia e Instinct MI455 di AMD. Spingere 100 TB/s attraverso la HBM a 2,4 pJ/bit consumerebbe circa 1,92 kW prima di qualsiasi traffico di fabric, secondo ServeTheHome.

La risposta di d-Matrix è impilare il calcolo direttamente sopra i die di DRAM. L'IO verticale 3D arriva a circa 0,3-0,4 pJ, circa 10 volte meno della HBM, perché è un percorso su scala millimetrica e non una rotta su interposer su scala centimetrica. L'azienda usa un die logico TSMC N4 impilato su un die 3D DRAM con impilamento face-to-face da 36 um. A 32GB per scheda, con pesi a 4 bit e una KV cache a 8 bit, uno scale-up da 72 schede può ospitare un modello di frontiera come Kimi K3 a 1M di contesto, secondo ServeTheHome.

Niente di tutto questo è gratis. d-Matrix dice che uno stack 1-Hi con logica sopra, a non più di 0,5 W/mm², può essere raffreddato a liquido e mantenere la DRAM sotto i 100 C. Ha anche dovuto risolvere un problema aritmetico scomodo. Ogni tensor engine ha bisogno di un flit da 128B per accesso, ma il suo die ha 840 banchi, 768 dopo 72 di riserva, distribuiti su 256 canali, il che fa 3 banchi per canale. Un singolo accesso restituisce 96B, quindi un flit da 128B richiede due accessi e recupera 192B, sprecando circa il 33% della banda vicino ai 33 TB/s. La soluzione, lo stream blocking, condivide un accesso parziale da 32B tra tre flit, così 4 accessi a 96B alimentano 3 flit a 128B.

Il ciclo di progetto stesso viene automatizzato

La terza strozzatura non è un materiale né un tipo di memoria, ma il processo ingegneristico. The Next Platform ha riportato il 27 luglio che Nvidia sta spingendo agenti AI nell'ingegneria dei chip, citando Tim Costa, vicepresidente e direttore generale dell'ingegneria computazionale di Nvidia, che ha detto ai giornalisti che entro il 2030 il settore dovrebbe produrre 2.000 miliardi di chip e lavorare circa 41 milioni di wafer al mese, con singoli package che si avvicinano a un trilione di transistor.

"Il punto chiave non è un singolo numero; è l'interazione di scala, architettura, packaging e complessità di sistema", ha detto Costa. "Il processo di progetto tradizionale non riesce a tenere il passo con quella scala di sfida".

Nvidia sta distribuendo la sua CPU Vera CV100 basata su Arm nei flussi EDA usati per creare le sue future CPU e GPU, inclusi simulazione, verifica formale e implementazione fisica. Secondo Costa, i primi test ingegneristici mostrano Vera in esecuzione sulle piattaforme VCS di Synopsys e Jasper di Cadence, con prestazioni 1,5 volte superiori a quelle dei sistemi Epyc Torrent di AMD. Vera ha 88 core CPU Olympus personalizzati e un sottosistema di memoria LPDDR5X da 1,2 TB/sec. La CPU di prossima generazione di Nvidia, Rosa, è attesa nel 2028 come parte della piattaforma datacenter Feynman.

I fornitori di strumenti fanno le loro affermazioni. Cadence ha detto che i suoi AI Super Agents possono implementare centinaia di simulazioni in meno di un giorno, lavoro che attualmente richiede cinque settimane, offrendo cicli di validazione Register-Transfer Level 40 volte più veloci. Synopsys ha dimostrato un Fully Autonomous Design Verification Workflow alla Design Automation Conference e ha detto di poter consegnare RTL validato 50 volte più velocemente di altre piattaforme.

Quei multipli vanno presi con cautela: vengono dai fornitori che vendono gli strumenti, e The Next Platform nota la sfida più ampia del settore su orchestrazione, integrazione e guardrail, con i risultati generati dall'AI che necessitano ancora di verifica prima dell'approvazione.

Maia 200 di Microsoft, presentato all'Hot Chips 2026 e trattato da ServeTheHome, mostra come sono fatti i progetti che ne risultano. È un chip a 3nm con 140 miliardi di transistor, 6 stack di HBM3e, 7TB/secondo di banda HBM, un TDP di 750 Watt, 10.000 TFLOPS di prestazioni FP4 e un die SoC da 820mm². Microsoft usa una topologia quad completamente connessa senza rete scale-out, solo scale-up: la sua slide mostra 128 rack con 6.000 chip. L'azienda ha anche co-progettato lo stack software, con la Microsoft Collective Communication Library al centro, perché il flusso di dati definito dal software dell'hardware richiede kernel ottimizzati per esso.

Mettendo insieme le tre storie, il quadro è coerente. L'acceleratore non è più un chip. È un package che dipende da un fornitore di materiali quasi in monopolio, da un'architettura di memoria che va co-progettata con il carico di lavoro, e da una pipeline di progetto che viene ricostruita con l'AI per tenere il passo con la propria complessità. Ogni strato ha i suoi tempi di consegna, e il più lento detta il ritmo.

Commenti 0

Fonti

4
  1. 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
  2. 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  3. 03Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN
  4. 04Nvidia Accelerates Chip Engineering With AI AgentsEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.