Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Cosa c'è davvero dentro un acceleratore AI: T-glass, HBM e il collo di bottiglia del decode

Una sola azienda giapponese controlla circa il 90% dell'offerta mondiale di un tessuto di fibra di vetro presente in ogni package avanzato per AI. La carenza ormai condiziona le roadmap degli acceleratori quanto l'architettura delle GPU.

TecnologiaSpiegatoChiara RomanoPubblicato: 28 settembre 20267 min di letturaFonti 4
Cosa c'è davvero dentro un acceleratore AI: T-glass, HBM e il collo di bottiglia del decode

Secondo Tom's Hardware, Nittobo controlla circa il 90% del mercato mondiale del T-glass, un tessuto di vetro a basso CTE usato nel core organico dei substrati per IC. Nittobo sta triplicando la capacità del suo impianto di Fukushima, ma la nuova offerta non arriverà sul mercato prima della metà del 2027.

Quel vuoto si vede già nei prezzi e nelle tempistiche. I prezzi del T-glass sono saliti tra il 20% e il 30%. I tempi di consegna per i materiali a valle, come i laminati rivestiti di rame, sono passati dalle normali 8-10 settimane a oltre 20. "Con l'offerta di T-glass ancora più limitata, i fornitori non comunicano più i tempi di consegna", ha detto a Tom's Hardware Bill Ho, analista di Yuanta. La stretta si manifesta prima nei preventivi, che i team commerciali non riescono a tenere fermi più di qualche giorno, poi nei programmi su cui i progettisti fabless costruiscono le finestre di lancio. Nessuno nella filiera vuole dire pubblicamente quanto durerà la tensione. Nessuno vuole essere quello che ha sbagliato la previsione.

Perché il substrato conta più del numero di transistor

Un acceleratore AI non è un solo chip. È un package: die logici, stack di memoria, un interposer e un substrato che collega tutto a una scheda a circuito stampato. Il core organico del substrato deve restare piatto mentre il package si scalda e si raffredda, perché un package deformato rompe le connessioni microscopiche tra i die. Il T-glass è ciò che lo tiene dimensionalmente stabile, e i suoi valori dielettrici e di espansione termica sono tarati esattamente per quel compito.

Bilal Hachemi, analista di Yole Group che segue la filiera dei substrati per IC, ha detto a Tom's Hardware Premium che sostituirlo non è semplice. Il T-glass "ha valori dielettrici e di CTE specifici che funzionano meglio per i chip AI, soprattutto per il core organico", ha affermato. Ha anche indicato una struttura industriale che trasforma piccoli shock di domanda in carenze: il business dei substrati per IC ha storicamente lavorato con margini sottili, quindi "qualsiasi aumento della domanda di materiali build-up, di materiale ABF o di T-glass può causare una potenziale carenza, perché va contro le basi di questo settore". Quella struttura è precedente al boom dell'AI. Era costruita per un mercato in cui la domanda di substrati cresceva lentamente e in modo prevedibile. Non è stata ricostruita per un mercato in cui un singolo ciclo di prodotto può raddoppiare gli ordini in un anno.

Il lato della domanda non è sottile. Ogni generazione di acceleratore AI usa un interposer più grande e un substrato più complesso, quindi più materiale per unità. Secondo i dati di Nvidia citati da Tom's Hardware, le dimensioni dell'interposer sono passate da 814mm² per Hopper a 1.700mm² per Blackwell, un aumento del 109%, con le prossime generazioni Rubin e Feynman destinate a salire ancora.

Bank of America stima che il segmento materiali elettronici di Nittobo vedrà le vendite quasi raddoppiare da 40,9 miliardi di yen (266 milioni di dollari) nel 2025 a 87,7 miliardi di yen entro marzo 2028, con margini operativi vicini al 48%. "La domanda di tessuto in T-glass sembra destinata a crescere più del previsto", ha detto Takashi Enomoto, analista di ricerca di Bank of America. Ha aggiunto che l'attenzione era sul T-glass spesso per i package di GPU e CPU, ma che la domanda di T-glass ultra-sottile è probabilmente destinata a salire man mano che i dispositivi di punta abbandonano l'E-glass.

Nittobo non sta aspettando. Oltre a Fukushima, sta raddoppiando la capacità di filato grezzo nel suo impianto a Taiwan e spedisce il filato in Giappone per la tessitura. Ha anche un accordo di collaborazione con Nanya Plastics per esternalizzare parte della tessitura. Tom's Hardware nota il simbolismo: Nittobo si allea con uno dei suoi maggiori concorrenti. Entro il 2027, circa il 20% del tessuto di vetro di Nittobo dovrebbe essere tessuto da Nanya.

La memoria è l'altra metà del collo di bottiglia

Se il substrato decide se un package può essere costruito, la memoria decide quanto velocemente può rispondere. d-Matrix ha usato la sua presentazione a Hot Chips 2026 sull'acceleratore Raptor, seguita da ServeTheHome, per esporre l'aritmetica. I pesi dei modelli continuano a crescere, e la KV cache scala con la lunghezza del contesto moltiplicata per la dimensione del batch. Quindi 64 utenti a 1M di contesto possono significare circa 935 GB di KV cache.

La separazione tra calcolo e memoria si vede nelle due fasi dell'inferenza. Il prefill elabora molti token del prompt in parallelo ed è limitato dal throughput di calcolo. Il decode produce un token alla volta ed è tipicamente limitato dalla larghezza di banda della memoria. Poiché il decode domina il tempo di esecuzione reale, è sulla larghezza di banda che si ottengono i guadagni. La SRAM centra l'obiettivo di larghezza di banda ma solo su scala minuscola: una coppia di schede acceleratore Corsair SRAM raggiunge circa 300 TB/s a circa 1 ns di latenza e contiene solo circa 4 GB. Una cella SRAM 6T è circa 10 volte più grande di una cella DRAM.

L'HBM risolve la capacità ma non la larghezza di banda. d-Matrix cita un tetto pratico intorno ai 20 TB/s per i package HBM4 come Nvidia Vera Rubin e AMD Instinct MI455, limitato dalla velocità dei pin, dall'ampiezza dell'I/O e dal fronte del package di circa 8-16 stack. La larghezza di banda ha anche un prezzo in potenza: a 2,4 pJ/bit, spingere 100 TB/s attraverso l'HBM costa circa 1,92 kW prima di contare qualsiasi traffico di fabric.

"Per la prima volta vediamo Nvidia, il cliente finale, rivolgersi ai fornitori di materiali a monte per assicurarsi la capacità e garantirsi di ottenerla." Bilal Hachemi, Yole Group, a Tom's Hardware

La risposta di d-Matrix è impilare il calcolo direttamente sui die DRAM. Un die logico TSMC N4 poggia su un die DRAM 3D con impilamento face-to-face da 36 um. L'I/O verticale 3D arriva a circa 0,3-0,4 pJ, circa 10 volte meno dell'HBM, perché è un percorso su scala millimetrica e non una rotta su interposer su scala centimetrica. L'azienda afferma che uno stack 1-Hi con la logica sopra, a non più di 0,5 W/mm², può essere raffreddato a liquido e mantenere la DRAM sotto i 100 C.

L'integrazione è il punto in cui l'eleganza finisce. Ogni tensor engine ha bisogno di un flit da 128B per accesso. Con 32B consegnati per accesso di colonna da banchi da 32B, il conto è di 4 banchi per canale. Il die ha 840 banchi, 768 dopo 72 di riserva, distribuiti su 256 canali, cioè solo 3 banchi per canale. Lo stream blocking risolve il disallineamento condividendo un accesso parziale da 32B tra tre flit, così 4 accessi da 96B alimentano 3 flit da 128B. A 32GB per scheda con pesi a 4 bit e KV cache a 8 bit, d-Matrix dimensiona un modello di frontiera come Kimi K3 a 1M di contesto in un singolo rack da 72 schede.

Il ciclo di progettazione viene automatizzato, in modo disomogeneo

Packaging e memoria sono vincoli fisici. Il tempo di progettazione è un vincolo economico. Tim Costa di Nvidia, vicepresidente e direttore generale della computational engineering, ha detto ai giornalisti che entro il 2030 il settore dovrebbe produrre 2.000 miliardi di chip e lavorare circa 41 milioni di wafer al mese, con singoli package che si avvicinano a un trilione di transistor. "Il processo di progettazione tradizionale non può semplicemente tenere il passo con una sfida di questa scala", ha detto, secondo The Next Platform.

Nvidia sta distribuendo la sua CPU Vera CV100 basata su Arm nei propri flussi EDA, inclusi simulazione, verifica formale e implementazione fisica. Costa ha detto che i test iniziali mostrano Vera eseguire Synopsys VCS e Cadence Jasper a 1,5 volte le prestazioni dei sistemi AMD Epyc Torrent. Cadence sostiene che i suoi AI Super Agents possono eseguire centinaia di simulazioni contemporaneamente e offrire cicli di validazione a livello register-transfer 40 volte più veloci. Synopsys dice che il suo flusso di verifica autonomo può produrre RTL validato 50 volte più velocemente. Sono numeri dei fornitori, e SemiEngineering nota che lo spostamento verso agenti specializzati sta creando nuovi problemi di orchestrazione, integrazione e guardrail, con i risultati generati dall'AI che richiedono ancora verifica prima della firma finale.

Un dato dal ChipStack AI Super Agent di Cadence, riportato da SemiEngineering, suggerisce che i guadagni non riguardano solo la velocità. L'azienda riporta circa il 24% in meno di area e il 18% in meno di potenza rispetto alla pura generazione di codice con modelli di fondazione.

Niente di tutto questo elimina il vincolo a monte. Un interposer più grande richiede più T-glass. Un modello più grande richiede più larghezza di banda di memoria. Nvidia che si rivolge direttamente a Nittobo, cosa che Hachemi ha definito senza precedenti in quella parte della filiera, è un segnale di dove si trova la vera scarsità. La preoccupazione che nomina è diretta: una volta che Nvidia si assicura la sua quota, gli acquirenti di chip rivali restano a contendersi quel che rimane. Le nuove fab richiedono anni, e così un nuovo forno per tessuto di vetro che lavora tra 1.600 e 1.700°C.

Commenti 0

Fonti

4
  1. 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
  2. 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  3. 03Nvidia Accelerates Chip Engineering With AI AgentsEN
  4. 04Chip Industry Week In ReviewEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.