Catena di fornitura degli acceleratori AI sotto stress per la carenza di T-glass
Un tessuto speciale in fibra di vetro, il T-glass, di cui la giapponese Nittobo controlla circa il 90% dell'offerta mondiale, è diventato l'ultimo collo di bottiglia per la produzione di acceleratori AI: i prezzi sono saliti del 20 al 30% e i tempi di consegna superano le 20 settimane.

La storia degli acceleratori AI di solito si racconta attraverso la roadmap delle GPU di Nvidia o la capacità produttiva delle fonderie di TSMC. Secondo Tom's Hardware, però, una società giapponese chiamata Nittobo controlla circa il 90% dell'offerta mondiale di un tessuto speciale in fibra di vetro noto come T-glass. Quel materiale è dentro ogni package avanzato per chip AI. La domanda ha superato l'offerta.
Il T-glass è un tessuto di vetro a basso CTE usato nel core organico dei substrati IC, lo strato di interconnessione tra un chip e il suo circuito stampato. Serve a tenere dimensionalmente stabili i package grandi e ad alta dissipazione. Più i processori AI diventano grandi e caldi, più quel compito si fa difficile. Secondo Tom's Hardware, la fisica che tiene piatti e funzionanti i processori AI dipende dal T-glass.
Perché l'offerta non può essere semplicemente attivata
Nittobo sta triplicando la capacità del suo impianto di Fukushima, in Giappone. La nuova offerta, però, non arriverà sul mercato prima della metà del 2027. La tempistica conta, perché il T-glass non è una commodity che si possa sostituire o avviare in fretta. Il materiale richiede forni elettrici di fusione specializzati che operano a 1.600-1.700 gradi Celsius. Il processo prevede la fusione di vetro ricco di silice, la filatura in filato e la tessitura in un tessuto ultrasottile. Tom's Hardware riferisce che scalare tutto questo richiede anni di investimenti e competenze.
Un'altra fibra di vetro, l'E-glass, viene usata allo stesso modo ma è più economica e serve soprattutto chip di fascia più bassa, come microcontrollori e processori mobili più vecchi. Il T-glass vince sulla resistenza termica. Per i chip a potenza più elevata, in particolare i grandi packaging 2.5D e 3D, il T-glass è l'opzione preferita.
Bilal Hachemi, analista di Yole Group che segue la catena di fornitura dei substrati IC, ha detto a Tom's Hardware Premium che sostituire il T-glass non è facile perché "ha valori specifici di dielettrico e CTE che funzionano meglio per i chip AI, soprattutto per il core organico". Hachemi ha anche osservato che l'industria dei substrati IC ha storicamente operato con margini sottili, quindi anche aumenti modesti della domanda possono innescare carenze. "Qualsiasi aumento della domanda di materiali build-up, materiale ABF o T-glass può causare una potenziale carenza, perché va contro le basi di questo settore", ha detto.
I numeri dietro la stretta
La crisi attuale è guidata dagli hyperscaler, che costruiscono package di chip sempre più grandi e consumano più T-glass per unità. Secondo dati di Nvidia citati da Tom's Hardware, le dimensioni degli interposer sono cresciute da 814mm2 per l'architettura Hopper a 1.700mm2 per Blackwell, un aumento del 109%. Le prossime generazioni Rubin e Feynman saliranno ancora.
Bank of America stima che il segmento materiali elettronici di Nittobo vedrà le vendite quasi raddoppiare, da 40,9 miliardi di yen (266 milioni di dollari) nel 2025 a 87,7 miliardi di yen entro marzo 2028, con margini operativi vicini al 48%. Takashi Enomoto, analista di ricerca presso Bank of America, ha affermato che la domanda di tessuto T-glass "sembra destinata a crescere più del previsto". Ha aggiunto che l'attenzione era sul T-glass spesso per i semi-package di GPU e CPU, ma che ora la domanda di T-glass ultrasottile è probabilmente destinata a salire, man mano che i dispositivi di punta abbandonano l'E-glass.
La corsa alle allocazioni ha già prodotto una scena insolita. Hachemi ha detto che vedere Nvidia rivolgersi direttamente a un fornitore di materiali a monte come Nittobo è senza precedenti. "Per la prima volta vediamo Nvidia, il cliente finale, contattare i fornitori di materiali a monte per assicurarsi la capacità e fare in modo di ottenerla", ha detto a Tom's Hardware. Il timore è che, una volta che Nvidia si assicura la sua quota, i compratori di chip rivali resteranno a contendersi quel che rimane.
Nittobo non si affida solo a Fukushima. Sta raddoppiando la capacità di filato grezzo nel suo impianto a Taiwan e importando filato in Giappone per la produzione del tessuto. Ha anche stretto un accordo di collaborazione con Nanya Plastics per esternalizzare parte della tessitura. Entro il 2027, circa il 20% del tessuto di vetro di Nittobo dovrebbe essere tessuto da Nanya, secondo Tom's Hardware.
Bill Ho, analista di Yuanta, ha descritto la situazione a valle senza giri di parole: "Con l'offerta di T-glass ancora più limitata ora, i fornitori non forniscono più tempi di consegna". I tempi di consegna dei laminati rivestiti in rame, un materiale a valle, sono passati dalle normali 8-10 settimane a oltre 20. I prezzi sono saliti tra il 20 e il 30%.
Un problema parallelo: quanta memoria serve davvero all'inferenza
Se i materiali limitano il lato dell'offerta, la larghezza di banda della memoria limita il lato della progettazione. A Hot Chips 2026, d-Matrix ha presentato il suo acceleratore Raptor 3D-DRAM per l'inferenza generativa. L'inquadramento del problema, come riportato da ServeTheHome, vale la pena di essere letto come una dichiarazione di dove è bloccato l'hardware AI. I pesi dei modelli continuano a crescere, e la KV cache scala con la lunghezza del contesto moltiplicata per la dimensione del batch. L'articolo di ServeTheHome porta l'esempio di 64 utenti a 1M di contesto che producono circa 935 GB di KV cache.
La SRAM raggiunge l'obiettivo di banda ma solo su scala minuscola. Un paio di schede acceleratore SRAM Corsair arriva a circa 300 TB/s con una latenza di circa 1 ns, ma contiene solo circa 4 GB. Una cella SRAM 6T è circa 10 volte più grande di una cella DRAM, e la dispersione arriva a decine di watt su scala GB. L'HBM risolve la capacità ma fatica sulla banda: ServeTheHome riporta che d-Matrix cita un tetto pratico intorno ai 20 TB/s per package HBM4 come Nvidia Vera Rubin e AMD Instinct MI455. A 2,4 pJ/bit, spingere 100 TB/s attraverso l'HBM consumerebbe circa 1,92 kW prima di contare qualsiasi traffico di fabric.
La risposta di d-Matrix è impilare il calcolo direttamente sopra i die DRAM, usando un die logico TSMC N4 su un die DRAM 3D con stacking face-to-face da 36 um. L'IO verticale 3D si attesta intorno a 0,3-0,4 pJ, circa 10 volte inferiore all'HBM, secondo ServeTheHome. A 32GB per scheda con pesi a 4 bit e KV cache a 8 bit, d-Matrix dimensiona per far entrare un modello di frontiera come Kimi K3 a 1M di contesto in uno scale-up da 72 schede, secondo l'azienda.
Il dettaglio ingegneristico è dove vive la difficoltà. Ogni tensor engine ha bisogno di un flit da 128B per accesso, ma con 3 banchi per canale un singolo accesso restituisce 96B. Consegnare un flit richiede quindi due accessi e recupera 192B, sprecando circa il 33% della banda vicino ai 33 TB/s. La risposta di d-Matrix, lo stream blocking, condivide un accesso parziale da 32B tra tre flit. Muovere 100 TB/s a 0,37 pJ/bit equivale a 296 W solo per l'I/O.
Gli hyperscaler costruiscono i propri, con prudenza
Il Maia 200 di Microsoft, presentato alla stessa conferenza e trattato da ServeTheHome, mostra l'altro estremo del compromesso. Il chip a 3nm ha 140 miliardi di transistor, sei stack di HBM3e, 7TB/secondo di banda HBM, 10.000 TFLOPS di prestazioni FP4 e un TDP di 750 Watt, con un die SoC da 820mm2. Microsoft lo ha abbinato a una topologia quad completamente connessa e a nessuna rete di scale-out: tutto è scale-up, su 128 rack e 6.000 chip nella slide mostrata. L'architettura Software Defined Local Access dataflow dell'azienda mantiene locale l'accesso ai dati e imposta il dataflow in fase di compilazione. In cambio ottiene determinismo e meno traffico di fabric.
Niente di tutto questo allenta il vincolo sui materiali. Lo Zhenwu V900 di Alibaba, annunciato con 216GB di memoria e 1.200GB/s di banda tra chip e produzione di massa prevista per il primo trimestre del 2027, aggiunge un altro compratore alla coda, come nota la rassegna settimanale di SemiEngineering del 25 settembre. Samsung, secondo quanto si riporta, prevede di almeno raddoppiare la produzione della famiglia HBM4 nel 2027, secondo Seoul Economic Daily. CXMT ha dichiarato che la sua DRAM G5 di quinta generazione è entrata in produzione di massa con un half-pitch dell'area attiva di 11,95nm, anche se non ha divulgato i rendimenti produttivi. Più memoria e più acceleratori significano più substrato, e più substrato significa più T-glass.
La conclusione scomoda è che il vincolo determinante per il calcolo AI nel 2027 potrebbe non essere la litografia o l'offerta di HBM, ma un tessuto di vetro intrecciato prodotto da una sola azienda a Fukushima, con un concorrente che aiuta a tesserlo e un tempo di consegna che nessuno vuole quantificare.
Fonti
4- 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN
- 04Chip Industry Week In ReviewEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.