Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Perché gli acceleratori AI sono sempre più difficili da costruire: T-glass, HBM e impilamento 3D

Una società giapponese, Nittobo, controlla circa il 90% dell'offerta mondiale di un tessuto speciale in fibra di vetro noto come T-glass. Secondo Tom's Hardware la stretta sta colpendo le catene di fornitura degli acceleratori AI: i prezzi sono saliti del 20-30% e i tempi di consegna superano le 20 settimane.

TecnologiaSpiegatoGiulia FerrariPubblicato: 28 settembre 20266 min di letturaFonti 5
Perché gli acceleratori AI sono sempre più difficili da costruire: T-glass, HBM e impilamento 3D

Gran parte dei resoconti sull'hardware per l'AI comincia e finisce con Nvidia e TSMC. Il 9 marzo Tom's Hardware ha riferito che il collo di bottiglia si è spostato di un livello più in basso, in un materiale di cui quasi nessuno ha mai sentito parlare: il T-glass, un tessuto di vetro a basso CTE usato nel nucleo organico dei substrati per IC, lo strato di interconnessione tra un chip e il suo circuito stampato.

Cosa fa davvero il T-glass

Il T-glass mantiene dimensionalmente stabili i package grandi e ad alta dissipazione. Man mano che i processori AI diventano più grandi e più caldi, tenerli piatti diventa un problema produttivo, non teorico. Un'altra fibra di vetro, l'E-glass, costa meno ma viene usata soprattutto in chip di fascia bassa come microcontrollori e vecchi processori per dispositivi mobili. Per i package 2.5D e 3D di grandi dimensioni, il T-glass è l'opzione preferita.

Nittobo domina quel mercato. Né l'azienda né altre possono avviare una nuova linea di produzione dall'oggi al domani: il materiale richiede forni elettrici di fusione specializzati che lavorano a 1.600-1.700 °C, e il processo prevede la fusione di vetro ricco di silice, la filatura in filato e la tessitura in un tessuto ultrasottile. Per scalare servono anni di investimenti e competenze.

Nittobo sta triplicando la capacità del suo stabilimento di Fukushima, in Giappone, ma la nuova offerta non arriverà sul mercato prima della metà del 2027. Nel frattempo i prezzi sono saliti tra il 20 e il 30%, mentre i tempi di consegna di materiali a valle come i laminati rivestiti in rame sono passati dalle normali 8-10 settimane a oltre 20. Bill Ho, analista di Yuanta, ha detto a Tom's Hardware: "Con l'offerta di T-glass ancora più limitata, i fornitori non comunicano più i tempi di consegna."

Bilal Hachemi, analista di Yole Group che segue la catena di fornitura dei substrati per IC, ha detto che il T-glass "ha valori specifici di dielettrico e CTE che funzionano meglio per i chip AI, soprattutto per il nucleo organico". Ha anche osservato che il settore dei substrati per IC ha storicamente lavorato con margini sottili, il che significa che anche aumenti modesti della domanda possono innescare carenze. "Qualsiasi aumento della domanda di materiali build-up, di materiale ABF o di T-glass può causare una potenziale carenza, perché va contro le basi di questo settore", ha detto.

Ciò che rende acuta questa stretta è chi la sta guidando. Gli hyperscaler ordinano package sempre più grandi, e ogni generazione usa un interposer più ampio e un substrato più complesso. Secondo i dati di Nvidia citati da Tom's Hardware, le dimensioni degli interposer sono passate da 814 mm² per l'architettura Hopper a 1.700 mm² per Blackwell, un aumento del 109%, con le prossime generazioni Rubin e Feynman destinate a crescere ancora.

Package più grandi, più materiale

Bank of America stima che il segmento dei materiali elettronici di Nittobo vedrà le vendite quasi raddoppiare da 40,9 miliardi di yen (266 milioni di dollari) nel 2025 a 87,7 miliardi di yen entro marzo 2028, con margini operativi vicini al 48%. Takashi Enomoto, analista di ricerca di Bank of America, ha detto che anche la domanda di T-glass ultrasottile sta crescendo, per il passaggio dall'E-glass nei dispositivi di punta.

La corsa all'allocazione è iniziata. Hachemi ha definito senza precedenti il fatto che Nvidia si sia rivolta direttamente a un fornitore di materiali a monte: "Per la prima volta vediamo Nvidia, il cliente finale, contattare i fornitori di materiali a monte per assicurarsi la capacità e garantirsi di ottenerla." Il timore è che, una volta che Nvidia si sia assicurata la sua quota, gli acquirenti di chip rivali restino a contendersi quel che rimane.

Nittobo non sta a guardare. Oltre all'espansione di Fukushima, sta raddoppiando la capacità di filato grezzo nel suo stabilimento di Taiwan e importando filato in Giappone per la produzione del tessuto. Ha anche stretto un accordo di collaborazione con Nanya Plastics per esternalizzare parte della tessitura, segno di quanto sia teso il mercato: Nittobo collabora con uno dei suoi maggiori concorrenti per alleviare il collo di bottiglia. Entro il 2027, circa il 20% del tessuto di vetro di Nittobo dovrebbe essere tessuto da Nanya.

Il muro della memoria e la risposta dell'impilamento

Il materiale di packaging è un vincolo. La larghezza di banda della memoria è l'altro, ed è oggetto di una discussione separata che attraversa le conferenze sui chip di quest'anno. Il resoconto di ServeTheHome della presentazione di d-Matrix a Hot Chips 2026 espone il problema: i pesi dei modelli continuano a crescere, e la KV cache scala con la lunghezza del contesto moltiplicata per la dimensione del batch. Sessantaquattro utenti a 1M di contesto possono significare circa 935 GB di KV cache.

La SRAM raggiunge l'obiettivo di banda ma solo su scala minuscola. Una coppia di schede acceleratrici SRAM Corsair arriva a circa 300 TB/s con una latenza di circa 1 ns, ma contiene solo circa 4 GB. L'HBM risolve la metà della capacità ma fatica sulla banda, con d-Matrix che cita un tetto pratico intorno ai 20 TB/s per i package HBM4. Una banda così alta ha un prezzo in potenza: a 2,4 pJ/bit, spingere 100 TB/s attraverso l'HBM consuma circa 1,92 kW prima di contare qualsiasi traffico di fabric.

La risposta di d-Matrix è impilare il calcolo direttamente sopra i die di DRAM. Un die logico TSMC N4 poggia su un die DRAM 3D con impilamento face-to-face da 36 um, un processo che l'azienda descrive come provato, a basso costo, ad alto volume e ad alto rendimento. La sfida termica è reale: d-Matrix dice che uno stack 1-Hi con la logica sopra, a non più di 0,5 W/mm², può essere raffreddato a liquido e mantenere la DRAM sotto i 100 C. L'IO verticale 3D si attesta su circa 0,3-0,4 pJ, circa 10 volte meno dell'HBM.

Ci sono compromessi ingegneristici. Ogni tensor engine ha bisogno di un flit da 128B per accesso, e con 3 banchi per canale un singolo accesso restituisce 96B, sprecando circa il 33% della banda. La soluzione di d-Matrix, chiamata stream blocking, condivide un accesso parziale da 32B tra tre flit, così l'overfetch scende a zero. Con 32 GB per scheda, uno scale-up da 72 schede può ospitare un modello di frontiera come Kimi K3 a 1M di contesto.

Microsoft e Rebellions mostrano la stessa tendenza

Il Maia 200 di Microsoft, presentato a Hot Chips 2026 e seguito in diretta da ServeTheHome, è un chip da 3 nm con 140 miliardi di transistor, 6 stack HBM3e, 7 TB/s di banda HBM, 750 W di TDP e 10.000 TFLOPS di prestazioni FP4. Il die del SoC misura 820 mm². Microsoft lo sta distribuendo nei data center Azure con un design di rete solo scale-up: 128 rack e 6.000 chip, collegati da switch di livello 0 e livello 1 su Ethernet unificata. I benchmark sull'attenzione mostrano un picco effettivo di 1,65 PFLOPS, e il benchmarking collettivo raggiunge quasi 1,3 TB/s in AllReduce BF16.

A Hot Chips 2025, Rebellions ha mostrato un approccio diverso allo stesso problema di packaging. Il REBEL-Quad usa quattro siti HBM3E per 144 GB di memoria e UCIe come interconnect per chiplet, costruito su Samsung SF4X e CoWoS-S con quattro ASIC di calcolo e quattro condensatori in silicio integrati per package. ServeTheHome ha notato che è una scheda dual PCIe Gen5 x16, e che l'azienda ha eseguito una demo dal vivo di Llama 3.3 70B a 35,5 msec di media per token in output su una scheda di sviluppo.

Anche il mondo accademico si muove. Stanford, Carnegie Mellon, Penn, MIT e SkyWater Technology hanno realizzato il primo chip 3D monolitico costruito in una fonderia statunitense, presentato alla 71ª IEEE International Electron Devices Meeting nel dicembre 2025. I primi test hardware mostrano che il prototipo supera i chip 2D comparabili di circa quattro volte, e le simulazioni di versioni più alte indicano un miglioramento fino a dodici volte su carichi di lavoro AI, compresi quelli derivati da LLaMA di Meta. Subhasish Mitra, il professore di Stanford che ha guidato il lavoro, ha detto che svolte come questa sono il modo in cui il settore arriva ai miglioramenti di prestazioni hardware di 1.000 volte che i futuri sistemi AI richiederanno.

Niente di tutto questo arriva nei tempi che l'attuale carenza richiede. Il vincolo del T-glass è un problema che dura anni, e la ricerca su impilamento e packaging che potrebbe alleviare la pressione più avanti è ancora in gran parte su slide di presentazioni e schede di sviluppo.

Commenti 0

Fonti

5
  1. 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
  2. 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  3. 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
  4. 04Scientists and U.S. foundry achieve 3D chip breakthrough to accelerate AIEN
  5. 05Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.