Acceleratori AI: il collo di bottiglia del packaging che nessuno mette nel prezzo, e le startup che scommettono contro HBM
Una società giapponese che quasi nessun gestore di datacenter ha mai sentito nominare controlla circa il 90% dell'offerta mondiale di un tessuto di vetro presente in ogni package di chip AI avanzato. La sua prossima linea di produzione non arriverà prima di metà 2027.

Il T-glass di Nittobo è un tessuto di vetro a basso CTE usato nel core organico dei substrati per IC, lo strato di interconnessione tra un chip e la sua scheda a circuito stampato. Secondo Tom's Hardware, la società detiene circa il 90% dell'offerta mondiale. La domanda l'ha superata al punto che i tempi di consegna a valle per i laminati rivestiti di rame sono passati dalle normali 8-10 settimane a oltre 20. I prezzi sono saliti del 20-30%.
Quel numero conta più di quanto sembri. Ogni generazione di acceleratore AI monta un interposer più grande e un substrato più complesso, quindi ogni chip consuma più materiale. I dati di Nvidia, citati da Tom's Hardware, indicano interposer da 814mm² per Hopper e 1.700mm² per Blackwell, un aumento del 109%, con Rubin e Feynman destinati a salire ancora. L'offerta non può rispondere in fretta. Il T-glass richiede forni a fusione elettrica che lavorano tra 1.600 e 1.700°C, e Nittobo sta triplicando la capacità nel suo stabilimento di Fukushima. La nuova produzione non arriverà sul mercato prima di metà 2027.
Gli analisti citati in quel rapporto descrivono un mercato in cui la sostituzione è difficile. "Non è facile sostituire il T-glass", ha detto a Tom's Hardware Bilal Hachemi di Yole Group, indicando valori specifici di dielettrico e CTE adatti ai chip AI, soprattutto al core organico. L'analista di Yuanta Bill Ho ha detto che i fornitori hanno smesso del tutto di quotare i tempi di consegna. Takashi Enomoto di Bank of America prevede che le vendite di materiali elettronici di Nittobo quasi raddoppino, da 40,9 miliardi di yen (266 milioni di dollari) nel 2025 a 87,7 miliardi di yen entro marzo 2028, con margini operativi vicini al 48%.
Un dettaglio salta all'occhio. Hachemi ha detto che il fatto che Nvidia si rivolgesse direttamente a un fornitore di materiali a monte era senza precedenti in quella parte della filiera. Se il compratore più grande blocca prima la capacità, tutti gli altri negoziano sul resto.
La banda di memoria è l'altro muro
Mentre il packaging si stringe, i progettisti di acceleratori discutono di memoria. A Hot Chips 2026 d-Matrix ha presentato Raptor, un acceleratore che impila un die logico TSMC N4 sopra un die DRAM 3D usando uno stacking face-to-face da 36 micron, secondo ServeTheHome. La tesi è che né SRAM né HBM da sole bastano per l'inferenza. La SRAM offre banda ma poca capacità. La HBM offre capacità ma si scontra con la velocità dei pin, il numero di stack e lo spazio sul package. d-Matrix cita un tetto pratico intorno a 20 TB/s per i package HBM4.
La banda ha una bolletta energetica. L'articolo di ServeTheHome colloca la HBM a 2,4 pJ/bit, il che significa che 100 TB/s costano circa 1,92 kW prima del traffico di fabric. L'IO verticale 3D si aggira intorno a 0,3-0,4 pJ, circa dieci volte meno, perché è un percorso su scala millimetrica e non una rotta su interposer su scala centimetrica.
I numeri di d-Matrix sono specifici e poco appariscenti. Ogni tensor engine ha bisogno di un flit da 128B per accesso, ma banchi da 32B su 256 canali danno 3 banchi per canale dopo le riserve, restituendo 96B per accesso. Due accessi prelevano 192B per consegnare 128B, sprecando circa il 33% della banda vicino a 33 TB/s. La soluzione della società, lo stream blocking, condivide un accesso parziale tra tre flit, così 384B in ingresso corrispondono a 384B in uscita, con l'overfetch che scende a zero. A 32GB per scheda con pesi a 4 bit e una cache KV a 8 bit, d-Matrix sostiene che uno scale-up da 72 schede può ospitare un modello di frontiera a 1M di contesto.
Chiplet e il cambio di licenza RISC-V
I vincoli del packaging e i compromessi sulla memoria spingono i fornitori verso strategie di integrazione diverse. Rebellions ha mostrato il suo REBEL-Quad a Hot Chips 2025: quattro ASIC di calcolo, quattro siti HBM3E per 144GB e UCIe-A come interconnessione die-to-die, costruito su Samsung SF4X e CoWoS-S, secondo ServeTheHome. La scheda usa dual PCIe Gen5 x16, e l'azienda ha mostrato Llama 3.3 70B su una scheda di sviluppo a una media di 35,5 msec per token in uscita.
ServeTheHome ha notato che la scelta del PCIe stona con la mossa di Nvidia verso Gen6, ma ha considerato la demo dal vivo il fatto più significativo: un chip funzionante basato su UCIe in pubblico, cosa abbastanza rara da meritare di essere segnalata. Sul fronte del calcolo, SiFive è passata dal concedere in licenza core CPU RISC-V per il silicio AI di altre aziende al vendere un proprio progetto di acceleratore. The Register ha riportato il 19 settembre 2024 che i cluster Intelligence XM di SiFive accoppiano quattro core CPU Intelligence X con un motore di matematica matriciale interno, con fino a 1TB/sec di banda di memoria per cluster e fino a 16 TOPS di INT8 o 8 teraFLOPS di BF16 per gigahertz.
John Ronco, SVP e GM di SiFive per il Regno Unito, ha detto a The Register che alcuni clienti vogliono ancora hardware proprio, ma altri preferivano un fornitore unico. Si aspettava che la maggior parte dei chip costruiti su quel progetto usasse da quattro a otto cluster, ed era esitante su quanto potesse scalare, anche se il deck della società suggerisce che 512 cluster siano possibili. Per contesto, i migliori chip Blackwell di Nvidia sono valutati a 2,5 petaFLOPS di BF16.
SiFive fornisce già progetti RISC-V usati nelle tensor processing unit di Google e nel Blackhole di Tenstorrent, e il CEO Patrick Little ha dichiarato in una nota preparata che la società rifornisce cinque delle aziende "Magnificent 7", un'affermazione che The Register ha segnalato come probabilmente non tutta legata all'AI.
Le sanzioni continuano a ridisegnare la mappa
La catena di fornitura viene anche ridisegnata dai controlli sulle esportazioni. The Register ha riportato il 28 ottobre 2024 che TSMC avrebbe tagliato i rapporti con il designer cinese Sophgo per il sospetto che stesse cercando di fornire componenti a Huawei. Reuters, citando due persone vicine alla questione, ha identificato il cliente che aveva ordinato un chip simile all'Ascend 910B di Huawei. Sophgo ha negato qualsiasi rapporto d'affari diretto o indiretto con Huawei e ha detto di aver presentato a TSMC un rapporto di indagine dettagliato. Bitmain, associata a Sophgo, ha definito le accuse false e infondate.
The Register ha notato che il curriculum di Bitmain non è pulito: nel 2021 i pubblici ministeri hanno perquisito i suoi uffici a Taiwan e accusato due affiliate di aver cercato di reclutare illegalmente ingegneri taiwanesi. TSMC ha smesso di fare affari con Huawei nel 2020 in base alle regole statunitensi.
L'Ascend 910B di Huawei è valutato a 320 teraFLOPS di FP16 o 640 teraFLOPS di Int8, più o meno alla pari con l'A100 di Nvidia di quattro anni prima, secondo quel rapporto. Più lento della frontiera attuale, ma disponibile, ed è questo che conta quando i tetti all'export continuano a stringersi.
Fonti
5- 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 04SiFive expands from RISC-V cores for AI chips to designing its own full-fat acceleratorEN
- 05TSMC reportedly cuts off RISC-V chip designer linked to Huawei acceleratorsEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.