Acceleratori AI: la partita del datacenter si sposta sulla catena di fornitura del packaging
I produttori di acceleratori AI stanno ridisegnando il modo in cui il calcolo comunica con la memoria, ma il collo di bottiglia più profondo sta a monte: un produttore giapponese di tessuto di fibra di vetro controlla circa il 90% di un materiale che serve a ogni package avanzato, e la nuova capacità non arriverà prima di metà 2027.

Nel 2026 ogni discussione sugli acceleratori AI finisce prima o poi contro lo stesso muro: la larghezza di banda della memoria. Il calcolo è costoso ma disponibile. Spostare pesi e KV cache dentro e fuori dalla memoria è il punto in cui si decidono il budget di potenza, le dimensioni del package e la data di spedizione. Per questo SiFive, d-Matrix e Rebellions hanno presentato in questo ciclo progetti che attaccano l'interfaccia di memoria invece dell'array multiply-accumulate.
The Register ha riportato il 19 settembre 2024 che SiFive, da tempo fornitore di core CPU RISC-V per il silicio AI di altre aziende, è passata a concedere in licenza un proprio acceleratore. Il cluster Intelligence XM abbina quattro core RISC-V Intelligence X a un motore di matematica matriciale interno. Ogni cluster supporta fino a 1TB/sec di larghezza di banda di memoria ed è classificato fino a 16 TOPS di INT8 o 8 teraFLOPS di BF16 per gigahertz. John Ronco di SiFive ha dichiarato alla testata che la maggior parte dei chip costruiti su questo progetto userà da quattro a otto cluster. Si arriva così a una larghezza di banda di memoria di picco tra 4 e 8TB/sec e fino a 32 o 64 teraFLOPS di BF16 a 1GHz.
Sono numeri modesti accanto a una Nvidia H100.
La parte interessante è a chi vende SiFive. Ronco ha detto che alcuni clienti vogliono ancora costruirsi l'hardware da soli, ma altri cercavano un fornitore unico. SiFive non punta a Google o Tenstorrent, che già progettano i propri acceleratori. Punta a organizzazioni che vogliono un blocco pronto da personalizzare e mandare in fonderia.
Il tetto non è chiaro: Ronco era esitante su quanto il progetto possa scalare, anche se la presentazione del prodotto suggerisce che 512 cluster XM siano alla portata. A un clock di 1GHz, sarebbero circa quattro petaFLOPS di calcolo matriciale BF16, contro i 2.5 petaFLOPS delle GPU Blackwell di Nvidia nella configurazione più spinta. SiFive ha anche annunciato che offrirà un'implementazione di riferimento open source della sua SiFive Kernel Library.
DRAM impilata sopra il die logico
La copertura di Hot Chips 2026 da parte di ServeTheHome descrive d-Matrix su una strada diversa: mettere la logica direttamente sopra la DRAM. Il progetto Raptor dell'azienda impila un die logico TSMC N4 su un die DRAM 3D con impilamento face-to-face da 36 micron. d-Matrix sostiene che la SRAM raggiunga l'obiettivo di larghezza di banda, circa 300 TB/s a una latenza di circa 1 ns per una coppia di schede acceleratore Corsair SRAM, ma contenga solo circa 4GB. Una cella SRAM 6T, aggiunge, è circa dieci volte più grande di una cella DRAM. HBM risolve la capacità, ma d-Matrix cita un tetto pratico di larghezza di banda intorno ai 20 TB/s per package HBM4 come Nvidia Vera Rubin e AMD Instinct MI455.
La potenza è il motivo. A 2.4 pJ/bit, spingere 100 TB/s attraverso HBM consuma circa 1.92 kW prima di contare qualsiasi traffico di fabric. L'IO verticale 3D, al contrario, si attesta su circa 0.3-0.4 pJ, circa dieci volte meno di HBM, perché è un percorso millimetrico senza PHY invece di una rotta su interposer centimetrica. Il compromesso è termico: d-Matrix dice che uno stack 1-Hi con logica sopra a non più di 0.5 W/mm2 può essere raffreddato a liquido e mantenere la DRAM sotto i 100C.
Il dettaglio ingegneristico è il punto in cui le affermazioni diventano verificabili. Ogni tensor engine ha bisogno di un flit da 128B per accesso. Con 32B consegnati per accesso di colonna da banchi da 32B, questo significa quattro banchi per canale. Il die di d-Matrix ha 840 banchi, 768 dopo 72 di riserva, su 256 canali: tre banchi per canale. Un singolo accesso restituisce 96B, quindi consegnare un flit da 128B richiede due accessi e ne recupera 192B, sprecando circa il 33% della larghezza di banda vicino ai 33 TB/s. La soluzione di d-Matrix, lo stream blocking, condivide un accesso parziale da 32B tra tre flit, così quattro accessi da 96B alimentano tre flit da 128B. L'overfetch scende a zero. Un secondo trucco, lo stream flipping, inverte ogni flit rispetto al precedente per ridurre i toggle. Recupera circa il 20% della potenza di I/O senza il pin di sideband che serve alla convenzionale inversione del bus dati.
A 32GB per scheda, con pesi a 4 bit e una KV cache a 8 bit, d-Matrix dimensiona uno scale-up da 72 schede per ospitare un modello di frontiera come Kimi K3 a 1M di contesto. ServeTheHome nota che l'azienda ha presentato il lavoro a Hot Chips 2026.
UCIe arriva su una scheda funzionante
Rebellions ha mostrato qualcosa di più raro di una slide: silicio in funzione. ServeTheHome ha riportato il 25 agosto 2025 che il Rebellions REBEL-Quad è stato dimostrato a Hot Chips 2025 su una scheda di sviluppo che eseguiva Llama 3.3 70B a 35.5 msec di media per token di output. Il package è costruito su Samsung SF4X e CoWoS-S, con quattro ASIC di calcolo, quattro siti HBM3E per 144GB di memoria e quattro condensatori in silicio integrati. Usa UCIe-A come interconnessione chiplet e una scheda con doppia interfaccia PCIe Gen5 x16.
ServeTheHome ha segnalato la scelta di PCIe come una possibile occasione mancata, visto che la GB300 di Nvidia introduce PCIe Gen6. È una critica giusta per una parte destinata all'inferenza scale-out. Ma la demo conta più della scheda tecnica. Di UCIe si parla da anni, e i produttori sono stati lenti a dichiarare di usarlo perché l'interconnessione sta dentro il package. Rebellions ha integrato così tanti pezzi di silicio in un unico grande package e li ha mostrati in funzione: è un dato che l'ecosistema dei chiplet aspettava.
Non ogni acceleratore ha bisogno di un rack da datacenter. Draw Things ha pubblicato l'11 novembre 2025 i risultati per Metal FlashAttention v2.5 con Neural Accelerators su M5 di Apple, dichiarando un miglioramento fino a 4.6x rispetto a M4 nella propria app di generazione di immagini e video. L'azienda riporta guadagni di prestazioni grezze da 3.6x a 5.5x rispetto a M4 iPad e da 3.3x a 4.6x end-to-end. Un iPad M5 si comporta nella fascia di un M2 Max e spesso risulta intorno all'80% più lento di un M3 Ultra (60c). Secondo l'azienda, un iPad M5 da 16GiB può generare video 480p da cinque secondi con i modelli Wan 2.2 A14B. Il rilascio è un'anteprima: Draw Things dice che il supporto BF16 era inizialmente disattivato per bug irrisolti, poi ripristinato in una build del 17 novembre, e che lunghezze di sequenza di attenzione dispari e dimensioni di testa grandi causano ancora crolli di prestazioni.
Il materiale di cui nessuno fuori dal packaging ha sentito parlare
Tutto questo lavoro di progettazione si scontra con un problema di catena di fornitura che non ha nulla a che fare con l'architettura. Tom's Hardware ha riportato il 9 marzo 2026 che Nittobo controlla circa il 90% della fornitura globale di T-glass, un tessuto di fibra di vetro a basso CTE usato nel core organico dei substrati IC, lo strato di interconnessione tra un chip e il suo circuito stampato. Il T-glass mantiene dimensionalmente stabili i package grandi e caldi. L'E-glass costa meno ma si usa soprattutto in chip di fascia bassa come microcontroller e processori mobili più vecchi; per il packaging 2.5D e 3D massiccio si preferisce il T-glass.
Nittobo sta triplicando la capacità nel suo impianto di Fukushima, ma la nuova fornitura non arriverà sul mercato prima di metà 2027. I prezzi sono saliti tra il 20% e il 30%, e i tempi di consegna per materiali a valle come i laminati rivestiti in rame sono passati dalle normali 8-10 settimane a oltre 20. L'analista di Yuanta Bill Ho ha detto a Tom's Hardware che i fornitori non comunicano più i tempi di consegna. Bilal Hachemi di Yole Group ha detto che il T-glass non è facile da sostituire perché ha valori dielettrici e di CTE specifici che funzionano meglio per i chip AI, soprattutto nel core organico. I margini storicamente sottili del settore dei substrati IC, ha aggiunto, fanno sì che anche aumenti modesti della domanda inneschino carenze.
Il motore della domanda è la dimensione del package. Secondo dati di Nvidia citati da Tom's Hardware, le dimensioni degli interposer sono cresciute da 814mm2 per Hopper a 1.700mm2 per Blackwell, un aumento del 109%, con Rubin e Feynman destinati a scalare ancora. Bank of America stima che il segmento materiali elettronici di Nittobo quasi raddoppierà le vendite da 40,9 miliardi di yen nel 2025 a 87,7 miliardi di yen entro marzo 2028, con margini operativi vicini al 48%. Nittobo sta raddoppiando la capacità di filato grezzo nel suo impianto a Taiwan e ha stretto un accordo di collaborazione con Nanya Plastics per esternalizzare parte della tessitura. Entro il 2027, circa il 20% del tessuto di vetro di Nittobo dovrebbe essere tessuto da Nanya.
Nittobo collabora con uno dei suoi maggiori concorrenti per alleviare il collo di bottiglia. È il segnale più chiaro di dove stia il vincolo. Gli architetti di acceleratori possono continuare a tagliare picojoule per bit, ma se il tessuto dentro il substrato è allocato con anni di anticipo, la data di spedizione si decide da tutt'altra parte.
Fonti
5- 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 04Metal FlashAttention v2.5 with Neural Accelerators on the Apple M5 ChipEN
- 05Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.