Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Dentro gli acceleratori dei datacenter AI: core RISC-V, scarsità di T-glass e DRAM 3D

I progetti degli acceleratori AI si muovono su tre fronti insieme: chi concede in licenza i blocchi costitutivi, chi riesce a procurarsi i materiali per il packaging e come la memoria viene impilata sotto il calcolo. The Register ha riferito il 19 settembre 2024 che SiFive ora offre i propri progetti di acceleratori, non solo core CPU RISC-V.

TecnologiaSpiegatoChiara RomanoPubblicato: 27 settembre 20266 min di letturaFonti 3
Dentro gli acceleratori dei datacenter AI: core RISC-V, scarsità di T-glass e DRAM 3D

SiFive progetta da tempo core CPU RISC-V che altre aziende montano sui propri chip AI. Questa settimana ha annunciato che concederà in licenza un acceleratore di machine learning completo di propria concezione. La serie Intelligence XM è un cluster di quattro core CPU RISC-V SiFive Intelligence X collegati a un motore di calcolo matriciale interno, secondo The Register.

John Ronco, SVP e GM di SiFive per il Regno Unito, ha detto a The Register che alcuni clienti vogliono ancora costruirsi l'hardware da soli, ma altri "volevano più un punto di riferimento unico da SiFive". In precedenza l'azienda metteva i suoi core CPU accanto a motori matriciali di terze parti, come nelle tensor processing unit di Google. I cluster XM ribaltano questo schema: ora SiFive fornisce l'intero progetto dell'acceleratore, che i clienti personalizzano e inviano a una fonderia.

Cosa offre davvero un cluster

Ogni cluster XM di base supporta fino a 1TB/sec di larghezza di banda della memoria attraverso un'interfaccia hub coerente. SiFive prevede di raggiungere fino a 16 TOPS di INT8 o 8 teraFLOPS di prestazioni BF16 per gigahertz.

I numeri per gigahertz possono ingannare, perché non si tratta di un chip finito. Le prestazioni finali dipendono da quanti cluster colloca un cliente, da come sono collegati, da cos'altro sta sul die e dal budget di potenza e raffreddamento. Ronco prevede che la maggior parte dei progetti userà tra quattro e otto cluster. A un clock di 1GHz, questo equivale a una larghezza di banda di picco della memoria tra 4 e 8TB/sec e fino a 32-64 teraFLOPS di BF16. Una Nvidia H100 sviluppa quasi un petaFLOPS di BF16 denso, quindi il confronto favorisce Nvidia. Ma i FLOPS non sono tutto per un lavoro limitato dalla larghezza di banda come l'inferenza. Ronco ha detto che i cluster XM probabilmente non saranno usati molto per l'addestramento AI.

La scala è la questione aperta. Ronco è stato esitante nel dire fino a dove può spingersi il progetto, e The Register ha osservato che la tecnologia di processo e l'area del die porranno dei limiti. Il deck di prodotto dell'azienda suggerisce che 512 cluster XM siano possibili. A 1GHz senza problemi termici o di potenza, si arriverebbe a circa quattro petaFLOPS di calcolo matriciale BF16. Le GPU Blackwell di Nvidia con le specifiche più alte sono elencate a 2,5 petaFLOPS di BF16.

SiFive ha anche detto che pubblicherà un'implementazione di riferimento open source della sua SiFive Kernel Library per abbassare le barriere all'adozione di RISC-V. Il suo CEO, Patrick Little, ha dichiarato in una nota preconfezionata che l'azienda fornisce progetti di chip basati su RISC-V a cinque delle aziende del gruppo "Magnificent 7", che comprende Microsoft, Apple, Nvidia, Alphabet, Amazon, Meta e Tesla. The Register ha osservato di sospettare che non tutto quel silicio riguardi l'AI.

Il collo di bottiglia del packaging che nessuno guarda

I progetti sono una cosa. I materiali un'altra. Un'azienda giapponese chiamata Nittobo controlla circa il 90% dell'offerta globale di tessuto speciale in fibra di vetro noto come T-glass, che si trova dentro ogni package di chip AI avanzato, secondo Tom's Hardware. Il T-glass è un tessuto di vetro a basso CTE usato nel core organico dei substrati per IC, lo strato di interconnessione tra un chip e il suo circuito stampato. Mantiene dimensionalmente stabili i package di chip grandi e caldi mentre diventano più densi.

La domanda ha superato l'offerta. Nittobo sta triplicando la capacità del suo stabilimento di Fukushima, ma la nuova produzione non arriverà sul mercato prima della metà del 2027. I prezzi sono già aumentati del 20% al 30%, e i tempi di consegna per materiali a valle come i laminati rivestiti in rame sono passati da un normale 8-10 settimane a oltre 20. "Con l'offerta di T-glass ora ancora più limitata, i fornitori non comunicano più i tempi di consegna", ha detto Bill Ho, analista di Yuanta, a Tom's Hardware.

Sostituire il T-glass non è semplice. Bilal Hachemi, analista di Yole Group che segue la catena di fornitura dei substrati per IC, ha detto che il materiale "ha valori dielettrici e di CTE specifici che funzionano meglio per i chip AI, soprattutto per il core organico". L'industria dei substrati vive su margini sottili, quindi anche aumenti modesti della domanda possono innescare carenze. "Qualsiasi aumento della domanda di materiali build-up, materiale ABF o T-glass può causare una potenziale carenza, perché va contro le basi di questa industria", ha detto Hachemi.

Gli hyperscaler peggiorano la situazione ordinando package sempre più grandi. Secondo i dati Nvidia citati da Tom's Hardware, le dimensioni degli interposer sono cresciute da 814mm2 per Hopper a 1.700mm2 per Blackwell, un aumento del 109%, con le generazioni Rubin e Feynman che scalano ulteriormente. Bank of America stima che il segmento materiali elettronici di Nittobo quasi raddoppierà le vendite, da 40,9 miliardi di yen, circa 266 milioni di dollari, nel 2025 a 87,7 miliardi di yen entro marzo 2028, con margini operativi vicini al 48%.

Nittobo sta raddoppiando la capacità di filato grezzo nel suo stabilimento taiwanese, importando filato in Giappone per la produzione del tessuto e affidando parte della tessitura a Nanya Plastics, uno dei suoi maggiori concorrenti. Entro il 2027, circa il 20% del tessuto di vetro di Nittobo dovrebbe essere tessuto da Nanya, ha reso noto l'azienda. Hachemi ha detto che il contatto diretto di Nvidia con un fornitore di materiali a monte come Nittobo è senza precedenti, e ha avvertito che una volta che Nvidia si sarà assicurata la sua quota, i clienti rivali si contenderanno ciò che resta.

DRAM 3D e il muro della memoria

La memoria è il terzo fronte. All'Hot Chips 2026, d-Matrix ha presentato il suo acceleratore Raptor, che impila il calcolo direttamente sopra i die di DRAM, secondo ServeTheHome. I pesi dei modelli continuano a crescere e la KV cache scala con la lunghezza del contesto moltiplicata per la dimensione del batch. L'esempio di ServeTheHome: 64 utenti a 1M di contesto possono significare circa 935GB di KV cache. È un problema sia di capacità sia di larghezza di banda.

La SRAM raggiunge l'obiettivo di larghezza di banda ma solo su scala minuscola. Una coppia di schede acceleratrici Corsair SRAM arriva a circa 300TB/s con circa 1 nanosecondo di latenza, ma contiene solo circa 4GB. La HBM risolve la capacità ma fatica sulla larghezza di banda, con un tetto pratico intorno ai 20TB/s per package HBM4 come Nvidia Vera Rubin e AMD Instinct MI455, secondo d-Matrix. La DRAM 3D impilata si colloca tra le due: l'IO 3D verticale costa circa 0,3-0,4 pJ, circa 10 volte meno della HBM, perché è un percorso senza PHY su scala millimetrica invece di una rotta su interposer su scala centimetrica.

Raptor mette un die logico TSMC N4 sopra un die di DRAM 3D usando un impilamento face-to-face da 36 micron, un processo che d-Matrix descrive come provato, a basso costo, ad alto volume e ad alto rendimento. Ogni scheda contiene 32GB, e d-Matrix afferma che uno scale-up da 72 schede può ospitare un modello di frontiera come Kimi K3 a 1M di contesto con pesi a 4 bit e una KV cache a 8 bit.

L'ingegneria non è finita. d-Matrix dice che uno stack 1-Hi logic-on-top a non più di 0,5 W/mm2 può essere raffreddato a liquido e mantenere la DRAM sotto i 100C. Il suo die ha 840 banchi, 768 dopo 72 di riserva, su 256 canali, il che dà 3 banchi per canale. Un flit da 128B non si divide in modo uniforme su questo, quindi un singolo accesso restituisce 96B e due accessi ne recuperano 192B, sprecando circa il 33% della larghezza di banda vicino ai 33TB/s. Il suo schema di stream blocking condivide un accesso parziale da 32B tra tre flit, riducendo l'overfetch a zero.

Poi c'è la potenza dell'I/O. Spostare 100TB/s a 0,37 pJ/bit equivale a 296W solo per l'I/O, e il DBI convenzionale potrebbe far risparmiare il 20%. La HBM se la cava con il DBI perché i suoi burst multi-ciclo permettono al PHY di vedere il burst completo. Il link 3D-DRAM a 256 bit a ciclo singolo di d-Matrix non ha burst né pin di sideband per segnalare la scelta di inversione, quindi usa lo stream flipping, confrontando ogni flit con il precedente e invertendo quando serve.

Niente di tutto questo arriva da solo. Progetti di acceleratori RISC-V, un quasi monopolio su un tessuto per il packaging e DRAM impilata devono tutti allinearsi prima che la prossima generazione di silicio per datacenter venga spedita.

Commenti 0

Fonti

3
  1. 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
  2. 02Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
  3. 03D-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.