Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Il muro della memoria negli acceleratori AI: d-Matrix, Microsoft e la spinta al 3D DRAM

Gli acceleratori AI stanno sbattendo contro un problema di memoria che i progettisti risolvono sempre più spesso impilando i chip in verticale. A Hot Chips 2026 d-Matrix ha sostenuto che il suo progetto Raptor, con un die logico TSMC N4 sopra un die DRAM 3D, può superare il tetto di banda che secondo l'azienda i package HBM raggiungono intorno ai 20 TB/s.

TecnologiaSpiegatoChiara RomanoPubblicato: 27 settembre 20265 min di letturaFonti 2
Il muro della memoria negli acceleratori AI: d-Matrix, Microsoft e la spinta al 3D DRAM

I pesi dei modelli continuano a crescere. La KV cache scala con la lunghezza del contesto moltiplicata per la dimensione del batch. ServeTheHome, riportando la presentazione di d-Matrix a Hot Chips 2026 del 14 settembre, fa i conti: 64 utenti con contesto da 1M possono significare circa 935 GB di KV cache. Pesi e cache insieme formano un problema che riguarda sia la capacità sia la banda. Entrambe le voci continuano a salire.

La SRAM centra l'obiettivo di banda, ma solo su scala minuscola. Una coppia di schede acceleratrici Corsair SRAM arriva a circa 300 TB/s con una latenza di circa 1 ns, ma contiene solo circa 4 GB. Una cella SRAM 6T è circa 10 volte più grande di una cella DRAM, e la corrente di dispersione arriva a decine di watt su scala di GB. Per questo la SRAM va bene per un draft model nel decoding speculativo, non per contenere i pesi di un modello di frontiera.

L'HBM risolve la capacità, non la banda

L'HBM risolve la metà della capacità ma fatica sulla banda. La velocità dei pin e l'ampiezza dell'I/O per base die migliorano lentamente. Il numero di stack è limitato dalla superficie di package disponibile, all'incirca da 8 a 16 stack per package. d-Matrix cita un tetto pratico di banda intorno ai 20 TB/s per i package HBM4 come NVIDIA Vera Rubin e AMD Instinct MI455.

Una banda così alta ha un prezzo in potenza. A 2,4 pJ/bit, spingere 100 TB/s attraverso l'HBM consuma circa 1,92 kW prima di contare qualsiasi traffico di fabric. Secondo l'articolo di ServeTheHome, i package di oggi non hanno né la superficie né il budget di potenza per raggiungere una banda di classe SRAM con l'HBM.

La risposta di d-Matrix è impilare il calcolo direttamente sopra i die DRAM. L'impilamento crea una sfida termica, perché centinaia di watt devono uscire attraverso i TSV in uno stack DRAM sensibile alla temperatura. A questa si aggiunge una sfida di distribuzione di potenza dovuta alla caduta IR. d-Matrix sostiene che uno stack 1-Hi con logica in cima, a non più di 0,5 W/mm2, può essere raffreddato a liquido e mantenere la DRAM sotto i 100 C.

L'azienda colloca il 3D DRAM tra i due estremi su una scala energetica. La SRAM on-die costa circa 50 fJ, mentre i sistemi 2.5D HBM4 stanno nell'intervallo 2,5-5 pJ quando si include l'energia a livello di chip. L'I/O verticale 3D arriva a circa 0,3-0,4 pJ, circa 10 volte meno dell'HBM, perché è un percorso senza PHY su scala millimetrica e non una rotta su interposer su scala centimetrica. Meno strati impilati rispetto all'HBM significano anche un die più grande e un rendimento migliore.

Il decode è la fase che consuma il tempo

Il prefill elabora molti token di prompt in parallelo ed è legato al throughput di calcolo. Il decode produce un token alla volta ed è tipicamente legato alla banda di memoria. L'attenzione può passare a essere legata al calcolo con GQA alto e decoding speculativo, e il MoE resta legato alla memoria anche con batch modesti. Il decode è la fase che vuole banda enorme.

Poiché il decode domina il tempo di esecuzione reale, la parte legata alla memoria conta di più. d-Matrix sottolinea che la maggior parte del tempo di inferenza si spende nella fase di decode, quindi migliorare la banda del decode migliora le prestazioni complessive di inferenza. A 32GB per scheda, con pesi a 4 bit e KV cache a 8 bit, d-Matrix dimensiona per stare in un rack. Uno scale-up da 72 schede può ospitare un modello di frontiera come Kimi K3 con contesto da 1M, e disaggregazione e multi-rack estendono oltre un singolo rack Raptor.

L'implementazione stessa si chiama Raptor. Un die logico TSMC N4 sta sopra un die DRAM 3D con impilamento face-to-face da 36 um, un processo che d-Matrix descrive come provato, a basso costo, ad alto volume e ad alto rendimento. Ogni tensor engine ha bisogno di un flit da 128B per accesso. Con 32B consegnati per accesso di colonna da banchi da 32B, servono 4 banchi per canale. Il die ha 840 banchi, 768 dopo 72 di riserva, distribuiti su 256 canali per appena 3 banchi per canale. Con 3 banchi per canale, un singolo accesso restituisce 96B. Consegnare un flit da 128B richiede quindi due accessi e preleva 192B, sprecando circa il 33 percento della banda vicino ai 33 TB/s.

Lo stream blocking recupera quello spreco. d-Matrix condivide un accesso parziale da 32B tra tre flit, così 4 accessi da 96B alimentano 3 flit da 128B, con 384B in ingresso e 384B in uscita corrispondenti. L'overfetch scende a zero e non serve alcuna rete di shifting. Muovere 100 TB/s a 0,37 pJ/bit equivale a 296 W solo per l'I/O, e il DBI convenzionale potrebbe far risparmiare il 20 percento. Lo stream flipping offre quel 20 percento senza il pin, confrontando ogni flit con il precedente e invertendolo quando serve, con un singolo bit di metadati per flit portato insieme all'ECC.

La Maia 200 di Microsoft prende l'altra strada

Microsoft ha usato Hot Chips 2026 per dettagliare il suo acceleratore di seconda generazione Maia 200, che ServeTheHome ha trattato il 26 agosto. Il chip da 3nm ha 140 miliardi di transistor, sei stack di HBM3e, 7TB/s di banda HBM e un TDP di 750 Watt, con 10.000 TFLOPS di prestazioni FP4 su un die SoC da 820mm2. Usa un'architettura dataflow Software Defined Local Access, in cui il dataflow è fissato in fase di compilazione e l'accesso ai dati resta dentro gli elementi di calcolo. Non c'è rete di scale-out: la slide di Microsoft mostra 128 rack e 6.000 chip in un dominio di scale-up su Ethernet unificata.

Due scommesse diverse, un vincolo condiviso. Che la soluzione sia impilare la DRAM sotto la logica o abbinare l'HBM a un dataflow definito via software, entrambi i progetti sono plasmati dal costo di spostare bit da e verso la memoria.

Commenti 0

Fonti

2
  1. 01d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  2. 02Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.