Ściana pamięci w akceleratorach AI: d-Matrix, Microsoft i napór na 3D DRAM
Akceleratory AI wpadają na problem pamięci, na który projektanci coraz częściej odpowiadają pionowym układaniem chipów. d-Matrix przekonywał na Hot Chips 2026, że jego konstrukcja Raptor, czyli układ logiczny w procesie TSMC N4 położony na warstwie 3D DRAM, potrafi przebić limit przepustowości, który według firmy osiągają układy HBM, około 20 TB/s.

Wagi modeli rosną, a pamięć KV skaluje się wraz z długością kontekstu pomnożoną przez rozmiar batcha. ServeTheHome, relacjonując prezentację d-Matrix na Hot Chips 2026 z 14 września, podaje rachunek: 64 użytkowników przy kontekście 1M to może być około 935 GB pamięci KV. Wagi i pamięć podręczna razem tworzą problem, który dotyczy zarówno pojemności, jak i przepustowości. Obie te strony stale rosną.
SRAM spełnia wymagania przepustowości, ale tylko w bardzo małej skali. Dwie karty akceleratorów SRAM Corsair osiągają około 300 TB/s przy opóźnieniu około 1 ns, lecz mieszczą jedynie około 4 GB. Komórka SRAM 6T jest około 10 razy większa od komórki DRAM, a prądy upływu sięgają dziesiątek watów przy skali gigabajtów. SRAM nadaje się więc do modelu szkicowego w dekodowaniu spekulatywnym, a nie do przechowywania wag modeli frontier.
HBM rozwiązuje pojemność, nie przepustowość
HBM rozwiązuje połowę problemu, tę z pojemnością, ale ma trudności z przepustowością. Szybkość pinów i szerokość wejścia/wyjścia na układ bazowy poprawiają się powoli, a liczbę stosów ogranicza dostępna przestrzeń na obrzeżach obudowy, około 8 do 16 stosów na obudowę. d-Matrix wskazuje praktyczny limit przepustowości około 20 TB/s dla obudów HBM4, takich jak NVIDIA Vera Rubin i AMD Instinct MI455.
Tak wysoka przepustowość ma swoją cenę w energii. Przy 2,4 pJ/bit przetłaczanie 100 TB/s przez HBM zjada około 1,92 kW, zanim doliczy się jakikolwiek ruch w tkaninie połączeń. Jak wynika z tekstu ServeTheHome, dzisiejszym obudowom brakuje zarówno miejsca na obrzeżach, jak i budżetu energetycznego, żeby osiągnąć przepustowość klasy SRAM przy pomocy HBM.
Odpowiedzią d-Matrix jest ułożenie obliczeń bezpośrednio na warstwach DRAM. Takie układanie stwarza problem termiczny, bo setki watów muszą uciec przez TSV w wrażliwej na temperaturę strukturze DRAM. Dochodzi do tego wyzwanie z dostarczaniem zasilania związane ze spadkiem IR. d-Matrix twierdzi, że stos 1-Hi z logiką na wierzchu, przy nie więcej niż 0,5 W/mm2, można chłodzić cieczą i utrzymać DRAM poniżej 100 C.
Firma umieszcza 3D DRAM między tymi dwoma skrajnościami na drabinie energii. SRAM w układzie kosztuje około 50 fJ, natomiast systemy 2,5D HBM4 mieszczą się w przedziale 2,5 do 5 pJ, gdy wliczy się energię na poziomie chipu. Pionowe 3D IO to około 0,3 do 0,4 pJ, jakieś 10 razy mniej niż HBM, bo jest to ścieżka bez PHY o milimetrowej skali, a nie trasa przez interposer o skali centymetrowej. Mniejsza liczba warstw niż w HBM oznacza też większy układ i lepszą wydajność produkcyjną.
Dekodowanie zjada czas
Prefill przetwarza wiele tokenów promptu równolegle i jest ograniczony przepustowością obliczeniową, natomiast dekodowanie generuje jeden token naraz i zwykle jest ograniczone przepustowością pamięci. Uwaga może przełączyć się na ograniczenie obliczeniowe przy wysokim GQA i dekodowaniu spekulatywnym, a MoE pozostaje ograniczony pamięciowo nawet przy skromnych rozmiarach batcha. Dekodowanie to faza, która domaga się ogromnej przepustowości.
Ponieważ dekodowanie dominuje w czasie rzeczywistym, część zależna od pamięci ma największe znaczenie. d-Matrix podkreśla, że większość czasu wnioskowania upływa w fazie dekodowania, więc poprawa przepustowości dekodowania przekłada się na ogólną wydajność wnioskowania. Przy 32 GB na kartę, wagach 4-bitowych i pamięci KV 8-bitowej d-Matrix dobiera rozmiar tak, żeby zmieścić się w jednej szafie. Skalowanie do 72 kart pozwala pomieścić model frontier, taki jak Kimi K3 przy kontekście 1M, a rozdzielenie i wiele szaf wykraczają poza jedną szafę Raptor.
Sama implementacja nazywa się Raptor. Układ logiczny z TSMC N4 leży na warstwie 3D DRAM, połączony techniką składania twarzą do twarzy 36 um, w procesie, który d-Matrix opisuje jako sprawdzony, tani, masowy i o wysokiej wydajności. Każdy silnik tensorowy potrzebuje 128B na dostęp, a ponieważ z banków 32B dostarczane jest 32B na dostęp kolumnowy, wynika z tego potrzeba 4 banków na kanał. Układ ma 840 banków, 768 po odjęciu 72 zapasowych, rozłożonych na 256 kanałów, co daje zaledwie 3 banki na kanał. Przy 3 bankach na kanał pojedynczy dostęp zwraca 96B, więc dostarczenie 128B wymaga dwóch dostępów i pobiera 192B, marnując około 33 procent przepustowości w okolicach 33 TB/s.
Blokowanie strumieni odzyskuje to, co się marnuje. d-Matrix dzieli jeden częściowy dostęp 32B między trzy flity, więc 4 dostępy po 96B zasilają 3 flity po 128B, a 384B na wejściu zgadza się z 384B na wyjściu. Nadmiarowe pobieranie spada do zera i żadna sieć przesuwająca nie jest potrzebna. Przesyłanie 100 TB/s przy 0,37 pJ/bit daje 296 W tylko na wejście/wyjście, a konwencjonalne DBI pozwoliłoby zaoszczędzić 20 procent. Odwracanie strumieni daje te 20 procent bez dodatkowego pinu, porównując każdy flit z poprzednim i odwracając go w razie potrzeby, z jednym bitem metadanych na flit przenoszonym razem z ECC.
Maia 200 od Microsoftu wybiera inną drogę
Microsoft przedstawił na Hot Chips 2026 swój drugiej generacji akcelerator Maia 200, który ServeTheHome opisał 26 sierpnia. Układ w procesie 3 nm ma 140 miliardów tranzystorów, sześć stosów HBM3e, 7TB/s przepustowości HBM i 750 W TDP, a przy tym 10 000 TFLOPS wydajności FP4 na układzie SoC o powierzchni 820 mm2. Stosuje architekturę przepływu danych Software Defined Local Access, w której przepływ danych ustala się w czasie kompilacji, a dostęp do danych pozostaje wewnątrz elementów obliczeniowych. Nie ma sieci do skalowania na zewnątrz: slajd Microsoftu pokazuje 128 szaf i 6 000 układów w domenie skalowania w górę po ujednoliconym Ethernecie.
Dwa różne zakłady, jedno wspólne ograniczenie. Niezależnie od tego, czy lekarstwem jest układanie DRAM pod logiką, czy łączenie HBM zdefiniowanym programowo przepływem danych, obie konstrukcje kształtuje koszt przesyłania bitów do pamięci i z pamięci.
Źródła
2- 01d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 02Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.