Die Speicherwand bei KI-Beschleunigern: d-Matrix, Microsoft und der Vorstoß zu 3D-DRAM
KI-Beschleuniger stoßen auf ein Speicherproblem, das Entwickler zunehmend mit vertikal gestapelten Chips lösen. d-Matrix nutzte die Hot Chips 2026, um für sein Raptor-Design zu werben: Ein TSMC-N4-Logik-Die auf einem 3D-DRAM-Die könne die Bandbreitengrenze übertreffen, die HBM-Pakete nach Angaben des Unternehmens bei rund 20 TB/s erreichen.

Die Modellgewichte wachsen weiter, und der KV-Cache skaliert mit der Kontextlänge mal Batch-Größe. ServeTheHome hat in seinem Bericht über d-Matrix' Präsentation auf den Hot Chips 2026 am 14. September die Rechnung aufgestellt: 64 Nutzer bei 1M Kontext können rund 935 GB KV-Cache bedeuten. Gewichte und Cache zusammen ergeben ein Problem, das sowohl die Kapazität als auch die Bandbreite betrifft. Beide Seiten wachsen weiter.
SRAM erreicht das Bandbreitenziel, aber nur in winzigem Maßstab. Ein Paar Corsair-SRAM-Beschleunigerkarten erreicht rund 300 TB/s bei etwa 1 ns Latenz, fasst aber nur etwa 4 GB. Eine 6T-SRAM-Zelle ist etwa 10-mal größer als eine DRAM-Zelle, und die Leckage erreicht im GB-Maßstab Dutzende Watt. Damit taugt SRAM für ein Draft-Modell beim spekulativen Decoding, nicht für das Halten von Frontier-Modellgewichten.
HBM löst die Kapazität, nicht die Bandbreite
HBM löst die Kapazitätshälfte, kämpft aber mit der Bandbreite. Pin-Geschwindigkeit und I/O-Breite pro Base-Die verbessern sich langsam, und die Zahl der Stapel ist durch die verfügbare Package-Beachfront begrenzt, etwa 8 bis 16 Stapel pro Package. d-Matrix nennt eine praktische Bandbreitengrenze von rund 20 TB/s für HBM4-Pakete wie NVIDIA Vera Rubin und AMD Instinct MI455.
So hohe Bandbreite hat einen Strompreis. Bei 2,4 pJ/Bit verbraucht der Transport von 100 TB/s durch HBM etwa 1,92 kW, bevor irgendein Fabric-Verkehr gezählt wird. Laut dem Beitrag von ServeTheHome fehlen heutigen Paketen sowohl die Beachfront als auch das Leistungsbudget, um mit HBM SRAM-Klasse-Bandbreite zu erreichen.
Die Antwort von d-Matrix besteht darin, Recheneinheiten direkt auf DRAM-Dies zu stapeln. Das Stapeln schafft eine thermische Herausforderung, weil Hunderte Watt durch TSVs in einem temperaturempfindlichen DRAM-Stapel entweichen müssen. Dazu kommt eine Herausforderung bei der Stromversorgung durch IR-Drop. d-Matrix zufolge lässt sich ein 1-Hi-Logic-on-Top-Stapel mit höchstens 0,5 W/mm2 flüssig kühlen und hält das DRAM unter 100 C.
Das Unternehmen ordnet 3D-DRAM auf einer Energieleiter zwischen den beiden Extremen ein. On-Die-SRAM kostet rund 50 fJ, während 2.5D-HBM4-Systeme im Bereich von 2,5 bis 5 pJ liegen, wenn die Energie auf Chipebene eingerechnet wird. Vertikales 3D-IO kommt auf etwa 0,3 bis 0,4 pJ, rund 10-mal weniger als HBM, weil es ein PHY-loser Pfad im Millimetersmaßstab ist und keine Interposer-Route im Zentimetermaßstab. Weniger gestapelte Schichten als bei HBM bedeuten zudem ein größeres Die und bessere Ausbeute.
Decode frisst die Zeit
Prefill verarbeitet viele Prompt-Token parallel und ist rechenleistungsgebunden, während Decode ein Token nach dem anderen erzeugt und typischerweise speicherbandbreitengebunden ist. Attention kann bei hohem GQA und spekulativem Decoding in den rechengebundenen Bereich kippen, und MoE bleibt selbst bei bescheidenen Batch-Größen speichergebunden. Decode ist die Phase, die enorme Bandbreite verlangt.
Da Decode die Laufzeit dominiert, zählt der speichergebundene Anteil am meisten. d-Matrix hebt hervor, dass die meiste Inferenzzeit in der Decode-Phase anfällt, sodass eine bessere Decode-Bandbreite die gesamte Inferenzleistung verbessert. Bei 32GB pro Karte, 4-Bit-Gewichten und einem 8-Bit-KV-Cache dimensioniert d-Matrix auf ein Rack. Ein Scale-up mit 72 Karten kann ein Frontier-Modell wie Kimi K3 bei 1M Kontext beherbergen, und Disaggregation und Multi-Rack reichen über ein einzelnes Raptor-Rack hinaus.
Die Implementierung selbst heißt Raptor. Ein TSMC-N4-Logik-Die sitzt auf einem 3D-DRAM-Die in 36 um Face-to-Face-Stapelung, ein Verfahren, das d-Matrix als bewährt, kostengünstig, hochvolumig und ertragsstark beschreibt. Jede Tensor-Engine braucht ein 128B-Flit pro Zugriff, und da aus 32B-Bänken 32B pro Spaltenzugriff geliefert werden, ergibt das 4 Bänke pro Kanal. Das Die hat 840 Bänke, nach 72 Reserve 768, verteilt auf 256 Kanäle, also nur 3 Bänke pro Kanal. Mit 3 Bänken pro Kanal liefert ein einzelner Zugriff 96B, sodass für ein 128B-Flit zwei Zugriffe nötig sind und 192B geholt werden, was nahe 33 TB/s etwa 33 Prozent der Bandbreite verschwendet.
Stream Blocking holt diese Verschwendung zurück. d-Matrix teilt einen partiellen 32B-Zugriff auf drei Flits auf, sodass 4 Zugriffe mit 96B drei Flits mit 128B versorgen, mit 384B rein und passenden 384B raus. Der Overfetch sinkt auf null, und ein Shifting-Netzwerk ist nicht nötig. 100 TB/s bei 0,37 pJ/Bit zu bewegen ergibt 296 W allein für I/O, und konventionelles DBI könnte 20 Prozent sparen. Stream Flipping liefert diese 20 Prozent ohne den Pin, indem es jedes Flit mit dem vorherigen vergleicht und bei Bedarf invertiert, mit einem einzelnen Metadatenbit pro Flit neben der ECC.
Microsofts Maia 200 nimmt den anderen Weg
Microsoft nutzte die Hot Chips 2026, um seinen Beschleuniger Maia 200 der zweiten Generation vorzustellen, den ServeTheHome am 26. August behandelte. Der 3nm-Chip hat 140 Milliarden Transistoren, sechs Stapel HBM3e, 7TB/s HBM-Bandbreite und eine TDP von 750 Watt, mit 10.000 TFLOPS FP4-Leistung auf einem 820mm2 großen SoC-Die. Er verwendet eine Software Defined Local Access genannte Dataflow-Architektur, bei der der Dataflow zur Compile-Zeit festgelegt wird und Datenzugriffe innerhalb der Rechenelemente bleiben. Ein Scale-out-Netzwerk gibt es nicht: Microsofts Folie zeigt 128 Racks und 6.000 Chips in einer Scale-up-Domain über einheitliches Ethernet.
Zwei verschiedene Wetten, eine gemeinsame Einschränkung. Ob die Lösung darin besteht, DRAM unter Logik zu stapeln oder HBM mit einem softwaredefinierten Dataflow zu kombinieren, beide Designs werden von den Kosten des Bit-Transports zu und von Speicher geprägt.
Quellen
2- 01d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 02Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.