AI加速器的内存墙:d-Matrix、微软与3D DRAM的推进
AI加速器正撞上内存难题,设计者越来越倾向于把芯片垂直堆叠。d-Matrix在Hot Chips 2026上主张,其Raptor设计把台积电N4逻辑裸片放在3D DRAM裸片之上,可以突破它所说的HBM封装约20 TB/s的带宽天花板。

模型权重一直在增长,KV缓存则随上下文长度乘以批大小而扩张。ServeTheHome在报道d-Matrix于9月14日Hot Chips 2026的演讲时给出了这笔算术:64个用户、1M上下文,可能意味着大约935 GB的KV缓存。权重和缓存合在一起,既是容量问题,也是带宽问题,而且两边都在持续增长。
SRAM能达到带宽目标,但规模极小。一对Corsair SRAM加速卡在约1 ns延迟下达到大约300 TB/s,却只能容纳约4 GB。一个6T SRAM单元比DRAM单元大约10倍,而在GB规模下漏电可达数十瓦。所以SRAM适合做投机解码中的草稿模型,不适合承载前沿模型的权重。
HBM解决了容量,没解决带宽
HBM解决了容量那一半,但在带宽上吃力。引脚速率和每个基底的I/O宽度提升缓慢,堆叠数量又受限于封装可用的岸线,每个封装大约8到16个堆叠。d-Matrix给出的实际带宽天花板约为20 TB/s,针对的是NVIDIA Vera Rubin和AMD Instinct MI455这类HBM4封装。
这么高的带宽要付出功耗代价。按2.4 pJ/bit计算,把100 TB/s推过HBM要吃掉约1.92 kW,还没算任何互连流量。据ServeTheHome的报道,今天的封装既没有岸线,也没有功耗预算,无法用HBM达到SRAM级带宽。
d-Matrix的答案是直接把计算堆叠在DRAM裸片之上。堆叠带来散热挑战,数百瓦必须穿过温度敏感的DRAM堆叠中的TSV散出。还有IR压降带来的供电挑战。d-Matrix称,不超过0.5 W/mm2的1-Hi逻辑在上堆叠可以液冷,并让DRAM保持在100 C以下。
该公司把3D DRAM放在能量阶梯的两个极端之间。片上SRAM大约50 fJ,而计入芯片级能耗后,2.5D HBM4系统在2.5到5 pJ区间。垂直3D IO大约0.3到0.4 pJ,比HBM低约10倍,因为它是无PHY的毫米级路径,而不是厘米级的中介层走线。堆叠层数比HBM少,也意味着裸片更大、良率更好。
时间花在解码上
Prefill并行处理大量提示词token,受计算吞吐限制。decode一次产生一个token,通常受内存带宽限制。在高GQA和投机解码下,注意力可能转为计算受限,而MoE即使在较小批大小下仍受内存限制。decode才是那个渴望巨大带宽的阶段。
由于decode主导实际运行时间,受内存限制的部分最关键。d-Matrix强调,大部分推理时间花在decode阶段,所以改善decode带宽就能改善整体推理性能。每卡32GB、4位权重和8位KV缓存,d-Matrix的规模设计是塞进一个机架。72卡scale-up可以承载Kimi K3这类前沿模型的1M上下文,解耦和多机架则可以超出单个Raptor机架。
这套实现叫Raptor。台积电N4逻辑裸片用36 um面对面堆叠坐在3D DRAM裸片之上,d-Matrix称这一工艺成熟、低成本、高量产、高良率。每个张量引擎每次访问需要128B flit,而32B bank每次列访问给出32B,算下来每个通道需要4个bank。这颗裸片有840个bank,扣掉72个备用后是768个,分布在256个通道上,每通道只有3个bank。每通道3个bank时,一次访问返回96B,所以送出一个128B flit需要两次访问,取回192B,在接近33 TB/s时浪费约33%的带宽。
流式分块把这份浪费收回来。d-Matrix让一次部分32B访问在三个flit之间共享,于是4次96B访问喂给3个128B flit,384B进对384B出。过取降到零,也不需要移位网络。以0.37 pJ/bit搬运100 TB/s,光I/O就是296 W,而传统DBI能省20%。流式翻转不用额外引脚就能拿到这20%,它把每个flit与前一个比较,需要时取反,每个flit的一个元数据位随ECC一起传送。
微软的Maia 200走另一条路
微软在Hot Chips 2026上详细介绍了第二代Maia 200加速器,ServeTheHome在8月26日报道过。这颗3nm芯片有1400亿个晶体管、六个HBM3e堆叠、7TB/s的HBM带宽和750瓦TDP,在820mm2的SoC裸片上提供1万TFLOPS的FP4性能。它采用软件定义本地访问的数据流架构,数据流在编译期确定,数据访问留在计算单元内部。它没有scale-out网络:微软的幻灯片显示,在统一以太网上,一个scale-up域有128个机架和6000颗芯片。
两种不同的押注,一个共同的约束。无论解法是把DRAM堆在逻辑之下,还是把HBM与软件定义数据流配对,两种设计都被搬运比特进出内存的成本所塑造。
资料来源
2- 01d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 02Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。