跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

AI加速器的内存墙:d-Matrix、微软与3D DRAM的推进

AI加速器正撞上内存难题,设计者越来越倾向于把芯片垂直堆叠。d-Matrix在Hot Chips 2026上主张,其Raptor设计把台积电N4逻辑裸片放在3D DRAM裸片之上,可以突破它所说的HBM封装约20 TB/s的带宽天花板。

科技解释林晓雯发布: 2026年9月27日5 分钟阅读资料来源 2
AI加速器的内存墙:d-Matrix、微软与3D DRAM的推进

模型权重一直在增长,KV缓存则随上下文长度乘以批大小而扩张。ServeTheHome在报道d-Matrix于9月14日Hot Chips 2026的演讲时给出了这笔算术:64个用户、1M上下文,可能意味着大约935 GB的KV缓存。权重和缓存合在一起,既是容量问题,也是带宽问题,而且两边都在持续增长。

SRAM能达到带宽目标,但规模极小。一对Corsair SRAM加速卡在约1 ns延迟下达到大约300 TB/s,却只能容纳约4 GB。一个6T SRAM单元比DRAM单元大约10倍,而在GB规模下漏电可达数十瓦。所以SRAM适合做投机解码中的草稿模型,不适合承载前沿模型的权重。

HBM解决了容量,没解决带宽

HBM解决了容量那一半,但在带宽上吃力。引脚速率和每个基底的I/O宽度提升缓慢,堆叠数量又受限于封装可用的岸线,每个封装大约8到16个堆叠。d-Matrix给出的实际带宽天花板约为20 TB/s,针对的是NVIDIA Vera Rubin和AMD Instinct MI455这类HBM4封装。

这么高的带宽要付出功耗代价。按2.4 pJ/bit计算,把100 TB/s推过HBM要吃掉约1.92 kW,还没算任何互连流量。据ServeTheHome的报道,今天的封装既没有岸线,也没有功耗预算,无法用HBM达到SRAM级带宽。

d-Matrix的答案是直接把计算堆叠在DRAM裸片之上。堆叠带来散热挑战,数百瓦必须穿过温度敏感的DRAM堆叠中的TSV散出。还有IR压降带来的供电挑战。d-Matrix称,不超过0.5 W/mm2的1-Hi逻辑在上堆叠可以液冷,并让DRAM保持在100 C以下。

该公司把3D DRAM放在能量阶梯的两个极端之间。片上SRAM大约50 fJ,而计入芯片级能耗后,2.5D HBM4系统在2.5到5 pJ区间。垂直3D IO大约0.3到0.4 pJ,比HBM低约10倍,因为它是无PHY的毫米级路径,而不是厘米级的中介层走线。堆叠层数比HBM少,也意味着裸片更大、良率更好。

时间花在解码上

Prefill并行处理大量提示词token,受计算吞吐限制。decode一次产生一个token,通常受内存带宽限制。在高GQA和投机解码下,注意力可能转为计算受限,而MoE即使在较小批大小下仍受内存限制。decode才是那个渴望巨大带宽的阶段。

由于decode主导实际运行时间,受内存限制的部分最关键。d-Matrix强调,大部分推理时间花在decode阶段,所以改善decode带宽就能改善整体推理性能。每卡32GB、4位权重和8位KV缓存,d-Matrix的规模设计是塞进一个机架。72卡scale-up可以承载Kimi K3这类前沿模型的1M上下文,解耦和多机架则可以超出单个Raptor机架。

这套实现叫Raptor。台积电N4逻辑裸片用36 um面对面堆叠坐在3D DRAM裸片之上,d-Matrix称这一工艺成熟、低成本、高量产、高良率。每个张量引擎每次访问需要128B flit,而32B bank每次列访问给出32B,算下来每个通道需要4个bank。这颗裸片有840个bank,扣掉72个备用后是768个,分布在256个通道上,每通道只有3个bank。每通道3个bank时,一次访问返回96B,所以送出一个128B flit需要两次访问,取回192B,在接近33 TB/s时浪费约33%的带宽。

流式分块把这份浪费收回来。d-Matrix让一次部分32B访问在三个flit之间共享,于是4次96B访问喂给3个128B flit,384B进对384B出。过取降到零,也不需要移位网络。以0.37 pJ/bit搬运100 TB/s,光I/O就是296 W,而传统DBI能省20%。流式翻转不用额外引脚就能拿到这20%,它把每个flit与前一个比较,需要时取反,每个flit的一个元数据位随ECC一起传送。

微软的Maia 200走另一条路

微软在Hot Chips 2026上详细介绍了第二代Maia 200加速器,ServeTheHome在8月26日报道过。这颗3nm芯片有1400亿个晶体管、六个HBM3e堆叠、7TB/s的HBM带宽和750瓦TDP,在820mm2的SoC裸片上提供1万TFLOPS的FP4性能。它采用软件定义本地访问的数据流架构,数据流在编译期确定,数据访问留在计算单元内部。它没有scale-out网络:微软的幻灯片显示,在统一以太网上,一个scale-up域有128个机架和6000颗芯片。

两种不同的押注,一个共同的约束。无论解法是把DRAM堆在逻辑之下,还是把HBM与软件定义数据流配对,两种设计都被搬运比特进出内存的成本所塑造。

评论 0

资料来源

2
  1. 01d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  2. 02Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。