跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

走进 AI 数据中心加速器:RISC-V 核心、T-glass 短缺与 3D DRAM

AI 加速器的设计正在三条战线上同时变化:谁授权基础模块,谁能拿到封装材料,内存又怎么堆到计算单元下面。The Register 在 2024 年 9 月 19 日报道,SiFive 现在不只卖 RISC-V CPU 核心,也开始出售自己的加速器蓝图。

科技解释林晓雯发布: 2026年9月27日6 分钟阅读资料来源 3
走进 AI 数据中心加速器:RISC-V 核心、T-glass 短缺与 3D DRAM

SiFive 一直以设计 RISC-V CPU 核心闻名,其他公司把这些核心装进自己的 AI 芯片。本周该公司表示,它将授权一套完整的机器学习加速器。据 The Register 报道,Intelligence XM 系列把四个 SiFive Intelligence X RISC-V CPU 核心组成一个集群,再连上自研的矩阵运算引擎。

SiFive 英国高级副总裁兼总经理 John Ronco 对 The Register 说,一些客户仍想自己搭硬件,另一些客户则「希望从 SiFive 获得更多一站式服务」。该公司早先的做法是把自家 CPU 核心放在第三方矩阵引擎旁边,谷歌的张量处理单元就是这种模式。XM 集群反过来:SiFive 现在提供整套加速器设计,客户定制后送往晶圆厂。

一个集群实际能提供什么

每个基础 XM 集群通过一致性集线器接口支持最高 1TB/s 的内存带宽。SiFive 预计它每吉赫兹可提供最高 16 TOPS 的 INT8 或 8 teraFLOPS 的 BF16 性能。

每吉赫兹的数字可能误导人,因为这不是一颗成品芯片。最终性能取决于客户放多少个集群、怎么连接、芯片上还有什么其他模块,以及功耗和散热预算。Ronco 预计大多数设计会用四到八个集群。在 1GHz 时钟下,这相当于 4 到 8TB/s 的峰值内存带宽,以及最高 32 到 64 teraFLOPS 的 BF16。英伟达 H100 的稠密 BF16 算力接近一 petaFLOPS,这种对比对英伟达有利。但对推理这类受带宽限制的工作来说,FLOPS 并非一切。Ronco 说,XM 集群大概不会太多用于 AI 训练。

规模是悬而未决的问题。Ronco 不愿透露这套设计能扩展到多大,The Register 指出制程工艺和芯片面积会设定上限。该公司的产品幻灯片显示,512 个 XM 集群是可能的。在 1GHz 且没有散热或功耗问题的情况下,这大约是四 petaFLOPS 的 BF16 矩阵算力。英伟达规格最高的 Blackwell GPU 标称 2.5 petaFLOPS 的 BF16。

SiFive 还表示,将发布 SiFive Kernel Library 的开源参考实现,以降低 RISC-V 的采用门槛。其 CEO Patrick Little 在一份事先准备好的声明中称,公司向「七巨头」中的五家提供基于 RISC-V 的芯片设计,这一群体包括微软、苹果、英伟达、Alphabet、亚马逊、Meta 和特斯拉。The Register 指出,它怀疑这些芯片并非全部涉及 AI。

没人盯着的封装瓶颈

设计是一回事,材料是另一回事。据 Tom's Hardware 报道,日本公司 Nittobo 控制着全球约 90% 的特种玻璃纤维布供应,这种布叫 T-glass,存在于每一颗先进 AI 芯片的封装之中。T-glass 是一种低 CTE 玻璃布,用在 IC 基板的有机芯层,也就是芯片与印刷电路板之间的互连层。它让又大又热的芯片封装在密度提高时保持尺寸稳定。

需求已经超过供应。Nittobo 正在把福岛工厂的产能提高到三倍,但新增产量要到 2027 年年中才能进入市场。价格已经上涨 20% 到 30%,铜箔层压板等下游材料的交货周期从正常的 8 到 10 周拉长到 20 周以上。元大分析师 Bill Ho 对 Tom's Hardware 说:「T-glass 供应现在更加紧张,供应商已经不再提供交货周期。」

替代 T-glass 并不简单。跟踪 IC 基板供应链的 Yole Group 分析师 Bilal Hachemi 说,这种材料「具有特定的介电常数和 CTE 值,更适合 AI 芯片,尤其是有机芯层」。基板行业利润微薄,所以即使需求温和上升也可能引发短缺。Hachemi 说:「增层材料、ABF 材料或 T-glass 的需求只要增加,就可能造成潜在短缺,因为这违背了这个行业的基本规律。」

超大规模厂商订购越来越大的封装,让情况更糟。根据 Tom's Hardware 引用的英伟达数据,中介层尺寸从 Hopper 的 814mm2 增长到 Blackwell 的 1,700mm2,增幅 109%,而 Rubin 和 Feynman 世代还会进一步扩大。美国银行估计,Nittobo 电子材料部门的销售额将从 2025 年的 409 亿日元,约合 2.66 亿美元,到 2028 年 3 月几乎翻倍至 877 亿日元,营业利润率接近 48%。

Nittobo 正在把台湾工厂的原丝产能提高一倍,把原丝进口回日本织成布,并把部分织造外包给其最大竞争对手之一南亚塑胶。该公司披露,到 2027 年,Nittobo 大约 20% 的玻璃布预计由南亚织造。Hachemi 说,英伟达直接联系 Nittobo 这样的上游材料供应商是前所未有的,并警告说,一旦英伟达锁定自己的份额,其他芯片买家将争夺剩下的部分。

3D DRAM 与内存墙

内存是第三条战线。据 ServeTheHome 报道,在 Hot Chips 2026 上,d-Matrix 展示了其 Raptor 加速器,把计算单元直接堆叠在 DRAM 裸片之上。模型权重不断增长,KV cache 则随上下文长度乘以批大小而扩大。ServeTheHome 举的例子是:64 个用户在 1M 上下文下可能意味着大约 935GB 的 KV cache。这既是容量问题,也是带宽问题。

SRAM 能达到带宽目标,但规模很小。一对 Corsair SRAM 加速卡可达到约 300TB/s,延迟约 1 纳秒,但只能容纳约 4GB。HBM 解决了容量问题,却在带宽上吃力,据 d-Matrix 称,对于英伟达 Vera Rubin 和 AMD Instinct MI455 这类 HBM4 封装,实际上限约为 20TB/s。堆叠的 3D DRAM 介于两者之间:垂直 3D IO 的成本约为 0.3 到 0.4 pJ,比 HBM 低约 10 倍,因为它是无 PHY 的毫米级通路,而不是厘米级的中介层走线。

Raptor 用 36 微米面对面堆叠,把一颗台积电 N4 逻辑裸片放在 3D DRAM 裸片之上,d-Matrix 称这一工艺成熟、低成本、可高量产且良率高。每张卡容纳 32GB,d-Matrix 称 72 卡扩展可以承载 Kimi K3 这样的前沿模型,在 1M 上下文下使用 4 比特权重和 8 比特 KV cache。

工程上还没有完成。d-Matrix 称,一个 1-Hi 逻辑在上的堆叠,功耗不超过 0.5 W/mm2 时,可以液冷并把 DRAM 保持在 100C 以下。其裸片有 840 个 bank,去掉 72 个备用后为 768 个,分布在 256 个通道上,即每通道 3 个 bank。128B 的 flit 无法整除,所以单次访问返回 96B,两次访问取回 192B,在接近 33TB/s 时浪费约 33% 的带宽。其流式分块方案把一个 32B 的部分访问分摊到三个 flit 上,把过度取数降到零。

还有 I/O 功耗。以 0.37 pJ/bit 传输 100TB/s,仅 I/O 就要 296W,而传统 DBI 可以节省 20%。HBM 能用 DBI,是因为它的多周期突发让 PHY 能看到完整突发。d-Matrix 的单周期 256 位 3D-DRAM 链路没有突发,也没有边带引脚来指示反转选择,所以改用流翻转,把每个 flit 与前一个比较,需要时反转。

这些都不会自己到来。RISC-V 加速器蓝图、一种封装布的近乎垄断,以及堆叠 DRAM,都必须在下一代数据中心芯片出货前对齐。

评论 0

资料来源

3
  1. 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
  2. 02Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
  3. 03D-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。