什么是 AI 加速器?拆开数据中心推理背后的芯片
AI 加速器是数据中心机架里紧挨着普通 CPU 的专用芯片,负责聊天机器人和图像生成背后的矩阵运算。它们怎么造出来、谁能造出来,比那些缩写本身更有意思。

你用过的每一个大语言模型,几乎可以肯定是由一颗不是 CPU 的芯片提供服务的。它是一颗加速器:为做一种算术,也就是矩阵乘法,而设计、并且做得极快的硅片。机器剩下的部分存在的意义,就是不断给它喂数据。这种分工解释了数据中心市场近期的大部分风波,也解释了为什么过去卖 CPU 核心、内存或封装的公司,如今在争论 teraFLOPS、内存带宽,以及一颗 DRAM 裸片上能放多少个 bank。
基本积木,以及 SiFive 为什么现在开始卖它
SiFive 多年来的生意是授权 RISC-V CPU 核心,由别的公司把它们接到自家的 AI 引擎上。据 The Register 报道,谷歌至少有一部分张量处理单元使用 SiFive 的 X280 核心来管理机器学习加速器,让矩阵乘法单元不断有数据可算。SiFive 英国高级副总裁兼总经理 John Ronco 对该刊表示,SiFive 的设计也是 Tenstorrent 的 Blackhole 加速器中 CPU 核心的基础。
2024 年 9 月,公司改变了位置。它发布了 Intelligence XM 系列,可授权的 AI 加速器集群,而不只是 CPU 部分。基础集群包含四个 Intelligence X RISC-V CPU 核心,连接到一个自研的矩阵数学引擎。据 The Register 的报道,每个集群支持最高 1TB/s 的内存带宽,按每吉赫兹计算,预期可提供最高 16 TOPS 的 INT8 或 8 teraFLOPS 的 BF16 性能。
"对一些客户来说,自己做硬件仍然是正确的选择,"Ronco 说。"但对另一些客户来说,他们希望从 SiFive 得到更接近一站式的东西。"
按每吉赫兹给出的数字乍看有点怪。这是一块积木,不是一颗芯片。The Register 指出,SiFive 预计基于该设计的大多数芯片会运行在 1GHz 左右,而 Ronco 预计每颗芯片放四到八个集群。按八个集群、1GHz 计算,最高是 64 teraFLOPS 的 BF16。产品幻灯片显示 512 个集群是可能的,The Register 据此推算,大约可达到四 petaFLOPS 的 BF16 矩阵算力,高于 Nvidia 为其最高规格 Blackwell GPU 给出的 2.5 petaFLOPS。这些数字是理论值。实际性能取决于时钟、功耗与散热预算、制程节点,以及裸片上还有什么在共享资源。SiFive 还表示将发布其 SiFive Kernel Library 的开源参考实现,以降低采用 RISC-V 的门槛。
推理首先是内存问题,其次才是数学问题
加速器厂商现在谈原始算力谈得少了,谈内存谈得多了,因为推理真正变慢的地方在那里。d-Matrix 借 Hot Chips 2026 的演讲把算术摆了出来:模型权重不断增长,而 KV cache 随上下文长度乘以批大小增长。据 ServeTheHome 报道,d-Matrix 举的例子是 64 个用户、1M 上下文,产生大约 935GB 的 KV cache。容量和带宽都成了问题,而且两者都在继续增长。
据 ServeTheHome,SRAM 能达到带宽目标,却几乎存不下东西,一对 Corsair 卡大约 4GB,带宽约 300 TB/s,延迟 1ns。一个 6T SRAM 单元比一个 DRAM 单元大约十倍。HBM 解决了容量,但在实际中撞上带宽天花板,HBM4 封装(如 Nvidia 的 Vera Rubin 和 AMD 的 Instinct MI455)大约在 20 TB/s。HBM 带宽还有功耗代价:按 2.4 pJ/bit 计算,把 100 TB/s 推过 HBM 要消耗约 1.92 kW,还没算上互连流量。
d-Matrix 的答案是直接在 DRAM 裸片上堆叠计算。公司称,一个不超过 0.5 W/mm2 的 1-Hi logic-on-top 堆叠可以液冷,并把 DRAM 保持在 100C 以下。垂直 3D IO 大约在 0.3 到 0.4 pJ,比 HBM 低约十倍。其 Raptor 实现用 36um 面对面堆叠,把一颗台积电 N4 逻辑裸片放到一颗 3D DRAM 裸片上。一个 72 卡的 scale-up 规模足以承载像 Kimi K3 这样的前沿模型、1M 上下文,每卡 32GB,用 4-bit 权重和 8-bit KV cache。这些工程细节重要,是因为它说明加速器设计现在有多大一部分是在解决数据搬运,而不是乘加单元。d-Matrix 的裸片有 840 个 bank,剔除备用后 768 个,分布在 256 个通道上,也就是每通道 3 个 bank。因此,要从 32B 的 bank 里送出一个 128B flit,需要两次访问并取回 192B,在接近 33 TB/s 时浪费约 33% 的带宽。Stream blocking 通过把一次不完整的 32B 访问分摊给三个 flit 把它找回来。
不只是硅片,还有封装
还有第二个约束,与芯片设计毫无关系。Tom's Hardware 在 2026 年 3 月报道,日本公司 Nittobo 控制着全球约 90% 的 T-glass 供应,这是一种低 CTE 的玻璃纤维布,用于 IC 基板的有机芯层。每一颗先进 AI 芯片的封装里都有它。需求正在超过供应。
数字很直白。Nittobo 正在把福岛工厂的产能提高到三倍,但新增供应要到 2027 年年中才能到达市场。价格已经上涨 20% 到 30%,铜箔层压板等下游材料的交期从正常的 8 到 10 周拉长到 20 周以上。据 Tom's Hardware 引用的 Nvidia 数据,interposer 尺寸从 Hopper 的 814mm2 增长到 Blackwell 的 1700mm2,增幅 109%,Rubin 和 Feynman 还会继续放大。
"T-glass 供应现在更加紧张,供应商已经不再提供交期,"元大证券分析师 Bill Ho 说。
Nittobo 正在把台湾工厂的原丝产能提高一倍,并与南亚塑胶达成合作,把部分织造外包出去。据 Tom's Hardware,到 2027 年,Nittobo 大约 20% 的玻璃布预计由南亚织造。美国银行估计,Nittobo 电子材料部门的销售额将从 2025 年的 409 亿日元几乎翻倍,到 2028 年 3 月达到 877 亿日元,营业利润率接近 48%。
真正在出货的是谁
在这一切还在争论的时候,一些初创公司已经把硅片摆到了观众面前。据 ServeTheHome,Rebellions 在 Hot Chips 2025 上展示了其 REBEL-Quad 加速器:四个计算 ASIC,四个 HBM3E 位点共 144GB 内存,基于三星 SF4X 和 CoWoS-S,chiplet 互连用 UCIe-A,另有双 PCIe Gen5 x16 接口。公司在开发板上跑了一场 Llama 3.3 70B 的现场演示,平均每个输出 token 35.5 毫秒。ServeTheHome 指出,很多加速器公司从未走到公开展示可运行演示这一步。
在客户端一侧,Draw Things 报告称,带 Neural Accelerators 的 Metal FlashAttention v2.5 在苹果 M5 上的性能最高比 M4 好 4.6 倍,原始提升为 3.6 到 5.5 倍,在一台 M5 iPad 上端到端提升为 3.3 到 4.6 倍。该软件还是预览版:BF16 支持最初因未解决的 bug 而被禁用,着色器特化也更慢。测量时在 iPad 下面垫了一块冰袋以求最大散热,这既说明了芯片,也说明了散热余量。
这些都不能决定哪种架构会赢。它确实说明,数据中心加速器不再是一个单一的产品类别。它是一摞东西:CPU 核心、矩阵引擎、内存技术、封装材料和软件库,每一样都有自己的瓶颈和自己的交期。
资料来源
5- 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
- 02Shortages of crucial chip packaging material threatens AI accelerator supplyEN
- 03d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 04Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 05Metal FlashAttention v2.5 with Neural Accelerators on the Apple M5 ChipEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。