AI加速器:数据中心的争夺转向封装供应链
AI加速器厂商正在重新设计计算与内存之间的通信方式,但更深的瓶颈在上游:一家日本玻璃纤维布厂商控制着约90%的一种材料,所有先进封装都离不开它,新增产能要到2027年年中才能到位。

2026年,每一场关于AI加速器的讨论最终都会撞上同一堵墙:内存带宽。算力昂贵,但买得到。真正决定功耗预算、封装尺寸和出货日期的,是把权重和KV cache搬进搬出内存的过程。SiFive、d-Matrix和Rebellions本轮拿出的设计,针对的都是内存接口,而不是乘加阵列。
The Register在2024年9月19日报道,SiFive长期向其他公司的AI芯片供应RISC-V CPU核,如今转而授权自家的加速器。Intelligence XM集群把四个Intelligence X RISC-V核与自研矩阵运算引擎配对。每个集群支持最高1TB/s的内存带宽,每GHz的算力标称为最高16 TOPS的INT8或8 teraFLOPS的BF16。SiFive的John Ronco对该刊表示,基于这一设计的大多数芯片会用四到八个集群。换算下来,峰值内存带宽在4到8TB/s之间,1GHz下BF16算力最高32到64 teraFLOPS。
这些数字放在Nvidia H100旁边并不算高。
有意思的是SiFive把东西卖给谁。Ronco说,一些客户仍想自己造硬件,另一些则想要一站式方案。SiFive的目标不是谷歌或Tenstorrent,这两家已经在自研加速器。它瞄准的是那些想要一个现成模块去定制、再送去晶圆厂的组织。
上限并不清楚。Ronco对设计能扩展到多大规模态度含糊,尽管产品幻灯片显示512个XM集群在可能范围内。按1GHz时钟算,那大约是四petaFLOPS的BF16矩阵算力,而Nvidia规格最高的Blackwell GPU是2.5 petaFLOPS。SiFive还表示会提供其SiFive Kernel Library的开源参考实现。
把DRAM堆在逻辑裸片上
ServeTheHome对Hot Chips 2026的报道描述了d-Matrix走的另一条路:把逻辑直接放在DRAM之上。该公司的Raptor设计用36微米面对面键合,把一颗台积电N4逻辑裸片叠在3D DRAM裸片上。d-Matrix认为SRAM能达到带宽目标,一对Corsair SRAM加速卡在约1 ns延迟下约有300 TB/s,但容量只有约4GB,而且6T SRAM单元比DRAM单元大约十倍。HBM解决了容量,但d-Matrix指出,对Nvidia Vera Rubin和AMD Instinct MI455这类HBM4封装,实际带宽天花板在20 TB/s左右。
原因在功耗。按2.4 pJ/bit计算,把100 TB/s推过HBM要消耗约1.92 kW,还没算任何互联流量。相比之下,垂直3D IO约为0.3到0.4 pJ,比HBM低约十倍,因为它是无PHY的毫米级路径,而不是厘米级的中介层走线。代价是散热:d-Matrix说,不超过0.5 W/mm2的1-Hi逻辑在上堆叠可以液冷,并把DRAM保持在100C以下。
工程细节才是这些说法可验证的地方。每个张量引擎每次访问需要128B的flit,而32B的bank每次列访问只给32B,这意味着每通道四个bank。d-Matrix的裸片有840个bank,扣掉72个备用后是768个,分布在256个通道上:每通道三个bank。一次访问返回96B,所以要凑出一个128B的flit需要两次访问,取回192B,在33 TB/s附近浪费约33%的带宽。d-Matrix的解法是stream blocking,把一次不完整的32B访问分摊到三个flit上,于是四次96B的访问喂三个128B的flit。多余取数降到零。第二个技巧是stream flipping,把每个flit与前一个取反以减少翻转,在不使用传统数据总线反转所需边带引脚的情况下收回约20%的I/O功耗。
按每卡32GB、4-bit权重和8-bit KV cache计算,d-Matrix把72卡的scale-up规模设计为能承载Kimi K3这样1M上下文的frontier模型。ServeTheHome指出,该公司在Hot Chips 2026上展示了这项工作。
UCIe走到了一块能跑的板子上
Rebellions展示的东西比幻灯片更少见:在运行的硅片。ServeTheHome在2025年8月25日报道,Rebellions REBEL-Quad在Hot Chips 2025上的一块开发板上演示,运行Llama 3.3 70B,平均每个输出token耗时35.5 msec。该封装基于三星SF4X和CoWoS-S,包含四个计算ASIC、四个HBM3E位点共144GB内存,以及四个集成硅电容。它用UCIe-A作为chiplet互连,配一张双PCIe Gen5 x16接口卡。
ServeTheHome指出PCIe的选择可能是个失误,因为Nvidia的GB300已经引入PCIe Gen6。对一个面向scale-out推理的部件来说,这个批评是公允的。但演示本身比规格表更重要。UCIe被讨论了很多年,厂商一直不急于宣传自己用了它,因为互连藏在封装内部。Rebellions把这么多块硅集成进一个大封装并让它跑起来,是chiplet生态需要的一个数据点。
并非每个加速器都需要一个数据中心机架。Draw Things在2025年11月11日公布了在苹果M5上配合Neural Accelerators的Metal FlashAttention v2.5结果,声称在其自家的图像和视频生成应用中比M4最高提升4.6倍。该公司报告相对M4 iPad的原始性能提升为3.6倍到5.5倍,端到端为3.3倍到4.6倍,M5 iPad的性能落在M2 Max区间,且往往比M3 Ultra(60c)慢约80%。它说16GiB的M5 iPad能用Wan 2.2 A14B模型生成五秒480p视频。这次发布是预览版:Draw Things说BF16支持最初因未解决的bug而关闭,后来在11月17日的构建中恢复,而奇怪的注意力序列长度和较大的head维度仍会造成性能断崖。
封装之外没人听说过的材料
所有这些设计工作都撞上一个与架构无关的供应链问题。Tom's Hardware在2026年3月9日报道,Nittobo控制着全球约90%的T-glass供应,这是一种低CTE的玻璃纤维布,用于IC基板的有机芯层,也就是芯片与其印刷电路板之间的互连层。T-glass让又大又热的封装保持尺寸稳定。E-glass更便宜,但主要用于微控制器和较老移动处理器这类低端芯片;对大规模2.5D和3D封装来说,T-glass是首选。
Nittobo正在把福岛工厂的产能提高到三倍,但新供应要到2027年年中才能进入市场。价格已经上涨20%到30%,而覆铜板这类下游材料的交期从正常的8到10周拉长到20周以上。元大分析师Bill Ho对Tom's Hardware说,供应商已经不再提供交期。Yole Group的Bilal Hachemi表示,T-glass不容易替代,因为它有特定的介电常数和CTE值,对AI芯片尤其是有机芯层更合适,而IC基板行业历来利润微薄,意味着哪怕温和的需求激增也会引发短缺。
需求驱动来自封装尺寸。根据Tom's Hardware引用的Nvidia数据,中介层尺寸从Hopper的814mm2增长到Blackwell的1700mm2,增幅109%,Rubin和Feynman还会继续放大。美国银行估计,Nittobo的电子材料部门销售额将从2025年的409亿日元几乎翻倍到2028年3月止的877亿日元,营业利润率接近48%。Nittobo正在把台湾工厂的原丝产能翻倍,并与南亚塑胶达成合作,把部分织造外包出去。到2027年,Nittobo约20%的玻璃布预计由南亚织造。
Nittobo正在与自己最大的竞争对手之一合作来缓解瓶颈。这是目前最清楚的信号,说明约束到底在哪里。加速器架构师可以继续削减每比特的皮焦耳,但如果基板里的那层布早在几年前就被分配掉了,出货日期就由别的地方决定。
资料来源
5- 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 04Metal FlashAttention v2.5 with Neural Accelerators on the Apple M5 ChipEN
- 05Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。