跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

AI加速器:数据中心的争夺转向封装供应链

AI加速器厂商正在重新设计计算与内存之间的通信方式,但更深的瓶颈在上游:一家日本玻璃纤维布厂商控制着约90%的一种材料,所有先进封装都离不开它,新增产能要到2027年年中才能到位。

科技分析林晓雯发布: 2026年9月27日7 分钟阅读资料来源 5
AI加速器:数据中心的争夺转向封装供应链

2026年,每一场关于AI加速器的讨论最终都会撞上同一堵墙:内存带宽。算力昂贵,但买得到。真正决定功耗预算、封装尺寸和出货日期的,是把权重和KV cache搬进搬出内存的过程。SiFive、d-Matrix和Rebellions本轮拿出的设计,针对的都是内存接口,而不是乘加阵列。

The Register在2024年9月19日报道,SiFive长期向其他公司的AI芯片供应RISC-V CPU核,如今转而授权自家的加速器。Intelligence XM集群把四个Intelligence X RISC-V核与自研矩阵运算引擎配对。每个集群支持最高1TB/s的内存带宽,每GHz的算力标称为最高16 TOPS的INT8或8 teraFLOPS的BF16。SiFive的John Ronco对该刊表示,基于这一设计的大多数芯片会用四到八个集群。换算下来,峰值内存带宽在4到8TB/s之间,1GHz下BF16算力最高32到64 teraFLOPS。

这些数字放在Nvidia H100旁边并不算高。

有意思的是SiFive把东西卖给谁。Ronco说,一些客户仍想自己造硬件,另一些则想要一站式方案。SiFive的目标不是谷歌或Tenstorrent,这两家已经在自研加速器。它瞄准的是那些想要一个现成模块去定制、再送去晶圆厂的组织。

上限并不清楚。Ronco对设计能扩展到多大规模态度含糊,尽管产品幻灯片显示512个XM集群在可能范围内。按1GHz时钟算,那大约是四petaFLOPS的BF16矩阵算力,而Nvidia规格最高的Blackwell GPU是2.5 petaFLOPS。SiFive还表示会提供其SiFive Kernel Library的开源参考实现。

把DRAM堆在逻辑裸片上

ServeTheHome对Hot Chips 2026的报道描述了d-Matrix走的另一条路:把逻辑直接放在DRAM之上。该公司的Raptor设计用36微米面对面键合,把一颗台积电N4逻辑裸片叠在3D DRAM裸片上。d-Matrix认为SRAM能达到带宽目标,一对Corsair SRAM加速卡在约1 ns延迟下约有300 TB/s,但容量只有约4GB,而且6T SRAM单元比DRAM单元大约十倍。HBM解决了容量,但d-Matrix指出,对Nvidia Vera Rubin和AMD Instinct MI455这类HBM4封装,实际带宽天花板在20 TB/s左右。

原因在功耗。按2.4 pJ/bit计算,把100 TB/s推过HBM要消耗约1.92 kW,还没算任何互联流量。相比之下,垂直3D IO约为0.3到0.4 pJ,比HBM低约十倍,因为它是无PHY的毫米级路径,而不是厘米级的中介层走线。代价是散热:d-Matrix说,不超过0.5 W/mm2的1-Hi逻辑在上堆叠可以液冷,并把DRAM保持在100C以下。

工程细节才是这些说法可验证的地方。每个张量引擎每次访问需要128B的flit,而32B的bank每次列访问只给32B,这意味着每通道四个bank。d-Matrix的裸片有840个bank,扣掉72个备用后是768个,分布在256个通道上:每通道三个bank。一次访问返回96B,所以要凑出一个128B的flit需要两次访问,取回192B,在33 TB/s附近浪费约33%的带宽。d-Matrix的解法是stream blocking,把一次不完整的32B访问分摊到三个flit上,于是四次96B的访问喂三个128B的flit。多余取数降到零。第二个技巧是stream flipping,把每个flit与前一个取反以减少翻转,在不使用传统数据总线反转所需边带引脚的情况下收回约20%的I/O功耗。

按每卡32GB、4-bit权重和8-bit KV cache计算,d-Matrix把72卡的scale-up规模设计为能承载Kimi K3这样1M上下文的frontier模型。ServeTheHome指出,该公司在Hot Chips 2026上展示了这项工作。

UCIe走到了一块能跑的板子上

Rebellions展示的东西比幻灯片更少见:在运行的硅片。ServeTheHome在2025年8月25日报道,Rebellions REBEL-Quad在Hot Chips 2025上的一块开发板上演示,运行Llama 3.3 70B,平均每个输出token耗时35.5 msec。该封装基于三星SF4X和CoWoS-S,包含四个计算ASIC、四个HBM3E位点共144GB内存,以及四个集成硅电容。它用UCIe-A作为chiplet互连,配一张双PCIe Gen5 x16接口卡。

ServeTheHome指出PCIe的选择可能是个失误,因为Nvidia的GB300已经引入PCIe Gen6。对一个面向scale-out推理的部件来说,这个批评是公允的。但演示本身比规格表更重要。UCIe被讨论了很多年,厂商一直不急于宣传自己用了它,因为互连藏在封装内部。Rebellions把这么多块硅集成进一个大封装并让它跑起来,是chiplet生态需要的一个数据点。

并非每个加速器都需要一个数据中心机架。Draw Things在2025年11月11日公布了在苹果M5上配合Neural Accelerators的Metal FlashAttention v2.5结果,声称在其自家的图像和视频生成应用中比M4最高提升4.6倍。该公司报告相对M4 iPad的原始性能提升为3.6倍到5.5倍,端到端为3.3倍到4.6倍,M5 iPad的性能落在M2 Max区间,且往往比M3 Ultra(60c)慢约80%。它说16GiB的M5 iPad能用Wan 2.2 A14B模型生成五秒480p视频。这次发布是预览版:Draw Things说BF16支持最初因未解决的bug而关闭,后来在11月17日的构建中恢复,而奇怪的注意力序列长度和较大的head维度仍会造成性能断崖。

封装之外没人听说过的材料

所有这些设计工作都撞上一个与架构无关的供应链问题。Tom's Hardware在2026年3月9日报道,Nittobo控制着全球约90%的T-glass供应,这是一种低CTE的玻璃纤维布,用于IC基板的有机芯层,也就是芯片与其印刷电路板之间的互连层。T-glass让又大又热的封装保持尺寸稳定。E-glass更便宜,但主要用于微控制器和较老移动处理器这类低端芯片;对大规模2.5D和3D封装来说,T-glass是首选。

Nittobo正在把福岛工厂的产能提高到三倍,但新供应要到2027年年中才能进入市场。价格已经上涨20%到30%,而覆铜板这类下游材料的交期从正常的8到10周拉长到20周以上。元大分析师Bill Ho对Tom's Hardware说,供应商已经不再提供交期。Yole Group的Bilal Hachemi表示,T-glass不容易替代,因为它有特定的介电常数和CTE值,对AI芯片尤其是有机芯层更合适,而IC基板行业历来利润微薄,意味着哪怕温和的需求激增也会引发短缺。

需求驱动来自封装尺寸。根据Tom's Hardware引用的Nvidia数据,中介层尺寸从Hopper的814mm2增长到Blackwell的1700mm2,增幅109%,Rubin和Feynman还会继续放大。美国银行估计,Nittobo的电子材料部门销售额将从2025年的409亿日元几乎翻倍到2028年3月止的877亿日元,营业利润率接近48%。Nittobo正在把台湾工厂的原丝产能翻倍,并与南亚塑胶达成合作,把部分织造外包出去。到2027年,Nittobo约20%的玻璃布预计由南亚织造。

Nittobo正在与自己最大的竞争对手之一合作来缓解瓶颈。这是目前最清楚的信号,说明约束到底在哪里。加速器架构师可以继续削减每比特的皮焦耳,但如果基板里的那层布早在几年前就被分配掉了,出货日期就由别的地方决定。

评论 0

资料来源

5
  1. 01SiFive shifts from RISC-V cores for AI chips to designing its own acceleratorEN
  2. 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  3. 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
  4. 04Metal FlashAttention v2.5 with Neural Accelerators on the Apple M5 ChipEN
  5. 05Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。