AI 加速器:没人算进价格的封装瓶颈,以及押注绕开 HBM 的初创公司
一家大多数数据中心运营商没听说过的日本公司,掌握着全球约 90% 的一种玻璃布。这种玻璃布用在每一块先进 AI 芯片的封装里。它的下一条产线要到 2027 年年中才能投产。

Nittobo 的 T-glass 是一种低热膨胀系数玻璃布,用在 IC 载板的有机芯层里。这层材料夹在芯片和印刷电路板之间。据 Tom's Hardware 报道,这家公司掌握全球约 90% 的供应。需求远远超过产能,覆铜板的下游交期从正常的 8 到 10 周拉长到 20 周以上,价格上涨了 20% 到 30%。
这个数字比看上去更重要。每一代 AI 加速器都塞进更大的中介层和更复杂的载板,每颗芯片消耗的材料因此更多。Tom's Hardware 引用 Nvidia 自己的数据:中介层尺寸 Hopper 为 814mm²,Blackwell 为 1,700mm²,增长了 109%,Rubin 和 Feynman 还会继续放大。供应端没法快速跟上。T-glass 需要 1,600 至 1,700°C 的电熔炉。Nittobo 正把福岛工厂的产能提高到三倍,新增产量要到 2027 年年中才能进入市场。
该报道引用的分析师说,这个市场很难找到替代品。Yole Group 的 Bilal Hachemi 对 Tom's Hardware 表示,替代 T-glass 并不容易。他指的是那些适合 AI 芯片、尤其是有机芯层的特定介电常数和热膨胀系数值。元大分析师 Bill Ho 说,供应商已经干脆不再报交期。美国银行的 Takashi Enomoto 预计,Nittobo 的电子材料销售额将从 2025 年的 409 亿日元(2.66 亿美元)几乎翻倍,到 2028 年 3 月达到 877 亿日元,营业利润率接近 48%。
有一个细节很突出。Hachemi 说,Nvidia 直接去找上游材料供应商,在这段链条上史无前例。如果最大的买家先锁定产能,其他人就只能在剩下的部分里谈判。
内存带宽是另一堵墙
封装在收紧的同时,加速器设计者正在争论内存。据 ServeTheHome 报道,在 Hot Chips 2026 上,d-Matrix 展示了 Raptor。这款加速器把台积电 N4 逻辑裸片用 36 微米面对面堆叠在 3D DRAM 裸片之上。它的说法是,SRAM 和 HBM 单独都不适合推理。SRAM 带宽高但容量小。HBM 容量大,却受制于引脚速度、堆叠层数和封装岸线。d-Matrix 给出的 HBM4 封装实际上限约为 20 TB/s。
带宽还带着一笔电费。ServeTheHome 的文章把 HBM 列为 2.4 pJ/bit,也就是说 100 TB/s 在 fabric 流量之前就要花掉约 1.92 kW。垂直 3D IO 约为 0.3 到 0.4 pJ,低了大约十倍,因为它是毫米级路径,而不是厘米级的中介层走线。
d-Matrix 的数字具体且不漂亮。每个张量引擎每次访问需要 128B 的 flit,但 256 个通道上的 32B bank 在扣除备用后每通道只有 3 个 bank,每次访问返回 96B。两次访问取回 192B 才能交付 128B,在接近 33 TB/s 时浪费约 33% 的带宽。该公司的解决办法是流式分块,把一次部分访问分摊到三个 flit 上,使 384B 进对应 384B 出,过量读取降到零。在每卡 32GB、4 位权重和 8 位 KV 缓存下,d-Matrix 说 72 卡的 scale-up 可以承载 1M 上下文的前沿模型。
Chiplet 与 RISC-V 授权模式的转变
封装限制和内存取舍正把厂商推向不同的集成策略。据 ServeTheHome 报道,Rebellions 在 Hot Chips 2025 上展示了 REBEL-Quad:四颗计算 ASIC、四个 HBM3E 位点共 144GB,以及作为裸片间互连的 UCIe-A,基于三星 SF4X 和 CoWoS-S。这张卡跑双 PCIe Gen5 x16,公司在开发板上演示了 Llama 3.3 70B,平均每个输出 token 35.5 毫秒。
ServeTheHome 指出,选择 PCIe 与 Nvidia 转向 Gen6 的举动放在一起显得有些别扭,但认为现场演示是更重要的事实:一颗基于 UCIe 的芯片公开跑起来,这本身就少见,值得点出。在计算一侧,SiFive 已从把 RISC-V CPU 核授权给其他公司的 AI 芯片,转向销售自己的加速器设计。The Register 在 2024 年 9 月 19 日报道,SiFive 的 Intelligence XM 集群把四颗 Intelligence X CPU 核与自研矩阵数学引擎配对,每个集群最高 1TB/sec 内存带宽,每 GHz 最高 16 TOPS 的 INT8 或 8 teraFLOPS 的 BF16。
SiFive 负责英国业务的高级副总裁兼总经理 John Ronco 对 The Register 说,一些客户仍然想要自己的硬件,另一些则想要一站式方案。他预计基于该设计造出的大多数芯片会用四到八个集群。他对接下来的扩展幅度有所保留,尽管公司的幻灯片显示 512 个集群是可能的。作为参照,Nvidia 顶级的 Blackwell 部件标称 2.5 petaFLOPS 的 BF16。
SiFive 已经在供应谷歌张量处理单元和 Tenstorrent Blackhole 中使用的 RISC-V 设计。CEO Patrick Little 在一份事先准备好的声明中称,公司为“七巨头”中的五家供货。The Register 指出,这一说法可能并不都与 AI 有关。
制裁不断重画地图
供应链也在被出口管制重塑。The Register 在 2024 年 10 月 28 日报道,台积电据称切断了中国设计公司 Sophgo,怀疑它试图向华为供应元件。路透社援引两名知情人士,指认下单那颗类似华为昇腾 910B 芯片的客户。Sophgo 否认与华为有任何直接或间接的业务关系,并表示已向台积电提交详细调查报告。与 Sophgo 有关联的比特大陆称这些指控虚假且毫无根据。
The Register 指出比特大陆的记录并不干净:2021 年,检方突袭其台湾办公室,指控两家关联公司试图非法招募台湾工程师。台积电在 2020 年依据美国规定停止与华为做生意。
据该报道,华为昇腾 910B 标称 320 teraFLOPS 的 FP16 或 640 teraFLOPS 的 Int8,大致与 Nvidia 四年前的 A100 相当。比当前前沿慢,但能拿到。在出口上限不断收紧的时候,这一点才是关键。
资料来源
5- 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 04SiFive expands from RISC-V cores for AI chips to designing its own full-fat acceleratorEN
- 05TSMC reportedly cuts off RISC-V chip designer linked to Huawei acceleratorsEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。