AI加速器内部到底有什么:T玻璃、HBM与解码瓶颈
全球约90%的T玻璃供应握在一家日本公司手里。这种玻璃纤维布用在每一块先进AI芯片的封装里。缺货对加速器路线图的影响,已经和GPU架构一样大。

据Tom's Hardware报道,Nittobo掌控着全球T玻璃市场约90%的份额。T玻璃是一种低热膨胀系数的玻璃布,用在IC基板的有机芯层里。Nittobo正把福岛工厂的产能提高到原来的三倍,但新增供应要到2027年年中才能进入市场。
缺口已经反映在价格和交期上。T玻璃价格上涨了20%到30%,铜箔层压板等下游材料的交期从正常的8到10周拉长到20周以上。元大证券分析师Bill Ho对Tom's Hardware说:“现在T玻璃供应更加紧张,供应商已经不再提供交期了。”压力最先出现在销售团队撑不了几天的报价上,随后出现在无晶圆厂设计公司安排发布窗口的时间表上。链条上没有人愿意公开说这种紧张会持续多久,谁都不想成为判断错的那一个。
为什么基板比晶体管数量更重要
AI加速器不是一颗芯片。它是一个封装体:逻辑裸片、内存堆栈、中介层,以及把它们全部连接到印刷电路板上的基板。封装体反复升温和降温时,基板的有机芯层必须保持平整。一旦翘曲,裸片之间的微观连接就会断裂。T玻璃的作用就是维持尺寸稳定,它的介电常数和热膨胀系数正是为这件事调校的。
Yole Group跟踪IC基板供应链的分析师Bilal Hachemi对Tom's Hardware Premium表示,替换它并不简单。他说,T玻璃“具有特定的介电常数和热膨胀系数,更适合AI芯片,尤其是有机芯层”。他还指出,这个行业的结构会把小的需求冲击放大成缺货:IC基板业务历来利润微薄,所以“对积层材料、ABF材料或T玻璃的任何需求增长都可能造成潜在缺货,因为这违背了这个行业的基本面”。这种结构早于AI热潮就已存在。它是为一个基板需求缓慢而可预测增长的市场建立的。如今单一产品周期就能让订单在一年内翻倍,这套结构并没有为此重建。
需求端的情况毫不含糊。每一代AI加速器都使用更大的中介层和更复杂的基板,也就是单位产品消耗更多材料。根据Tom's Hardware引用的英伟达数据,中介层面积从Hopper的814mm²增长到Blackwell的1700mm²,增幅109%,即将推出的Rubin和Feynman世代还会进一步扩大。
美国银行估计,Nittobo电子材料部门的销售额将从2025年的409亿日元(2.66亿美元)增长到2028年3月的877亿日元,接近翻倍,营业利润率接近48%。美国银行研究分析师Takashi Enomoto说:“T玻璃布的需求很可能比原先预期增长得更多。”他补充说,此前关注点一直放在用于GPU和CPU封装的厚T玻璃上,但随着领先制程器件逐步弃用E玻璃,超薄T玻璃的需求可能上升。
Nittobo没有坐等。除了福岛之外,它正在把台湾工厂的原丝产能翻倍,再把纱线运回日本织造,并与南亚塑胶达成合作协议,把部分织造外包出去。Tom's Hardware点出了其中的象征意义:Nittobo正在与自己最大的竞争对手之一合作。到2027年,Nittobo大约20%的玻璃布预计将由南亚织造。
内存是瓶颈的另一半
如果说基板决定封装体能不能造出来,那么内存决定它能多快给出答案。d-Matrix在Hot Chips 2026上介绍Raptor加速器时算了一笔账,ServeTheHome对此做了报道。模型权重持续增长,KV缓存随上下文长度乘以批大小而扩大,因此64个用户在1M上下文下可能意味着大约935 GB的KV缓存。
计算与内存的分野体现在推理的两个阶段。预填充并行处理大量提示词token,受计算吞吐限制。解码一次生成一个token,通常受内存带宽限制。由于解码主导实际运行时间,收益就在这里。SRAM能达到带宽目标,但规模极小:一对Corsair SRAM加速卡达到大约300 TB/s、延迟约1 ns,容量只有约4 GB。一个6T SRAM单元比DRAM单元大约10倍。
HBM解决了容量,但没有解决带宽。d-Matrix指出,英伟达Vera Rubin和AMD Instinct MI455等HBM4封装的实际上限约为20 TB/s,受引脚速率、I/O宽度和大约8到16个堆栈的封装边缘长度限制。带宽还要付出功耗代价:在2.4 pJ/bit下,通过HBM推送100 TB/s在计入任何互连流量之前就要消耗约1.92 kW。
“我们第一次看到英伟达这个终端客户主动接触上游材料供应商,去锁定产能并确保自己能拿到货。”Yole Group的Bilal Hachemi对Tom's Hardware说
d-Matrix的答案是直接把计算堆叠在DRAM裸片上。一颗台积电N4逻辑裸片用36 um面对面堆叠放在3D DRAM裸片上。垂直3D IO约为0.3到0.4 pJ,比HBM低大约10倍,因为它是毫米级路径,而不是厘米级的中介层走线。该公司称,一个1-Hi逻辑在上的堆栈在不超过0.5 W/mm²时可以采用液冷,并把DRAM保持在100 C以下。
集成才是优雅消失的地方。每个张量引擎每次访问需要128B flit,而32B bank每次列访问提供32B,算下来每通道需要4个bank。这颗裸片有840个bank,扣除72个备用后为768个,分布在256个通道上,也就是每通道只有3个bank。流式分块解决了这种不匹配:把一次不完整的32B访问分摊给三个flit,于是96B的4次访问供给128B的3个flit。在每卡32GB、4位权重和8位KV缓存下,d-Matrix把Kimi K3这类前沿模型在1M上下文下装进一个72卡机架。
设计循环正在被自动化,但进度不均
封装和内存是物理约束。设计时间则是经济约束。英伟达计算工程副总裁兼总经理Tim Costa对记者表示,到2030年,行业预计将生产2万亿颗芯片,每月处理约4100万片晶圆,单个封装体接近一万亿个晶体管。据The Next Platform报道,他说:“传统设计流程根本跟不上这种规模的挑战。”
英伟达正在把基于Arm的Vera CV100 CPU部署到自己的EDA工作流中,包括仿真、形式验证和物理实现。Costa说,早期测试显示Vera运行Synopsys VCS和Cadence Jasper的性能是AMD Epyc Torrent系统的1.5倍。Cadence声称其AI Super Agents可以同时运行数百次仿真,把寄存器传输级验证周期加快40倍;Synopsys称其自主验证工作流可以把经过验证的RTL交付速度提高50倍。这些都是厂商数据。SemiEngineering指出,向专用智能体的转变正在编排、集成和护栏方面带来新问题,AI生成的结果在签核前仍需验证。
SemiEngineering报道的Cadence ChipStack AI Super Agent的一个数据点说明,收益不只是速度。该公司报告称,与纯基础模型代码生成相比,面积减少约24%,功耗降低18%。
这些都没有消除上游约束。更大的中介层需要更多T玻璃。更大的模型需要更多内存带宽。英伟达直接去找Nittobo,Hachemi称这在供应链的这一环节前所未有,这本身就说明真正的稀缺在哪里。他点出的担忧很直接:一旦英伟达锁定自己的份额,其他芯片买家就只能争抢剩下的部分。新建晶圆厂要花数年,新建一座运行在1600到1700°C之间的玻璃布熔炉同样如此。
资料来源
4- 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Nvidia Accelerates Chip Engineering With AI AgentsEN
- 04Chip Industry Week In ReviewEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。