AI加速器为何越来越难造:T玻璃、HBM与3D堆叠
日本公司Nittobo控制着全球约90%的特种玻璃纤维布T玻璃供应。据Tom's Hardware报道,这种材料的紧张正传导至AI加速器供应链,价格上涨20%到30%,交货周期拉长到20周以上。

关于AI硬件的报道,大多从英伟达和台积电说起,也到它们为止。Tom's Hardware在3月9日报道说,瓶颈已经下移了一层,落进一种大多数人从未听说过的材料:T玻璃。这是一种低热膨胀系数的玻璃布,用在IC载板的有机芯层,也就是芯片与印刷电路板之间的互连层。
T玻璃到底做什么
T玻璃让尺寸大、发热高的芯片封装保持形状稳定。AI处理器越做越大、运行温度越来越高,保持封装平整已经从理论问题变成制造问题。另一种玻璃纤维E玻璃更便宜,但主要用于微控制器和老款移动处理器等低端芯片。大规模2.5D和3D封装则首选T玻璃。
Nittobo在这一市场占据主导。它或其他任何公司都无法在一夜之间开出新的产线。这种材料需要专用的电熔炉,运行温度在1600至1700°C,工艺包括熔化富硅玻璃、拉丝成纱、再织成超薄布。要扩大规模,需要多年的投资和经验积累。
Nittobo正在把日本福岛工厂的产能提高到三倍,但新增供应要到2027年年中才能进入市场。与此同时,价格上涨了20%到30%,覆铜板等下游材料的交货周期已从正常的8到10周拉长到20周以上。元大证券分析师Bill Ho对Tom's Hardware说:“T玻璃供应现在更加紧张,供应商已经不再给出交货周期。”
追踪IC载板供应链的Yole Group分析师Bilal Hachemi表示,T玻璃“具有特定的介电常数和热膨胀系数,更适合AI芯片,尤其是有机芯层”。他还指出,IC载板行业历来利润微薄,即便是温和的需求增长也可能引发短缺。他说:“对积层材料、ABF材料或T玻璃的任何需求增加都可能造成潜在短缺,因为这违背了这个行业的基本规律。”
这次紧张之所以尖锐,关键在于谁在推动需求。超大规模云厂商订购的芯片封装越来越大,每一代都使用更大的中介层和更复杂的载板。根据Tom's Hardware引用的英伟达数据,中介层尺寸已从Hopper架构的814mm²增长到Blackwell的1700mm²,增幅109%,即将推出的Rubin和Feynman世代还会继续扩大。
封装更大,材料更多
美国银行估计,Nittobo电子材料部门的销售额将从2025年的409亿日元(2.66亿美元)增长到2028年3月的877亿日元,接近翻倍,营业利润率接近48%。美国银行研究分析师Takashi Enomoto表示,随着领先制程器件弃用E玻璃,超薄T玻璃的需求也在上升。
争夺配额的行动已经开始。Hachemi形容英伟达直接联系上游材料供应商是前所未有的:“我们第一次看到英伟达这样的终端客户主动接触上游材料供应商,以确保产能、确保自己能拿到货。”令人担心的是,一旦英伟达锁定自己的份额,其他芯片买家就只能争抢剩下的部分。
Nittobo也没有坐等。除了福岛扩产,它还在把台湾工厂的纱线产能翻倍,再把纱线运回日本织布。它还和南亚塑胶达成合作,把部分织造外包出去。这本身就说明市场有多紧:Nittobo正在与自己最大的竞争对手之一合作来缓解瓶颈。到2027年,Nittobo大约20%的玻璃布预计将由南亚织造。
内存墙,以及堆叠给出的答案
封装材料是一个约束。内存带宽是另一个,也是今年芯片会议上另一条独立讨论的主线。ServeTheHome对d-Matrix在Hot Chips 2026演讲的报道列出了问题:模型权重持续增长,KV缓存随上下文长度乘以批大小而扩大。64个用户在1M上下文下,可能意味着大约935 GB的KV缓存。
SRAM能达到带宽目标,但规模很小。一对Corsair SRAM加速卡可达到约300 TB/s、延迟约1 ns,但只能容纳约4 GB。HBM解决了容量那一半,却在带宽上吃力,d-Matrix给出的HBM4封装实际上限约为20 TB/s。这么高的带宽要付出功耗代价:按2.4 pJ/bit计算,通过HBM推送100 TB/s要消耗约1.92 kW,还没算上互联网络本身的流量。
d-Matrix的答案是直接把计算堆叠在DRAM裸片上。一颗台积电N4逻辑裸片用36 um面对面堆叠放在3D DRAM裸片上,公司称这一工艺已经验证、成本低、可量产、良率高。散热挑战是真实的:d-Matrix表示,1-Hi逻辑在上的堆叠只要不超过0.5 W/mm²,就可以用液冷把DRAM保持在100 C以下。垂直3D IO约为0.3到0.4 pJ,比HBM低约10倍。
工程上也有取舍。每个张量引擎每次访问需要128B的flit,而每个通道3个bank时,单次访问只返回96B,浪费约33%的带宽。d-Matrix的解决办法叫stream blocking,把一次32B的部分访问分摊到三个flit上,使过量读取降到零。每卡32GB时,72卡纵向扩展可以承载Kimi K3这类前沿模型在1M上下文下运行。
微软和Rebellions显示出同样的趋势
微软的Maia 200在Hot Chips 2026上展示,由ServeTheHome现场报道。这是一颗3nm芯片,1400亿晶体管,6组HBM3e堆栈,7TB/秒的HBM带宽,750瓦TDP,FP4性能10000 TFLOPS。SoC裸片面积820mm²。微软正在Azure数据中心内部署它,采用只做纵向扩展的网络设计:128个机架、6000颗芯片,通过统一以太网由tier-0和tier-1交换机连接。注意力基准测试显示有效峰值1.65 PFLOPS,集合通信基准测试在BF16 AllReduce下达到接近1.3TB/秒。
在Hot Chips 2025上,Rebellions针对同样的封装问题展示了不同做法。REBEL-Quad使用四个HBM3E位点,提供144GB内存,以UCIe作为芯粒互连,基于三星SF4X和CoWoS-S,每个封装内有四个计算ASIC和四个集成硅电容。ServeTheHome指出它是一张双PCIe Gen5 x16卡,并提到该公司在开发板上现场演示了Llama 3.3 70B,平均每个输出token耗时35.5毫秒。
学术界也在推进。斯坦福、卡内基梅隆、宾夕法尼亚大学、麻省理工和SkyWater Technology报告了在美国晶圆厂制造的第一颗单片3D芯片,于2025年12月在第七十一届IEEE国际电子器件会议上展示。早期硬件测试显示,原型性能约为同类2D芯片的四倍,对更高版本的模拟则指向AI工作负载最高十二倍的提升,其中包括源自Meta LLaMA的负载。领导这项工作的斯坦福教授Subhasish Mitra表示,未来的AI系统会要求硬件性能提升1000倍,靠的就是这类突破。
这些都不会在当前短缺所要求的时间尺度上到来。T玻璃的约束是一个以年计的问题,而可能在未来缓解压力的堆叠与封装研究,目前大多还停留在演示幻灯片和开发板上。
资料来源
5- 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 04Scientists and U.S. foundry achieve 3D chip breakthrough to accelerate AIEN
- 05Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。