跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

AI加速器为何越来越难造:T玻璃、HBM与3D堆叠

日本公司Nittobo控制着全球约90%的特种玻璃纤维布T玻璃供应。据Tom's Hardware报道,这种材料的紧张正传导至AI加速器供应链,价格上涨20%到30%,交货周期拉长到20周以上。

科技解释王雅琴发布: 2026年9月28日6 分钟阅读资料来源 5
AI加速器为何越来越难造:T玻璃、HBM与3D堆叠

关于AI硬件的报道,大多从英伟达和台积电说起,也到它们为止。Tom's Hardware在3月9日报道说,瓶颈已经下移了一层,落进一种大多数人从未听说过的材料:T玻璃。这是一种低热膨胀系数的玻璃布,用在IC载板的有机芯层,也就是芯片与印刷电路板之间的互连层。

T玻璃到底做什么

T玻璃让尺寸大、发热高的芯片封装保持形状稳定。AI处理器越做越大、运行温度越来越高,保持封装平整已经从理论问题变成制造问题。另一种玻璃纤维E玻璃更便宜,但主要用于微控制器和老款移动处理器等低端芯片。大规模2.5D和3D封装则首选T玻璃。

Nittobo在这一市场占据主导。它或其他任何公司都无法在一夜之间开出新的产线。这种材料需要专用的电熔炉,运行温度在1600至1700°C,工艺包括熔化富硅玻璃、拉丝成纱、再织成超薄布。要扩大规模,需要多年的投资和经验积累。

Nittobo正在把日本福岛工厂的产能提高到三倍,但新增供应要到2027年年中才能进入市场。与此同时,价格上涨了20%到30%,覆铜板等下游材料的交货周期已从正常的8到10周拉长到20周以上。元大证券分析师Bill Ho对Tom's Hardware说:“T玻璃供应现在更加紧张,供应商已经不再给出交货周期。”

追踪IC载板供应链的Yole Group分析师Bilal Hachemi表示,T玻璃“具有特定的介电常数和热膨胀系数,更适合AI芯片,尤其是有机芯层”。他还指出,IC载板行业历来利润微薄,即便是温和的需求增长也可能引发短缺。他说:“对积层材料、ABF材料或T玻璃的任何需求增加都可能造成潜在短缺,因为这违背了这个行业的基本规律。”

这次紧张之所以尖锐,关键在于谁在推动需求。超大规模云厂商订购的芯片封装越来越大,每一代都使用更大的中介层和更复杂的载板。根据Tom's Hardware引用的英伟达数据,中介层尺寸已从Hopper架构的814mm²增长到Blackwell的1700mm²,增幅109%,即将推出的Rubin和Feynman世代还会继续扩大。

封装更大,材料更多

美国银行估计,Nittobo电子材料部门的销售额将从2025年的409亿日元(2.66亿美元)增长到2028年3月的877亿日元,接近翻倍,营业利润率接近48%。美国银行研究分析师Takashi Enomoto表示,随着领先制程器件弃用E玻璃,超薄T玻璃的需求也在上升。

争夺配额的行动已经开始。Hachemi形容英伟达直接联系上游材料供应商是前所未有的:“我们第一次看到英伟达这样的终端客户主动接触上游材料供应商,以确保产能、确保自己能拿到货。”令人担心的是,一旦英伟达锁定自己的份额,其他芯片买家就只能争抢剩下的部分。

Nittobo也没有坐等。除了福岛扩产,它还在把台湾工厂的纱线产能翻倍,再把纱线运回日本织布。它还和南亚塑胶达成合作,把部分织造外包出去。这本身就说明市场有多紧:Nittobo正在与自己最大的竞争对手之一合作来缓解瓶颈。到2027年,Nittobo大约20%的玻璃布预计将由南亚织造。

内存墙,以及堆叠给出的答案

封装材料是一个约束。内存带宽是另一个,也是今年芯片会议上另一条独立讨论的主线。ServeTheHome对d-Matrix在Hot Chips 2026演讲的报道列出了问题:模型权重持续增长,KV缓存随上下文长度乘以批大小而扩大。64个用户在1M上下文下,可能意味着大约935 GB的KV缓存。

SRAM能达到带宽目标,但规模很小。一对Corsair SRAM加速卡可达到约300 TB/s、延迟约1 ns,但只能容纳约4 GB。HBM解决了容量那一半,却在带宽上吃力,d-Matrix给出的HBM4封装实际上限约为20 TB/s。这么高的带宽要付出功耗代价:按2.4 pJ/bit计算,通过HBM推送100 TB/s要消耗约1.92 kW,还没算上互联网络本身的流量。

d-Matrix的答案是直接把计算堆叠在DRAM裸片上。一颗台积电N4逻辑裸片用36 um面对面堆叠放在3D DRAM裸片上,公司称这一工艺已经验证、成本低、可量产、良率高。散热挑战是真实的:d-Matrix表示,1-Hi逻辑在上的堆叠只要不超过0.5 W/mm²,就可以用液冷把DRAM保持在100 C以下。垂直3D IO约为0.3到0.4 pJ,比HBM低约10倍。

工程上也有取舍。每个张量引擎每次访问需要128B的flit,而每个通道3个bank时,单次访问只返回96B,浪费约33%的带宽。d-Matrix的解决办法叫stream blocking,把一次32B的部分访问分摊到三个flit上,使过量读取降到零。每卡32GB时,72卡纵向扩展可以承载Kimi K3这类前沿模型在1M上下文下运行。

微软和Rebellions显示出同样的趋势

微软的Maia 200在Hot Chips 2026上展示,由ServeTheHome现场报道。这是一颗3nm芯片,1400亿晶体管,6组HBM3e堆栈,7TB/秒的HBM带宽,750瓦TDP,FP4性能10000 TFLOPS。SoC裸片面积820mm²。微软正在Azure数据中心内部署它,采用只做纵向扩展的网络设计:128个机架、6000颗芯片,通过统一以太网由tier-0和tier-1交换机连接。注意力基准测试显示有效峰值1.65 PFLOPS,集合通信基准测试在BF16 AllReduce下达到接近1.3TB/秒。

在Hot Chips 2025上,Rebellions针对同样的封装问题展示了不同做法。REBEL-Quad使用四个HBM3E位点,提供144GB内存,以UCIe作为芯粒互连,基于三星SF4X和CoWoS-S,每个封装内有四个计算ASIC和四个集成硅电容。ServeTheHome指出它是一张双PCIe Gen5 x16卡,并提到该公司在开发板上现场演示了Llama 3.3 70B,平均每个输出token耗时35.5毫秒。

学术界也在推进。斯坦福、卡内基梅隆、宾夕法尼亚大学、麻省理工和SkyWater Technology报告了在美国晶圆厂制造的第一颗单片3D芯片,于2025年12月在第七十一届IEEE国际电子器件会议上展示。早期硬件测试显示,原型性能约为同类2D芯片的四倍,对更高版本的模拟则指向AI工作负载最高十二倍的提升,其中包括源自Meta LLaMA的负载。领导这项工作的斯坦福教授Subhasish Mitra表示,未来的AI系统会要求硬件性能提升1000倍,靠的就是这类突破。

这些都不会在当前短缺所要求的时间尺度上到来。T玻璃的约束是一个以年计的问题,而可能在未来缓解压力的堆叠与封装研究,目前大多还停留在演示幻灯片和开发板上。

评论 0

资料来源

5
  1. 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
  2. 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  3. 03Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
  4. 04Scientists and U.S. foundry achieve 3D chip breakthrough to accelerate AIEN
  5. 05Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。