跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

T玻璃短缺,AI加速器供应链吃紧

一种叫T玻璃的特种玻璃纤维布,成了AI加速器生产的最新瓶颈。日本日东纺控制着全球约90%的供应,价格已涨20%到30%,交货周期拉长到20周以上。

科技分析王雅琴发布: 2026年9月27日7 分钟阅读资料来源 4
T玻璃短缺,AI加速器供应链吃紧

讲AI加速器,人们通常从英伟达的GPU路线图或台积电的代工产能说起。但据Tom's Hardware报道,卡住脖子的是一家日本企业。日东纺控制着全球约90%的特种玻璃纤维布T玻璃,每一颗先进AI芯片的封装里都有这种材料。需求已经超过供给。

T玻璃是一种低热膨胀系数的玻璃布,用在IC载板的有机芯层,也就是芯片与印刷电路板之间的互连层。它让尺寸大、发热高的封装保持形状稳定。AI处理器越做越大、温度越来越高,这件事就越难办。据Tom's Hardware报道,要让AI处理器保持平整、正常工作,物理上离不开T玻璃。

为什么供应没法说开就开

日东纺正在把日本福岛工厂的产能提高到原来的三倍。新增供应要到2027年年中才能进入市场。这个时间表很关键,因为T玻璃不是能快速替代、迅速扩产的大宗商品。生产它需要专门的电熔炉,炉温在1600至1700摄氏度。工艺是先把富含二氧化硅的玻璃熔化,再纺成纱线,最后织成超薄布。Tom's Hardware报道称,要把这套规模做起来,需要多年的投资和经验。

另一种玻璃纤维E玻璃用法相同,但价格更低,主要供微控制器和较老的移动处理器等低端芯片使用。T玻璃胜在耐热强度。功耗更高的芯片,尤其是大型2.5D和3D封装,首选T玻璃。

Yole Group分析师Bilal Hachemi跟踪IC载板供应链。他对Tom's Hardware Premium说,替代T玻璃并不容易,因为它“具有特定的介电常数和热膨胀系数值,更适合AI芯片,尤其是用于有机芯层”。Hachemi还指出,IC载板行业历来利润率微薄,即便是温和的需求激增也可能引发短缺。他说:“增层材料、ABF材料或T玻璃的需求只要增加,就可能造成潜在短缺,因为这违背了这个行业的基本规律。”

紧缺背后的数字

当前的紧张局面,源于超大规模云厂商不断建造更大的芯片封装,每颗芯片消耗的T玻璃也随之增加。根据Tom's Hardware引用的英伟达数据,中介层尺寸已从Hopper架构的814mm2增长到Blackwell的1700mm2,增幅109%,即将推出的Rubin和Feynman世代还会进一步扩大。

美国银行估计,日东纺电子材料部门的销售额将从2025年的409亿日元(2.66亿美元)增长近一倍,到2028年3月达到877亿日元,营业利润率接近48%。美国银行研究分析师Takashi Enomoto表示,T玻璃布的需求“似乎可能比原先预期增长更多”。他补充说,此前关注点一直放在用于GPU和CPU半封装(semi package)的厚T玻璃上,但随着领先器件从E玻璃转向,超薄T玻璃的需求现在可能上升。

对配额的争夺已经出现了不寻常的一幕。Hachemi表示,英伟达直接联系日东纺这样的上游材料供应商,是前所未有的。他对Tom's Hardware说:“我们第一次看到英伟达这个终端客户直接接触上游材料供应商,以锁定产能并确保自己能拿到货。”令人担忧的是,一旦英伟达锁定自己的份额,其他芯片买家就只能争抢剩下的部分。

日东纺并不只依赖福岛。它正在把台湾工厂的原纱产能提高一倍,再把纱线进口回日本织布。它还和南亚塑胶达成合作,把部分织造工序外包出去。据Tom's Hardware报道,到2027年,日东纺约20%的玻璃布预计将由南亚塑胶织造。

元大证券分析师Bill Ho直言下游局面:“由于T玻璃供应如今更加紧张,供应商已经不再提供交货周期。”下游材料覆铜板的交货周期已从正常的8至10周延长到20周以上,价格上涨了20%至30%。

一个平行问题:推理究竟需要多少内存

材料制约的是供应端,内存带宽制约的则是设计端。在Hot Chips 2026上,d-Matrix展示了面向生成式推理的Raptor 3D-DRAM加速器。据ServeTheHome报道,它对问题的表述值得一读,说明了AI硬件卡在哪里。模型权重持续增长,KV缓存则随上下文长度乘以批量大小而扩大。ServeTheHome的文章举了一个例子:64个用户、1M上下文,产生约935 GB的KV缓存。

SRAM能达到带宽目标,但规模很小。一对Corsair SRAM加速卡在约1 ns延迟下达到约300 TB/s,容量却只有约4 GB。原因是6T SRAM单元比DRAM单元大约10倍,在GB规模下漏电可达数十瓦。HBM解决了容量问题,却在带宽上吃力。ServeTheHome报道称,d-Matrix提到,英伟达Vera Rubin和AMD Instinct MI455等HBM4封装的实际上限约为20 TB/s。在2.4 pJ/bit下,通过HBM推送100 TB/s将消耗约1.92 kW,还没算上互连流量。

d-Matrix的答案是直接在DRAM裸片上堆叠计算单元,把台积电N4逻辑裸片放在3D DRAM裸片之上,面对面堆叠间距36 um。据ServeTheHome报道,垂直3D IO约为0.3至0.4 pJ,比HBM低约10倍。在每卡32GB、4位权重和8位KV缓存下,d-Matrix称其规模设计可在72卡的scale-up内装下一个1M上下文的前沿模型,例如Kimi K3。

难点在工程细节。每个张量引擎每次访问需要128B的flit,但每通道3个bank时单次访问只返回96B。交付一个flit需要两次访问,取回192B,在接近33 TB/s时浪费约33%的带宽。d-Matrix的应对办法是流式分块(stream blocking),把一次32B的部分访问分摊到三个flit上。以0.37 pJ/bit传输100 TB/s,仅I/O就要消耗296 W。

超大规模厂商谨慎自研

微软在同一场会议上展示的Maia 200,据ServeTheHome报道,体现了权衡的另一端。这颗3nm芯片有1400亿个晶体管、六堆HBM3e、7TB/s的HBM带宽、1万TFLOPS的FP4性能和750瓦TDP,SoC裸片面积820mm2。微软为它配了全连接的四路拓扑,完全没有scale-out网络。幻灯片中展示的6000颗芯片、128个机架全部是scale-up。该公司的软件定义本地访问数据流架构让数据访问保持在本地,并在编译时确定数据流,这换来了确定性,也减少了互连流量。

这些都没有放松材料约束。阿里巴巴的真武V900宣布配备216GB内存和1200GB/s的芯片间带宽,计划于2027年第一季度量产,这又给排队名单添了一个买家,SemiEngineering 9月25日的一周回顾如此指出。据《首尔经济日报》报道,三星据称计划在2027年将HBM4系列产量至少提高一倍。长鑫存储表示其第五代G5 DRAM已进入量产,有源区半间距为11.95nm,但未披露制造良率。内存更多,加速器更多,载板就更多;载板更多,T玻璃就更多。

令人不安的结论是:2027年约束AI算力的关键,可能不是光刻,也不是HBM供应,而是一块由福岛一家公司织造的玻璃布。还有一家竞争对手帮忙织造,以及没人愿意给出的交货周期。

评论 0

资料来源

4
  1. 01Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
  2. 02d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
  3. 03Microsoft's Maia 200 AI Accelerator at Hot Chips 2026EN
  4. 04Chip Industry Week In ReviewEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。