SiFive 学 Arm 模式授权自家 AI 加速器,芯片材料供应吃紧
SiFive 开始对外授权一整套 AI 加速器设计,也就是它的 Intelligence XM 集群。此前它只卖 RISC-V CPU 核,客户包括 Google 和 Tenstorrent。公司称每个集群在每 GHz 下最高提供 16 TOPS 的 INT8 或 8 teraFLOPS 的 BF16 算力。

SiFive 是一家无晶圆厂公司,靠给别人的 AI 芯片提供 RISC-V CPU 核起家。现在它想直接卖加速器。本周发布的 Intelligence XM 系列是一套可授权的集群,客户可以把它放进处理器或系统级芯片,再送去流片。The Register 于 9 月 19 日报道了此事。
基础集群围绕四个 SiFive Intelligence X RISC-V CPU 核搭建,中间接上自研的矩阵运算引擎。每个集群通过一致性集线器接口支持最高 1TB/秒的内存带宽,额定性能为每 GHz 最高 16 TOPS 的 INT8 或 8 teraFLOPS 的 BF16。SiFive 预计基于该设计的大多数芯片运行在 1GHz 左右。
这个每 GHz 的数字需要背景说明。它不是一颗完整的芯片。
实际性能取决于客户放多少个集群、内部如何布线、裸片上还有什么其他模块,以及可用的功耗和散热。SiFive 英国高级副总裁兼总经理 John Ronco 告诉 The Register,基于该设计的大多数芯片会使用四到八个集群。按 1GHz 计算,峰值内存带宽为 4 到 8TB/秒,BF16 算力最高 32 到 64 teraFLOPS。SiFive 的产品幻灯片暗示 512 个集群也在可能性范围内,不过 Ronco 不愿说明该设计能扩展到什么程度。按 512 个集群和 1GHz 计算,该设计将声称约 4 petaFLOPS 的 BF16 矩阵算力,而 Nvidia 规格最高的 Blackwell GPU 为 2.5 petaFLOPS。
Ronco 预计这些集群不会大量用于 AI 训练。FLOPS 不是一切,对带宽受限的推理工作尤其如此,价格、功耗和制程节点都很重要。
Tom's Hardware 引用的分析师指出了 AI 加速器供应的另一个制约因素:T-glass,一种用于 IC 载板有机芯层的低热膨胀系数玻璃纤维布。控制全球约 90% 供应的日本公司日东纺正在将其福岛工厂的产能提高到三倍,但 Tom's Hardware 在 2026 年 3 月 9 日报道称,新增供应要到 2027 年年中才能进入市场。
T-glass 价格上涨了 20% 到 30%,覆铜板等下游材料的交货周期从正常的 8 到 10 周拉长到 20 周以上。元大分析师 Bill Ho 表示:“如今 T-glass 供应更加紧张,供应商已经不再提供交货周期。”
Yole Group 追踪 IC 载板供应链的分析师 Bilal Hachemi 告诉 Tom's Hardware Premium,替换这种材料并不容易,因为 T-glass“具有特定的介电常数和热膨胀系数,对 AI 芯片更合适,尤其是有机芯层”。他补充说,IC 载板行业历来利润微薄,因此“对积层材料、ABF 材料或 T-glass 需求的任何增长都可能造成短缺,因为这违背了这个行业的基本规律。”
Tom's Hardware 引用的 Nvidia 数据显示,中介层尺寸从 Hopper 的 814mm² 增长到 Blackwell 的 1700mm²,增幅 109%,Rubin 和 Feynman 还会进一步扩大。美国银行估计,日东纺电子材料部门的销售额将从 2025 年的 409亿日元(26600万美元)到 2028 年 3 月几乎翻倍至 877亿日元,营业利润率接近 48%。Hachemi 表示,Nvidia 直接接触上游材料供应商是前所未有的。
另外,据报道台积电已停止向中国芯片设计公司算能科技供货,原因是该公司涉嫌违反美国制裁向华为提供组件。The Register 于 10 月 28 日报道了此事。此前台积电就一份类似华为 Ascend 910B 加速器的客户订单向美国官员发出警告。路透社援引两名知情人士的话点名了算能科技。该公司在周日声明中否认相关报道,称其“从未与华为有过任何直接或间接的业务关系”,并已向台积电提交了详细调查报告。与算能科技有关联的中国加密货币设备公司比特大陆也否认参与,称这些指控“虚假且毫无根据”。
华为 Ascend 910B 的额定性能为 320 teraFLOPS 的 FP16 或 640 teraFLOPS 的 Int8,与 Nvidia 的 A100 大致相当。根据美国实体清单规定,台积电于 2020 年停止与华为做生意。
在架构方面,据 ServeTheHome 报道,Rebellions 在 Hot Chips 2025 上展示了其 REBEL-Quad 加速器。该封装结合了四个计算 ASIC、四个 HBM3E 位点共 144GB 内存和四个集成硅电容,基于三星 SF4X 和 CoWoS-S 制造,并使用 UCIe-A 作为芯粒互连。ServeTheHome 报道称,在一块开发板上现场演示了 Llama 3.3 70B,每个输出 token 平均耗时 35.5 毫秒。
d-Matrix 利用 Hot Chips 2026 展示了 Raptor,这款加速器用 36 微米面对面堆叠把一颗台积电 N4 逻辑裸片叠在 3D DRAM 裸片之上。ServeTheHome 报道了该公司的说法:在不超过 0.5 W/mm² 的条件下,1-Hi 逻辑在上的堆叠可以液冷,同时让 DRAM 保持在 100 C 以下。每卡 32GB,配合 4 位权重和 8 位 KV 缓存,d-Matrix 称 72 卡的纵向扩展可以承载 Kimi K3 这类前沿模型,上下文长度 1M。
在客户端方面,Draw Things 表示其带 Neural Accelerators 的 Metal FlashAttention v2.5 在苹果 M5 上的性能比 M4 最高好 4.6 倍,配备 16GiB 内存的 M5 iPad 可以用 Wan 2.2 A14B 模型在五秒内生成 480p 视频。该版本是预览版:公司称 BF16 支持最初因未解决的 bug 而关闭,神经加速器着色器在首次生成时需要 10 秒或更长时间来特化。后续编辑指出,构建版本 1.20251117.1 加入了 BF16 和二进制产物缓存。
资料来源
6- 01SiFive offers drop-in AI accelerator driven by RISC-V CPUsEN
- 02TSMC reportedly cuts off RISC-V chip designer linked to Huawei acceleratorsEN
- 03Shortages of crucial chip packaging material threatens AI accelerator supply chainsEN
- 04d-Matrix Raptor 3D-DRAM Accelerator for Generative Inference at Hot Chips 2026EN
- 05Rebellions REBEL-Quad UCIe and 144GB HBM3E Accelerator at Hot Chips 2025EN
- 06Metal FlashAttention v2.5 w/ Neural Accelerators: delivering breakthrough performance on the Apple M5 chipEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。