跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

OpenAI 在 AMD Turin 主机上运行 Jalapeno ASIC,液冷取代风冷

OpenAI 硬件主管 10 月 2 日表示,公司正在部署 Jalapeno ASIC,搭配配备 1.5TB 内存的 AMD EPYC Turin 主机。随着数据中心建设面临风冷无法再满足的散热极限,这一选择凸显了行业趋势。

科技分析王雅琴发布: 2026年10月2日6 分钟阅读资料来源 8
OpenAI 在 AMD Turin 主机上运行 Jalapeno ASIC,液冷取代风冷

据 Tom's Hardware 10 月 2 日报道,OpenAI 正在内部部署新的 Jalapeno ASIC,搭配 AMD EPYC Turin 主机,每台主机配备 1.5TB 内存。OpenAI 硬件副总裁兼硬件主管 Richard Ho 将该选择称为“务实”的,并表示 Nvidia 的新 Vera CPU 在成熟度上“稍微落后一点”。

对于一家严重依赖 Nvidia 芯片的公司来说,这一承认颇为引人注目。Ho 将其定位为风险管理,而非偏好。

“我们设计该方案的方式主要是为了降低风险,并能够快速完成设计,”Ho 告诉 Tom's Hardware Premium。“在 Jalapeno 项目中,我们试图做出非常务实的决定。我们在性能和成本目标上保持进取,但不想承担不必要的风险。”

据同一报道,机架级部署首先由 SemiAnalysis 描述。Tom's Hardware 指出,基于 Arm 的替代方案,如 Google Cloud 的 Axiom、AWS 的 Graviton 和 Arm 自家的 AGI 芯片,定位为智能体 CPU,旨在加速智能体工作负载运行的推理循环。Turin 是 x86 架构。OpenAI 依然选择了它,Ho 的回答表明,周边平台的成熟度比指令集更重要。

为什么机架越来越热

上游的硬件选择对下游有物理后果。Wanma Technology 在 9 月 29 日发布的液冷机柜指南中指出,传统风冷服务器机柜的上限在每机架 8 至 10 千瓦之间,这一阈值是在处理器功耗较低的时代设定的。高性能计算芯片现在的功耗达到每单元 700 瓦、1200 瓦甚至更高,在单个机柜中部署多个这样的芯片会超过强制风冷所能散热的范围。

结果是热节流、性能损失,或者如果散热跟不上,直接故障。Wanma 表示,对于大规模部署现代计算的人来说,转向液冷是一种必要性,而非优化。

CoolIT 在 IEEE Spectrum 于 9 月 22 日发布的赞助文章中给出了更具体的数字:超过每机架 250 千瓦后,液气混合方案不再有效,因为 70/30 的液气比例仍剩下 75 千瓦的热量需要空气系统带走。CoolIT 表示,液冷可以带走几乎所有热量,空气负载降至 1% 以下,这使得服务器可以无风扇运行。该公司称,其回路采用模块化冷板块构建,已在六代无风扇设计中得到验证。

这是供应商的表述,应如此解读。但这一方向与运营商的采购行为一致。

CDU 获得认证徽章

Nvidia 于 9 月 21 日着手标准化供应链的一部分,宣布 DSX Ready,这是一个针对符合其 DSX AI 工厂参考设计要求的合作伙伴产品的认证计划。该计划启动时包含两个类别:电池储能系统和冷却分配单元。启动时获得认证的 BESS 产品来自 Hitachi Energy、LG Energy Solution 和 Tesla;获得认证的 CDU 来自 LG Electronics、LiquidStack 和 Vertiv。

Nvidia 的博客明确说明了徽章的局限性。通过认证“不能替代站点级工程,也不意味着站点级稳定性”,博客称。对于 CDU,该路径使用自认证套件来确定特定产品是否满足适用的功能要求。构建者仍需确定认证单元如何适应其站点、配置和运营需求。

八天后,9 月 29 日,Trane Technologies 在爱尔兰 Swords 的 Yotta 2026 上宣布了 LiquidStack CDU 2.X 平台。HPCwire 报道该单元架构无关,流量能力高达每分钟 3750 升,压力为 3.5 巴,设计用于支持当前 GPU 平台,并为包括 Nvidia Vera Rubin 在内的下一代平台预留空间。

“运营商需要能够随着 GPU 平台和机架密度演变而适应的冷却基础设施,”Trane Technologies LiquidStack 总经理 Scott Smith 在公告中表示。“CDU 2.X 将客户今天所需的性能和灵活性,与为未来做好准备的空间结合起来。”

同一公告提到设施入口温度高达 45C,以及旨在从源头减少谐波失真的超低谐波 VFD 架构。支持行尾和机架邻近部署。

安装是容易的部分

LiquidStack 要约与捕获管理总监 Kevin Roof 在 Data Center POST 中认为,行业问错了问题。部署受到关注,他写道,但运营决定了性能能否持续十年。安装以周衡量;运营以年衡量。

他的具体警告是关于爆炸半径。通过计算冗余 CDU 来评估韧性,忽略了故障如何在整个流体分配和控制网络中传播。他还指出性能漂移,认为实时运营数据让运营商能够在组件实际故障前捕捉到退化。在这种解读下,冷却回路是一个互联系统,机架配置、加速器或控制策略的变化可能会改变回路其他地方的行为。

制造公差也导致同样的问题。XEBEC Deburring Technologies 指出,冷板具有复杂的内部通道、交叉孔、加工通道和密封表面,加工会留下毛刺。松动的颗粒会造成污染担忧;密封区域附近的毛刺会复杂化组装。该公司的观点是,去毛刺应属于加工过程的一部分,而不是事后的人工补救,这是一个供应商论点,但指向了真实的检查负担。

流体,以及买家真正问的问题

Telecomate 的直接对芯片(DTC)常见问题解答,面向网络工程师和采购团队,解决了冷板模块是否可以在非导电介电流体上运行的问题。答案是肯定的,但有注意事项:介电材料消除了水基回路的短路风险,但通常导热系数较低,粘度较高,因此流量、泵尺寸和微通道几何形状必须相应指定。根据 FAQ,大多数主要 DTC 供应商都发布了批准流体列表和材料兼容性矩阵,涵盖铜、铝、不锈钢、EPDM 和氟聚合物垫圈。

FAQ 还区分了单相和两相介电 DTC。单相保持流体为液态,依赖显热升高;两相允许流体在芯片表面沸腾,并在远程热交换器中冷凝,以潜能形式移动热量。对于电信线路卡和 1U-2U 交换机,FAQ 称单相是更务实的选择,将两相保留给每封装功耗高于约 500 瓦的极高 TDP ASIC。

这是来自技术 FAQ 的指导,而非基准测试,同样的注意事项也适用于选择指南。运营图景比营销更确定。

这就是为什么 OpenAI 的披露超越了一个芯片计划。选择 Turin 主机并与其一起运行 Jalapeno 是一个计算决策,但这些机架中的每一个都落在必须移除热量的设施中。在 Wanma 描述的 8-10 千瓦风冷上限和 CoolIT 引用的 250 千瓦阈值之间,混合设计的空间迅速缩小。供应商正在通过认证计划、高流量 CDU 和流体兼容性列表做出回应。与此同时,运营商被告知,困难的部分始于开箱之后。

评论 0

资料来源

8
  1. 01OpenAI's Jalapeno ASICs are deployed alongside AMD EPYC 'Turin' CPUs as hostsEN
  2. 02How Liquid-Cooled Server Cabinets Are Reshaping Data Center Infrastructure for AI WorkloadsEN
  3. 03The Future Is Fanless: 100% Heat Capture for Liquid Cooled AI ServersEN
  4. 04NVIDIA Launches DSX Ready to Qualify Power and Cooling Products for AI FactoriesEN
  5. 05LiquidStack CDU 2.X Brings Flexible Cooling to AI and HPC Data CentersEN
  6. 06The Real Challenges of Liquid Cooling Begin After InstallationEN
  7. 07Data Center Liquid Cooling: Deburring and Surface Finishing MatterEN
  8. 08Direct-to-Chip Liquid Cooling FAQ: Expert Answers to Technical Deployment QuestionsEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。