跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

算力之争不再是堆卡:从 IDC 报告看国产智算的两条路

在 AICC 2026 上,IDC 报告把算力缺口拆成能力上限与产能两个方向:到 2030 年算力缺口绝对值或达 3809 亿美元,单纯堆卡已难以覆盖 Prefill 与 Decode 的不同负载。

人工智能与模型分析王雅琴发布: 2026年9月23日7 分钟阅读资料来源 2
算力之争不再是堆卡:从 IDC 报告看国产智算的两条路

AI 算力的竞争多年来只有一个字:堆。堆卡、堆机柜、堆发电机。但在 AICC 2026 上,IDC 发布的《2026 年中国人工智能计算力发展评估报告》把这个词拆成了两层:智能上限与智能规模。

先看需求。报告显示,到 2030 年,全球每年的 AI 推理任务将增长 4000 万亿次。单个多轮任务的 Token 消耗,从过去的几十个涨到几十万个。多智能体协同又放大了前两项。IDC 数据显示,从今年到 2030 年,全球 Token 消耗量的复合增长率将达到 4822.6%。

供给却跟不上。报告指出,全球 AI 算力需求满足率从 2024 年的 79% 一路下滑,2027 年预计跌至 71%。即便上游半导体供应链压力缓解,2030 年也只能恢复到 77% 左右。到 2030 年,算力缺口的绝对值将达到 3809 亿美元,扩大到 2024 年的将近十倍。

堆卡为什么不再管用?Agent 时代的推理负载很杂。Prefill 是高并行、高计算密度的任务。Decode 要逐 Token 串行处理,更吃内存带宽。Attention 要频繁访问不断增长的 KV Cache,MoE 还有稀疏计算与大规模路由调度。堆同一种算力,反而容易造成资源配比失衡。

硬件厂商的回应分两条路。一条是能力型,例如超节点 AI 服务器元脑 SD200 Ultra:整机芯片数量从 64 颗增加到 128 颗,显存与扩展存储提升到 8TB 和 64TB。官方称,这台机器可单机装下并运行 2.8 万亿参数的 Kimi K3,甚至支持在单机上部署 10 万亿参数的模型。它通过统一寻址与对称直连把 All to All 通信时延缩到 0.69 微秒,并用超级算子把算子数量降到十分之一。官方称,运行 Kimi K3 的推理性能提升 3 倍以上。

另一条是容量型,例如多元算力机组元脑 HC2000:采用全液冷与高通流供电,单柜供电能力超过 300 千瓦,最多承载 256 张 AI 加速卡,算力密度达到传统风冷机柜的 4 倍,柜内聚合带宽达 200Tbps。它让不同类型的芯片按推理阶段分工:Prefill 用大算力芯片,Decode 用大容量 HBM 芯片。

这两条路有一个共同前提:算力要被用得更满。DeepSeek 公开的 DSec 论文也指向同一方向。Agent 训练需要每秒造出大量沙盒,对集群调度的压力远超传统预训练。对国产智算来说,接下来的竞争不只是谁的卡多,而是谁能把异构资源调度得更细。

评论 0

资料来源

2
  1. 01AI 算力之争不靠堆卡!浪潮信息捅破智算能力天花板ZH
  2. 02DeepSeek 新论文公开 Agent 训练,梁文锋署名ZH

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。