算力之争不再是堆卡:从 IDC 报告看国产智算的两条路
在 AICC 2026 上,IDC 报告把算力缺口拆成能力上限与产能两个方向:到 2030 年算力缺口绝对值或达 3809 亿美元,单纯堆卡已难以覆盖 Prefill 与 Decode 的不同负载。

AI 算力的竞争多年来只有一个字:堆。堆卡、堆机柜、堆发电机。但在 AICC 2026 上,IDC 发布的《2026 年中国人工智能计算力发展评估报告》把这个词拆成了两层:智能上限与智能规模。
先看需求。报告显示,到 2030 年,全球每年的 AI 推理任务将增长 4000 万亿次。单个多轮任务的 Token 消耗,从过去的几十个涨到几十万个。多智能体协同又放大了前两项。IDC 数据显示,从今年到 2030 年,全球 Token 消耗量的复合增长率将达到 4822.6%。
供给却跟不上。报告指出,全球 AI 算力需求满足率从 2024 年的 79% 一路下滑,2027 年预计跌至 71%。即便上游半导体供应链压力缓解,2030 年也只能恢复到 77% 左右。到 2030 年,算力缺口的绝对值将达到 3809 亿美元,扩大到 2024 年的将近十倍。
堆卡为什么不再管用?Agent 时代的推理负载很杂。Prefill 是高并行、高计算密度的任务。Decode 要逐 Token 串行处理,更吃内存带宽。Attention 要频繁访问不断增长的 KV Cache,MoE 还有稀疏计算与大规模路由调度。堆同一种算力,反而容易造成资源配比失衡。
硬件厂商的回应分两条路。一条是能力型,例如超节点 AI 服务器元脑 SD200 Ultra:整机芯片数量从 64 颗增加到 128 颗,显存与扩展存储提升到 8TB 和 64TB。官方称,这台机器可单机装下并运行 2.8 万亿参数的 Kimi K3,甚至支持在单机上部署 10 万亿参数的模型。它通过统一寻址与对称直连把 All to All 通信时延缩到 0.69 微秒,并用超级算子把算子数量降到十分之一。官方称,运行 Kimi K3 的推理性能提升 3 倍以上。
另一条是容量型,例如多元算力机组元脑 HC2000:采用全液冷与高通流供电,单柜供电能力超过 300 千瓦,最多承载 256 张 AI 加速卡,算力密度达到传统风冷机柜的 4 倍,柜内聚合带宽达 200Tbps。它让不同类型的芯片按推理阶段分工:Prefill 用大算力芯片,Decode 用大容量 HBM 芯片。
这两条路有一个共同前提:算力要被用得更满。DeepSeek 公开的 DSec 论文也指向同一方向。Agent 训练需要每秒造出大量沙盒,对集群调度的压力远超传统预训练。对国产智算来说,接下来的竞争不只是谁的卡多,而是谁能把异构资源调度得更细。
资料来源
2本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。