中国算力供应商:真正拉开差距的是软件
「一张半6000D打败一张B300」,一家中国云计算供应商这样总结推理优化。浪潮信息则谈到,到2030年算力缺口将达3809亿美元。

谈AI成本,人们先看显卡价格。中国基础设施供应商是石科技(METASTONE)认为,更大的余量藏在软件里。这家公司优化了DeepSeek-V4.1-Flash的运行方式,让它只靠PCIe连接的八张卡就能跑起来,不需要卡间的高速总线。
量子位给出的结果是:输入吞吐量从每秒1932个token升到13274个token,即6.87倍。做法是补齐计算内核、重构卡间通信,再复用上下文缓存。公司用一句话总结:「一张半6000D打败一张B300。」意思是,只要把计算编排好,更便宜、更慢的硬件也能赢过更贵的硬件。该公司在十几座数据中心里管理着超过2万P的算力,并称服务可用性高于99.95%。
第二种声音来自浪潮信息。它在AICC 2026大会上引用了IDC的数据:全球AI算力需求在2024年有79%得到满足,2027年为71%,2030年约为77%。需求与供给之间的缺口将达到3809亿美元,是2024年的十倍。token消耗量按累计口径每年增长超过48倍,推理任务到2030年将达到每年4000万亿次。
浪潮信息用硬件回应。SD200 Ultra系统在一台机器里容纳128颗芯片、8TB内存和64TB存储,可以运行万亿参数模型,不必拆分到多个机柜。全对全通信延迟降到0.69微秒。
对算力买家来说,每个token的价格不再只由硬件价格决定。它越来越取决于供应商能多高效地利用手里已有的东西,云服务招标的规则也随之改变。
这个结论很实际。既然只是重写缓存处理、把工作分摊到现有芯片上,就带来了数倍的吞吐量提升,那么买新一代硬件之前,应当先审计软件。能拿同一套基础设施给出实测数值的供应商,今天卖的不是算力,而是节省。这也是中国数据中心运营商应对出口限制最直接的办法:在买不到最强显卡的地方,机房里已有设备的效率最重要。
资料来源
2本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。