推理成本算术:GPU 小时价掩盖了什么
GPUAdvisor 的追踪表在 10 月 1 日更新,现已覆盖 14 家出售 H100、H200、A100 和 B200 算力的云厂商。同一款芯片最便宜和最贵的挂牌价差得足够大,单看小时价几乎说明不了什么。

比价网站的增长速度超过了折扣本身。10 月 1 日,GPUAdvisor 表示其云 GPU 价格追踪表覆盖 14 家厂商和所有主流加速卡,并在表格上方印了一句提醒:价格是近似值,随地区和可用性变化,反映的是 2026 年 9 月的估算。这就是市场的现状。挂牌价只是起点,不是账单。
Meetrix 在 9 月 29 日发布了自己的对比,价格于 9 月 28 日核对于美国东部和 us-central1 的按需实例。结论很直接:H100 或 A100 的挂牌价 AWS 更便宜,如果一块 L4 够用,GCP 略便宜。H100 在 AWS 上是每小时 6.88 美元,在 GCP 上是 10.98 美元。
利用率比选哪家云更重要
同一篇文章随后推翻了自己的标题。Meetrix 用一个占位吞吐量 2500 输出 token/s 做了算术,发现当利用率从 100% 降到 25%,AWS H100 上每百万 token 的成本从 0.76 美元涨到 3.06 美元。GCP H100 上同样的变化是从 1.22 美元到 4.88 美元。文章明确说明这个吞吐量是假设而非实测,各行之间的比例关系不依赖它。
所以换云省下的 37% 值得拿。但它小于一个闲置下午的代价。Meetrix 还指出一个数据问题:谷歌自己的 GPU 价格页面在客户端渲染表格,作者无法用程序读取;三个追踪表对 a3-highgpu-8g 的报价一致,都是 87.83 美元,第四个却列出 88.49 美元。这种分歧值得点明,而不是取平均值。
便宜的那一侧有个结构性障碍。AWS 只按 8 卡整机卖 A100:p4d.24xlarge 配 40 GB 卡,p4de.24xlarge 配 80 GB 卡。想要单张 A100 就只能选 GCP 的 a2-highgpu-1g,尽管那里每块 GPU 更贵。Meetrix 给出的 AWS 8 卡 A100 是每小时 21.96 美元,合每块 GPU 2.75 美元,而 GCP 单卡规格是 3.67 美元。
预留和竞价价格让情况更复杂。Meetrix 报告称,3 年预留能在 AWS 上省 54% 到 57%,H100 或 A10G 的竞价折扣在 53% 到 62% 之间,L40S 的竞价折扣只有 1%。它还指出,AWS 把 P4d 和 P4de 的按需价格下调了 33%,P5 下调了 44%,对比的是 2025 年 5 月 31 日的价格。
有一项确实涨了:面向机器学习的 EC2 Capacity Blocks,也就是按固定时间窗预留 GPU 的服务。《The Register》报道称 2026 年 1 月涨价约 15%,p5e 从每小时 34.61 美元涨到 39.80 美元。
同一个模型向三家买
推理成本的另一半根本不在 GPU 上。Unblocked 在 9 月 29 日记录了把开放权重流量分发给 Baseten、Fireworks 和 CoreWeave 的过程,三家都在提供 GLM 5.2,价格和速度各不相同。最初的轮询方案在最后一个完整周里把 51% 的任务发给了 Fireworks,49% 发给 Baseten,尽管 Fireworks 贵 25% 而且更慢。
改成固定顺序后问题解决了,98.5% 的任务流向 Baseten,1.5% 流向 Fireworks。随后运维问题来了:改顺序要改代码再部署,熔断器把一分钟内五次 429 当成全面故障,CoreWeave 的挂牌价(比 Baseten 低约 45%)一直闲置,因为没人有它的性能数据。替代方案按成本和速度给每家打分,权重分别是 0.7 和 0.3,不用工程师介入就能调整流量。文章说这些数字来自其生产环境的 token 账本和日志。
模型层面的 token 行为会直接反映到账单上。Artificial Analysis 在 9 月 29 日报告称,Claude Sonnet 5.5 在其智能指数上得 56 分,比最高努力档的 Opus 5.5 低两分,但每个指数任务约消耗 193000 输出 token。该机构称这是它测过的最高 token 用量,比 Opus 5.5 高约 60%,约为最高努力档 GPT-6 Astra 的 7 倍。Sonnet 5.5 定价为每百万输入 token 2 美元、每百万输出 token 10 美元,与 Sonnet 5 相同,但 Artificial Analysis 算出它每个任务 7.60 美元,比 Sonnet 5 高约 50%。该公司指出评测跑在发布前的部署上,存在影响结构化输出的缺陷,公开版本已修复。
钱流向了别处
路透社看到、CNBC 在 9 月 29 日报道的 Anthropic IPO 招股书,用一行给出了这个市场的需求端:2025 年在算力和基础设施上花了 73.3 亿美元,比 2024 年增长两倍,占 126.5 亿美元总运营支出的一半以上。同一份文件还写明未来数年有 5180 亿美元的云、计算和基础设施义务,以及 2025 年 420 亿美元的净亏损。
内存是另一个地方浮现的约束。雅虎财经在 9 月 30 日报道,据彭博消息,苹果新任首席执行官 John Ternus 正计划小规模裁员和取消项目,原因是内存成本上升;文章引用前首席执行官 Tim Cook 在最后一次财报电话会上形容内存定价遭遇百年一遇的洪水。文章还提到 SK 海力士、三星和美光已将大部分高端 AI 内存产能卖到 2026 年之后。
这些都不说明按小时的 GPU 价格表有错,只说明它不完整。Meetrix 自己的说法最诚实:先解决利用率再下承诺,而且要竖着读一列,而不是横着读一行,因为换云省下的钱,抵不过一个闲置下午的代价。
资料来源
6- 01Cloud GPU Pricing — Cost Intelligence for H100, A100 & B200EN
- 02GPU Costs for LLM Inference: AWS vs GCP (2026)EN
- 03Routing LLM traffic across inference providers with TCP-style congestion controlEN
- 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
- 05Anthropic's IPO prospectus shows AI vision, surging costsEN
- 06New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。