跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

推理成本算术:GPU 小时价掩盖了什么

GPUAdvisor 的追踪表在 10 月 1 日更新,现已覆盖 14 家出售 H100、H200、A100 和 B200 算力的云厂商。同一款芯片最便宜和最贵的挂牌价差得足够大,单看小时价几乎说明不了什么。

人工智能与模型解释林晓雯发布: 2026年9月29日5 分钟阅读资料来源 6
推理成本算术:GPU 小时价掩盖了什么

比价网站的增长速度超过了折扣本身。10 月 1 日,GPUAdvisor 表示其云 GPU 价格追踪表覆盖 14 家厂商和所有主流加速卡,并在表格上方印了一句提醒:价格是近似值,随地区和可用性变化,反映的是 2026 年 9 月的估算。这就是市场的现状。挂牌价只是起点,不是账单。

Meetrix 在 9 月 29 日发布了自己的对比,价格于 9 月 28 日核对于美国东部和 us-central1 的按需实例。结论很直接:H100 或 A100 的挂牌价 AWS 更便宜,如果一块 L4 够用,GCP 略便宜。H100 在 AWS 上是每小时 6.88 美元,在 GCP 上是 10.98 美元。

利用率比选哪家云更重要

同一篇文章随后推翻了自己的标题。Meetrix 用一个占位吞吐量 2500 输出 token/s 做了算术,发现当利用率从 100% 降到 25%,AWS H100 上每百万 token 的成本从 0.76 美元涨到 3.06 美元。GCP H100 上同样的变化是从 1.22 美元到 4.88 美元。文章明确说明这个吞吐量是假设而非实测,各行之间的比例关系不依赖它。

所以换云省下的 37% 值得拿。但它小于一个闲置下午的代价。Meetrix 还指出一个数据问题:谷歌自己的 GPU 价格页面在客户端渲染表格,作者无法用程序读取;三个追踪表对 a3-highgpu-8g 的报价一致,都是 87.83 美元,第四个却列出 88.49 美元。这种分歧值得点明,而不是取平均值。

便宜的那一侧有个结构性障碍。AWS 只按 8 卡整机卖 A100:p4d.24xlarge 配 40 GB 卡,p4de.24xlarge 配 80 GB 卡。想要单张 A100 就只能选 GCP 的 a2-highgpu-1g,尽管那里每块 GPU 更贵。Meetrix 给出的 AWS 8 卡 A100 是每小时 21.96 美元,合每块 GPU 2.75 美元,而 GCP 单卡规格是 3.67 美元。

预留和竞价价格让情况更复杂。Meetrix 报告称,3 年预留能在 AWS 上省 54% 到 57%,H100 或 A10G 的竞价折扣在 53% 到 62% 之间,L40S 的竞价折扣只有 1%。它还指出,AWS 把 P4d 和 P4de 的按需价格下调了 33%,P5 下调了 44%,对比的是 2025 年 5 月 31 日的价格。

有一项确实涨了:面向机器学习的 EC2 Capacity Blocks,也就是按固定时间窗预留 GPU 的服务。《The Register》报道称 2026 年 1 月涨价约 15%,p5e 从每小时 34.61 美元涨到 39.80 美元。

同一个模型向三家买

推理成本的另一半根本不在 GPU 上。Unblocked 在 9 月 29 日记录了把开放权重流量分发给 Baseten、Fireworks 和 CoreWeave 的过程,三家都在提供 GLM 5.2,价格和速度各不相同。最初的轮询方案在最后一个完整周里把 51% 的任务发给了 Fireworks,49% 发给 Baseten,尽管 Fireworks 贵 25% 而且更慢。

改成固定顺序后问题解决了,98.5% 的任务流向 Baseten,1.5% 流向 Fireworks。随后运维问题来了:改顺序要改代码再部署,熔断器把一分钟内五次 429 当成全面故障,CoreWeave 的挂牌价(比 Baseten 低约 45%)一直闲置,因为没人有它的性能数据。替代方案按成本和速度给每家打分,权重分别是 0.7 和 0.3,不用工程师介入就能调整流量。文章说这些数字来自其生产环境的 token 账本和日志。

模型层面的 token 行为会直接反映到账单上。Artificial Analysis 在 9 月 29 日报告称,Claude Sonnet 5.5 在其智能指数上得 56 分,比最高努力档的 Opus 5.5 低两分,但每个指数任务约消耗 193000 输出 token。该机构称这是它测过的最高 token 用量,比 Opus 5.5 高约 60%,约为最高努力档 GPT-6 Astra 的 7 倍。Sonnet 5.5 定价为每百万输入 token 2 美元、每百万输出 token 10 美元,与 Sonnet 5 相同,但 Artificial Analysis 算出它每个任务 7.60 美元,比 Sonnet 5 高约 50%。该公司指出评测跑在发布前的部署上,存在影响结构化输出的缺陷,公开版本已修复。

钱流向了别处

路透社看到、CNBC 在 9 月 29 日报道的 Anthropic IPO 招股书,用一行给出了这个市场的需求端:2025 年在算力和基础设施上花了 73.3 亿美元,比 2024 年增长两倍,占 126.5 亿美元总运营支出的一半以上。同一份文件还写明未来数年有 5180 亿美元的云、计算和基础设施义务,以及 2025 年 420 亿美元的净亏损。

内存是另一个地方浮现的约束。雅虎财经在 9 月 30 日报道,据彭博消息,苹果新任首席执行官 John Ternus 正计划小规模裁员和取消项目,原因是内存成本上升;文章引用前首席执行官 Tim Cook 在最后一次财报电话会上形容内存定价遭遇百年一遇的洪水。文章还提到 SK 海力士、三星和美光已将大部分高端 AI 内存产能卖到 2026 年之后。

这些都不说明按小时的 GPU 价格表有错,只说明它不完整。Meetrix 自己的说法最诚实:先解决利用率再下承诺,而且要竖着读一列,而不是横着读一行,因为换云省下的钱,抵不过一个闲置下午的代价。

评论 0

资料来源

6
  1. 01Cloud GPU Pricing — Cost Intelligence for H100, A100 & B200EN
  2. 02GPU Costs for LLM Inference: AWS vs GCP (2026)EN
  3. 03Routing LLM traffic across inference providers with TCP-style congestion controlEN
  4. 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
  5. 05Anthropic's IPO prospectus shows AI vision, surging costsEN
  6. 06New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。