跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

AWS 的 H100 单价更低,但推理账单由利用率决定

9 月 28 日核对的价格显示,AWS 的 H100 每小时 6.88 美元,谷歌云是 10.98 美元。37% 的价差,远不如一块满载 GPU 和一块闲置 GPU 之间四倍的差距重要。

人工智能与模型解释王雅琴发布: 2026年9月29日5 分钟阅读资料来源 6
AWS 的 H100 单价更低,但推理账单由利用率决定

9 月 28 日核对的价格显示,AWS 的 H100 每小时 6.88 美元,谷歌云是 10.98 美元。37% 的价差,远不如一块满载 GPU 和一块闲置 GPU 之间四倍的差距重要。

这组对比来自 meetrix.io。该网站称,它 9 月 28 日核对了 AWS 美国东部和谷歌云 us-central1 的按需标价。同一篇文章写得很直白:无论在哪个云上,利用率 25% 时每个 token 的成本都是满载时的四倍。作者还提醒,算例里用的每秒 token 数只是占位数字,不是基准测试结果。

表格里谁最便宜

按需价格下,Meetrix 算出 AWS 的每块 H100 比谷歌云便宜约 37%,每块 A100 便宜 25%。谷歌唯一占优的是小卡 L4:g2-standard-4 每小时约 0.70 美元,AWS 的 g6.xlarge 是 0.805 美元。文章自己说,这个差距大约是每月 75 美元。

A100 那一行藏着条件。AWS 只按八卡规格卖 A100,40GB 卡是 p4d.24xlarge,80GB 卡是 p4de.24xlarge,每 GPU 小时 2.75 美元,整节点 21.96 美元。如果你只需要一块 A100,谷歌的 a2-highgpu-1g 每小时 3.67 美元才是现实选择,尽管它每块 GPU 更贵。

在数据来源上,meetrix 难得地坦率。它说 AWS 的数字取自 Vantage 的 EC2 追踪器,更新于 2026 年 9 月 28 日。谷歌自己的 GPU 价格页面在客户端渲染表格,无法用程序读取。因此 GCP 的数字来自价格追踪网站:其中三家对 a3-highgpu-8g 一致给出 87.83 美元,第四家列出 88.49 美元。分歧不大,但确实是分歧,知道自己的预算落在哪一侧是有用的。

利用率比到处比价更重要

meetrix 那篇文章的算例按一块 H100 每秒输出 2500 个 token 计算,作者标明这是假设,不是实测。100% 满载时,AWS 折合每百万 token 0.76 美元,GCP 是 1.22 美元。50% 负载时变成 1.53 美元和 2.44 美元。25% 负载时是 3.06 美元和 4.88 美元。

文章建议,要竖着读一列,而不是横着读一行。

这个建议是对的。换云能在同一块 H100 上省下 37%。让卡有四分之三的时间闲置,成本是四倍。前者是采购决策,后者是调度决策,只有后者每天都在累积。

GPUAdvisor 称自己追踪 14 家供应商,最近一次每日核查在 2026 年 10 月 1 日进行。它的数据展示了比价逻辑会走向哪里:Lium 的 L40S 每 GPU 小时 0.38 美元,标注比 AWS 低 89%;Thunder Compute 的 RTX A6000 是 0.35 美元;Hyperstack 的 A4000 是 0.15 美元。同一页面指出,专做 GPU 的云商每 GPU 价格比超大规模云商低两到四倍,并说明价格是近似值,因地区而异。专业云商提供的并不是和超大规模云商一样的产品,但这个价差也不是噪声。

承诺折扣也会改变这个数字,而且方向不一。Meetrix 报告称,AWS 三年预留可省 54% 到 57%,但提醒 GPU 贬值很快。GPUAdvisor 给出的数字是:常开推理端点的一年期承诺可省 35% 到 40%,GCP Spot 的 A100 和 H100 实例最高可省 70%。Meetrix 补充说,目前 AWS 的 Spot 对 H100 和 A10G 可省 53% 到 62%,但 L40S 只有 1%。

唯一涨价的那个容量产品

并非所有价格都在下降。Meetrix 引用 The Register 的报道称,2026 年 1 月 EC2 Capacity Blocks for ML 涨价约 15%,p5e 从每小时 34.61 美元涨到 39.80 美元。文章指出,这与对比表中的按需价格是不同产品。团队在规划会上只报一个 GPU 数字时,丢掉的恰恰就是这类区别。

这一切的背景是一场远不止 GPU 的供应紧张。雅虎财经 9 月 30 日报道,新任苹果 CEO John Ternus 计划小规模裁员并取消部分项目,消息引自彭博社,原因是内存成本上升。报道引用了前 CEO Tim Cook 在最后一次财报电话会上的说法,称内存定价正遭遇百年一遇的洪水。报道还指出,SK 海力士、三星和美光的高端 AI 内存产能在 2026 年大部分时间里已基本售罄。算力和内存面对的是同一批买家。

路透社看到并在 9 月 29 日报道的 Anthropic IPO 招股书,给这种胃口标上了数字:2025 年算力和基础设施支出 73.3 亿美元,比 2024 年增长三倍,占 126.5 亿美元总运营支出的一半以上。未来数年的云、计算和基础设施义务为 5180 亿美元。这是一家买家的远期承诺,比大多数云商一年的 GPU 收入还高。

与此同时,软件侧还在推高账单。Artificial Analysis 9 月 29 日报道,Claude Sonnet 5.5 在最高努力档下完成一项 Intelligence Index 任务约消耗 193000 个输出 token,是它测量过的最重的 token 用量,约为最高档 GPT-6 Astra 的 7 倍。Anthropic 给它的定价与 Sonnet 5 相同,每百万输入/输出 token 2 美元和 10 美元。所以成本落在 token 数量上,而不是价目表上。Artificial Analysis 算出每项任务 7.60 美元,比 Sonnet 5 高约 50%。

路由是另一个杠杆,而且正在自动化。Unblocked 9 月 29 日介绍了一个自适应路由器,按成本和速度给供应商打分,权重分别是 0.7 和 0.3,当某家变差时就切换流量。在此之前,轮询会把 51% 的 GLM 5.2 任务发给价格比 Baseten 高 25% 的 Fireworks。改成固定顺序后,Baseten 承接了 98.5%。该公司说,第三家供应商 CoreWeave 的标价比 Baseten 低约 45%,但它没有性能数据来给它排位。

这些都不说明 AWS 与 GCP 之争是错的。它只说明这是第二个问题。先测利用率,再来争每小时的费率。

评论 0

资料来源

6
  1. 01GPU Costs for LLM Inference: AWS vs GCP (2026)EN
  2. 02Cloud GPU Pricing — Cost Intelligence for H100, A100 & B200EN
  3. 03New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
  4. 04Anthropic's IPO prospectus shows sweeping AI vision, surging costs: ReutersEN
  5. 05Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
  6. 06Routing LLM traffic across inference providers with TCP-style congestion controlEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。