跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

GPU涨价,云厂商报价却在降:推理到底要花多少钱

路透社9月28日报道的Anthropic招股书显示,该公司未来云与算力义务高达5180亿美元,而2025年净亏损为420亿美元。本周公布的一批价格数据说明,买家真正该仔细看的是后一个数字。

人工智能与模型解释林晓雯发布: 2026年9月29日3 分钟阅读资料来源 7
GPU涨价,云厂商报价却在降:推理到底要花多少钱

标价并不是钱花出去的地方。Meetrix对比了AWS和GCP,价格核对日期为9月28日:按需使用的H100在AWS上每小时6.88美元,在GCP上为10.98美元。这37%的差距是真的。但同一张卡在四分之一负载下运行,差距更大。按Meetrix设定的每秒2500个token吞吐量计算,GPU满负荷时每百万token为0.76美元,利用率25%时为3.06美元。

整件事就这一句话:闲置的芯片比选哪家云厂商更贵。

GPUAdvisor追踪14家供应商,称数据最后更新于10月1日。它显示专业云厂商在旧型号卡上大幅低于超大规模云厂商:Hyperstack上A4000为每GPU小时0.15美元,Lium上L40S为0.38美元,RTX 4090为0.40美元。该网站把这些标为追踪得到的近似值,并提醒买家到供应商页面上确认价格。这话说得在理,因为同一页面显示RunPod上RTX 4090为0.74美元。同样的型号,两个价格,差了近一倍。

token账单又是另一个数字

Artificial Analysis于9月29日发布了对Anthropic的Claude Sonnet 5.5的评测。该模型在其智能指数上达到56分,比最高努力档的Opus 5.5低两分,而每个任务约消耗193000个输出token。据该机构称,这比Opus 5.5多约60%,约为最高努力档GPT-6 Astra的七倍。Anthropic的定价没有变,仍是每百万输入token 2美元、每百万输出token 10美元,但每个任务的成本落在7.60美元,比Sonnet 5高出约50%。

同样的价目表,不同的账单。问题出在token数量上。

AI Pricing Guru每天刷新价格,最后更新于10月1日。它给出的通用API可用区间是每百万输出token 0.50至15美元,输入通常便宜两到八倍,在供应商支持的情况下缓存输入还能再省75%到90%。其计算器追踪超过10家供应商的154个在用模型。

检索在生成开始之前就改变了算术。Spheron于9月29日发布成本拆解,指出标准RAG设置每次查询取回五个500 token的片段,就会增加2500 token的上下文。于是一个作为普通对话只需100到200个输入token的问题,在输入侧可能高出15到20倍。

Unblocked在9月29日介绍了自己的路由工作,按成本占70%、延迟占30%的评分,在Baseten、Fireworks和CoreWeave之间调度GLM 5.2的流量。在偏向Baseten的固定顺序下,第一个完整周里该供应商承担了98.5%的任务。该公司称CoreWeave的标价比Baseten低约45%,但它没有性能数据,无法把CoreWeave排进去。采购的现状就是这样:最便宜的那个选项,往往没人测过。

评论 0

资料来源

7
  1. 01Anthropic's IPO prospectus shows sweeping AI vision, surging costs: ReutersEN
  2. 02GPU Costs for LLM Inference: AWS vs GCP (2026)EN
  3. 03Cloud GPU Pricing - Cost Intelligence for H100, A100 & B200EN
  4. 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
  5. 05AI Token Cost Calculator 2026: 154 Models by TierEN
  6. 06RAG Inference Cost Calculator: Cost Per Token, Broken Down (2026)EN
  7. 07Routing LLM traffic across inference providers with TCP-style congestion controlEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。