GPU涨价,云厂商报价却在降:推理到底要花多少钱
路透社9月28日报道的Anthropic招股书显示,该公司未来云与算力义务高达5180亿美元,而2025年净亏损为420亿美元。本周公布的一批价格数据说明,买家真正该仔细看的是后一个数字。

标价并不是钱花出去的地方。Meetrix对比了AWS和GCP,价格核对日期为9月28日:按需使用的H100在AWS上每小时6.88美元,在GCP上为10.98美元。这37%的差距是真的。但同一张卡在四分之一负载下运行,差距更大。按Meetrix设定的每秒2500个token吞吐量计算,GPU满负荷时每百万token为0.76美元,利用率25%时为3.06美元。
整件事就这一句话:闲置的芯片比选哪家云厂商更贵。
GPUAdvisor追踪14家供应商,称数据最后更新于10月1日。它显示专业云厂商在旧型号卡上大幅低于超大规模云厂商:Hyperstack上A4000为每GPU小时0.15美元,Lium上L40S为0.38美元,RTX 4090为0.40美元。该网站把这些标为追踪得到的近似值,并提醒买家到供应商页面上确认价格。这话说得在理,因为同一页面显示RunPod上RTX 4090为0.74美元。同样的型号,两个价格,差了近一倍。
token账单又是另一个数字
Artificial Analysis于9月29日发布了对Anthropic的Claude Sonnet 5.5的评测。该模型在其智能指数上达到56分,比最高努力档的Opus 5.5低两分,而每个任务约消耗193000个输出token。据该机构称,这比Opus 5.5多约60%,约为最高努力档GPT-6 Astra的七倍。Anthropic的定价没有变,仍是每百万输入token 2美元、每百万输出token 10美元,但每个任务的成本落在7.60美元,比Sonnet 5高出约50%。
同样的价目表,不同的账单。问题出在token数量上。
AI Pricing Guru每天刷新价格,最后更新于10月1日。它给出的通用API可用区间是每百万输出token 0.50至15美元,输入通常便宜两到八倍,在供应商支持的情况下缓存输入还能再省75%到90%。其计算器追踪超过10家供应商的154个在用模型。
检索在生成开始之前就改变了算术。Spheron于9月29日发布成本拆解,指出标准RAG设置每次查询取回五个500 token的片段,就会增加2500 token的上下文。于是一个作为普通对话只需100到200个输入token的问题,在输入侧可能高出15到20倍。
Unblocked在9月29日介绍了自己的路由工作,按成本占70%、延迟占30%的评分,在Baseten、Fireworks和CoreWeave之间调度GLM 5.2的流量。在偏向Baseten的固定顺序下,第一个完整周里该供应商承担了98.5%的任务。该公司称CoreWeave的标价比Baseten低约45%,但它没有性能数据,无法把CoreWeave排进去。采购的现状就是这样:最便宜的那个选项,往往没人测过。
资料来源
7- 01Anthropic's IPO prospectus shows sweeping AI vision, surging costs: ReutersEN
- 02GPU Costs for LLM Inference: AWS vs GCP (2026)EN
- 03Cloud GPU Pricing - Cost Intelligence for H100, A100 & B200EN
- 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
- 05AI Token Cost Calculator 2026: 154 Models by TierEN
- 06RAG Inference Cost Calculator: Cost Per Token, Broken Down (2026)EN
- 07Routing LLM traffic across inference providers with TCP-style congestion controlEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。