推理成本两头分化:ChatGPT 月费 500 美元,开源引擎快 2 倍,每十亿 token 6 美分
据 Business Insider 报道,OpenAI 在 9 月 29 日推出每月 500 美元的 ChatGPT Pro 档,这是该公司迄今最贵的方案,比此前最高档贵了 300 美元。与此同时,更便宜的开源推理栈正在把价格往下压。

新方案在周二的 DevDay 上公布,打包了 ChatGPT Work 和 Codex 中 GPT-6 Astra 的“Ultrafast”算力。Business Insider 报道称,该模式下的 Codex 承诺提速 8 倍。同一篇报道说,OpenAI 将重新开放每月 200 美元的 Pro 方案。该方案在 9 月 10 日暂停过。重开后算力额度砍半,从 20 倍于每月 20 美元的 Plus 档降到 10 倍,GPT-6 Pro 的聊天消息也从每周 200 条减到 100 条。
Codex 工程负责人 Thibault Sottiaux 在周一的 X 帖子中写道,与之前的方案相比,这些变化折算下来 API 支出只有原来的一半。Business Insider 引用了这段话。
“我想提前把这一变化告诉大家,让你们在我们带来好消息之前先弄明白。”他写道。
这是市场的顶部。底部跑得更快。
开源引擎与自调优内核
9 月 30 日,YC 投资的 Magnitude 发布了一个开源推理引擎。它在模型运行前先在用户自己的硬件上编译并调优内核,声称开源模型运行速度最高可比 llama.cpp 快 2 倍。GitHub README 称,在 Apple Silicon 的 Metal 后端上解码快 92%,CUDA 上快 19%,每个 agent 少占 27% 内存,并为并发会话提供共享前缀缓存。
它以 Apache 2.0 许可的桌面应用形式发布,支持 Apple Silicon、NVIDIA、AMD 或纯 CPU,可连接 Pi、OpenCode、Hermes、Codex 以及其他 agent。两小时前,Modal 和 Full Stack Data Lab 发布了一个联合的 SQL 加推理引擎,名为 Quail。Modal 的文章称,Quail 在一块 H100 GPU 上对多表连接查询每分钟处理超过十亿 token,在同一硬件上超过其 vLLM 基线 10 倍以上,在 Modal 上每十亿 token 成本低于 6 美分。在该团队新的 AI-SQL 基准上,相对 vLLM 的几何平均加速为 1.84 倍。文章还点名了两个查询,用来展示这种方法仍有不足的地方。
作者们明确指出,通用引擎不适合这类负载。在 Full Stack Data Lab 的帖子中,Shreya Shankar、Charles Frye、Fergus Finn、Arnav Dhariya、Joseph Barrow 和 Meryem Arik 写道,把数百万次相关的模型调用作为独立请求发给 vLLM 这样的引擎,成本很高。他们举的例子是 QUAIL-B 基准中的 BIO-4 查询:它把 5,000 份长病历报告与 4,144 个反应词做两次过滤,朴素执行会把一条 SQL 语句变成数量极大的模型调用。
价格下限已经公布,而且并不平坦
AICostBudget 的 9 月价格指数以 2026-09-30 UTC 为截止点冻结,覆盖 11 家供应商的 81 条公开记录。它给出的输入价格中位数为每百万 token 1.32 美元,输出价格中位数为 6 美元。在同时给出两个数字的 69 条记录中,输出价格中位数是输入的 5.0 倍。观察到的区间从每百万输入 token 0.10 美元到 30 美元,每百万输出 token 0.10 美元到 180 美元。
同一数据集还给出各供应商的中位数:OpenAI 在 18 条记录上输入 2 美元、输出 11 美元,Google Gemini 在 14 条上为 0.75 美元和 4.125 美元,Anthropic 在 13 条上为 5 美元和 25 美元,xAI 在九条上为 1.25 美元和 2.5 美元,Mistral AI 在七条上为 0.20 美元和 0.60 美元,DeepSeek 在三条上为 0.30 美元和 1.2 美元,Moonshot AI 在三条上为 0.95 美元和 4 美元。在 58 条可比的缓存输入记录中,折扣中位数为 90%;在 44 条批量定价记录中,批量折扣中位数为 50%。忽略这两种模式中的任何一种,比较的都是标价,不是账单。
硬件才是更难有定论的地方。9 月 28 日在 SOSP '26 上,Prasoon Sinha、Dimitrios Liakopoulos、Nathan Lemma 和 Neeraja J. Yadwadkar 的论文 EnerTune 认为,单纯为了抬高利用率而多路复用 GPU 可能推高能耗。作者报告说,他们的能耗感知装箱系统在满足性能 SLO 的同时,相比最先进的基线把能耗降低 1.4 到 2.3 倍,功耗降低 1.3 到 2.6 倍。
本周的成本新闻并不都关于数据中心。Transport & Environment 在 9 月 29 日分析的数据显示,按柴油每 100 公里 6.9 升、纯电每 100 公里 20.2 kWh、电价每 kWh 0.343 欧元计算,电动车每公里运行成本不到柴油车的一半。据 CleanTechnica 引用的欧洲央行估算,柴油车主每加 50 升油箱比年初多付 32 欧元,其中约 16 欧元是额外的炼油利润。
本周还有两条教训完全在 AI 之外。Pinecone 从定价页上撤掉了价格计算器。创始人 Greg Kogan 说,一次 A/B 测试发现没看到计算器的访客注册概率高 16%,联系公司的概率高 90%,而定价支持工单没有增加。电信方面,Light Reading 在 9 月 30 日报道,新加坡的 StarHub 和 M1 正在洽谈合并,新西兰的 2degrees 和 OneNZ 则提议合并双方的无线接入网。
贯穿其中的线索:当一项工作的单位成本足够低时,买家就不再盯着计算器,而是开始看账单。
资料来源
9- 01ChatGPT's new plan costs $500 a monthEN
- 02Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
- 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 04Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 05AI API pricing index - September 2026EN
- 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
- 08The pricing calculator made people more confused about pricingEN
- 09Singapore, New Zealand operators seek partnerships to cut costsEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。