跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

推理成本两头分化:ChatGPT 月费 500 美元,开源引擎快 2 倍,每十亿 token 6 美分

据 Business Insider 报道,OpenAI 在 9 月 29 日推出每月 500 美元的 ChatGPT Pro 档,这是该公司迄今最贵的方案,比此前最高档贵了 300 美元。与此同时,更便宜的开源推理栈正在把价格往下压。

人工智能与模型新闻王雅琴发布: 2026年9月30日5 分钟阅读资料来源 9
推理成本两头分化:ChatGPT 月费 500 美元,开源引擎快 2 倍,每十亿 token 6 美分

新方案在周二的 DevDay 上公布,打包了 ChatGPT Work 和 Codex 中 GPT-6 Astra 的“Ultrafast”算力。Business Insider 报道称,该模式下的 Codex 承诺提速 8 倍。同一篇报道说,OpenAI 将重新开放每月 200 美元的 Pro 方案。该方案在 9 月 10 日暂停过。重开后算力额度砍半,从 20 倍于每月 20 美元的 Plus 档降到 10 倍,GPT-6 Pro 的聊天消息也从每周 200 条减到 100 条。

Codex 工程负责人 Thibault Sottiaux 在周一的 X 帖子中写道,与之前的方案相比,这些变化折算下来 API 支出只有原来的一半。Business Insider 引用了这段话。

“我想提前把这一变化告诉大家,让你们在我们带来好消息之前先弄明白。”他写道。

这是市场的顶部。底部跑得更快。

开源引擎与自调优内核

9 月 30 日,YC 投资的 Magnitude 发布了一个开源推理引擎。它在模型运行前先在用户自己的硬件上编译并调优内核,声称开源模型运行速度最高可比 llama.cpp 快 2 倍。GitHub README 称,在 Apple Silicon 的 Metal 后端上解码快 92%,CUDA 上快 19%,每个 agent 少占 27% 内存,并为并发会话提供共享前缀缓存。

它以 Apache 2.0 许可的桌面应用形式发布,支持 Apple Silicon、NVIDIA、AMD 或纯 CPU,可连接 Pi、OpenCode、Hermes、Codex 以及其他 agent。两小时前,Modal 和 Full Stack Data Lab 发布了一个联合的 SQL 加推理引擎,名为 Quail。Modal 的文章称,Quail 在一块 H100 GPU 上对多表连接查询每分钟处理超过十亿 token,在同一硬件上超过其 vLLM 基线 10 倍以上,在 Modal 上每十亿 token 成本低于 6 美分。在该团队新的 AI-SQL 基准上,相对 vLLM 的几何平均加速为 1.84 倍。文章还点名了两个查询,用来展示这种方法仍有不足的地方。

作者们明确指出,通用引擎不适合这类负载。在 Full Stack Data Lab 的帖子中,Shreya Shankar、Charles Frye、Fergus Finn、Arnav Dhariya、Joseph Barrow 和 Meryem Arik 写道,把数百万次相关的模型调用作为独立请求发给 vLLM 这样的引擎,成本很高。他们举的例子是 QUAIL-B 基准中的 BIO-4 查询:它把 5,000 份长病历报告与 4,144 个反应词做两次过滤,朴素执行会把一条 SQL 语句变成数量极大的模型调用。

价格下限已经公布,而且并不平坦

AICostBudget 的 9 月价格指数以 2026-09-30 UTC 为截止点冻结,覆盖 11 家供应商的 81 条公开记录。它给出的输入价格中位数为每百万 token 1.32 美元,输出价格中位数为 6 美元。在同时给出两个数字的 69 条记录中,输出价格中位数是输入的 5.0 倍。观察到的区间从每百万输入 token 0.10 美元到 30 美元,每百万输出 token 0.10 美元到 180 美元。

同一数据集还给出各供应商的中位数:OpenAI 在 18 条记录上输入 2 美元、输出 11 美元,Google Gemini 在 14 条上为 0.75 美元和 4.125 美元,Anthropic 在 13 条上为 5 美元和 25 美元,xAI 在九条上为 1.25 美元和 2.5 美元,Mistral AI 在七条上为 0.20 美元和 0.60 美元,DeepSeek 在三条上为 0.30 美元和 1.2 美元,Moonshot AI 在三条上为 0.95 美元和 4 美元。在 58 条可比的缓存输入记录中,折扣中位数为 90%;在 44 条批量定价记录中,批量折扣中位数为 50%。忽略这两种模式中的任何一种,比较的都是标价,不是账单。

硬件才是更难有定论的地方。9 月 28 日在 SOSP '26 上,Prasoon Sinha、Dimitrios Liakopoulos、Nathan Lemma 和 Neeraja J. Yadwadkar 的论文 EnerTune 认为,单纯为了抬高利用率而多路复用 GPU 可能推高能耗。作者报告说,他们的能耗感知装箱系统在满足性能 SLO 的同时,相比最先进的基线把能耗降低 1.4 到 2.3 倍,功耗降低 1.3 到 2.6 倍。

本周的成本新闻并不都关于数据中心。Transport & Environment 在 9 月 29 日分析的数据显示,按柴油每 100 公里 6.9 升、纯电每 100 公里 20.2 kWh、电价每 kWh 0.343 欧元计算,电动车每公里运行成本不到柴油车的一半。据 CleanTechnica 引用的欧洲央行估算,柴油车主每加 50 升油箱比年初多付 32 欧元,其中约 16 欧元是额外的炼油利润。

本周还有两条教训完全在 AI 之外。Pinecone 从定价页上撤掉了价格计算器。创始人 Greg Kogan 说,一次 A/B 测试发现没看到计算器的访客注册概率高 16%,联系公司的概率高 90%,而定价支持工单没有增加。电信方面,Light Reading 在 9 月 30 日报道,新加坡的 StarHub 和 M1 正在洽谈合并,新西兰的 2degrees 和 OneNZ 则提议合并双方的无线接入网。

贯穿其中的线索:当一项工作的单位成本足够低时,买家就不再盯着计算器,而是开始看账单。

评论 0

资料来源

9
  1. 01ChatGPT's new plan costs $500 a monthEN
  2. 02Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
  3. 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  4. 04Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  5. 05AI API pricing index - September 2026EN
  6. 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  7. 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  8. 08The pricing calculator made people more confused about pricingEN
  9. 09Singapore, New Zealand operators seek partnerships to cut costsEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。