OpenAI 推出每月 500 美元的 ChatGPT 套餐,恰逢输入价格中位数 1.32 美元的月度快照
OpenAI 在周二的 DevDay 上宣布推出每月 500 美元的 ChatGPT 订阅套餐。同一周,一份月末快照显示,81 条公开记录中每百万输入 token 的标价中位数为 1.32 美元。

据 Business Insider 报道,OpenAI 在周二的 DevDay 上宣布推出新的顶级订阅套餐 Pro 500,每月 500 美元。这比该公司此前最高档套餐贵 300 美元,折算下来单个席位一年要 6000 美元。
该套餐捆绑了 OpenAI 所称的“Ultrafast”算力,用于 ChatGPT Work 和 Codex 中的 GPT-6 Astra。Business Insider 报道称,这一选项承诺 Codex 内速度提升 8 倍,并包含该公司提供的最高用量额度。同一篇报道称,OpenAI 正在重新开放其较早的每月 200 美元 Pro 套餐。该套餐于 9 月 10 日暂停,重新开放后算力额度砍掉一半:从原先相当于 20 美元 Plus 套餐的 20 倍降至 10 倍,GPT-6 Pro 的每周聊天消息数从 200 条降到 100 条。
OpenAI 负责 Codex 的工程负责人 Thibault Sottiaux 周一在 X 上写道,这些调整折算下来,API 支出是此前套餐的一半。Business Insider 直接引用了他的话。本资料包中没有其他媒体证实这些定价细节,OpenAI 也没有发布本文能够独立核实的公开价格表。
时机之所以重要,是因为 9 月一份已公布 API 定价的快照显示,对大多数工作负载来说,标价下限远达不到每月 500 美元。AICostBudget 的 AI API Pricing Index 以 2026-09-30 UTC 为截止时点,覆盖 11 家供应商的 81 条公开定价记录。其中 69 条带有当前输入 token 标量,观察到的区间从每百万 token 0.10 美元到 30 美元。同样这 69 条记录的输出 token 区间,从每百万 0.10 美元到 180 美元。
折扣、缓存与标价
该指数的主要中位数是每百万输入 token 1.32 美元、每百万输出 token 6 美元,输出与输入的中位数之比为 5.0 倍。这些都是标价,而该指数明确指出,标价并不是大多数买家实际支付的价格。在 58 条可比记录中,观察到的缓存输入折扣从 75% 到 98%,中位数为 90%。在 44 条支持 Batch 的记录中,观察到的批量输入折扣从 20% 到 50%,中位数为 50%。
这一差距正是上周出现的推理引擎和查询优化项目的全部理由。如果一个工作负载能把重复前缀放进缓存、把批量任务放进批处理,每 token 的实际价格就会远低于中位数。如果做不到,标价就是账单。
9 月 30 日发表的两个项目从技术栈的两端攻击这个问题。在数据库一侧,Full Stack Data Lab 于 9 月 30 日发布的 QUAIL 工作同时优化 SQL 查询规划和 LLM 推理。其 BIO-4 基准查询跑在 5000 多份长篇医疗报告和 4144 个反应术语之上,反应列表在两次 join 中被用了两遍。作者认为,把数百万次相关模型调用作为独立请求发给 vLLM 这样的通用引擎成本很高,因为每个 prompt 都要作为一次独立推理请求来渲染和提供服务。
Modal 对同一系统的解读同样标注 9 月 30 日,并给出了数字。Quail 在一块 H100 GPU 上、针对一个多 join 查询,每分钟处理超过十亿 token。Modal 称,在相同硬件上这比其 vLLM 基线快 10 倍以上,而在 Modal 上每十亿 token 成本不到 6 美分。在最新发布的 AI-SQL 基准上,Modal 报告 Quail 比 vLLM 快 1.84 倍,这是按任务取几何平均的结果,其中包括作者特意设计、用来展示 AI-SQL 推理仍有待改进之处的两个查询。
1.84 倍的几何平均值和 10 倍的单查询数字来自同一个团队,不应被当作同一项测量来读。
本地内核与机器人延迟
在客户端一侧,Y Combinator S25 公司 Magnitude 于 9 月 30 日发布了一款开源推理引擎。它在模型运行之前,先在用户自己的设备上编译并调优内核。其 GitHub README 声称,开放模型比 llama.cpp 快最多 2 倍,Metal 上解码快 92%,CUDA 上快 19%,每个 agent 的内存占用少 27%。它支持 Apple Silicon、NVIDIA、AMD 或纯 CPU。这些数字来自项目自己,本资料包中没有独立复现。
机器人推理也在追同一个时钟。MindOn 于 9 月 30 日推出 Mind-1,声称把机器人推理延迟从 82ms 降到 32ms。该公司指出,在末端执行器速度 3 m/s 时,10 ms 延迟对应大约 3 cm 的移动距离,足以影响精确抓取、插入或富接触操作。其速度声明覆盖物流和日常人类环境,来自 MindOn 自己的测试。
学术工作指向了利用率指标所掩盖的一项成本。Prasoon Sinha、Dimitrios Liakopoulos、Nathan Lemma 和 Neeraja J. Yadwadkar 于 9 月 28 日在 SOSP '26 上展示的一篇论文描述了 EnerTune,这是一个服务系统,对共享 GPU 上每个模型的功耗以及共置模型的功耗进行建模。作者报告称,在满足性能 SLO 的前提下,能耗比最先进的基线降低 1.4 倍到 2.3 倍,功耗降低 1.3 倍到 2.6 倍。他们的论点是,纯粹为利用率做优化反而可能抬高能耗,而大规模对每种配置做性能剖析所耗费的能源太多,不切实际。
钱最终落在哪里仍无定论。Light Reading 于 9 月 30 日报道,新加坡的 StarHub 和 M1 正在进行合并谈判,新西兰的 2degrees 和 OneNZ 已提议合并双方的无线网络。StarHub 提醒谈判仍在继续。Light Reading 指出,StarHub 与 M1 合并后的规模大致相当于 Singtel,并称 Singtel 在 6 月据报占有 43% 的移动市场份额,M1 为 22%,StarHub 为 21%,Simba 为 14%。
同一周还有一条定价教训与 GPU 毫无关系。据 Gkogan 于 9 月 30 日发表的第一人称记述,Pinecone 撤下了其定价计算器,原因是发现一个被误解的输入可能把估算值夸大到 1000 倍之多。没有看到该计算器的访客注册的可能性高出 16%,联系公司的可能性高出 90%,而定价相关的支持工单并未增加。十名员工中有七名原本预计计算器版本会胜出。
资料来源
9- 01ChatGPT's new plan costs $500 a monthEN
- 02AI API Pricing Index - September 2026EN
- 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 04Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 05Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 06Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 07Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 08Singapore, New Zealand operators seek partnerships to cut costsEN
- 09The pricing calculator made people more confused about pricingEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。