跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

OpenAI 推出每月 500 美元的 ChatGPT 套餐,恰逢输入价格中位数 1.32 美元的月度快照

OpenAI 在周二的 DevDay 上宣布推出每月 500 美元的 ChatGPT 订阅套餐。同一周,一份月末快照显示,81 条公开记录中每百万输入 token 的标价中位数为 1.32 美元。

人工智能与模型分析林晓雯发布: 2026年9月30日5 分钟阅读资料来源 9
OpenAI 推出每月 500 美元的 ChatGPT 套餐,恰逢输入价格中位数 1.32 美元的月度快照

据 Business Insider 报道,OpenAI 在周二的 DevDay 上宣布推出新的顶级订阅套餐 Pro 500,每月 500 美元。这比该公司此前最高档套餐贵 300 美元,折算下来单个席位一年要 6000 美元。

该套餐捆绑了 OpenAI 所称的“Ultrafast”算力,用于 ChatGPT Work 和 Codex 中的 GPT-6 Astra。Business Insider 报道称,这一选项承诺 Codex 内速度提升 8 倍,并包含该公司提供的最高用量额度。同一篇报道称,OpenAI 正在重新开放其较早的每月 200 美元 Pro 套餐。该套餐于 9 月 10 日暂停,重新开放后算力额度砍掉一半:从原先相当于 20 美元 Plus 套餐的 20 倍降至 10 倍,GPT-6 Pro 的每周聊天消息数从 200 条降到 100 条。

OpenAI 负责 Codex 的工程负责人 Thibault Sottiaux 周一在 X 上写道,这些调整折算下来,API 支出是此前套餐的一半。Business Insider 直接引用了他的话。本资料包中没有其他媒体证实这些定价细节,OpenAI 也没有发布本文能够独立核实的公开价格表。

时机之所以重要,是因为 9 月一份已公布 API 定价的快照显示,对大多数工作负载来说,标价下限远达不到每月 500 美元。AICostBudget 的 AI API Pricing Index 以 2026-09-30 UTC 为截止时点,覆盖 11 家供应商的 81 条公开定价记录。其中 69 条带有当前输入 token 标量,观察到的区间从每百万 token 0.10 美元到 30 美元。同样这 69 条记录的输出 token 区间,从每百万 0.10 美元到 180 美元。

折扣、缓存与标价

该指数的主要中位数是每百万输入 token 1.32 美元、每百万输出 token 6 美元,输出与输入的中位数之比为 5.0 倍。这些都是标价,而该指数明确指出,标价并不是大多数买家实际支付的价格。在 58 条可比记录中,观察到的缓存输入折扣从 75% 到 98%,中位数为 90%。在 44 条支持 Batch 的记录中,观察到的批量输入折扣从 20% 到 50%,中位数为 50%。

这一差距正是上周出现的推理引擎和查询优化项目的全部理由。如果一个工作负载能把重复前缀放进缓存、把批量任务放进批处理,每 token 的实际价格就会远低于中位数。如果做不到,标价就是账单。

9 月 30 日发表的两个项目从技术栈的两端攻击这个问题。在数据库一侧,Full Stack Data Lab 于 9 月 30 日发布的 QUAIL 工作同时优化 SQL 查询规划和 LLM 推理。其 BIO-4 基准查询跑在 5000 多份长篇医疗报告和 4144 个反应术语之上,反应列表在两次 join 中被用了两遍。作者认为,把数百万次相关模型调用作为独立请求发给 vLLM 这样的通用引擎成本很高,因为每个 prompt 都要作为一次独立推理请求来渲染和提供服务。

Modal 对同一系统的解读同样标注 9 月 30 日,并给出了数字。Quail 在一块 H100 GPU 上、针对一个多 join 查询,每分钟处理超过十亿 token。Modal 称,在相同硬件上这比其 vLLM 基线快 10 倍以上,而在 Modal 上每十亿 token 成本不到 6 美分。在最新发布的 AI-SQL 基准上,Modal 报告 Quail 比 vLLM 快 1.84 倍,这是按任务取几何平均的结果,其中包括作者特意设计、用来展示 AI-SQL 推理仍有待改进之处的两个查询。

1.84 倍的几何平均值和 10 倍的单查询数字来自同一个团队,不应被当作同一项测量来读。

本地内核与机器人延迟

在客户端一侧,Y Combinator S25 公司 Magnitude 于 9 月 30 日发布了一款开源推理引擎。它在模型运行之前,先在用户自己的设备上编译并调优内核。其 GitHub README 声称,开放模型比 llama.cpp 快最多 2 倍,Metal 上解码快 92%,CUDA 上快 19%,每个 agent 的内存占用少 27%。它支持 Apple Silicon、NVIDIA、AMD 或纯 CPU。这些数字来自项目自己,本资料包中没有独立复现。

机器人推理也在追同一个时钟。MindOn 于 9 月 30 日推出 Mind-1,声称把机器人推理延迟从 82ms 降到 32ms。该公司指出,在末端执行器速度 3 m/s 时,10 ms 延迟对应大约 3 cm 的移动距离,足以影响精确抓取、插入或富接触操作。其速度声明覆盖物流和日常人类环境,来自 MindOn 自己的测试。

学术工作指向了利用率指标所掩盖的一项成本。Prasoon Sinha、Dimitrios Liakopoulos、Nathan Lemma 和 Neeraja J. Yadwadkar 于 9 月 28 日在 SOSP '26 上展示的一篇论文描述了 EnerTune,这是一个服务系统,对共享 GPU 上每个模型的功耗以及共置模型的功耗进行建模。作者报告称,在满足性能 SLO 的前提下,能耗比最先进的基线降低 1.4 倍到 2.3 倍,功耗降低 1.3 倍到 2.6 倍。他们的论点是,纯粹为利用率做优化反而可能抬高能耗,而大规模对每种配置做性能剖析所耗费的能源太多,不切实际。

钱最终落在哪里仍无定论。Light Reading 于 9 月 30 日报道,新加坡的 StarHub 和 M1 正在进行合并谈判,新西兰的 2degrees 和 OneNZ 已提议合并双方的无线网络。StarHub 提醒谈判仍在继续。Light Reading 指出,StarHub 与 M1 合并后的规模大致相当于 Singtel,并称 Singtel 在 6 月据报占有 43% 的移动市场份额,M1 为 22%,StarHub 为 21%,Simba 为 14%。

同一周还有一条定价教训与 GPU 毫无关系。据 Gkogan 于 9 月 30 日发表的第一人称记述,Pinecone 撤下了其定价计算器,原因是发现一个被误解的输入可能把估算值夸大到 1000 倍之多。没有看到该计算器的访客注册的可能性高出 16%,联系公司的可能性高出 90%,而定价相关的支持工单并未增加。十名员工中有七名原本预计计算器版本会胜出。

评论 0

资料来源

9
  1. 01ChatGPT's new plan costs $500 a monthEN
  2. 02AI API Pricing Index - September 2026EN
  3. 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  4. 04Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  5. 05Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  6. 06Mind-1: Cutting robot inference latency from 82ms to 32msEN
  7. 07Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  8. 08Singapore, New Zealand operators seek partnerships to cut costsEN
  9. 09The pricing calculator made people more confused about pricingEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。