推理成本正走向 AI 技术栈的中心,新引擎接连发布
Y Combinator S25 孵化公司 Magnitude 于 9 月 30 日在 GitHub 上发布其开源推理引擎,称在相同硬件上运行开放模型比 llama.cpp 快最多 2 倍。

GitHub 页面显示,Magnitude 于 9 月 30 日 17:37 UTC 发布代码仓库。它的定位很窄,也很具体:一个面向智能体的推理引擎,在运行设备上编译并调优内核。公司称这样能带来比 llama.cpp 快最多 2 倍的性能,其中苹果 Metal 后端解码快 92%,CUDA 上快 19%。
这是厂商自己的基准测试,目前还没有外部机构复现过。仓库没有说明这些数字背后的模型、提示长度或批大小。在有人独立跑出结果之前,2 倍只能当作宣传数字看。
更值得注意的是这家公司瞄准的位置。Magnitude 表示它提供一个桌面应用,可以接入人们已经在用的智能体,列出的有 Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi 和 Cline。其他工具则通过兼容 OpenAI 的 API 接入。按照仓库说明,引擎可运行在苹果芯片、NVIDIA 或 AMD GPU 上,也可以只用 CPU。Magnitude 还声称每个智能体的内存占用减少 27%,在智能体停止运行时释放,并称多个会话共享前缀缓存,以避免并发时变慢。
同一周,技术栈的另一层
9 月 30 日两小时后,第二个发布来了。Full Stack Data Lab 发布了一篇关于 Quail 的博客文章,Quail 是一个用 Modal 构建的查询感知推理层,Modal 同一天 17:38 UTC 也发了自己的文章。Quail 针对的是 AI-SQL,也就是在 SQL 查询里逐行调用语言模型的做法。
数字很大,说法也很直接。Full Stack Data Lab 称,一个查询可能产生几十万甚至几百万次模型调用,因为一个 AI 函数每行评估一个提示,而一次朴素连接每对行评估一个提示。在一个名为 BIO-4 的基准查询上,该查询把 5000 份医疗报告与 4144 个反应术语连接起来,实验室推演了把这些调用作为独立请求发给 vLLM 这类通用引擎的成本。
Modal 的文章给出了结果:在一个多连接查询上,Quail 在单块 H100 GPU 上每分钟处理超过十亿个 token,在相同硬件上比其 vLLM 基线快 10 倍以上,在 Modal 上每十亿 token 成本低于 6 美分。在一个新发布的基准上,Modal 称 Quail 比 vLLM 快 1.84 倍,这是各任务上的几何平均值。它同时指出,该基准集中包含两个查询,专门用来展示 AI-SQL 推理仍有待改进的地方。
I see it as a point on the LLM pareto optimal curve in a regime that had a large revealed latent demand (no thinking, single token, low latency acceptable intelligence) that was under-invested into because of a race to higher intelligence. Karpathy-san, on Jev
这段话出现在 Modal 的文章里,文中标注为 Karpathy 对 TypeSafe AI 的 Jev 模型的评论。值得仔细读。其论点是,大量推理需求处在便宜、低延迟的一端,却一直没被满足,因为各家实验室都在追逐前沿能力。Magnitude 和 Quail 都是在赌这个缺口。
两篇文章都没有经过同行评审。它们都是伴随代码发布的企业博客,而且比较基线分别选的是 llama.cpp 和 vLLM,由作者自己选定。方向是一致的,但幅度不应被视为定论。
电力和价目表说明了什么
本周发表的一项学术工作指向一个更快 token 本身解决不了的相关问题。一篇在 SOSP '26 上宣读、日期为 9 月 28 日并收录于 ACM 论文集的论文认为,纯粹为利用率优化 GPU 集群反而可能增加能耗。作者 Prasoon Sinha、Dimitrios Liakopoulos、Nathan Lemma 和 Neeraja J. Yadwadkar 描述了一个名为 EnerTune 的系统,它用解析方法对每个模型的性能和功耗建模,而不是对每种配置都做性能分析,并据此把模型打包到共享 GPU 上。他们报告称,在仍满足性能目标的前提下,能耗比最先进的基线降低 1.4 到 2.3 倍,功耗降低 1.3 到 2.6 倍。
然后是标价这一侧。AICostBudget 于 9 月 30 日发布其 9 月价格指数,这是以 2026-09-30 UTC 为截止时间的冻结快照,覆盖 11 家供应商的 81 条公开定价记录。69 条记录的输入价格中位数为每百万 token 1.32 美元,输出价格中位数为每百万 token 6 美元,比值 5.0 倍。通常更大的部分是输出定价,而不是提示输入。
该指数还戳破了成本讨论中一个常见的偷懒做法。在 58 条可比缓存输入记录中,折扣中位数为 90%。在 44 条批量定价记录中,折扣中位数为 50%。任何忽略缓存和批量定价的工作负载比较,描述的都是一份大多数客户永远不会看到的账单,指数里也是这么直接写的。在供应商一侧,其价格中位数从 Mistral AI 的每百万 token 输入 0.20 美元、输出 0.60 美元(7 条记录),到 DeepSeek 的 0.30 美元和 1.20 美元(3 条),再到 Anthropic 的 5 美元和 25 美元(13 条记录)以及 OpenAI 的 2 美元和 11 美元(18 条)。这些是公开标价的中位数,不是折后实际价格,而且各家的记录数量不同,所以不能当作同口径的模型排名。
速度只是成本之一
在数据中心之外,延迟有可测量的物理成本。MindOn 于 9 月 30 日推出其 Mind-1 物理 AI 模型,称把机器人推理延迟从 82ms 降到 32ms,并把操作任务推到人类水平的循环时间。公司自己对这件事为何重要的解释才是最有用的部分:当末端执行器速度为每秒 3 米时,10ms 的延迟对应大约 3cm 的位移,足以影响精确抓取或插入。MindOn 还指出一个数据问题,称很多机器人操作数据来自遥操作,而遥操作比自然人动作慢,所以模型在学会任务的同时也学会了更慢的节奏。
同一时间窗口里还有一个面向消费者的成本故事。CleanTechnica 于 9 月 29 日报道,Transport & Environment 的分析认为欧洲电动车每公里运行成本不到柴油车的一半,依据是柴油平均油耗 6.9 升每 100km、纯电动车 20.2 kWh 每 100km,电价为每 kWh 0.343 欧元。T&E 的 Antony Froggatt 在文中说,柴油车主每箱油比年初多付 32 欧元,并警告如果美国阻止柴油出口,供应会有风险。T&E 指出其充电成本估算很可能是上限。
定价页面本身也可能是一种成本。Gokhan Kogan 于 9 月 30 日发表的一篇第一人称叙述,讲述他在 Pinecone 的经历,称定价页面上的用量计算器因为一个被误解的输入,给出的估算最高虚高 1000 倍。他写道,在一次 A/B 测试中,没看到计算器的访客注册可能性高 16%,联系公司的可能性高 90%,而定价相关的客服工单没有增加。他还提到,内部调查的员工中有 7 成预计带计算器的版本表现更好。这是一家公司的经历,不是普遍规律,但它提醒人们,感知成本和实际成本很容易分道扬镳。
网络层的容量经济也在变化。Light Reading 于 9 月 30 日报道,StarHub 和 M1 在新加坡进行合并谈判,两家公司已经通过共同拥有的 Antina 共享 5G 频谱和无线接入网。报道称,Singtel 在 6 月占据移动市场 43%,M1 为 22%,StarHub 为 21%,Simba 为 14%。在新西兰,2degrees 和 OneNZ 提议合并各自的无线网络,商业委员会的决定预计在明年做出。
贯穿这一切的并不是推理即将免费。而是本周到来的优化都瞄准具体瓶颈:消费级硬件上的智能体解码速度、逐行的 SQL 调用、闲置 GPU 功耗,每一个都有自己的基准测试和自己的厂商。价格指数显示标价本身没怎么动。省下来的钱是在引擎层卖出去的,买家得在自己的工作负载上验证。
资料来源
9- 01Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
- 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 04AI API pricing index - September 2026EN
- 05Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 06The pricing calculator made people more confused about pricingEN
- 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
- 08Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 09Singapore, New Zealand operators seek partnerships to cut costsEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。