跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

推理成本正走向 AI 技术栈的中心,新引擎接连发布

Y Combinator S25 孵化公司 Magnitude 于 9 月 30 日在 GitHub 上发布其开源推理引擎,称在相同硬件上运行开放模型比 llama.cpp 快最多 2 倍。

人工智能与模型分析王雅琴发布: 2026年9月30日7 分钟阅读资料来源 9
推理成本正走向 AI 技术栈的中心,新引擎接连发布

GitHub 页面显示,Magnitude 于 9 月 30 日 17:37 UTC 发布代码仓库。它的定位很窄,也很具体:一个面向智能体的推理引擎,在运行设备上编译并调优内核。公司称这样能带来比 llama.cpp 快最多 2 倍的性能,其中苹果 Metal 后端解码快 92%,CUDA 上快 19%。

这是厂商自己的基准测试,目前还没有外部机构复现过。仓库没有说明这些数字背后的模型、提示长度或批大小。在有人独立跑出结果之前,2 倍只能当作宣传数字看。

更值得注意的是这家公司瞄准的位置。Magnitude 表示它提供一个桌面应用,可以接入人们已经在用的智能体,列出的有 Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi 和 Cline。其他工具则通过兼容 OpenAI 的 API 接入。按照仓库说明,引擎可运行在苹果芯片、NVIDIA 或 AMD GPU 上,也可以只用 CPU。Magnitude 还声称每个智能体的内存占用减少 27%,在智能体停止运行时释放,并称多个会话共享前缀缓存,以避免并发时变慢。

同一周,技术栈的另一层

9 月 30 日两小时后,第二个发布来了。Full Stack Data Lab 发布了一篇关于 Quail 的博客文章,Quail 是一个用 Modal 构建的查询感知推理层,Modal 同一天 17:38 UTC 也发了自己的文章。Quail 针对的是 AI-SQL,也就是在 SQL 查询里逐行调用语言模型的做法。

数字很大,说法也很直接。Full Stack Data Lab 称,一个查询可能产生几十万甚至几百万次模型调用,因为一个 AI 函数每行评估一个提示,而一次朴素连接每对行评估一个提示。在一个名为 BIO-4 的基准查询上,该查询把 5000 份医疗报告与 4144 个反应术语连接起来,实验室推演了把这些调用作为独立请求发给 vLLM 这类通用引擎的成本。

Modal 的文章给出了结果:在一个多连接查询上,Quail 在单块 H100 GPU 上每分钟处理超过十亿个 token,在相同硬件上比其 vLLM 基线快 10 倍以上,在 Modal 上每十亿 token 成本低于 6 美分。在一个新发布的基准上,Modal 称 Quail 比 vLLM 快 1.84 倍,这是各任务上的几何平均值。它同时指出,该基准集中包含两个查询,专门用来展示 AI-SQL 推理仍有待改进的地方。

I see it as a point on the LLM pareto optimal curve in a regime that had a large revealed latent demand (no thinking, single token, low latency acceptable intelligence) that was under-invested into because of a race to higher intelligence. Karpathy-san, on Jev

这段话出现在 Modal 的文章里,文中标注为 Karpathy 对 TypeSafe AI 的 Jev 模型的评论。值得仔细读。其论点是,大量推理需求处在便宜、低延迟的一端,却一直没被满足,因为各家实验室都在追逐前沿能力。Magnitude 和 Quail 都是在赌这个缺口。

两篇文章都没有经过同行评审。它们都是伴随代码发布的企业博客,而且比较基线分别选的是 llama.cpp 和 vLLM,由作者自己选定。方向是一致的,但幅度不应被视为定论。

电力和价目表说明了什么

本周发表的一项学术工作指向一个更快 token 本身解决不了的相关问题。一篇在 SOSP '26 上宣读、日期为 9 月 28 日并收录于 ACM 论文集的论文认为,纯粹为利用率优化 GPU 集群反而可能增加能耗。作者 Prasoon Sinha、Dimitrios Liakopoulos、Nathan Lemma 和 Neeraja J. Yadwadkar 描述了一个名为 EnerTune 的系统,它用解析方法对每个模型的性能和功耗建模,而不是对每种配置都做性能分析,并据此把模型打包到共享 GPU 上。他们报告称,在仍满足性能目标的前提下,能耗比最先进的基线降低 1.4 到 2.3 倍,功耗降低 1.3 到 2.6 倍。

然后是标价这一侧。AICostBudget 于 9 月 30 日发布其 9 月价格指数,这是以 2026-09-30 UTC 为截止时间的冻结快照,覆盖 11 家供应商的 81 条公开定价记录。69 条记录的输入价格中位数为每百万 token 1.32 美元,输出价格中位数为每百万 token 6 美元,比值 5.0 倍。通常更大的部分是输出定价,而不是提示输入。

该指数还戳破了成本讨论中一个常见的偷懒做法。在 58 条可比缓存输入记录中,折扣中位数为 90%。在 44 条批量定价记录中,折扣中位数为 50%。任何忽略缓存和批量定价的工作负载比较,描述的都是一份大多数客户永远不会看到的账单,指数里也是这么直接写的。在供应商一侧,其价格中位数从 Mistral AI 的每百万 token 输入 0.20 美元、输出 0.60 美元(7 条记录),到 DeepSeek 的 0.30 美元和 1.20 美元(3 条),再到 Anthropic 的 5 美元和 25 美元(13 条记录)以及 OpenAI 的 2 美元和 11 美元(18 条)。这些是公开标价的中位数,不是折后实际价格,而且各家的记录数量不同,所以不能当作同口径的模型排名。

速度只是成本之一

在数据中心之外,延迟有可测量的物理成本。MindOn 于 9 月 30 日推出其 Mind-1 物理 AI 模型,称把机器人推理延迟从 82ms 降到 32ms,并把操作任务推到人类水平的循环时间。公司自己对这件事为何重要的解释才是最有用的部分:当末端执行器速度为每秒 3 米时,10ms 的延迟对应大约 3cm 的位移,足以影响精确抓取或插入。MindOn 还指出一个数据问题,称很多机器人操作数据来自遥操作,而遥操作比自然人动作慢,所以模型在学会任务的同时也学会了更慢的节奏。

同一时间窗口里还有一个面向消费者的成本故事。CleanTechnica 于 9 月 29 日报道,Transport & Environment 的分析认为欧洲电动车每公里运行成本不到柴油车的一半,依据是柴油平均油耗 6.9 升每 100km、纯电动车 20.2 kWh 每 100km,电价为每 kWh 0.343 欧元。T&E 的 Antony Froggatt 在文中说,柴油车主每箱油比年初多付 32 欧元,并警告如果美国阻止柴油出口,供应会有风险。T&E 指出其充电成本估算很可能是上限。

定价页面本身也可能是一种成本。Gokhan Kogan 于 9 月 30 日发表的一篇第一人称叙述,讲述他在 Pinecone 的经历,称定价页面上的用量计算器因为一个被误解的输入,给出的估算最高虚高 1000 倍。他写道,在一次 A/B 测试中,没看到计算器的访客注册可能性高 16%,联系公司的可能性高 90%,而定价相关的客服工单没有增加。他还提到,内部调查的员工中有 7 成预计带计算器的版本表现更好。这是一家公司的经历,不是普遍规律,但它提醒人们,感知成本和实际成本很容易分道扬镳。

网络层的容量经济也在变化。Light Reading 于 9 月 30 日报道,StarHub 和 M1 在新加坡进行合并谈判,两家公司已经通过共同拥有的 Antina 共享 5G 频谱和无线接入网。报道称,Singtel 在 6 月占据移动市场 43%,M1 为 22%,StarHub 为 21%,Simba 为 14%。在新西兰,2degrees 和 OneNZ 提议合并各自的无线网络,商业委员会的决定预计在明年做出。

贯穿这一切的并不是推理即将免费。而是本周到来的优化都瞄准具体瓶颈:消费级硬件上的智能体解码速度、逐行的 SQL 调用、闲置 GPU 功耗,每一个都有自己的基准测试和自己的厂商。价格指数显示标价本身没怎么动。省下来的钱是在引擎层卖出去的,买家得在自己的工作负载上验证。

评论 0

资料来源

9
  1. 01Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
  2. 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  3. 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  4. 04AI API pricing index - September 2026EN
  5. 05Mind-1: Cutting robot inference latency from 82ms to 32msEN
  6. 06The pricing calculator made people more confused about pricingEN
  7. 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  8. 08Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  9. 09Singapore, New Zealand operators seek partnerships to cut costsEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。