Quail 与 Magnitude 从技术栈两端夹击推理成本
9 月 30 日,两个开源项目从不同方向瞄准同一个目标。Quail 让推理引擎按 SQL 查询计划来调度,称在单块 H100 上每分钟处理超过十亿 token。Magnitude 则在用户自己的硬件上编译内核,称运行开源模型比 llama.cpp 最高快 2 倍。

Modal 与卡内基梅隆大学 Full Stack Data Lab 给出的说法很具体。团队在 9 月 30 日写道,Quail(QUery-Aware Inference Layer)在单块 H100 GPU 上跑一个多表连接查询,每分钟处理超过十亿 token,比同一硬件上的 vLLM 基线快 10 倍以上。放到 Modal 的云上,折算下来每十亿 token 不到 6 美分。
这个数字大得像是打错了。
它说的不是新模型,也不是新芯片,而是顺序。
Quail 究竟做了什么
AI-SQL 在 SQL 上扩展出一类函数,可以按行调用语言模型。做一次过滤,每一行就要调用一次模型。做一次朴素连接,两张表的每一对行都要调用一次。Full Stack Data Lab 的博客 9 月 24 日发布,Modal 随后转载,里面演示了一个叫 BIO-4 的基准查询:5,000 份医疗报告与 4,144 个反应词条连接两次。实验室算出的理论下限是 894.37 秒,也就是 14.91 分钟,前提是 GPU 吞吐达到峰值、CPU 与 GPU 完全重叠、保留的 KV cache 空间不受限制。在一块 H100 上用 Qwen3 4B FP8 跑 vLLM 0.26.0,实际耗时 6.84 小时,是这个下限的 27.55 倍。博客把差距归到两点。一是主机开销:CPU 忙着调度请求,H100 却在空转。二是他们所说的 KV regret:vLLM 丢掉了之后还要再用的 key-value cache。在规模因子 1.0 的 BIO-4 上,实验室称 vLLM 处理了 17460万,这句话在我们拿到的文本里就此中断。
Quail 的办法是把查询结构本身当成调度信号。引擎知道执行计划,就能安排请求顺序去复用 cache,主动驱逐,而不是被动应对。Modal 的文章说,这是对 Hydragen 式级联注意力的小幅修改,功劳归于 Modal 的推理研究员与 CMU 的数据库研究员之间的合作。
在最新发布的 AI-SQL 基准上,Quail 按任务做几何平均,比 vLLM 快 1.84 倍,远小于十亿 token 那个标题数字。Modal 的文章说,这个基准里有两个查询,专门用来暴露 AI-SQL 推理还有哪些地方要补。这个披露有用:10 倍是单个查询上的最好情况,不是普遍加速。
Magnitude 走的是另一条路
Magnitude 是一家 Y Combinator S25 公司,9 月 30 日发布代码仓库,论据不一样。它的推理引擎在模型运行之前,先在实际设备上编译并调优内核,而不是发布为宽泛硬件类别预编译好的内核。README 称比 llama.cpp 最高快 2 倍,其中 Metal 上解码快 92%,CUDA 上快 19%,每个 agent 的内存占用还少 27%。
支持的硬件刻意铺得很宽:Apple Silicon、NVIDIA、AMD,或者只有 CPU。项目称没有固定的最低配置,机器越小就跑越小的模型。它以桌面应用加 CLI 的形式发布,可连接 Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi 和 Cline,其他场景则提供兼容 OpenAI 的 API。采用 Apache 2.0 许可,在本地运行。
这两个项目并不是竞争对手。Quail 面向分析型 SQL 层,那里查询规划器会生成数百万次小而结构化的模型调用。Magnitude 面向开发者的笔记本电脑,那里一个 agent 对一个模型运行,约束是内存和解码速度。但它们从相反的两端指向同一个成本问题:推理之所以贵,是因为通用引擎不知道工作负载接下来要做什么。
价格数据说明了什么
AICostBudget 的 9 月价格指数以 9 月 30 日 UTC 为截止时点冻结,覆盖 11 家提供商的 81 条公开记录,给出了市场背景。在 69 条带有当前输入 token 单价系数的记录中,价格从每 1M token 0.10 美元到 30 美元不等,输出价格从 0.10 美元到 180 美元。输入价格中位数 1.32 美元,输出价格中位数 6 美元,输出与输入的比值中位数 5.0 倍。
该指数指出了一个在单一最便宜模型排名里容易被忽略的点。在 58 条可比记录中,缓存输入折扣的中位数是 90%。在 44 条支持批处理的记录中,批处理折扣的中位数是 50%。做工作负载比较时忽略这两种模式中的任何一种,比的都是没人真正支付的标价。
指数里的提供商中位数,方法论说明这些数字未按用量或市场份额加权:Google Gemini 在 14 条有价记录中为输入 0.75 美元、输出 4.125 美元,Mistral AI 在 7 条中为 0.20 美元和 0.60 美元,DeepSeek 在 3 条中为 0.30 美元和 1.20 美元,OpenAI 在 18 条中为 2 美元和 11 美元,xAI 在 9 条中为 1.25 美元和 2.50 美元,Cohere 在 2 条中为 1.50 美元和 5.75 美元,Anthropic 在 13 条中为 5 美元和 25 美元,Moonshot AI 在 3 条中为 0.95 美元和 4 美元。AWS、Azure 和 Google Cloud 各贡献一条记录,没有数值。
硬件这一侧
硬件效率也在被同步攻克。EnerTune 是一篇 9 月 28 日发表于 SOSP '26 论文集的论文,它认为纯粹为提高利用率而优化 GPU 集群,反而可能推高能耗。作者 Prasoon Sinha、Dimitrios Liakopoulos、Nathan Lemma 和 Neeraja J. Yadwadkar 提出了单模型性能与功耗的分析模型,以及共享 GPU 上共置模型的功耗模型,再喂给一个能耗感知的装箱算法。他们报告在满足性能 SLO 的同时,相比最先进的基线把能耗降低 1.4 倍到 2.3 倍,功耗降低 1.3 倍到 2.6 倍。
这是与 Quail 不同的杠杆,但带有同样的保留:是基准结果,不是生产部署。论文明确指出,在规模上对每个模型在数百种配置下做性能分析,代价高得不可行,所以它改用分析模型。
与此同时,Pinecone 对自己价格计算器的经验,由 Gkogan 在 9 月 30 日描述,提醒人们成本困惑不只是算力问题。一次 A/B 测试发现,没有看到该计算器的访客注册的可能性高 16%,主动联系的可能性高 90%,而定价支持工单并未增加,公司随后撤下了这个计算器。每十名员工中有七人曾预测带计算器的版本会赢。
Quail、Magnitude 和 EnerTune 的共同线索是,最大的收益来自对工作负载知道得更多,无论那是一份查询计划、一块具体的芯片,还是一种共置模式。通用引擎把这些信息留在了桌上。三者都还没有证明的是,这些收益能否经受住杂乱生产流量的考验,而只有 Magnitude 交出了开发者今天就能安装的东西。
资料来源
6- 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 03Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 04AI API Pricing Index - September 2026EN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 06The pricing calculator made people more confused about pricingEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。