Quail 与 Magnitude 压低推理成本,单卡 H100 每分钟处理超十亿 token
Modal 与卡内基梅隆大学 Full Stack Data Lab 于 9 月 30 日表示,Quail 引擎在单块 H100 GPU 上每分钟处理超过十亿 token,比他们的 vLLM 基线快 10 倍以上,在 Modal 上的价格低于每十亿 token 6 美分。

同一天,Y Combinator 支持的项目 Magnitude 发布了一款开源推理引擎,它会在用户自己的硬件上调优内核。两者指向同一个判断:模型已经不是昂贵的那一环,服务层才是。
Quail 由 Modal 的推理研究人员与卡内基梅隆大学 Full Stack Data Lab 的数据库研究人员合作完成。成果写在 9 月 30 日 Modal 博客的一篇文章和该实验室的一份配套报告里。他们要解决的是 AI-SQL 问题,也就是 SQL 查询逐行调用语言模型。一个简单的过滤条件,每一行都要调用一次模型;一次朴素的 join,每一对行都要调用一次。实验室自己的基准查询 BIO-4 用 4144 个不良反应词条过滤 5000 份医疗报告,然后再做两次 join。他们的文章根据一个 roofline 模型估算出理想运行时间为 894.37 秒,即 14.91 分钟。这个模型假设 GPU 达到峰值吞吐、CPU 与 GPU 完全重叠、KV cache 空间不受限制。
实验室称,在一块 H100 上以 scale factor 1.0 运行 vLLM 0.26.0 加 Qwen3 4B FP8,耗时 6.84 小时,是理想估算值的 27.55 倍。
原因有两个。一是主机开销:CPU 在调度请求时,GPU 处于空闲。二是他们所说的 KV regret:vLLM 丢弃了之后还要用到的 key-value 状态。实验室统计,那次运行浪费了 17460 万 token。
在一个规划尤为重要的多 join 查询上,Quail 在单块 H100 GPU 上每分钟处理超过十亿 token(TPM/GPU),比同一硬件上的 vLLM 基线快 10 倍以上。
Modal 的文章把这一优势归因于提前知道查询结构。引擎因此能更好地安排请求顺序,从而缓存和淘汰 KV 状态。这需要对 Hydragen 式级联注意力做一次修改。在整个基准测试上,Quail 的几何平均速度是 vLLM 的 1.84 倍。其中有两个查询,作者设计它们就是为了展示 AI-SQL 推理仍有待改进之处。
Magnitude 把赌注押在用户自己的芯片上
Magnitude 被列为 YC S25 公司,它用相反的路线解决同一个成本问题。其 GitHub README 于 9 月 30 日更新,描述的引擎会在模型运行前在用户设备上编译并调优内核,而不是针对硬件类别预先编译好内核再分发。项目声称比 llama.cpp 最快可快 2 倍,Metal 上解码快 92%,CUDA 上快 19%,每个 agent 的内存占用少 27%。它可运行在 Apple Silicon、NVIDIA、AMD 或单独的 CPU 上,通过一键接入 Pi、OpenCode、Hermes、Codex 和 Claude Code 等 agent,采用 Apache 2.0 许可。README 称,提示词、文件和模型都留在本地。
两个项目追逐的是同一套经济账。
AICostBudget 于 9 月 30 日发布的一份价格指数覆盖 11 家提供商的 81 条公开记录。其中输入价格中位数为每百万 token 1.32 美元,输出价格中位数为 6 美元。中位数上,输出成本约为输入的 5 倍。同一份快照在 58 条可比记录中发现缓存输入折扣中位数为 90%,在 44 条记录中发现批量折扣中位数为 50%。这对跑 AI-SQL 的人来说是关键细节。能批量、能缓存的工作负载只付标价的一小部分,不能的则付全价。
账单出现在别处
能源是房间里另一个数字。
9 月 28 日在 SOSP '26 上发表的一篇论文由 Prasoon Sinha、Dimitrios Liakopoulos、Nathan Lemma 和 Neeraja J. Yadwadkar 撰写。论文认为,单纯为利用率优化 GPU 集群反而会推高能耗。他们的系统 EnerTune 使用按模型划分的性能与功耗分析模型,其中包含同一块 GPU 上共置模型的功耗,并配合一个能耗感知的装箱算法。他们报告称,在仍满足性能目标的前提下,能耗比当前最优基线低 1.4 到 2.3 倍,功耗低 1.3 到 2.6 倍。
Quail 的作者并未声称自己的基准测试能下定论。他们表示,其中两个查询就是为了展示 AI-SQL 推理需要改进的地方,并把 1.84 倍的几何平均值看作起点而非上限。实验室那个 14.91 分钟的理想仍然是理想:没有任何实现能满足它的全部假设。
还有一个数据点,来自定价争论的另一侧。
Gagan Kogan 在 9 月 30 日的一篇文章中回顾了在 Pinecone 的工作,描述了一次 A/B 测试。从定价页面移除按用量计费的计算器后,访客注册的可能性提高了 16%,联系公司的可能性提高了 90%,而定价相关的客服工单没有增加。十名员工中有七名此前预测这个计算器会胜出。事实证明,成本透明本身就是一种复杂。
对买家来说,实际的解读比新闻标题要窄。对于结构化、可缓存的工作负载,每 token 价格正在下降,厂商也在公布让价格下降的档位。底下的基础设施,GPU、电力以及两者之间的调度,才是现在成本争夺的战场。
资料来源
6- 01Building an Ultra-High Throughput AI-SQL EngineEN
- 02Quail: Speeding up AI-SQL by jointly optimizing query planner and inference engineEN
- 03magnitudedev/magnitude: Open source inference engine for agentsEN
- 04AI API Pricing Index, September 2026EN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 06The pricing calculator made people more confused about pricingEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。