跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

Quail 与 Magnitude 压低推理成本,单卡 H100 每分钟处理超十亿 token

Modal 与卡内基梅隆大学 Full Stack Data Lab 于 9 月 30 日表示,Quail 引擎在单块 H100 GPU 上每分钟处理超过十亿 token,比他们的 vLLM 基线快 10 倍以上,在 Modal 上的价格低于每十亿 token 6 美分。

人工智能与模型解释王雅琴发布: 2026年9月30日4 分钟阅读资料来源 6
Quail 与 Magnitude 压低推理成本,单卡 H100 每分钟处理超十亿 token

同一天,Y Combinator 支持的项目 Magnitude 发布了一款开源推理引擎,它会在用户自己的硬件上调优内核。两者指向同一个判断:模型已经不是昂贵的那一环,服务层才是。

Quail 由 Modal 的推理研究人员与卡内基梅隆大学 Full Stack Data Lab 的数据库研究人员合作完成。成果写在 9 月 30 日 Modal 博客的一篇文章和该实验室的一份配套报告里。他们要解决的是 AI-SQL 问题,也就是 SQL 查询逐行调用语言模型。一个简单的过滤条件,每一行都要调用一次模型;一次朴素的 join,每一对行都要调用一次。实验室自己的基准查询 BIO-4 用 4144 个不良反应词条过滤 5000 份医疗报告,然后再做两次 join。他们的文章根据一个 roofline 模型估算出理想运行时间为 894.37 秒,即 14.91 分钟。这个模型假设 GPU 达到峰值吞吐、CPU 与 GPU 完全重叠、KV cache 空间不受限制。

实验室称,在一块 H100 上以 scale factor 1.0 运行 vLLM 0.26.0 加 Qwen3 4B FP8,耗时 6.84 小时,是理想估算值的 27.55 倍。

原因有两个。一是主机开销:CPU 在调度请求时,GPU 处于空闲。二是他们所说的 KV regret:vLLM 丢弃了之后还要用到的 key-value 状态。实验室统计,那次运行浪费了 17460 万 token。

在一个规划尤为重要的多 join 查询上,Quail 在单块 H100 GPU 上每分钟处理超过十亿 token(TPM/GPU),比同一硬件上的 vLLM 基线快 10 倍以上。

Modal 的文章把这一优势归因于提前知道查询结构。引擎因此能更好地安排请求顺序,从而缓存和淘汰 KV 状态。这需要对 Hydragen 式级联注意力做一次修改。在整个基准测试上,Quail 的几何平均速度是 vLLM 的 1.84 倍。其中有两个查询,作者设计它们就是为了展示 AI-SQL 推理仍有待改进之处。

Magnitude 把赌注押在用户自己的芯片上

Magnitude 被列为 YC S25 公司,它用相反的路线解决同一个成本问题。其 GitHub README 于 9 月 30 日更新,描述的引擎会在模型运行前在用户设备上编译并调优内核,而不是针对硬件类别预先编译好内核再分发。项目声称比 llama.cpp 最快可快 2 倍,Metal 上解码快 92%,CUDA 上快 19%,每个 agent 的内存占用少 27%。它可运行在 Apple Silicon、NVIDIA、AMD 或单独的 CPU 上,通过一键接入 Pi、OpenCode、Hermes、Codex 和 Claude Code 等 agent,采用 Apache 2.0 许可。README 称,提示词、文件和模型都留在本地。

两个项目追逐的是同一套经济账。

AICostBudget 于 9 月 30 日发布的一份价格指数覆盖 11 家提供商的 81 条公开记录。其中输入价格中位数为每百万 token 1.32 美元,输出价格中位数为 6 美元。中位数上,输出成本约为输入的 5 倍。同一份快照在 58 条可比记录中发现缓存输入折扣中位数为 90%,在 44 条记录中发现批量折扣中位数为 50%。这对跑 AI-SQL 的人来说是关键细节。能批量、能缓存的工作负载只付标价的一小部分,不能的则付全价。

账单出现在别处

能源是房间里另一个数字。

9 月 28 日在 SOSP '26 上发表的一篇论文由 Prasoon Sinha、Dimitrios Liakopoulos、Nathan Lemma 和 Neeraja J. Yadwadkar 撰写。论文认为,单纯为利用率优化 GPU 集群反而会推高能耗。他们的系统 EnerTune 使用按模型划分的性能与功耗分析模型,其中包含同一块 GPU 上共置模型的功耗,并配合一个能耗感知的装箱算法。他们报告称,在仍满足性能目标的前提下,能耗比当前最优基线低 1.4 到 2.3 倍,功耗低 1.3 到 2.6 倍。

Quail 的作者并未声称自己的基准测试能下定论。他们表示,其中两个查询就是为了展示 AI-SQL 推理需要改进的地方,并把 1.84 倍的几何平均值看作起点而非上限。实验室那个 14.91 分钟的理想仍然是理想:没有任何实现能满足它的全部假设。

还有一个数据点,来自定价争论的另一侧。

Gagan Kogan 在 9 月 30 日的一篇文章中回顾了在 Pinecone 的工作,描述了一次 A/B 测试。从定价页面移除按用量计费的计算器后,访客注册的可能性提高了 16%,联系公司的可能性提高了 90%,而定价相关的客服工单没有增加。十名员工中有七名此前预测这个计算器会胜出。事实证明,成本透明本身就是一种复杂。

对买家来说,实际的解读比新闻标题要窄。对于结构化、可缓存的工作负载,每 token 价格正在下降,厂商也在公布让价格下降的档位。底下的基础设施,GPU、电力以及两者之间的调度,才是现在成本争夺的战场。

评论 0

资料来源

6
  1. 01Building an Ultra-High Throughput AI-SQL EngineEN
  2. 02Quail: Speeding up AI-SQL by jointly optimizing query planner and inference engineEN
  3. 03magnitudedev/magnitude: Open source inference engine for agentsEN
  4. 04AI API Pricing Index, September 2026EN
  5. 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  6. 06The pricing calculator made people more confused about pricingEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。