跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

推理成本工具层出不穷,GPU 价格依旧不透明

9月23日上线的一款浏览器计算器,用同一套假设对比了27个模型的推理成本。作者自己提醒,算出来的只是规划用的估算,不是厂商报价。几天后,另一份基准测试把运行一个模型一小时的成本放到了同一盏灯下。

人工智能与模型分析王雅琴发布: 2026年9月28日3 分钟阅读资料来源 5
推理成本工具层出不穷,GPU 价格依旧不透明

推理成本这场争论里最新出现的东西不是定价公告,而是一个计算器。Flavio Copes 在9月23日发布了 Inference Cost Calculator,用完全相同的假设给27个模型排名。这些模型来自 OpenAI、Anthropic、Google、xAI、Mistral、OpenRouter 和 Workers AI。

你要填的是日活跃用户数、每位用户的调用次数、每次调用的输入与输出 token 数,还有一个可选的提示缓存命中率。工具给出每月账单。它同时提醒,这些数字来自公开的 API 价格,没有算批量定价、企业折扣、图像或工具附加费,也没算你自己搭的缓存层。

这条提醒比排名本身更重要。

给“思考一小时”定价的基准测试

9月26日,StarSkirmish 公布了另一种成本对比。每个 LLM 拿到一小时,用 C++ 为《星际争霸:母巢之战》写一个 Protoss 机器人。写完之后,这些机器人互相对战,也跟人类写的对手打。参赛阵容是来自10个模型的50个 LLM 机器人,外加3个演示机器人和9个竞赛级人类编写机器人,共62个参赛者,跑在 Prime Intellect 沙箱上。

按项目自己的说明,GPT-6 Astra 与 Claude Opus 5.5 在榜首实际上打平,GPT-6 Sol 与它们同列,明显高出其余选手一档。该基准还以对数刻度画出得分与单次一小时运行的平均 API 成本的关系,并指出在这一对比中 GPT-6 Sol 的性价比独一无二。

这是按能力算成本,不是按 token 算成本。它也承认一个局限:作者说,当前最先进的推理模型已经能从超过一小时的推理时长中显著获益,运行更久的版本正在计划中。

公开数字为什么难以信任

上面两个来源都没有给出 GPU 价格。要说这个,本档案里还有 Nexlab 在9月20日发布的一份调研,对比了 LocalAI、exo、GPUStack、vLLM、Ollama、Xinference 和 CoderAI 等自托管编排工具。星标数取自9月20日的 GitHub API。作者明确说,凡是无法确认的功能,表格里就如实写明,不猜。

这份调研真正有用的区分跟价格无关。它看三件事:一个模型能不能跨越多台机器;后续回合会不会被路由到 KV 缓存或前缀缓存已经所在的位置;服务器能不能自己租 GPU。在该快照中星标数为 92000 的 vLLM,支持基于 Ray 的张量并行与流水线并行,以及按实例的前缀缓存。星标数为 181000 的 Ollama,一次只能跑一台机器上的一个模型,除了在 Open WebUI 后面轮询多个 URL,没有集群方案。

钱花在硬件上,不在软件上。巴西的光伏市场不是 AI 故事,但 pv magazine 在9月26日报道,根据 Greener 的分布式能源解决方案研究,2026年1月至6月,该国 300 kW 以下项目的平均光伏系统价格上涨了7%。4 kW 系统的套件成本上涨18.3%,从 1.42 雷亚尔/瓦升到 1.68 雷亚尔/瓦。

不同的大宗商品,同样的毛病:头条数字会动,是因为零部件在动。

研究对输出端怎么说

成本图景还有一块在需求端。一篇9月14日提交至 arXiv、9月17日修订的论文 SlopShape,描述了一种有 214 个特征的仪器,仅凭结构特征就能识别 AI 生成的商业网页内容。它由 LLM 应用,并以人工标注做验证,在留出公司上达到 98.0 的 macro-F1;当每一篇 AI 帖子都被其自身模型改写后,为 98.1。作者是 Sitefire 的 Jochen Madler。

推理越便宜,产出的文本越多。识别这些文本如今成了一项有公开准确率的可测量任务,而这本身就是一种基础设施成本。

这些来源没有哪一个在“推理应该花多少钱”上达成一致,因为它们测的根本不是同一件事。计算器测的是一张假想账单。基准测的是每小时 API 支出换来的能力。编排工具调研测的是功能,不是发票。把任何一个单一数字都当作起始假设。

评论 0

资料来源

5
  1. 01Inference Cost CalculatorEN
  2. 02StarSkirmish BenchEN
  3. 03Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLMEN
  4. 04PV system costs increase by 7% in Brazil in H1EN
  5. 05SlopShape: Identifying AI-Generated Commercial Web ContentEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。