同一批分数,不同的账:开源模型的评测该怎么读
Artificial Analysis 指数上,小米 MiMo-V2.6-Pro 与闭源模型 Grok 4.7 同为 46 分,但完成一项任务的平均成本相差约 29 倍——分数之外的成本,正在成为新的评测维度。

看 开源 模型 的 发布 稿,最 容易 被 忽略 的 是 分数 背后 的 条件。以 小米 MiMo-V2.6-Pro 为 例,它 在 Artificial Analysis Intelligence Index 上 拿到 46 分,位列 开源 第一。巧合 的 是,同日 发布 的 闭源 模型 Grok 4.7 在 同 一 指数 上 也 是 46 分。如果 只 看 这 一 行,两 个 模型 似乎 势均力敌。
但 换 一 个 维度,结论 就 变 了。据 Artificial Analysis 实测,Grok 4.7 的 高配 版本 完成 一项 任务 平均 需要 3.74 美元,而 MiMo-V2.6-Pro 完成 一项 任务 平均 成本 只有 0.13 美元,差距 约 29 倍。这 说明 同样 的 分数,可以 对应 完全 不同 的 使用 成本。
第二 个 容易 被 忽略 的 是 测试 的 具体 设置。MiMo-V2.6 的 成绩 来自 只 跑 30 个 Step 的 强化 学习 训练,每个 Step 包含 1568 个 Prompt,每 道 题 让 模型 尝试 16 条 不同 路线。在 考察 Coding Agent 的 DeepSWE v1.1 上,Pro 从 58.4 分 涨到 72.57 分,Flash 从 48.7 分 涨到 65.68 分。这些 数字 的 意义,取决 于 样本 外 泛化 是否 成立,而 不 是 训练集 上 刷 了 多 少 分。
第三 个 变量 是 评测 本身 的 选择。官方 在 V4.1 Flash 的 说明 里 强调,经 内部、外部 多方 测试,模型 在 性能、费用、速度、总用时 等 各项 指标 上 全面 超越 V4 Pro。但 「全面 超越」是 官方 的 表述,具体 的 测试 方法、样本 数 与 评测 工具,才 决定 了 这 些 结论 能 推广 到 多 大 范围。
所以,读 评测 的 正确 姿势 是 把 三 件 事 放 在 一起 看:模型 在 什么 条件 下 跑 的、完成 任务 的 成本 是 多少、样本 外 表现 如何。只 引用 最高 的 那个 分数,等于 用 一 个 点 代替 一 个 面。
对 企业 选型 来说,更 实用 的 做法 是 拿 自己 的 任务 做 小 规模 对照:固定 评测 框架,比 较 单位 任务 成本 与 成功率,再 决定 把 哪 个 模型 放 在 生产 环境。分数 是 入口,账 才 是 结论。
资料来源
3本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。