跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

同一批分数,不同的账:开源模型的评测该怎么读

Artificial Analysis 指数上,小米 MiMo-V2.6-Pro 与闭源模型 Grok 4.7 同为 46 分,但完成一项任务的平均成本相差约 29 倍——分数之外的成本,正在成为新的评测维度。

人工智能与模型观点林晓雯发布: 2026年9月18日5 分钟阅读资料来源 3
同一批分数,不同的账:开源模型的评测该怎么读

看 开源 模型 的 发布 稿,最 容易 被 忽略 的 是 分数 背后 的 条件。以 小米 MiMo-V2.6-Pro 为 例,它 在 Artificial Analysis Intelligence Index 上 拿到 46 分,位列 开源 第一。巧合 的 是,同日 发布 的 闭源 模型 Grok 4.7 在 同 一 指数 上 也 是 46 分。如果 只 看 这 一 行,两 个 模型 似乎 势均力敌。

但 换 一 个 维度,结论 就 变 了。据 Artificial Analysis 实测,Grok 4.7 的 高配 版本 完成 一项 任务 平均 需要 3.74 美元,而 MiMo-V2.6-Pro 完成 一项 任务 平均 成本 只有 0.13 美元,差距 约 29 倍。这 说明 同样 的 分数,可以 对应 完全 不同 的 使用 成本。

第二 个 容易 被 忽略 的 是 测试 的 具体 设置。MiMo-V2.6 的 成绩 来自 只 跑 30 个 Step 的 强化 学习 训练,每个 Step 包含 1568 个 Prompt,每 道 题 让 模型 尝试 16 条 不同 路线。在 考察 Coding Agent 的 DeepSWE v1.1 上,Pro 从 58.4 分 涨到 72.57 分,Flash 从 48.7 分 涨到 65.68 分。这些 数字 的 意义,取决 于 样本 外 泛化 是否 成立,而 不 是 训练集 上 刷 了 多 少 分。

第三 个 变量 是 评测 本身 的 选择。官方 在 V4.1 Flash 的 说明 里 强调,经 内部、外部 多方 测试,模型 在 性能、费用、速度、总用时 等 各项 指标 上 全面 超越 V4 Pro。但 「全面 超越」是 官方 的 表述,具体 的 测试 方法、样本 数 与 评测 工具,才 决定 了 这 些 结论 能 推广 到 多 大 范围。

所以,读 评测 的 正确 姿势 是 把 三 件 事 放 在 一起 看:模型 在 什么 条件 下 跑 的、完成 任务 的 成本 是 多少、样本 外 表现 如何。只 引用 最高 的 那个 分数,等于 用 一 个 点 代替 一 个 面。

对 企业 选型 来说,更 实用 的 做法 是 拿 自己 的 任务 做 小 规模 对照:固定 评测 框架,比 较 单位 任务 成本 与 成功率,再 决定 把 哪 个 模型 放 在 生产 环境。分数 是 入口,账 才 是 结论。

评论 0

资料来源

3
  1. 01DeepSeek V4.1 Flash – Artificial AnalysisEN
  2. 026 天烧光 2000 多万,拿下开源第一ZH
  3. 03DeepSeek-V4.1-Flash 模型卡EN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。