小米直播训练模型,六天烧掉350万美元
MiMo-V2.6-Pro 有 1.02 万亿参数,其中 420 亿为激活参数。公开直播的强化学习训练结束后,它在 Artificial Analysis 智能指数上拿到 46 分,在开放模型里排第一。

小米把模型训练做成了一场公开表演。连续六天,它直播强化学习过程,屏幕上的花费计数器实时上涨。据中国媒体量子位报道,MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 各完成 30 个训练步,最终账单停在 350 万美元,约合 2344 万人民币。
费用拆分说明,如今大规模强化学习有多贵。仅 Pro 就用了 5 天 3 小时,花费约 260 万美元。Flash 用了 3 天 10 小时,约 90 万美元。每一步包含 1568 个提示词,每个任务模型尝试 16 条不同路径,一步下来超过 25000 次运行。每步训练消耗 37 亿到 1110 亿 token,仅 Pro 在整个训练中就处理了约 1110 亿 token。按量子位的计算,这相当于 8 万多个长度百万 token 的上下文窗口。
成绩与前沿模型的对比
MiMo-V2.6-Pro 有 1.02 万亿参数,其中 420 亿为激活参数,在 Artificial Analysis 智能指数上拿到 46 分,在开放模型中排第一。在多数智能体测试中,Pro 的成绩接近 Claude Opus 5 和 GPT-5.6 Sol。MiMo 项目负责人罗福莉此前参与过 DeepSeek-R1 的工作。她称这是任何开放模型团队做过的最大的单次强化学习训练之一,并说工程难度超过她在 DeepSeek-R1 时记得的水平。
开放是策略,不是姿态
与此同时,小米公布架构细节。MiMo-V3 基于 HySparse2 方案,针对长程、多步智能体任务做了优化:两级 KV 共享、稀疏 token 选择,以及提前退出预填充阶段。效果是预填充阶段的计算开销降到混合注意力窗口版 HySparse 的五分之一,在百万 token 上下文下 KV cache 从 12 GB 降到 2.7 GB。据小米说,长文本检索能力没有下降,反而上升。
这与 DeepSeek 系列呈现的方向一致:中国模型今天比拼的不是参数峰值,而是维持长上下文的成本。对最终用户来说还有一点重要,权重是开放的,所以结果不必只凭信任接受。
资料来源
2本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。