跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

小米直播训练模型,六天烧掉350万美元

MiMo-V2.6-Pro 有 1.02 万亿参数,其中 420 亿为激活参数。公开直播的强化学习训练结束后,它在 Artificial Analysis 智能指数上拿到 46 分,在开放模型里排第一。

人工智能与模型新闻林晓雯发布: 2026年9月23日5 分钟阅读资料来源 2
小米直播训练模型,六天烧掉350万美元

小米把模型训练做成了一场公开表演。连续六天,它直播强化学习过程,屏幕上的花费计数器实时上涨。据中国媒体量子位报道,MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 各完成 30 个训练步,最终账单停在 350 万美元,约合 2344 万人民币。

费用拆分说明,如今大规模强化学习有多贵。仅 Pro 就用了 5 天 3 小时,花费约 260 万美元。Flash 用了 3 天 10 小时,约 90 万美元。每一步包含 1568 个提示词,每个任务模型尝试 16 条不同路径,一步下来超过 25000 次运行。每步训练消耗 37 亿到 1110 亿 token,仅 Pro 在整个训练中就处理了约 1110 亿 token。按量子位的计算,这相当于 8 万多个长度百万 token 的上下文窗口。

成绩与前沿模型的对比

MiMo-V2.6-Pro 有 1.02 万亿参数,其中 420 亿为激活参数,在 Artificial Analysis 智能指数上拿到 46 分,在开放模型中排第一。在多数智能体测试中,Pro 的成绩接近 Claude Opus 5 和 GPT-5.6 Sol。MiMo 项目负责人罗福莉此前参与过 DeepSeek-R1 的工作。她称这是任何开放模型团队做过的最大的单次强化学习训练之一,并说工程难度超过她在 DeepSeek-R1 时记得的水平。

开放是策略,不是姿态

与此同时,小米公布架构细节。MiMo-V3 基于 HySparse2 方案,针对长程、多步智能体任务做了优化:两级 KV 共享、稀疏 token 选择,以及提前退出预填充阶段。效果是预填充阶段的计算开销降到混合注意力窗口版 HySparse 的五分之一,在百万 token 上下文下 KV cache 从 12 GB 降到 2.7 GB。据小米说,长文本检索能力没有下降,反而上升。

这与 DeepSeek 系列呈现的方向一致:中国模型今天比拼的不是参数峰值,而是维持长上下文的成本。对最终用户来说还有一点重要,权重是开放的,所以结果不必只凭信任接受。

评论 0

资料来源

2
  1. 016 天烧光 2000 多万,拿下开源第一!小米史无前例「炼丹直播」收官 (量子位)ZH
  2. 02小米公开 MiMo-V3 核心架构 HySparse2 (IT之家, tag AI)ZH

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。