350万美元的开源模型:小米与DeepSeek改写成本账
MiMo-V2.6-Pro在基准测试上跑了30步强化学习,花费约260万美元,在部分智能体任务上超过了闭源模型。

多年来规则很简单:最好的模型是闭源的,价格由运营方说了算。中国门户网站量子位(qbitai)报道了小米的一次实验,至少推翻了这条规则的后半部分。
直播中,罗福莉带领的MiMo团队公开了训练账单。她此前参与过DeepSeek-R1的工作。模型MiMo-V2.6-Pro用5天3小时跑完30步强化学习,消耗约260万美元。更轻量的MiMo-V2.6-Flash用3天10小时做同样的事,花费约90万美元。两笔加起来约350万美元。
单步的规模解释了这些数字为何不算奢侈。每一步包含1568个查询,模型对每个查询尝试16条不同路径,一轮下来就产生超过25000次尝试。每步训练需要37亿token,Pro模型总共处理了约1110亿token。这相当于超过8万个长度达百万token的上下文窗口。
可以核验的结果
小米在两个地方给出了效果。30步之后,平均通过率分别提升了25%(Flash版)和12%(Pro版)。更重要的是训练集之外的测试:在检验智能体在真实代码仓库中工作的DeepSWE v1.1上,Pro从58.4分提升到72.57分,Flash从48.7分提升到65.68分。这说明模型不只是记住了任务,还把能力迁移到了全新的工程问题上。
在Artificial Analysis Intelligence Index排名中,MiMo-V2.6-Pro拿到46分,位居开源模型第一。在AutomationBench任务中它得到53.1分,超过Claude Opus 5(50.3)和GPT-5.6 Sol(45.8)。价格与上一代持平:Pro每百万输入token约3元、输出6元,Flash分别为1元和2元。据Artificial Analysis估算,Pro完成该指数中一个任务的平均成本为0.13美元。同一天拿到同样46分的Grok 4.7,其xHigh版本成本约为3.74美元,接近29倍。
不只是代码
更有意思的是科学应用。小米让模型设计用于捕捉PFAS的MOF材料,PFAS是难以降解的持久性污染物。模型查阅文献和专利,自行核实了想法的新颖性,然后搭建模拟环境并计算结合强度。它提出两种结构A50和B50,基于UiO-67型锆基骨架,其对PFAS的吸附能力据称比参照材料强百万倍到千万倍。报道中引用的北京大学窦金虎教授评价这一结果接近有经验的博士生水平,公司的研发周期从一个月缩短到两三天。
开源不再是营销口号,而是把单个任务的成本从几美元降到十几美分的方法。
背后起作用的机制与DeepSeek-V4.1-Flash相同,后者以5520亿参数和MIT许可证降低了推理的内存需求。小米不仅公开了权重和技术报告,还公开了7000多个强化学习任务环境、完整的训练框架,以及一个基于Qwen3.5-9B蒸馏的小模型。这是关于开源的讨论中的质变:重点不再是放出权重文件,而是交出整个生产流程。
资料来源
3- 01量子位 (qbitai): 小米 MiMo-V2.6 强化学习直播 — 350万美元的训练ZH
- 02DeepSeek-V4.1-Flash ReleaseEN
- 03DeepSeek-V4.1-Flash – model cardEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。