跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

350万美元的开源模型:小米与DeepSeek改写成本账

MiMo-V2.6-Pro在基准测试上跑了30步强化学习,花费约260万美元,在部分智能体任务上超过了闭源模型。

科技观点王雅琴发布: 2026年9月25日7 分钟阅读资料来源 3
350万美元的开源模型:小米与DeepSeek改写成本账

多年来规则很简单:最好的模型是闭源的,价格由运营方说了算。中国门户网站量子位(qbitai)报道了小米的一次实验,至少推翻了这条规则的后半部分。

直播中,罗福莉带领的MiMo团队公开了训练账单。她此前参与过DeepSeek-R1的工作。模型MiMo-V2.6-Pro用5天3小时跑完30步强化学习,消耗约260万美元。更轻量的MiMo-V2.6-Flash用3天10小时做同样的事,花费约90万美元。两笔加起来约350万美元。

单步的规模解释了这些数字为何不算奢侈。每一步包含1568个查询,模型对每个查询尝试16条不同路径,一轮下来就产生超过25000次尝试。每步训练需要37亿token,Pro模型总共处理了约1110亿token。这相当于超过8万个长度达百万token的上下文窗口。

可以核验的结果

小米在两个地方给出了效果。30步之后,平均通过率分别提升了25%(Flash版)和12%(Pro版)。更重要的是训练集之外的测试:在检验智能体在真实代码仓库中工作的DeepSWE v1.1上,Pro从58.4分提升到72.57分,Flash从48.7分提升到65.68分。这说明模型不只是记住了任务,还把能力迁移到了全新的工程问题上。

在Artificial Analysis Intelligence Index排名中,MiMo-V2.6-Pro拿到46分,位居开源模型第一。在AutomationBench任务中它得到53.1分,超过Claude Opus 5(50.3)和GPT-5.6 Sol(45.8)。价格与上一代持平:Pro每百万输入token约3元、输出6元,Flash分别为1元和2元。据Artificial Analysis估算,Pro完成该指数中一个任务的平均成本为0.13美元。同一天拿到同样46分的Grok 4.7,其xHigh版本成本约为3.74美元,接近29倍。

不只是代码

更有意思的是科学应用。小米让模型设计用于捕捉PFAS的MOF材料,PFAS是难以降解的持久性污染物。模型查阅文献和专利,自行核实了想法的新颖性,然后搭建模拟环境并计算结合强度。它提出两种结构A50和B50,基于UiO-67型锆基骨架,其对PFAS的吸附能力据称比参照材料强百万倍到千万倍。报道中引用的北京大学窦金虎教授评价这一结果接近有经验的博士生水平,公司的研发周期从一个月缩短到两三天。

开源不再是营销口号,而是把单个任务的成本从几美元降到十几美分的方法。

背后起作用的机制与DeepSeek-V4.1-Flash相同,后者以5520亿参数和MIT许可证降低了推理的内存需求。小米不仅公开了权重和技术报告,还公开了7000多个强化学习任务环境、完整的训练框架,以及一个基于Qwen3.5-9B蒸馏的小模型。这是关于开源的讨论中的质变:重点不再是放出权重文件,而是交出整个生产流程。

评论 0

资料来源

3
  1. 01量子位 (qbitai): 小米 MiMo-V2.6 强化学习直播 — 350万美元的训练ZH
  2. 02DeepSeek-V4.1-Flash ReleaseEN
  3. 03DeepSeek-V4.1-Flash – model cardEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。