Mozilla 报告:中国最强开源权重模型落后美国前沿约 4.4 个月
Mozilla《开源 AI 现状》报告 1.1 版显示,中国最强的开源权重模型目前落后美国前沿模型大约 4.4 个月。报告 9 月 15 日发布,数据截至 9 月 1 日。

Tom's Hardware 9 月 16 日报道,Mozilla 在 METR 的任务时域数据上做了拟合,把开源与闭源的差距定在约 4.4 个月,与 Epoch AI 的四个月估计接近。METR 是一家研究类非营利机构,它按任务所需的人类工作时间给模型打分:模型能在一半情况下完成多长的任务,就得多少分。
按 Mozilla 的拟合估计,闭源模型能处理人类专家需要 8 到 12 小时的任务。开源模型大约在四个月后达到这一水平。Mozilla 的计算显示,开源能力的翻倍周期为 3.9 个月,闭源为 5.5 个月。
这份报告是系列评估,7 月 14 日首次发表在 Mozilla 博客上。数据来自 Mozilla 与 SlashData 对约 1400 名开发者的调查,以及 OpenRouter 的流量数据和第三方基准指数。Mozilla 是开源模型的倡导者。TIME 7 月 14 日报道称,Mozilla 首席技术官 Raffi Krikorian 说这份报告有一部分是倡导性工作。
这里的「开源权重」指可下载的权重,而不是训练数据或代码。报告统计了 16 个值得注意的开源发布,但没有一个提供开源促进会(OSI)定义所要求的数据配方。
基准与价格讲的是两个故事
据 Tom's Hardware 对报告的解读,最好的开源模型在 Artificial Analysis 智能指数上落后闭源领先者三分,价格为后者的 60%;落后 Claude Fable 5 两分,价格为后者的 30%。
Mozilla 还绘制了 vals.ai 的 Terminal-Bench 2.1 结果。该测试让所有模型经过同一套测试框架,也就是为模型提供工具的那层软件。在这个榜单上,Z.ai 的 GLM-5.2 与 Claude Opus 4.7 相差一分以内,落后 Opus 4.8 约四分,每次测试的成本不到后者的五分之一。
OpenRouter 是一个把开发者流量路由到数百个模型的市场。Mozilla 统计,按 8 月的 token 用量,前十名模型中有八个是开源权重,其中七个由中国团队构建。但 Linux 基金会报告称,2025 年 5 月到 9 月,闭源提供商仍拿走了 OpenRouter 上模型层收入的 96%。
Krikorian 在给 Ars Technica 的邮件中说:「我们认为为闭源模型付费的决定取决于具体工作负载,而不是取决于机构。」
Mozilla 自己给图表配的说明对那个头条数字的持久性毫不含糊:「差距每个发布周期都会重置。」
四个月这个数字有前提
一个前提是,四个月的差距和 30% 的 token 价格都是按托管端点上的 API 对 API、按标价衡量的。报告自己的硬件图表给出,能装进一台服务器的最好开源模型得分为 52.6,能装进一块 GPU 的最好模型为 40。与榜首的差距分别是 10 分和 23 分,比报告说的四个月更大。
部署要求是另一个问题。Kimi K3 的原生 MXFP4 检查点约 1.56TB,分布在 96 个分片。Mozilla 的部署配置列出 64 个或更多加速器,而 vLLM 要求至少八块 GB300 GPU,生产流量还需要多个节点。
报告把这种情况描述为开放,但大多数拿到它的人跑不起来。Tom's Hardware 在 7 月给出的内存需求接近 1.5TB。
一个例外是 Thinking Machines 的 Inkling-Small 模型,采用 Apache 2.0 许可,其 NVFP4 版本能装进一块 B300,下限为 180GB。
还有一个模型带有来源争议。K3 牵涉 9 月 8 日 NSA/CISA/FBI 联合公告(AA26-251A)中详述的一项指控。Mozilla 的报告把这一说法表述为「被断言,但未被展示」,即 Moonshot 通过蒸馏提取 Claude Fable 5 的数据来训练 K3。蒸馏指用一个模型的输出来训练另一个模型。
Mozilla 的数据止于 9 月 1 日。此后 Artificial Analysis 已把指数更新到 v4.3,评估集也不同。当前榜单上,Claude Fable 5.1 在最高努力设置下得 53 分,Kimi K3 得 44 分,与 Mozilla 绘制的 v4.1.1 数字不可比。vals.ai 的 Terminal-Bench 2.1 榜单 9 月 11 日更新,目前由 GPT-6 Astra 以 87.27% 领先,Fable 5.1 为 85.02%。
这些排名变动有多快,可作参照:7 月 17 日 Artificial Analysis 给 K3 打 57 分,Fable 5 为 60 分;而到 9 月 1 日,Mozilla 记录的是落后两分。
数字底下的定义之争
Mozilla 衡量的是能力差距,开源促进会则认为行业衡量错了东西。在 9 月 19 日的一篇博文中,OSI 主席(博文未署名)写道,开源权重让用户能行使四项软件自由中的一部分,即无需向权利人申请即可使用、研究、修改和分享的自由,但不是全部,而且只在某种程度上。
据 OSI 的说法,AI 模型由三个主要部分组成:训练数据,权重与参数,以及用于数据准备和训练的代码。用户获取这些组件的能力,决定一个模型是闭源、开源权重还是开源。开源权重发布分享的是权重,用户可以在本地运行模型,付费让第三方托管,或用自己的数据微调。它们不分享代码,也不分享训练数据。
OSI 承认,开源权重比 ChatGPT、Claude 以及许多自动驾驶系统这类完全闭源的系统提供更多选择。它的异议在于验证。OSI 认为,没有代码和训练数据,你就无法完整检查一个模型,去解释某次输出,或确认它可信。
博文举 Ai2 的 Olmo 作为更严格类别的例子。OSI 写道,研究人员用完整的训练数据集和模型检查点,把新信息注入训练数据,然后观察模型如何记住或遗忘它。该组织认为,这类研究只有在开源 AI 发布下才有可能。
这一区分不是学术问题。Mozilla 的报告统计了 16 个值得注意的开源发布,发现没有一个提供开源促进会所要求的数据配方。
小模型,窄任务
在前沿之争之外,一些开源权重发布刻意做得很小、只干一件事。据其在 Hugging Face 上的模型卡,Superwhisper 发布了 S1-mini,一个 0.6B 参数的语音转文字输出文本规范化器。
它接收原始 ASR 转写,改写成干净的书面文本:去掉填充词,把说错重来的部分落到说话人最终说出的值,加上标点和大小写,并把口述的数字、日期、时间、货币和电子邮件地址写成书面形式。
在一个含 7519 个英语案例的留出集上,它达到 94.8% 的 token 准确率,量化版本是一个 462 MiB 的文件,可在笔记本 CPU 上运行。它由 Qwen/Qwen3-0.6B 微调而来,采用 Apache 2.0 许可并附带一条命名条款。模型卡明确说明这不是聊天模型,不会遵循一般指令。
类似的做法出现在 James Cruce 9 月 22 日发表于 ASTGL 的一篇部署记录中。他用 Laya 替换了一个确定性路由器。Laya 是一个开源权重的类型化决策模型,约 4.21 亿参数,基于 ModernBERT-large 编码器,上下文上限 1024 token,在一台配备 M3 Ultra 和 256 GB 统一内存的 Mac Studio 上通过仅限回环的 API 提供服务。
他选择它而不是 TypeSafe 的 Jev。Jev 是早期访问的托管服务,标价每百万输入 token 0.042 美元,输出 token 不收费,支持最多 255 个选项。他想要的是让日常决策留在自己的机器上。Cruce 对结果能说明什么很谨慎:在固定回放上,该模型胜过他的确定性路由器,但他没有测试 Laya 是否在总体上胜过 Jev。
他还指出一个适用于 Mozilla 报告中每个数字的限制。模型卡警告 Laya 过度自信,需要针对具体领域做校准。他写道,一个类型化答案可以结构上完美,而事实上错误。
资料来源
4- 01China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
- 02Open Weights Are Good. Open Source Is Better.EN
- 03S1-mini, Superwhisper's first open-weights language modelEN
- 04Local Laya vs Hosted Jev: Why My Agents Make Typed Decisions on My MacEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。