开放权重不等于开源,差距越来越难衡量
Mozilla 的一份报告称,中国最好的开放权重模型目前落后美国前沿模型约四个月。批评者则认为,“开放权重”这个词正被拉伸到远远超出开源促进会定义所允许的范围。

Mozilla 的报告《State of Open Source AI》1.1 版在 9 月 15 日发布,数据截至 9 月 1 日。报告统计了 16 个值得关注的开放发布。据 Tom's Hardware 转述,这些发布没有一个提供开源促进会《开源 AI 定义》所要求的训练数据配方。
下载一个模型很容易。想知道它用了什么、或者把它重新做出来,并不容易。这就是本月开放权重新闻背后的张力。
四个月这个数字,以及它的保留条件
Mozilla 的核心主张是差距在缩小。在 Artificial Analysis 智能指数上,最好的开放模型以 60% 的价格落后闭源领先者三个点,以 30% 的价格落后 Claude Fable 5 两个点。Mozilla 对 METR 任务时间跨度数据做了拟合,得出开放与闭源之间的差距约为 4.4 个月,与 Epoch AI 的四个月估计一致。按 Mozilla 的计算,开放模型的能力每 3.9 个月翻一倍,闭源模型为 5.5 个月。
报告依据 Mozilla 与 SlashData 对约 1400 名开发者的调查、OpenRouter 流量数据以及第三方基准指数。Mozilla 是开放模型的倡导者。TIME 在 7 月 14 日报道称,Mozilla 首席技术官 Raffi Krikorian 表示这份报告带有倡导性质。Mozilla 称,四个月这一数字和 30% 的 token 价格数字都是在托管端点上按 API 对 API、按标价测得的。
硬件是故事不那么好看的地方。报告自己的图表显示,能装进一台服务器的最好开放模型得分为 52.6,能装进一块 GPU 的最好模型为 40。与榜首的落差分别是 10 分和 23 分,比四个月所暗示的差距更大。Kimi K3 的原生 MXFP4 检查点分布在 96 个分片上,约 1.56TB,Mozilla 的部署配置列出 64 个或更多加速器。报告把这种情况描述为开放,但大多数拿到它的人跑不起来。
也有反例。Thinking Machines 的 Inkling-Small 采用 Apache 2.0 许可,其 NVFP4 版本在 180GB 下限下能装进一块 B300。
“开放”被要求意味着什么
The Register 的 Steven J. Vaughan-Nichols 在 9 月 15 日撰文认为,业界滥用了这个词。他写道,把权重发布到 Hugging Face 并让开发者在自己的 GPU 上运行,这是开放权重的分发,不是开源。他说,这一区别决定的是:你只能部署一个成品网络,还是能够检查、复现、修改并再分发产生它的那套系统。
OSI 直接做出了区分:“开放权重指的是训练好的神经网络的最终权重和偏置。”OSI 还补充说,仅有权重只暴露了“实现完整问责所需信息的一小部分”。
斯坦福以人为本人工智能研究院主任 James Landay 对 The Register 说:“开放权重是进步。你可以下载模型,在自己的机器上运行,把它挡在别人的数据管线之外。但你仍然看不到这东西是怎么造的、用什么训练的、为什么会有这样的行为。那不是开放模型,那是开放分发。”
Landay 的担忧很具体:没有训练数据或详细文档,外部人无法判断使用了哪些来源、可能包含哪些受版权保护或私密材料、数据是如何筛选或删除的、哪些语言被低估、基准数据是否泄漏进训练,以及预训练之后有哪些对齐方法塑造了模型。
2024 年 10 月发布的《开源 AI 定义》1.0 要求模型参数(包括权重)以 OSI 认可的条款提供,但没有规定法律机制。Lightning AI 首席技术官 Luca Antiga 曾表示,这种处理留下了一个“巨大的漏洞”,会削弱许可证作为实际可采纳性信号的作用。原版《开源定义》的作者 Bruce Perens 在 2024 年公开谴责 OSAID,后来又说 OSI 本身如今也参与了 openwashing。软件自由保护协会的 Bradley Kuhn 和红帽的 Richard Fontana 都呼吁废除 OSAID。
记忆化的实际问题就压在这整件事下面。A. Feder Cooper、Mark A. Lemley 及合著者的一篇论文于 2025 年 5 月提交到 arXiv,并修订至 2026 年 7 月,在 200 本书和 14 个开放权重 LLM 上进行了超过 3000 次实验。作者发现,大多数 LLM 没有记住大多数书。但 Llama 3.1 70B 完全记住了其中一些书名,包括《哈利·波特与魔法石》,从开头几个词就能几乎逐字提取整本书。
与此同时,开放权重生态仍在持续发布。Superwhisper 发布了 S1-mini,一个 0.6B 参数的语音转文字输出文本规范化器,基于 Qwen/Qwen3-0.6B 微调,采用 Apache 2.0 加一条命名条款。它报告在 7519 个留出的英文案例上达到 94.8% 的 token 准确率,量化版本为 462 MiB,可在笔记本 CPU 上运行。
小、可下载、文档足够运行。问责的问题是另一份文件。
资料来源
4- 01China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
- 02Open weights are not open source: Why AI's favorite label is under disputeEN
- 03Extracting memorized pieces of (copyrighted) books from open-weight language modelsEN
- 04S1-mini, Superwhisper's first open-weights language modelEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。