开放权重不等于开源:一场关于标签的争论
开放权重语言模型的发布速度,快过描述它们的规则。开源促进会表示,只公开权重,暴露的只是"实现完整问责所需信息的一小部分"。批评者认为,这个标签正在被拉伸。

从 Hugging Face 下载一个模型文件只要几秒钟。想搞清楚它是怎么做出来的,却需要一张传票。这个落差就是整场争论的核心。
The Register 的 Steven J. Vaughan-Nichols 在 9 月 15 日把这个区别说得很直白:一次发布可以是开放权重,却不是开源。这个差别决定了你究竟只是能运行一个训练好的神经网络,还是能真正检查、复现、修改并再分发产出它的那个系统。权重是训练产生的数值参数。它们连同架构和推理代码一起,让大语言模型得以工作。你可以自托管一个开放权重模型,用内部文档微调它,让提示词不经过某家专有 API。但在大多数发布中,你看不到它背后的数据配方。
对写许可证的人来说,这不是技术细节。
OSI 划了一条线,随后因此受到批评
开源定义由开源促进会负责维护。该组织明确指出,"开放权重指的是训练好的神经网络的最终权重和偏置",公开它们只能暴露"实现完整问责所需信息的一小部分"。它自己的开源 AI 定义 OSAID 1.0 本意是补上这个缺口。定义要求模型参数(包括权重)以 OSI 认可的条款提供,但没有规定具体的法律机制。该定义于 2024 年 10 月发布,当时就被承认是一份会持续演进的文档。
批评者说,核心缺陷始终没有修好。Lightning AI 的 CTO、知名 PyTorch 贡献者 Luca Antiga 认为,OSAID 对权重的处理留下了"一个巨大的漏洞,会让许可证在判断经 OSI 许可的 AI 系统能否在真实场景中采用时变得更无力"。原始开源定义的作者 Bruce Perens 在 2024 年公开谴责 OSAID,后来更宣称:"这不是开源!……不幸的是,开源促进会自己也参与了开源洗白。"软件自由保护协会的 Bradley Kuhn 和红帽高级商业法律顾问 Richard Fontana 呼吁废除 OSAID。他们认为,OSI"行动过快,把一项过于宏大的政策妥协强加给社区",而这道裂痕"严重损害了 OSI 的声誉、权威和影响力"。
斯坦福以人为本人工智能研究院主任 James Landay 向 The Register 说出了这个抱怨的实际版本:"开放权重是进步。你可以下载模型,在自己的机器上运行,让它不进入别人的数据管道。但你仍然看不到这东西是怎么造的、用什么训练的、为什么会有这样的行为。那不是开放模型。那是开放分发。"
"开放权重回答的是'我能运行它吗?'开源回答的是'我能信任它、改进它,并在它之上构建下一个东西吗?'"Landay 说。
没有训练数据或详细文档,外部者无法确定用了哪些来源、可能包含哪些受版权保护或私密的内容、数据是如何筛选或删除的、哪些语言和社群被低估、基准数据是否泄漏进训练、以及预训练之后有哪些对齐和安全方法塑造了模型。
一份试图折中的许可证
填补这个真空的,是 Linux 基金会的开放模型、数据与权重许可证,由 Mike Dolan 提交给 OSI。OpenMDW 自 2025 年存在至今,贡献者名单包括亚马逊、Meta、IBM、微软和英伟达,这给了它行业分量。它的做法是为模型的架构、训练数据和权重分别定义条款,把许可方提供的一切纳入同一份协议。传统开源围绕源代码展开;大语言模型则把代码、架构和数值权重结合在一起,而这些权重来自可能专有、受版权保护或根本未披露的数据集。
这份提交在 OSI 的许可证审查邮件列表上遭到反对。在 OSAID 制定期间领导 OSI 的前执行董事 Stefano Maffulli 说:"我一直觉得 OpenMDW 的审查被一种意识形态偏见污染了:因为我们不喜欢大科技公司,而现在 AI 就是大科技公司,所以我们不喜欢 AI;于是我们会不惜一切去阻止它。"
与此同时,模型还在不断发布。Mozilla 的《开源 AI 现状》报告 1.1 版于 9 月 15 日发布,数据截至 9 月 1 日,统计了 16 个值得关注的开放发布。没有一个提供 OSAID 所要求的数据配方。Mozilla 是开放模型的倡导者,其 CTO Raffi Krikorian 在 7 月 14 日对《时代》表示,这份报告部分带有倡导性质,据 Tom's Hardware 报道。
能力差距在缩小,成本差距没有
Mozilla 的数字是目前对开放权重处境最具体的衡量。最好的开放模型在 Artificial Analysis 智能指数上落后闭源领先者三分,价格是后者的 60%,并以 30% 的价格落后 Claude Fable 5 两分。Mozilla 对 METR 任务时间跨度数据做了拟合,把开放与闭源的差距定在约 4.4 个月,与 Epoch AI 的四个月估计一致。METR 的评分方式,是按模型能在一半情况下完成的任务相当于人类多少工作时间。按 Mozilla 的计算,开放能力每 3.9 个月翻一番,闭源模型则是 5.5 个月。
在 vals.ai 的 Terminal-Bench 2.1 榜单上,所有模型跑同一套测试框架。Z.ai 的 GLM-5.2 得分与 Claude Opus 4.7 相差不到一分,落后 Opus 4.8 约四分,而每次测试的成本不到后者的五分之一。在 OpenRouter 上,Mozilla 统计,按 8 月的 token 用量,前十名模型中有八个是开放权重,其中七个由中国团队打造。据 Linux 基金会,2025 年 5 月到 9 月,闭源提供商仍在 OpenRouter 上拿走了模型层收入的 96%。Krikorian 在邮件中对 Ars Technica 说:"我们认为为闭源模型付费是工作负载层面的决定,而不是组织层面的决定。"
这些数字附带着报告自己说明的限定条件。四个月的差距和 30% 的 token 价格,都是在托管端点上按 API 对 API、按标价测得的。Mozilla 自己的硬件图表显示,能装进一台服务器的最好开放模型得分为 52.6,能装进一张 GPU 的为 40,比榜首分别低 10 分和 23 分,差距大于四个月。Kimi K3 的原生 MXFP4 检查点跨 96 个分片约 1.56TB;Mozilla 的部署配置列出 64 个或更多加速器,而 vLLM 要求至少八块 GB300 GPU,生产流量还需要多节点。报告把这描述为开放,但大多数持有者并不能运行。Thinking Machines 的 Inkling-Small 采用 Apache 2.0,是一个例外:它的 NVFP4 版本能装进单块 B300,下限为 180GB。
数据截至 9 月 1 日,此后榜单已经变化。Artificial Analysis 现在运行的是采用不同评测集的 index v4.3;其实时榜单上 Claude Fable 5.1 在最高努力设置下得 53,Kimi K3 得 44,这些数字与 Mozilla 所绘制的 v4.1.1 数据不可比。Mozilla 自己图表的说明写着:"差距在每个发布周期都会重置。"
围绕 K3 还有一项未解决的指控。美国国家安全局、网络安全和基础设施安全局与联邦调查局 9 月 8 日的联合公告(AA26-251A)称,Moonshot 通过蒸馏提取 Claude Fable 5 的数据来训练 K3。蒸馏指的是用一个模型的输出训练另一个模型。Mozilla 的报告把这一说法表述为"有断言,无展示"。7 月 17 日,Artificial Analysis 给 K3 打 57 分,Fable 5 为 60 分;到 9 月 1 日,Mozilla 测得的差距是两分。
这个标签到底是为了什么
这一切都没有解决版权之争。A. Feder Cooper、Mark A. Lemley 及合著者的一篇论文,2025 年 5 月首次提交到 arXiv,修订持续到 2026 年 7 月,用 14 个开放权重模型对 200 本书做了 3000 多次实验。作者发现,大多数大语言模型不会完整或部分记住大多数书。但 Llama 3.1 70B 完整记住了某些书名,包括《哈利·波特与魔法石》,从开头几个词就能几乎逐字提取整本书。论文的结论是,记忆因模型和书而异,这些结果对版权案件有重大影响,"尽管并非明确偏向任何一方"。
这就是这个标签所处的尴尬中间地带。开放权重告诉你一个模型可以运行、可以微调。它们不告诉你它吃了什么。Landay 被 The Register 引用的说法是最简洁的版本:开放权重回答你能不能运行这东西,开源回答你能不能信任它、改进它并在它之上构建。眼下,对 Hub 上几乎每一个发布来说,第一个答案是能,第二个仍是问号。
资料来源
3- 01Open weights are not open source: Why AI's favorite label is under disputeEN
- 02China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
- 03Extracting memorized pieces of books from open-weight language modelsEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。