开放权重,封闭配方:记忆化论文与许可之争究竟说明了什么
一篇 COLM 2026 论文测量了 14 个开放权重语言模型对 200 本书的记忆程度。多数模型不会复现多数书籍,但 Llama 3.1 70B 只要拿到一本书开头的几个词,就能逐字输出某些书的内容。这件事正好落在关于“开放”到底该是什么含义的争论中间。

论文题为 Extracting memorized pieces of (copyrighted) books from open-weight language models,编号 arXiv:2505.12546,2025 年 5 月 18 日首次提交,修订至 2026 年 7 月 20 日。作者是 A. Feder Cooper、Mark A. Lemley、Allison Casasola、Ahmed Ahmed、Aaron Gokaslan、Amy B. Cyphert、Christopher De Sa、Daniel E. Ho 和 Percy Liang。论文已被 COLM 2026 接收。
作者瞄准的是诉讼里的论证方式。摘要写道,生成式 AI 版权案的原告和被告“常常就大语言模型(LLM)从其训练数据中的书籍里记忆受保护表达的程度,提出笼统而相互对立的说法”。作者认为,双方都“把记忆与版权之间的关系极度简单化了”。
于是他们做出一套测量方法,并大规模跑了一遍:200 本书、14 个开放权重模型、超过 3000 次实验。核心结果对最强的主张不利。“就我们的具体抽取方法而言,我们发现多数 LLM 不会记忆多数书籍,无论是整本还是部分。”
然后是例外。Llama 3.1 70B“完整记忆了某些书,比如《哈利·波特与魔法石》”。那里的记忆程度足够高,按摘要的说法,“可以用这本书开头的几个词作为初始提示,确定性地几乎逐字抽取整本书”。这个发现与具体模型、具体书籍相关,而这正是要点:记忆不是 LLM 的一般属性。
这是否能在法庭上帮到谁,论文没有回答。摘要说,这些结果“对版权案件有重要含义,但并非明确有利于任何一方”。
底下的标签问题
那项研究里的模型是开放权重,可以下载。这与开源不是一回事。The Register 在 2026 年 9 月 15 日 Steven J. Vaughan-Nichols 的专栏中提出了这一点。开源定义的管理者开源促进会(OSI)把开放权重定义为“训练好的神经网络的最终权重与偏置”,并补充说,仅有权重只能暴露“实现完整问责所需信息的一小部分”。
斯坦福以人为本人工智能研究院院长 James Landay 对 The Register 给出了实用版本的说法:“开放权重是进步。你可以下载模型,在自己的机器上运行,让它不进别人的数据管线。但你仍然看不到这东西是怎么造的、用什么训练的、为什么这样表现。那不是开放模型。那是开放分发。”
“开放权重回答的是‘我能运行它吗?’开源回答的是‘我能信任它、改进它,并在它之上构建下一个东西吗?’”
第二句引语同样出自 Landay,来自同一篇 Register 专栏。该文报道了 Bruce Perens、Bradley Kuhn 和 Richard Fontana 对 OSI 的 Open Source AI Definition 1.0 的批评。OSI 在 2024 年 10 月发布 OSAID 1.0 时承认,该定义会继续演变。Linux 基金会的 Mike Dolan 提交了 Open Model, Data, and Weights 许可证。该许可证自 2025 年起流传,列出的贡献者来自 Amazon、Meta、IBM、Microsoft 和 Nvidia,而这份提交在 OSI 的许可证审查邮件列表上引来了反对意见。
这对记忆化结果很重要。如果看不到训练数据,就无法独立核查哪些书进了模型。抽取出的文本,是你关于输出了什么的唯一证据。
便宜、接近,却难以运行
Mozilla 于 2026 年 9 月 15 日发布了其《State of Open Source AI》报告 1.1 版,据 Tom's Hardware 报道,数据截至 9 月 1 日。Mozilla 是 Firefox 背后的非营利组织,也是开放模型的倡导者。报告依据 Mozilla/SlashData 对约 1400 名开发者的调查、OpenRouter 流量数据和第三方基准指数。报告统计了 16 个值得注意的开放发布,Tom's Hardware 指出,其中没有一个提供 OSI 定义所要求的数据配方。
能力数字如下:最好的开放模型在 Artificial Analysis Intelligence Index 上落后封闭领先者三点,价格为 60%;与 Claude Fable 5 相差两点,价格为 30%。Mozilla 对 METR 任务时间跨度数据的拟合把开放与封闭的差距定在约 4.4 个月,接近 Epoch AI 的四个月估计。按 Mozilla 的计算,开放能力每 3.9 个月翻一番,封闭为 5.5 个月。
这些限定条件与标题数字同样重要。四个月的差距和 30% 的数字,是按标价在托管端点上以 API 对 API 测得的。Mozilla 自己的硬件图表显示,能放进一台服务器的最好开放模型得分为 52.6,能放进一块 GPU 的最好模型为 40,比榜首低 10 分和 23 分。这个落差比四个月所暗示的更大。Kimi K3 的原生 MXFP4 检查点分布在 96 个分片上,约 1.56TB;Mozilla 的服务配置列出 64 个或更多加速器,vLLM 则要求至少八块 GB300 GPU。报告称这算开放,但不是大多数持有者能运行的。
在需求侧,Mozilla 统计出 OpenRouter 上 8 月 token 量前十的模型中有八个是开放权重,其中七个由中国团队构建。据 Linux 基金会,2025 年 5 月至 9 月,封闭提供商仍拿走 OpenRouter 上模型层收入的 96%。Mozilla 首席技术官 Raffi Krikorian 通过邮件告诉 Ars Technica,为封闭模型付费的选择看起来取决于工作负载,而不是取决于组织。
还有一条线索。报告把 9 月 8 日 NSA/CISA/FBI 联合公告 AA26-251A 中的一项指控标为“已断言、未展示”:Moonshot 通过蒸馏提取 Claude Fable 5 的数据来训练 Kimi K3。未经证实,也未解决。
把两份文件放在一起看,它们从两端描述同一个对象。一个模型可以被下载、微调,并且至少在一个有记录的案例中,可以被提示几乎逐字复现一部小说。而它背后的训练数据始终没有文档、没有作为开源授权;对最大的检查点来说,也超出了大多数人手上硬件的能力范围。
资料来源
3- 01Extracting memorized pieces of (copyrighted) books from open-weight language modelsEN
- 02Open weights are not open source: Why AI's favorite label is under disputeEN
- 03China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。