记忆化研究:多数大模型无法复现大多数书籍
一篇被 COLM 2026 接收的论文报告称,在 200 本书和 14 个开放权重语言模型上,多数模型无法记忆大多数书籍,但 Llama 3.1 70B 能够完整复现至少一本书。

多数大语言模型没有记住训练时用到的那些书。这个结论来自一篇被 COLM 2026 接收的论文。研究团队在 200 本书和 14 个开放权重模型上做了 3000 多次提取实验。生成式人工智能版权诉讼里,双方都说过一些笼统的话,这项结果跟两边都对不上。
论文题为《Extracting memorized pieces of (copyrighted) books from open-weight language models》,2025 年 5 月首次发布在 arXiv,此后修订到 2026 年 7 月。作者包括 A. Feder Cooper、Mark A. Lemley、Allison Casasola、Ahmed Ahmed、Aaron Gokaslan、Amy B. Cyphert、Christopher De Sa、Daniel E. Ho 和 Percy Liang。摘要写得很直白:原告和被告各自坚持的两极化立场“极大地简化了记忆化与版权之间的关系”。
提取方法实际发现了什么
核心结果是否定性的,而且比听上去更窄。就作者采用的这套提取方法而言,多数大模型没有记住大多数书籍,整本没有,部分也没有。这个限定很重要。它说的是这套技术能提取出什么,不是训练数据不留任何痕迹的普遍证明。
例外的地方,正是论文让模型开发者不安之处。作者写道,Llama 3.1 70B 完整记住了某些书,并点名《哈利·波特与魔法石》。记住的程度很深:拿这本书开头的几个词当初始提示,就能确定性地、几乎逐字地提取出整本书。不需要采样技巧,不需要越狱,只要开头那句话。
在受测的 14 个开放权重系统里,记忆化程度因模型而异,也因书而异。摘要没有列出其他模型,也没有给出逐书的细分。除了哈利·波特这个例子,哪些书最容易暴露,在已发表的摘要里仍没有答案。
作者对结果在法庭上的意义措辞谨慎。他们得出结论,这些发现对版权案件有重大影响,“但并不明确偏向任何一方”。这句话才是论文对这场争论的真正贡献,而且很可能被双方律师断章引用。
与研究并行的许可之争
研究人员在测量模型保留了什么,与此同时,另一场争论围绕“开放”一词用在模型上到底指什么展开。《The Register》9 月 15 日刊登了 Steven J. Vaughan-Nichols 的专栏,认为业界常把仅属开放权重的发布称为“开源模型”。
按该专栏的框架,这一区别决定的是:你只能部署一个训练完成的神经网络,还是能够检查、复现、修改并再分发产出它的整个系统。权重是训练产生的已学习数值参数。权重连同架构和推理代码一起让模型跑起来,但它们不会告诉你模型里装进了什么。
开源促进会直接划出界线。该专栏援引其立场称,开放权重指的是训练完成的神经网络的最终权重和偏置,发布它们只暴露“实现完整问责所需信息的一小部分”。
“开放权重是进步。你可以下载模型,在自己的机器上运行,不让它进入别人的数据管道。但你仍然看不到这东西是怎么造出来的、用什么训练的、为什么表现成那样。那不是开放模型,那是开放分发。”
说这话的是斯坦福以人为本人工智能研究院院长 James Landay,他接受了《The Register》的采访。他补充说,“开放权重 AI 与开源 AI 之间存在巨大差距”,并认为如果没有披露训练数据、也没有可审计的书面说明,外部人无法在最完整的意义上测试或复现这项工作。
该专栏指出,没有训练数据,外部人无法确定使用了哪些来源、其中可能包含哪些受版权保护或私密材料、数据如何被筛选或删除、哪些语言和社群被低估、基准数据是否泄漏进训练,以及预训练之后有哪些对齐方法塑造了模型。这份清单恰恰是那篇记忆化论文试图从外部、用提取而非披露来实证回答的问题集合。
OSI 自己的《开源 AI 定义》OSAID 1.0 于 2024 年 10 月发布,要求模型参数(包括权重)以 OSI 认可的条款提供,但并未规定具体的法律机制。它招致了包括原始《开源定义》作者 Bruce Perens 在内的批评,后者宣称:“这不是开源!……不幸的是,开源促进会自己如今也参与了开放洗白。”软件自由保护协会的 Bradley Kuhn 和红帽的 Richard Fontana 呼吁废除 OSAID,认为 OSI“行动过快,把一项过于激进的学理妥协强加给社群”。
另一项竞争性努力,即 Linux 基金会的开放模型、数据与权重许可(OpenMDW),已提交给 OSI。它自 2025 年起存在,贡献者名单包括 Amazon、Meta、IBM、Microsoft 和 Nvidia,并为模型的架构、训练数据和权重分别定义条款。《The Register》报道称,该提交在 OSI 的许可审查邮件列表上遭到反对。OSI 前执行董事 Stefano Maffulli 说,他总觉得这项审查“被意识形态偏见污染”。
更便宜、更接近,却仍不可复现
Mozilla 于 9 月 15 日发布其《开源 AI 现状》报告 1.1 版,数据截至 9 月 1 日。Tom's Hardware 次日作了报道。报告称,在 Artificial Analysis 智能指数上,最好的开放模型落后闭源领先者 3 分,价格为其 60%;落后 Claude Fable 5 两分,价格为其 30%。Mozilla 对 METR 任务时长数据的拟合显示,开放与闭源的差距约为 4.4 个月,与 Epoch AI 的四个月估计一致。
其方法值得审视。METR 按任务长度给模型打分,任务长度以人类工作时间计,模型需在一半情况下完成该任务。按 Mozilla 的拟合估计,闭源模型能处理人类专家需 8 至 12 小时的任务;开放模型大约四个月后达到同等水平,开放能力每 3.9 个月翻倍,闭源则为 5.5 个月。该报告依据的是 Mozilla/SlashData 对约 1400 名开发者的调查、OpenRouter 流量数据和第三方基准指数。Mozilla 主张开放模型,而《TIME》7 月 14 日报道称,Mozilla 首席技术官 Raffi Krikorian 表示该报告部分属于倡导。
在 vals.ai 的 Terminal-Bench 2.1 上,所有模型都跑同一套测试装置,Z.ai 的 GLM-5.2 得分与 Claude Opus 4.7 相差一分以内,落后 Opus 4.8 约四分,而每次测试成本不到其五分之一。在 OpenRouter 上,Mozilla 统计 8 月 token 量前十的模型中,有八个是开放权重,其中七个由中国团队构建。但据 Linux 基金会,2025 年 5 月至 9 月,闭源供应商仍拿走了 OpenRouter 上模型层收入的 96%。Krikorian 在邮件中对 Ars Technica 说:“我们认为为闭源模型付费的决定取决于具体工作负载,而非具体组织。”
报告统计了 16 个值得关注的开放发布,Tom's Hardware 指出其中没有一个提供 OSI 定义所要求的数据配方。四个月的差距和 30% 的 token 价格数字,都是在托管端点上按 API 对 API、按标价测得的。报告自己的硬件图表显示,能装进一台服务器的最佳开放模型得分为 52.6,能装进一块 GPU 的最佳模型为 40,分别比榜首低 10 分和 23 分:这比四个月所暗示的差距更大。Kimi K3 的原生 MXFP4 检查点分布在 96 个分片上,约 1.56TB,Mozilla 的服务配置列出 64 个或更多加速器,而 vLLM 要求生产流量至少使用八块 GB300 GPU 并跨多节点。报告称这属于开放,但大多数拿到它的人跑不起来。Thinking Machines 的 Inkling-Small 采用 Apache 2.0,是个例外,其 NVFP4 版本能装进一块 B300,下限 180GB。
数据截至 9 月 1 日,此后基准已经变化。Artificial Analysis 现处于指数 v4.3,评估集不同,其实时榜单上 Claude Fable 5.1 在最高努力设置下为 53,Kimi K3 为 44,这些数字与 Mozilla 绘制的 v4.1.1 数字不可比。Mozilla 自己的图表说明写道:“差距在每个发布周期都被重置。”
报告中还有一项内容是以指控而非发现的形式陈述的。NSA、CISA 和 FBI 于 9 月 8 日发布的联合公告(AA26-251A)称,Moonshot 通过蒸馏提取了 Claude Fable 5 的数据来训练 K3,蒸馏即用一个模型的输出训练另一个模型的做法。Mozilla 的报告称该说法“已提出,但未展示证据”。
把这两条线索放在一起,画面让任何想要一个干净答案的人都感到尴尬。一个模型可以可下载、便宜、距前沿只有几个月,却仍对其训练数据不透明。而当研究人员去寻找它保留了什么,正如那篇 COLM 论文用 200 本书和 3000 多次实验所做的那样,他们发现答案取决于你问的是哪个模型和哪本书。Landay 对这道差距的总结,正如《The Register》所引:“开放权重回答的是‘我能运行它吗?’开源回答的是‘我能信任它、改进它、并在其上构建下一个东西吗?’”
资料来源
3- 01Extracting memorized pieces of books from open-weight language modelsEN
- 02Open weights are not open source: Why AI's favorite label is under disputeEN
- 03China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。