跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

记忆化研究:多数大模型无法复现大多数书籍

一篇被 COLM 2026 接收的论文报告称,在 200 本书和 14 个开放权重语言模型上,多数模型无法记忆大多数书籍,但 Llama 3.1 70B 能够完整复现至少一本书。

人工智能与模型新闻王雅琴发布: 2026年9月27日8 分钟阅读资料来源 3
记忆化研究:多数大模型无法复现大多数书籍

多数大语言模型没有记住训练时用到的那些书。这个结论来自一篇被 COLM 2026 接收的论文。研究团队在 200 本书和 14 个开放权重模型上做了 3000 多次提取实验。生成式人工智能版权诉讼里,双方都说过一些笼统的话,这项结果跟两边都对不上。

论文题为《Extracting memorized pieces of (copyrighted) books from open-weight language models》,2025 年 5 月首次发布在 arXiv,此后修订到 2026 年 7 月。作者包括 A. Feder Cooper、Mark A. Lemley、Allison Casasola、Ahmed Ahmed、Aaron Gokaslan、Amy B. Cyphert、Christopher De Sa、Daniel E. Ho 和 Percy Liang。摘要写得很直白:原告和被告各自坚持的两极化立场“极大地简化了记忆化与版权之间的关系”。

提取方法实际发现了什么

核心结果是否定性的,而且比听上去更窄。就作者采用的这套提取方法而言,多数大模型没有记住大多数书籍,整本没有,部分也没有。这个限定很重要。它说的是这套技术能提取出什么,不是训练数据不留任何痕迹的普遍证明。

例外的地方,正是论文让模型开发者不安之处。作者写道,Llama 3.1 70B 完整记住了某些书,并点名《哈利·波特与魔法石》。记住的程度很深:拿这本书开头的几个词当初始提示,就能确定性地、几乎逐字地提取出整本书。不需要采样技巧,不需要越狱,只要开头那句话。

在受测的 14 个开放权重系统里,记忆化程度因模型而异,也因书而异。摘要没有列出其他模型,也没有给出逐书的细分。除了哈利·波特这个例子,哪些书最容易暴露,在已发表的摘要里仍没有答案。

作者对结果在法庭上的意义措辞谨慎。他们得出结论,这些发现对版权案件有重大影响,“但并不明确偏向任何一方”。这句话才是论文对这场争论的真正贡献,而且很可能被双方律师断章引用。

与研究并行的许可之争

研究人员在测量模型保留了什么,与此同时,另一场争论围绕“开放”一词用在模型上到底指什么展开。《The Register》9 月 15 日刊登了 Steven J. Vaughan-Nichols 的专栏,认为业界常把仅属开放权重的发布称为“开源模型”。

按该专栏的框架,这一区别决定的是:你只能部署一个训练完成的神经网络,还是能够检查、复现、修改并再分发产出它的整个系统。权重是训练产生的已学习数值参数。权重连同架构和推理代码一起让模型跑起来,但它们不会告诉你模型里装进了什么。

开源促进会直接划出界线。该专栏援引其立场称,开放权重指的是训练完成的神经网络的最终权重和偏置,发布它们只暴露“实现完整问责所需信息的一小部分”。

“开放权重是进步。你可以下载模型,在自己的机器上运行,不让它进入别人的数据管道。但你仍然看不到这东西是怎么造出来的、用什么训练的、为什么表现成那样。那不是开放模型,那是开放分发。”

说这话的是斯坦福以人为本人工智能研究院院长 James Landay,他接受了《The Register》的采访。他补充说,“开放权重 AI 与开源 AI 之间存在巨大差距”,并认为如果没有披露训练数据、也没有可审计的书面说明,外部人无法在最完整的意义上测试或复现这项工作。

该专栏指出,没有训练数据,外部人无法确定使用了哪些来源、其中可能包含哪些受版权保护或私密材料、数据如何被筛选或删除、哪些语言和社群被低估、基准数据是否泄漏进训练,以及预训练之后有哪些对齐方法塑造了模型。这份清单恰恰是那篇记忆化论文试图从外部、用提取而非披露来实证回答的问题集合。

OSI 自己的《开源 AI 定义》OSAID 1.0 于 2024 年 10 月发布,要求模型参数(包括权重)以 OSI 认可的条款提供,但并未规定具体的法律机制。它招致了包括原始《开源定义》作者 Bruce Perens 在内的批评,后者宣称:“这不是开源!……不幸的是,开源促进会自己如今也参与了开放洗白。”软件自由保护协会的 Bradley Kuhn 和红帽的 Richard Fontana 呼吁废除 OSAID,认为 OSI“行动过快,把一项过于激进的学理妥协强加给社群”。

另一项竞争性努力,即 Linux 基金会的开放模型、数据与权重许可(OpenMDW),已提交给 OSI。它自 2025 年起存在,贡献者名单包括 Amazon、Meta、IBM、Microsoft 和 Nvidia,并为模型的架构、训练数据和权重分别定义条款。《The Register》报道称,该提交在 OSI 的许可审查邮件列表上遭到反对。OSI 前执行董事 Stefano Maffulli 说,他总觉得这项审查“被意识形态偏见污染”。

更便宜、更接近,却仍不可复现

Mozilla 于 9 月 15 日发布其《开源 AI 现状》报告 1.1 版,数据截至 9 月 1 日。Tom's Hardware 次日作了报道。报告称,在 Artificial Analysis 智能指数上,最好的开放模型落后闭源领先者 3 分,价格为其 60%;落后 Claude Fable 5 两分,价格为其 30%。Mozilla 对 METR 任务时长数据的拟合显示,开放与闭源的差距约为 4.4 个月,与 Epoch AI 的四个月估计一致。

其方法值得审视。METR 按任务长度给模型打分,任务长度以人类工作时间计,模型需在一半情况下完成该任务。按 Mozilla 的拟合估计,闭源模型能处理人类专家需 8 至 12 小时的任务;开放模型大约四个月后达到同等水平,开放能力每 3.9 个月翻倍,闭源则为 5.5 个月。该报告依据的是 Mozilla/SlashData 对约 1400 名开发者的调查、OpenRouter 流量数据和第三方基准指数。Mozilla 主张开放模型,而《TIME》7 月 14 日报道称,Mozilla 首席技术官 Raffi Krikorian 表示该报告部分属于倡导。

在 vals.ai 的 Terminal-Bench 2.1 上,所有模型都跑同一套测试装置,Z.ai 的 GLM-5.2 得分与 Claude Opus 4.7 相差一分以内,落后 Opus 4.8 约四分,而每次测试成本不到其五分之一。在 OpenRouter 上,Mozilla 统计 8 月 token 量前十的模型中,有八个是开放权重,其中七个由中国团队构建。但据 Linux 基金会,2025 年 5 月至 9 月,闭源供应商仍拿走了 OpenRouter 上模型层收入的 96%。Krikorian 在邮件中对 Ars Technica 说:“我们认为为闭源模型付费的决定取决于具体工作负载,而非具体组织。”

报告统计了 16 个值得关注的开放发布,Tom's Hardware 指出其中没有一个提供 OSI 定义所要求的数据配方。四个月的差距和 30% 的 token 价格数字,都是在托管端点上按 API 对 API、按标价测得的。报告自己的硬件图表显示,能装进一台服务器的最佳开放模型得分为 52.6,能装进一块 GPU 的最佳模型为 40,分别比榜首低 10 分和 23 分:这比四个月所暗示的差距更大。Kimi K3 的原生 MXFP4 检查点分布在 96 个分片上,约 1.56TB,Mozilla 的服务配置列出 64 个或更多加速器,而 vLLM 要求生产流量至少使用八块 GB300 GPU 并跨多节点。报告称这属于开放,但大多数拿到它的人跑不起来。Thinking Machines 的 Inkling-Small 采用 Apache 2.0,是个例外,其 NVFP4 版本能装进一块 B300,下限 180GB。

数据截至 9 月 1 日,此后基准已经变化。Artificial Analysis 现处于指数 v4.3,评估集不同,其实时榜单上 Claude Fable 5.1 在最高努力设置下为 53,Kimi K3 为 44,这些数字与 Mozilla 绘制的 v4.1.1 数字不可比。Mozilla 自己的图表说明写道:“差距在每个发布周期都被重置。”

报告中还有一项内容是以指控而非发现的形式陈述的。NSA、CISA 和 FBI 于 9 月 8 日发布的联合公告(AA26-251A)称,Moonshot 通过蒸馏提取了 Claude Fable 5 的数据来训练 K3,蒸馏即用一个模型的输出训练另一个模型的做法。Mozilla 的报告称该说法“已提出,但未展示证据”。

把这两条线索放在一起,画面让任何想要一个干净答案的人都感到尴尬。一个模型可以可下载、便宜、距前沿只有几个月,却仍对其训练数据不透明。而当研究人员去寻找它保留了什么,正如那篇 COLM 论文用 200 本书和 3000 多次实验所做的那样,他们发现答案取决于你问的是哪个模型和哪本书。Landay 对这道差距的总结,正如《The Register》所引:“开放权重回答的是‘我能运行它吗?’开源回答的是‘我能信任它、改进它、并在其上构建下一个东西吗?’”

评论 0

资料来源

3
  1. 01Extracting memorized pieces of books from open-weight language modelsEN
  2. 02Open weights are not open source: Why AI's favorite label is under disputeEN
  3. 03China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。