跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

开放权重、开源,以及那个背下《哈利·波特》的模型

一篇新的 arXiv 论文报告称,Llama 3.1 70B 能几乎逐字复现至少一本书。争论因此重新燃起:所谓“开放权重”,究竟公开了什么。

人工智能与模型分析林晓雯发布: 2026年9月27日5 分钟阅读资料来源 3
开放权重、开源,以及那个背下《哈利·波特》的模型

关于开放权重语言模型,有两件事同时成立。整个行业花了三年时间假装并非如此。它们确实有用。它们并不是开源。

这一区分不是咬文嚼字。它决定发布实验室之外的人能否审查模型学到了什么,能否复现它的学习过程,能否验证关于偏见与安全的说法。当前这一波“开放”模型发布,从 Meta 的 Llama 系列到 Mistral 的 Mixtral,公开的只有权重。训练代码、数据集和方法论仍留在墙内。Prompt Engineering 在 2023 年 12 月的文章里把这个缺口说得很直白:开放权重允许使用模型,但不允许完全透明;开源能让人理解并定制模型,但发布所需的工作量大得多。

权重到底是什么

权重是一次训练运行输出的数字。它们不是人类可读的,不可调试,也不是指令。源代码三者兼具。据 Prompt Engineering 所说,把两者混为一谈是常见错误,后果真实存在。有人仅仅因为一个参数文件可以下载,就把一套专有的训练流水线说成开源。

实际代价体现在可审查性上。同一篇文章指出,如果只有权重可用,开发者可以运行最先进的模型,却无法有意义地评估偏见、局限和社会影响。模型与真实需求之间的错位会变得难以识别。若拥有完整的源代码访问权,不同机构的研究者就能对公平性、安全性和稳健性进行严格审查。这就是那笔交易:眼下方便,永不可查。

只发布模型权重,广泛地促成了应用开发,却把控制权集中在少数机构手中。开放源代码访问则分散了控制权,但要求对透明与去中心化作出更大承诺。

这套说法经受住了时间考验,部分原因是可审查性问题的证据不断出现。

记忆问题

2025 年 5 月 18 日,A. Feder Cooper、Mark A. Lemley 和 Percy Liang 等研究者向 arXiv 提交了一篇论文,测量开放权重语言模型能被诱导复现多少受版权保护的书籍文本。他们把提取技术应用于 200 本书和 14 个开放权重模型,进行了 3000 多次实验。论文的第六版于 2026 年 7 月 20 日修订,是目前的最新版本。

主要发现对版权诉讼的双方都不利。论文称,大多数大语言模型不会记住大多数书,无论整体还是部分。但存在明显的例外。Llama 3.1 70B 完整记住了某些书,包括《哈利·波特与魔法石》。这种记忆足够广泛,以至于可以用这本书开头的几个词作为初始提示,确定性地、几乎逐字地提取出整本书。

作者写道,生成式 AI 版权诉讼中的原告和被告对记忆问题提出了笼统而相互对立的说法,把记忆与版权之间的关系过度简化了。他们补充说,自己的结果对版权案件有重要影响,但这些影响并不会明确地偏向任何一方。

注意这个实验需要什么。它需要可以下载并加以询问的权重。一个受限模型会让外部研究者无法做同样的测试。换句话说,开放权重促成了这一发现,尽管开放权重并不是开源。

一个小反例

并非每一次开放权重发布都是前沿模型。Superwhisper 以 Apache 2.0 加一条命名条款发布了 s1-mini,一个用于语音转文字输出的 0.6B 参数文本规范化器。它接收原始的 ASR 转写,改写为干净的书面文本:删除填充词,解决错误开头,加上标点和大小写,把口述的数字和日期写成书面形式。在一个包含 7519 个英语案例的留出集上,它达到 94.8% 的词元准确率,量化版本是一个 462 MiB 的文件,可在笔记本 CPU 上运行。

发布说明对一处文档怪癖异常坦率。Hugging Face 侧栏显示 0.8B 参数,但模型卡说真实数字是 596.0M 个唯一参数,因为 155.6M 参数的嵌入被存了两次:751.6M 个张量元素对应 596.0M 个唯一元素。这一布局继承自 Qwen/Qwen3-0.6B,后者在 Hub 上出于同样原因显示 0.8B。

这种披露正是发布权重时附带文档的全部理由。它也恰恰不是源代码。模型卡告诉你基础模型、精度、预期输入形状和许可。它不给你训练数据或完整配方。

为什么标签不如访问权重要

Prompt Engineering 提议拆分词汇:用“开放权重”指覆盖神经网络权重的许可,用“伦理权重”指专为权重设计的另一类许可。这一建议没有被广泛采纳,营销宣传也没有放慢。

  • 开放权重:参数发布,训练代码和数据保留,允许使用和微调。
  • 开源:架构代码、训练方法、超参数、原始数据集和文档一并发布。
  • 受限权重:参数只在重大的法律或伦理限制下可用。

这一区分还有一层二阶效应,很少出现在发布公告里。用 Prompt Engineering 的话说,开源推动去中心化的进展,因为全世界的研究者都能提出改进和替代发展方向,进展不必被少数有能力训练大型专有模型的公司卡住。开放权重则相反,把这种能力集中起来,同时把成品分发出去。

这一切并不意味着开放权重发布毫无价值。记忆研究之所以存在,正是因为它们并非毫无价值。但一个可下载的检查点是一份使用模型的许可,不是一份理解模型的许可。当前关于 AI 开放性的争论,大多正发生在这两者之间的缺口里。

评论 0

资料来源

3
  1. 01Openness in Language Models: Open Source vs Open Weights vs Restricted WeightsEN
  2. 02Extracting memorized pieces of (copyrighted) books from open-weight language modelsEN
  3. 03S1-mini, Superwhisper's first open-weights language modelEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。