跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

开放权重不等于开源,差距越来越难衡量

Mozilla 的一份报告称,中国最好的开放权重模型目前落后美国前沿模型约四个月。批评者则认为,“开放权重”这个词正被拉伸到远远超出开源促进会定义所允许的范围。

人工智能与模型新闻林晓雯发布: 2026年9月27日4 分钟阅读资料来源 4
开放权重不等于开源,差距越来越难衡量

Mozilla 的报告《State of Open Source AI》1.1 版在 9 月 15 日发布,数据截至 9 月 1 日。报告统计了 16 个值得关注的开放发布。据 Tom's Hardware 转述,这些发布没有一个提供开源促进会《开源 AI 定义》所要求的训练数据配方。

下载一个模型很容易。想知道它用了什么、或者把它重新做出来,并不容易。这就是本月开放权重新闻背后的张力。

四个月这个数字,以及它的保留条件

Mozilla 的核心主张是差距在缩小。在 Artificial Analysis 智能指数上,最好的开放模型以 60% 的价格落后闭源领先者三个点,以 30% 的价格落后 Claude Fable 5 两个点。Mozilla 对 METR 任务时间跨度数据做了拟合,得出开放与闭源之间的差距约为 4.4 个月,与 Epoch AI 的四个月估计一致。按 Mozilla 的计算,开放模型的能力每 3.9 个月翻一倍,闭源模型为 5.5 个月。

报告依据 Mozilla 与 SlashData 对约 1400 名开发者的调查、OpenRouter 流量数据以及第三方基准指数。Mozilla 是开放模型的倡导者。TIME 在 7 月 14 日报道称,Mozilla 首席技术官 Raffi Krikorian 表示这份报告带有倡导性质。Mozilla 称,四个月这一数字和 30% 的 token 价格数字都是在托管端点上按 API 对 API、按标价测得的。

硬件是故事不那么好看的地方。报告自己的图表显示,能装进一台服务器的最好开放模型得分为 52.6,能装进一块 GPU 的最好模型为 40。与榜首的落差分别是 10 分和 23 分,比四个月所暗示的差距更大。Kimi K3 的原生 MXFP4 检查点分布在 96 个分片上,约 1.56TB,Mozilla 的部署配置列出 64 个或更多加速器。报告把这种情况描述为开放,但大多数拿到它的人跑不起来。

也有反例。Thinking Machines 的 Inkling-Small 采用 Apache 2.0 许可,其 NVFP4 版本在 180GB 下限下能装进一块 B300。

“开放”被要求意味着什么

The Register 的 Steven J. Vaughan-Nichols 在 9 月 15 日撰文认为,业界滥用了这个词。他写道,把权重发布到 Hugging Face 并让开发者在自己的 GPU 上运行,这是开放权重的分发,不是开源。他说,这一区别决定的是:你只能部署一个成品网络,还是能够检查、复现、修改并再分发产生它的那套系统。

OSI 直接做出了区分:“开放权重指的是训练好的神经网络的最终权重和偏置。”OSI 还补充说,仅有权重只暴露了“实现完整问责所需信息的一小部分”。

斯坦福以人为本人工智能研究院主任 James Landay 对 The Register 说:“开放权重是进步。你可以下载模型,在自己的机器上运行,把它挡在别人的数据管线之外。但你仍然看不到这东西是怎么造的、用什么训练的、为什么会有这样的行为。那不是开放模型,那是开放分发。”

Landay 的担忧很具体:没有训练数据或详细文档,外部人无法判断使用了哪些来源、可能包含哪些受版权保护或私密材料、数据是如何筛选或删除的、哪些语言被低估、基准数据是否泄漏进训练,以及预训练之后有哪些对齐方法塑造了模型。

2024 年 10 月发布的《开源 AI 定义》1.0 要求模型参数(包括权重)以 OSI 认可的条款提供,但没有规定法律机制。Lightning AI 首席技术官 Luca Antiga 曾表示,这种处理留下了一个“巨大的漏洞”,会削弱许可证作为实际可采纳性信号的作用。原版《开源定义》的作者 Bruce Perens 在 2024 年公开谴责 OSAID,后来又说 OSI 本身如今也参与了 openwashing。软件自由保护协会的 Bradley Kuhn 和红帽的 Richard Fontana 都呼吁废除 OSAID。

记忆化的实际问题就压在这整件事下面。A. Feder Cooper、Mark A. Lemley 及合著者的一篇论文于 2025 年 5 月提交到 arXiv,并修订至 2026 年 7 月,在 200 本书和 14 个开放权重 LLM 上进行了超过 3000 次实验。作者发现,大多数 LLM 没有记住大多数书。但 Llama 3.1 70B 完全记住了其中一些书名,包括《哈利·波特与魔法石》,从开头几个词就能几乎逐字提取整本书。

与此同时,开放权重生态仍在持续发布。Superwhisper 发布了 S1-mini,一个 0.6B 参数的语音转文字输出文本规范化器,基于 Qwen/Qwen3-0.6B 微调,采用 Apache 2.0 加一条命名条款。它报告在 7519 个留出的英文案例上达到 94.8% 的 token 准确率,量化版本为 462 MiB,可在笔记本 CPU 上运行。

小、可下载、文档足够运行。问责的问题是另一份文件。

评论 0

资料来源

4
  1. 01China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
  2. 02Open weights are not open source: Why AI's favorite label is under disputeEN
  3. 03Extracting memorized pieces of (copyrighted) books from open-weight language modelsEN
  4. 04S1-mini, Superwhisper's first open-weights language modelEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。