跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

开放权重到底是什么意思,模型还藏着什么

开放权重发布让任何人都能下载模型参数,但 Mozilla 9 月 15 日发布的报告称,最好的开放模型仍比闭源领先者落后约四个月。开源促进会则认为,这个标签涵盖的内容远少于四项软件自由。

人工智能与模型解释王雅琴发布: 2026年9月28日6 分钟阅读资料来源 2
开放权重到底是什么意思,模型还藏着什么

“开放权重”如今既是一个技术说法,也是一个营销说法。直白地说:模型训练好的参数以文件形式发布,你可以下载、运行和微调。仅此而已。它没有说明模型从什么数据学来,没有说明训练用的代码,也没有说明附带什么许可。

这个区别重要,是因为这个词正被用在政策争论、采购决定,以及越来越多的国家安全论证里。所以有必要分开看:一次开放权重发布给了你什么,又扣下了什么。

四项自由的检验

开源促进会维护着软件行业多数人使用的那个定义。9 月 19 日,它在一篇博客文章中说明了立场。文章指出,AI 模型有三个主要部分:训练数据、权重或参数,以及数据准备和训练的代码。你能拿到其中哪些,决定了这个模型是闭源、开放权重,还是开源 AI。

开放权重让你拿到三者中的一项。你可以在本地运行模型,只付电费和硬件钱,也可以交给第三方托管。你可以用自己的数据微调它。这比完全闭源的系统给了更多自由。闭源系统里,你只能用厂商的基础设施,付厂商的费用。

开放权重模型限制了你修改模型的能力,你无法完整地研究它。

开源促进会的论点是,这还不足以满足四项软件自由:使用、研究、修改和分享,且无需向权利人请求许可。没有训练代码,也没有数据集或关于模型如何构建的详细说明,你就无法审视模型为什么会产生某个输出。该组织举 Ai2 的 Olmo 作为反例。这个大型语言模型发布时带上了完整的训练数据集和检查点,研究者得以向训练数据中注入新信息,观察模型如何记住或忘记它。

这类实验就是两个标签之间的实际差别。按开源促进会的解读,这也是能够验证一个模型,与只能听信别人说法的差别。

差距,以及它如何被测量

Mozilla 在 9 月 15 日发布了《开源 AI 现状》报告 1.1 版。据 Tom's Hardware 报道,所用数据截至 9 月 1 日。主要发现是:最好的开放模型在 Artificial Analysis 智能指数上落后闭源领先者三分,价格是后者的 60%,比 Claude Fable 5 低两分,成本是后者的 30%。

Mozilla 对 METR 任务时长数据的拟合把开放与闭源的差距定在约 4.4 个月,与 Epoch AI 的四个月估计一致。研究非营利机构 METR 按任务长度给模型打分,任务长度以人类工作时间衡量,看模型有一半概率完成多长的任务。按 Mozilla 的估计,闭源模型能处理人类专家要花 8 到 12 小时的任务;开放模型大约四个月后达到同样水平。Mozilla 算出开放模型的能力每 3.9 个月翻一倍,闭源为 5.5 个月。

这份报告不是中立文件,Tom's Hardware 也这么说。Mozilla 是 Firefox 背后的非营利组织,也是开放模型的倡导者。TIME 在 7 月 14 日报道,Mozilla 首席技术官 Raffi Krikorian 称这份报告带有倡导性质。它基于 Mozilla 与 SlashData 对约 1,400 名开发者的调查,加上 OpenRouter 流量数据和第三方基准指数,统计了 16 个值得注意的开放发布,其中没有一个给出开源促进会定义所要求的数据配方。

还有其他需要注意的限定条件。四个月这个数字和 30% 的 token 价格对比,是在托管端点上按标价做的 API 对 API 比较。Mozilla 自己的硬件图表讲的故事更严峻:能装在一台服务器上的最好开放模型得分 52.6,能装在一块 GPU 上的最好模型得分 40,比榜首低 10 分和 23 分。Kimi K3 的原生 MXFP4 检查点分布在 96 个分片上,约 1.56TB。Mozilla 的服务配置列出 64 个或更多加速器,而 vLLM 要求至少八块 GB300 GPU 并需要多节点才能承载生产流量。报告把这描述为开放,但多数拿到它的人跑不起来。

市场实际在做什么

采用情况和收入指向不同方向。在把开发者流量路由到数百个模型的市场 OpenRouter 上,Mozilla 统计 8 月 token 量前十的模型中有八个是开放权重,其中七个由中国团队构建。然而据 Linux 基金会,2025 年 5 月到 9 月间,闭源供应商拿走了 OpenRouter 上模型层收入的 96%。

“我们认为为闭源模型付费的决定取决于具体工作负载,而不是取决于组织,”Krikorian 在给 Ars Technica 的电子邮件中说。

基准格局变化之快,足以让任何静态比较变得复杂。Mozilla 的数据止于 9 月 1 日。此后 Artificial Analysis 把指数升级到 v4.3,评估集也换了。实时榜单显示 Claude Fable 5.1 在最高努力设置下为 53,Kimi K3 为 44。Tom's Hardware 指出,这些数字与 Mozilla 绘制的 v4.1.1 数据不可比。vals.ai 的 Terminal-Bench 2.1 榜单更新于 9 月 11 日,GPT-6 Astra 以 87.27% 领先,Fable 5.1 为 85.02%。Mozilla 自己的图表说明写着:“差距每个发布周期都会重置。”

Kimi K3 的讨论里还有一条线索。这个模型牵涉 9 月 8 日 NSA/CISA/FBI 联合公告 AA26-251A 中详述的一项指控。Mozilla 的报告把它表述为“已主张、未展示”:Moonshot 通过蒸馏提取 Claude Fable 5 的数据来训练 K3,蒸馏即用一个模型的输出训练另一个模型的做法。7 月 17 日,Artificial Analysis 给 K3 的分数是 57,Fable 5 是 60;到 9 月 1 日,Mozilla 的统计里它落后两分。

为什么这个标签会被争夺

开源促进会和 Mozilla 都在从不同角度主张更多开放。开源促进会希望把“开源”一词保留给三个部分齐全的发布,理由是随着 AI 进入日常生活,信任和验证问题会越来越难。Mozilla 希望人们认真对待开放模型实测出来的能力,同时承认领先的那些模型,多数能下载它们的人跑不起来。

对任何读模型卡的人来说,实际结论很窄,也可检验。看权重能否下载,受什么许可约束,是否附上训练代码或数据说明,以及这东西实际需要什么硬件。页面最上面那句口号,回答不了其中任何一个问题。

评论 0

资料来源

2
  1. 01China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
  2. 02Open Weights Are Good. Open Source Is Better.EN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。