开放权重,封闭争论:监管出手,开源模型竞赛更趋激烈
CNBC 于 9 月 30 日率先证实,美国联邦贸易委员会已对 OpenAI、Anthropic 及其他 AI 实验室展开全行业调查,审查其产品给消费者带来的风险。同一周,开放权重模型在公开榜单上不断刷新成绩,OpenAI 则指控 Moonshot AI 发动蒸馏攻击。

美国联邦贸易委员会已对 OpenAI、Anthropic 及其他 AI 公司展开调查,审查其产品可能带来的危险。机构发言人于 9 月 30 日向 CNBC 证实了这一消息,《纽约邮报》最早报道了这项调查。
据《卫报》报道,这是美国首次针对失控 AI 智能体采取正式执法行动。此前 7 月已有多起相关事件被曝光。联邦贸易委员会计划发出正式的信息调取要求,并强制高管作证,其中包括研究机构 Metr。Anthropic 和 OpenAI 曾委托该机构进行独立的事件调查。
开放权重持续攀升
监管机构行动之际,开放权重榜单仍在不断洗牌。BenchLeader 的开放权重榜单在过去一天内更新,Moonshot AI 的 Kimi K3 以 66.2 分位居榜首,领先智谱 AI 的 GLM 5.3(64.7 分)和小米的 MiMo-V2.6-Pro(64.5 分)。
BenchLM.ai 对同一批模型的排名不同。在其 BenchAlign v5.8 评分中,MiMo-V2.6-Pro 以 75.5 分排第一,Qwen3.8 Max 和 MiMo-V2.6-Flash 紧随其后。两家网站采用不同的评分规则和不同的证据标签,因此分歧既关乎方法,也关乎模型。LMC Marketcap 收录了 175 个开放模型,其中 Qwen3.8 27B 以 71 分居首。The Open Weights 引用 10 月 1 日更新的 Artificial Analysis 数据,给 GLM-5.3 打出最高的智能评分 44.8,Kimi K3 以 43.6 分紧随其后。
四个榜单放在一起看,有一点是一致的:中国实验室占据了大多数靠前位置。
英伟达于 9 月 29 日切入开放模型目录的另一个角落。其面向表格数据的 Kumo Tabular 基础模型以 OpenMDW-1.1 许可证发布,提供从 28M 到 215M 参数三种规模。据该公司在 Hugging Face 的帖子介绍,该模型仅用人工数据预训练,无需训练、微调或特征工程,单次前向传播即可预测标签。英伟达称其在 TabArena、BeyondArena、TALENT 和 ScoringBench 上排名第一。
小模型,窄任务
本周更有意思的开放发布都偏小、偏专用。Fermion Research 于 9 月 30 日发布 Phonon-2,这是一个英语语音识别模型,下载量仅 164 MB,在 Open ASR Leaderboard 的七个英语数据集上平均词错误率为 5.21%,与其 2.5 GB 的教师模型相差在噪声范围内,在会议和议会演讲上表现更好。权重采用 CC-BY-4.0 许可证,源自英伟达的 Parakeet TDT 0.6B v3。
MarkTechPost 报道了 H Company 的 Holo4 系列,该系列将计算机操作权重分为两种规模:27B 稠密模型和 35B-A3B 专家混合模型。较大的一款以 Apache 2.0 许可证发布,可用于商业自托管。27B 模型按 H 公司自己的数据在 OSWorld 上得分 85.2%,每项任务成本 0.08 美元,采用 CC BY-NC 4.0 许可证,因此商业使用需通过厂商 API。MarkTechPost 指出,前沿对比使用了不同的测试框架,且 AutomationBench 的 600 个公开任务中有 480 个属于 H 公司的训练集。
“又快又便宜很容易,你知道的,”TypeSafe 首席执行官 Diogo Almeida 对 TechCrunch 说。“如果你想要真正的又快又便宜,用骰子就行,对吧?智能才是难的部分。”
这句话点出了榜单之下的低调故事:Jev 风格的决策模型格式正在快速扩散,它返回的是选项和概率,而不是文字。据 TechCrunch 9 月 30 日报道,OpenAI 在 DevDay 上发布的 Decisions API 将同样的思路用于其 Luna 模型。Bespoke Labs 的 Nimble 是基于 Qwen3.5-9B 构建的 9B 模型,公开了完整的训练配方和 2676 条训练样本。其代码库明确表示没有从 Jev 蒸馏。Ollama 在 0.35 版本中加入了对 Nimble 的本地支持。《The Register》9 月 29 日报道的开源工具 Jevstiller 声称与 Jev 的一致率达到 98%,同时可在设备上以最快 15 毫秒响应常见请求。
指控与无所谓
9 月 30 日政治气温升高。OpenAI 称其瓦解了一场对抗性蒸馏行动,该行动从 7 月 1 日持续到 7 月 28 日,在 7 月 24 日和 25 日达到高峰,来自 4000 多名用户的 16000 次请求。OpenAI 的博客称核心集群来自 Moonshot AI。《The Register》在标题中点出了其中的讽刺意味,并指出 Moonshot 未回应置评请求。
Moonshot 的 Kimi K3 本周在多个开放榜单上位居前列。蒸馏指控是否会改变企业选择权重的方式,是另一个问题,而 token 账单的论据比任何指控都更有说服力。
资料来源
14- 01FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
- 02US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
- 03Best open weights AI models ranked (2026)EN
- 04Open-Source LLM Leaderboard 2026: 94 Models RankedEN
- 05Best Open Source AI Models & LLM Leaderboard (2026)EN
- 06LLM Intelligence leaderboardEN
- 07NVIDIA Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 08Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 09H Company Releases Holo4: Open-Weight Computer-Use ModelsEN
- 10OpenAI's Jev clone could help the frontier lab stop its swarming agentsEN
- 11Nimble: Data, Model, Recipe for an Open Jev (From Bespoke Labs)EN
- 12Ollama now supports Jev-like decision models all locally in 0.35EN
- 13Open source tool distills Jev so you can run it locallyEN
- 14Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。