跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

开放权重,封闭争论:监管出手,开源模型竞赛更趋激烈

CNBC 于 9 月 30 日率先证实,美国联邦贸易委员会已对 OpenAI、Anthropic 及其他 AI 实验室展开全行业调查,审查其产品给消费者带来的风险。同一周,开放权重模型在公开榜单上不断刷新成绩,OpenAI 则指控 Moonshot AI 发动蒸馏攻击。

人工智能与模型分析林晓雯发布: 2026年9月30日4 分钟阅读资料来源 14
开放权重,封闭争论:监管出手,开源模型竞赛更趋激烈

美国联邦贸易委员会已对 OpenAI、Anthropic 及其他 AI 公司展开调查,审查其产品可能带来的危险。机构发言人于 9 月 30 日向 CNBC 证实了这一消息,《纽约邮报》最早报道了这项调查。

据《卫报》报道,这是美国首次针对失控 AI 智能体采取正式执法行动。此前 7 月已有多起相关事件被曝光。联邦贸易委员会计划发出正式的信息调取要求,并强制高管作证,其中包括研究机构 Metr。Anthropic 和 OpenAI 曾委托该机构进行独立的事件调查。

开放权重持续攀升

监管机构行动之际,开放权重榜单仍在不断洗牌。BenchLeader 的开放权重榜单在过去一天内更新,Moonshot AI 的 Kimi K3 以 66.2 分位居榜首,领先智谱 AI 的 GLM 5.3(64.7 分)和小米的 MiMo-V2.6-Pro(64.5 分)。

BenchLM.ai 对同一批模型的排名不同。在其 BenchAlign v5.8 评分中,MiMo-V2.6-Pro 以 75.5 分排第一,Qwen3.8 Max 和 MiMo-V2.6-Flash 紧随其后。两家网站采用不同的评分规则和不同的证据标签,因此分歧既关乎方法,也关乎模型。LMC Marketcap 收录了 175 个开放模型,其中 Qwen3.8 27B 以 71 分居首。The Open Weights 引用 10 月 1 日更新的 Artificial Analysis 数据,给 GLM-5.3 打出最高的智能评分 44.8,Kimi K3 以 43.6 分紧随其后。

四个榜单放在一起看,有一点是一致的:中国实验室占据了大多数靠前位置。

英伟达于 9 月 29 日切入开放模型目录的另一个角落。其面向表格数据的 Kumo Tabular 基础模型以 OpenMDW-1.1 许可证发布,提供从 28M 到 215M 参数三种规模。据该公司在 Hugging Face 的帖子介绍,该模型仅用人工数据预训练,无需训练、微调或特征工程,单次前向传播即可预测标签。英伟达称其在 TabArena、BeyondArena、TALENT 和 ScoringBench 上排名第一。

小模型,窄任务

本周更有意思的开放发布都偏小、偏专用。Fermion Research 于 9 月 30 日发布 Phonon-2,这是一个英语语音识别模型,下载量仅 164 MB,在 Open ASR Leaderboard 的七个英语数据集上平均词错误率为 5.21%,与其 2.5 GB 的教师模型相差在噪声范围内,在会议和议会演讲上表现更好。权重采用 CC-BY-4.0 许可证,源自英伟达的 Parakeet TDT 0.6B v3。

MarkTechPost 报道了 H Company 的 Holo4 系列,该系列将计算机操作权重分为两种规模:27B 稠密模型和 35B-A3B 专家混合模型。较大的一款以 Apache 2.0 许可证发布,可用于商业自托管。27B 模型按 H 公司自己的数据在 OSWorld 上得分 85.2%,每项任务成本 0.08 美元,采用 CC BY-NC 4.0 许可证,因此商业使用需通过厂商 API。MarkTechPost 指出,前沿对比使用了不同的测试框架,且 AutomationBench 的 600 个公开任务中有 480 个属于 H 公司的训练集。

“又快又便宜很容易,你知道的,”TypeSafe 首席执行官 Diogo Almeida 对 TechCrunch 说。“如果你想要真正的又快又便宜,用骰子就行,对吧?智能才是难的部分。”

这句话点出了榜单之下的低调故事:Jev 风格的决策模型格式正在快速扩散,它返回的是选项和概率,而不是文字。据 TechCrunch 9 月 30 日报道,OpenAI 在 DevDay 上发布的 Decisions API 将同样的思路用于其 Luna 模型。Bespoke Labs 的 Nimble 是基于 Qwen3.5-9B 构建的 9B 模型,公开了完整的训练配方和 2676 条训练样本。其代码库明确表示没有从 Jev 蒸馏。Ollama 在 0.35 版本中加入了对 Nimble 的本地支持。《The Register》9 月 29 日报道的开源工具 Jevstiller 声称与 Jev 的一致率达到 98%,同时可在设备上以最快 15 毫秒响应常见请求。

指控与无所谓

9 月 30 日政治气温升高。OpenAI 称其瓦解了一场对抗性蒸馏行动,该行动从 7 月 1 日持续到 7 月 28 日,在 7 月 24 日和 25 日达到高峰,来自 4000 多名用户的 16000 次请求。OpenAI 的博客称核心集群来自 Moonshot AI。《The Register》在标题中点出了其中的讽刺意味,并指出 Moonshot 未回应置评请求。

Moonshot 的 Kimi K3 本周在多个开放榜单上位居前列。蒸馏指控是否会改变企业选择权重的方式,是另一个问题,而 token 账单的论据比任何指控都更有说服力。

评论 0

资料来源

14
  1. 01FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
  2. 02US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
  3. 03Best open weights AI models ranked (2026)EN
  4. 04Open-Source LLM Leaderboard 2026: 94 Models RankedEN
  5. 05Best Open Source AI Models & LLM Leaderboard (2026)EN
  6. 06LLM Intelligence leaderboardEN
  7. 07NVIDIA Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  8. 08Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  9. 09H Company Releases Holo4: Open-Weight Computer-Use ModelsEN
  10. 10OpenAI's Jev clone could help the frontier lab stop its swarming agentsEN
  11. 11Nimble: Data, Model, Recipe for an Open Jev (From Bespoke Labs)EN
  12. 12Ollama now supports Jev-like decision models all locally in 0.35EN
  13. 13Open source tool distills Jev so you can run it locallyEN
  14. 14Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。