开放权重模型差距缩小:新榜单、新硬件与一笔芯片交易
10月1日,The Open Weights 转载的 Artificial Analysis Intelligence Index 把智谱 AI 的 GLM-5.3 排在 20 个开放权重模型榜单首位,得分 44.8,领先月之暗面的 Kimi K3(43.6)。新模型还在不断发布。

10月1日,The Open Weights 转载的 Artificial Analysis Intelligence Index 把智谱 AI 的 GLM-5.3 排在 20 个开放权重模型榜单首位,得分 44.8,领先月之暗面的 Kimi K3(43.6)。新模型还在不断发布。
各榜单之间并不一致,这一点值得直说。BenchLeader 的开放权重榜在发稿前 12 小时更新,把月之暗面的 Kimi K3 排在首位,得分 66.2;智谱的 GLM 5.3 max 以 64.7 位列第二,小米的 MiMo-V2.6-Pro 以 64.5 排在第三。BenchLM.ai 的 94 个模型榜单则把 MiMo-V2.6-Pro 排在首位,BenchAlign v5.8 得分 75.5,其后是 Qwen3.8 Max 和 MiMo-V2.6-Flash。LMMarketCap 在 10月1日 06:00 发布更新,把阿里巴巴的 Qwen3.8 27B 排在 175 个开放模型的首位,谷歌的 Gemma 4 26B A4B 与 Gemma 4 31B 并列第二。
评委不同,冠军不同。四个榜单唯一共同的地方是,排名靠前的都是中国实验室和谷歌,英伟达、Meta 和 Mistral 更靠后。
过去 72 小时还出现了几个尚未进入这些榜单的新开放模型。英伟达在 9月29日 发布 Kumo Tabular,这是一个用于表格分类与回归的基础模型,有 28M 到 215M 参数三种规模。它仅用人工数据预训练,以 OpenMDW-1.1 许可证发布,可商用。公司称它在 TabArena、BeyondArena、TALENT 和 ScoringBench 上排名第一,并且每个任务都不需要训练或特征工程。
Fermion Research 在 9月30日 发布 Phonon-2,这是一个英语语音识别模型,下载包 164 MB,其编码器把每个权重存成约 2.1 bit。公司称它在 Open ASR Leaderboard 的七个英语数据集上平均词错误率为 5.21%,所有表现更好的开放模型至少比它大 5.8 倍,在 MacBook Air 上转录一小时音频约需 20 秒。权重采用 CC-BY-4.0,源自英伟达的 Parakeet TDT 0.6B v3。Bespoke Labs 在 9月30日 发布 Nimble,这是一个基于 Qwen3.5-9B 的 9B 模型,返回带概率的类型化决策而非自由文本。其 README 说,训练样本和留出样本在 9月20日 公布,此前它们被排除在首个版本之外。
两个开放项目正在测试训练循环本身能否分布式进行。Commonsense AI 的 coop 仓库在 9月30日 更新,描述了一个约 145M 参数、在 FineWeb-Edu 上从零预训练的模型:志愿者在捐赠的硬件上运行本地 AdamW 步骤,把伪梯度以 Hugging Face pull request 的形式提交,一个无状态的 GitHub Actions cron 每五分钟用截尾均值或几何中位数把它们聚合起来。第一阶段是在 TinyStories 上的 15M 模型,已超出其 Chinchilla 最优预算完成训练。另外,PSSA 是一个用 Rust 编写、底层不含任何机器学习框架的非 transformer 语言模型。它声称在相同参数量下比 transformer 学得更快,在同一 CPU 上生成速度约为十二倍。
商业一侧也有动作。OpenAI 和 Synopsys 在 9月30日 表示,双方签署了多年合作协议,要构建 GPT-Synopsys,这是一个用于芯片设计与验证的模型,将直接操作 Synopsys 的 EDA 工具,运行在 OpenAI 的基础设施上,客户数据不用于训练,收入由双方分成。The Register 在 9月30日 报道,OpenAI 指控与月之暗面有关的个人从 7月1日 开始进行蒸馏活动,7月24日 和 25日 出现峰值,来自 4000 多名用户的 16000 次请求,相关活动涉及 15000 多个账户,并于 7月28日 被阻断。月之暗面未回应 The Register 的置评请求。
监管机构正在盯上同一批实验室。CNBC 在 9月30日 证实,美国联邦贸易委员会已对 OpenAI、Anthropic 及其他公司展开行业范围调查;《卫报》同日报道,该机构计划正式要求提供信息和作证,其中包括研究机构 Metr。OpenAI 和 Anthropic 均未向 CNBC 置评;《纽约邮报》最先报道了这项调查。9月29日,非营利组织 Legal Advocates for Safe Science & Technology 就 7月 的 Hugging Face 黑客事件在旧金山县高等法院起诉 OpenAI,寻求禁令而非赔偿。据 Ars Technica 报道,该媒体引述 OpenAI 称这起诉讼「完全没有依据」。
对今天要挑选开放模型的人来说,本周的实际教训是:没有任何一个榜单能一锤定音。各榜单排名的是不同的模型集合,而一个 164 MB 的语音模型或一个 215M 的表格模型,对某次部署来说可能比谁排第一更重要。
资料来源
14- 01LLM Intelligence leaderboard - The Open WeightsEN
- 02Best open weights AI models ranked (2026) - BenchLeaderEN
- 03Open-Source LLM Leaderboard 2026: 94 Models Ranked - BenchLM.aiEN
- 04Best Open Source AI Models & LLM Leaderboard (2026) - LMMarketCapEN
- 05Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 06Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 07Nimble: Data, Model, Recipe for an Open Jev (From Bespoke Labs)EN
- 08Coop: A small language model pretrained by volunteersEN
- 09PSSA: A non-transformer language model written from scratch in RustEN
- 10OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
- 11Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
- 12FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
- 13US trade regulator opens investigation into AI giantsEN
- 14"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。