跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

开放权重模型差距缩小:新榜单、新硬件与一笔芯片交易

10月1日,The Open Weights 转载的 Artificial Analysis Intelligence Index 把智谱 AI 的 GLM-5.3 排在 20 个开放权重模型榜单首位,得分 44.8,领先月之暗面的 Kimi K3(43.6)。新模型还在不断发布。

人工智能与模型分析王雅琴发布: 2026年9月30日4 分钟阅读资料来源 14
开放权重模型差距缩小:新榜单、新硬件与一笔芯片交易

10月1日,The Open Weights 转载的 Artificial Analysis Intelligence Index 把智谱 AI 的 GLM-5.3 排在 20 个开放权重模型榜单首位,得分 44.8,领先月之暗面的 Kimi K3(43.6)。新模型还在不断发布。

各榜单之间并不一致,这一点值得直说。BenchLeader 的开放权重榜在发稿前 12 小时更新,把月之暗面的 Kimi K3 排在首位,得分 66.2;智谱的 GLM 5.3 max 以 64.7 位列第二,小米的 MiMo-V2.6-Pro 以 64.5 排在第三。BenchLM.ai 的 94 个模型榜单则把 MiMo-V2.6-Pro 排在首位,BenchAlign v5.8 得分 75.5,其后是 Qwen3.8 Max 和 MiMo-V2.6-Flash。LMMarketCap 在 10月1日 06:00 发布更新,把阿里巴巴的 Qwen3.8 27B 排在 175 个开放模型的首位,谷歌的 Gemma 4 26B A4B 与 Gemma 4 31B 并列第二。

评委不同,冠军不同。四个榜单唯一共同的地方是,排名靠前的都是中国实验室和谷歌,英伟达、Meta 和 Mistral 更靠后。

过去 72 小时还出现了几个尚未进入这些榜单的新开放模型。英伟达在 9月29日 发布 Kumo Tabular,这是一个用于表格分类与回归的基础模型,有 28M 到 215M 参数三种规模。它仅用人工数据预训练,以 OpenMDW-1.1 许可证发布,可商用。公司称它在 TabArena、BeyondArena、TALENT 和 ScoringBench 上排名第一,并且每个任务都不需要训练或特征工程。

Fermion Research 在 9月30日 发布 Phonon-2,这是一个英语语音识别模型,下载包 164 MB,其编码器把每个权重存成约 2.1 bit。公司称它在 Open ASR Leaderboard 的七个英语数据集上平均词错误率为 5.21%,所有表现更好的开放模型至少比它大 5.8 倍,在 MacBook Air 上转录一小时音频约需 20 秒。权重采用 CC-BY-4.0,源自英伟达的 Parakeet TDT 0.6B v3。Bespoke Labs 在 9月30日 发布 Nimble,这是一个基于 Qwen3.5-9B 的 9B 模型,返回带概率的类型化决策而非自由文本。其 README 说,训练样本和留出样本在 9月20日 公布,此前它们被排除在首个版本之外。

两个开放项目正在测试训练循环本身能否分布式进行。Commonsense AI 的 coop 仓库在 9月30日 更新,描述了一个约 145M 参数、在 FineWeb-Edu 上从零预训练的模型:志愿者在捐赠的硬件上运行本地 AdamW 步骤,把伪梯度以 Hugging Face pull request 的形式提交,一个无状态的 GitHub Actions cron 每五分钟用截尾均值或几何中位数把它们聚合起来。第一阶段是在 TinyStories 上的 15M 模型,已超出其 Chinchilla 最优预算完成训练。另外,PSSA 是一个用 Rust 编写、底层不含任何机器学习框架的非 transformer 语言模型。它声称在相同参数量下比 transformer 学得更快,在同一 CPU 上生成速度约为十二倍。

商业一侧也有动作。OpenAI 和 Synopsys 在 9月30日 表示,双方签署了多年合作协议,要构建 GPT-Synopsys,这是一个用于芯片设计与验证的模型,将直接操作 Synopsys 的 EDA 工具,运行在 OpenAI 的基础设施上,客户数据不用于训练,收入由双方分成。The Register 在 9月30日 报道,OpenAI 指控与月之暗面有关的个人从 7月1日 开始进行蒸馏活动,7月24日 和 25日 出现峰值,来自 4000 多名用户的 16000 次请求,相关活动涉及 15000 多个账户,并于 7月28日 被阻断。月之暗面未回应 The Register 的置评请求。

监管机构正在盯上同一批实验室。CNBC 在 9月30日 证实,美国联邦贸易委员会已对 OpenAI、Anthropic 及其他公司展开行业范围调查;《卫报》同日报道,该机构计划正式要求提供信息和作证,其中包括研究机构 Metr。OpenAI 和 Anthropic 均未向 CNBC 置评;《纽约邮报》最先报道了这项调查。9月29日,非营利组织 Legal Advocates for Safe Science & Technology 就 7月 的 Hugging Face 黑客事件在旧金山县高等法院起诉 OpenAI,寻求禁令而非赔偿。据 Ars Technica 报道,该媒体引述 OpenAI 称这起诉讼「完全没有依据」。

对今天要挑选开放模型的人来说,本周的实际教训是:没有任何一个榜单能一锤定音。各榜单排名的是不同的模型集合,而一个 164 MB 的语音模型或一个 215M 的表格模型,对某次部署来说可能比谁排第一更重要。

评论 0

资料来源

14
  1. 01LLM Intelligence leaderboard - The Open WeightsEN
  2. 02Best open weights AI models ranked (2026) - BenchLeaderEN
  3. 03Open-Source LLM Leaderboard 2026: 94 Models Ranked - BenchLM.aiEN
  4. 04Best Open Source AI Models & LLM Leaderboard (2026) - LMMarketCapEN
  5. 05Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  6. 06Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  7. 07Nimble: Data, Model, Recipe for an Open Jev (From Bespoke Labs)EN
  8. 08Coop: A small language model pretrained by volunteersEN
  9. 09PSSA: A non-transformer language model written from scratch in RustEN
  10. 10OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
  11. 11Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
  12. 12FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
  13. 13US trade regulator opens investigation into AI giantsEN
  14. 14"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。