跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

开放权重走向小型化:Phonon-2、Kumo Tabular 与志愿者训练的模型同日发布

Fermion Research 于 9 月 30 日发布 Phonon-2。这是一个开放语音识别模型,下载包只有 164 MB,在 Open ASR Leaderboard 的七个英语数据集上平均词错误率为 5.21%。几小时内,Nvidia 的 Kumo Tabular 和一个由志愿者训练的 145M 参数语言模型也相继发布。

人工智能与模型新闻王雅琴发布: 2026年9月30日3 分钟阅读资料来源 7
开放权重走向小型化:Phonon-2、Kumo Tabular 与志愿者训练的模型同日发布

一天之内有三个开放权重模型发布,没有一个在拼规模。Fermion Research 于 9 月 30 日发布 Phonon-2。这是一个英语语音识别模型,把每个编码器权重存为五个学习电平之一,约 2.1 比特,文件大小 164 MB。公司称它在各个数据集上与 2.5 GB 的全精度教师模型持平,在会议和议会演讲数据上还更好,在 MacBook Air 上转录一小时音频约需 20 秒。权重放在 Hugging Face 上,采用 CC-BY-4.0 许可,与 Nvidia 的 Parakeet TDT 0.6B v3 相同,Phonon-2 正是由它衍生而来。

最后这点很关键。小型开放模型的竞争,很大程度上是教师模型和许可的竞争。

Fermion 称,在 Open ASR Leaderboard 七个英语数据集上得分更高的开放模型,体积至少是它的 5.8 倍。这一领先在噪声条件下依然成立,超过同尺寸的另一个低比特模型 Parakeet Redux。速度数据附有条件:一次只处理一段音频,包含 log-mel 计算,不包含模型加载时间。每条快速路径只有在配对自举检验(对音频片段重采样 4000 次)下词错误率与精确路径的差距落在噪声范围内时才会发布。

Kumo Tabular 直指树模型的生命周期

Nvidia 于 9 月 29 日发布 Kumo Tabular。这是一个用于表格分类和回归的开放基础模型,一次前向传播即可预测新行,无需训练、调参或特征工程。它有三个尺寸,从 28M 到 215M 参数,采用 OpenMDW-1.1 许可,可商用。据 Hugging Face 帖子所述,它在四个基准上排名第一:TabArena、BeyondArena、TALENT 和 ScoringBench。

架构借鉴了 TabICL 和 TabPFN,包含列注意力、行注意力和上下文注意力。公司称它只用人工数据预训练,避开了用客户表格训练带来的隐私问题。它能否在生产环境取代梯度提升树,与基准排名是两回事,Nvidia 的帖子没有回答。

一个用 GitHub Actions 和捐赠硬件训练的语言模型

Coop 项目是一个 9 月 30 日上线的 GitHub 仓库,尝试的事情更奇怪:没有服务器、没有资金,预训练一个小语言模型。第二阶段是一个约 145M 参数的纯解码器 Transformer,从零开始在 FineWeb-Edu 上训练。工作节点从 Hugging Face 下载检查点,在个人数据分片上跑本地 AdamW 步骤,再把伪梯度作为拉取请求提交到公开数据集仓库。一个无状态的 GitHub Actions 定时任务每五分钟运行一次,用截尾均值或几何中位数汇总提交,并执行一次 Nesterov 外层更新。

第一阶段就是证明:一个 15M 参数模型由志愿者在六天内训练,超出了 Chinchilla 最优预算,验证损失从 9.01 降到 2.8。权重保持可获取。项目自己的文档在评估问题上异常坦诚,指出单个验证损失数字说明不了什么,因为外层更新让它上升的次数和下降的次数差不多,方向是一整个序列的性质,而不是某一个点。

这个窗口里还有另外两个开放发布。英国 AI 安全研究所和 Meridian Labs 发布了 Inspect。这是一个评估框架,带有 200 多个预置评估,并能在 Docker、Kubernetes 和 Modal 中沙箱化运行不可信的模型代码。Sparticle62ops 发布了 PSSA,一个用 Rust 写的非 Transformer 语言模型,底下没有任何机器学习框架,声称在相同参数下比 Transformer 学得更快,在同一 CPU 上生成文本约快十二倍。

开放权重并不是全部。同样在 9 月 30 日,FTC 对 Anthropic、OpenAI 和研究机构 Metr 展开全行业调查,这是美国针对失控 AI 代理的首次官方执法行动,据 The Guardian 报道。与此同时,OpenAI 推迟 IPO,并出于安全考虑暂缓发布一个模型,据 Ars Technica 报道。对比很难忽略:顺利发布的都是小模型,被审查的都是估值最高的公司。

评论 0

资料来源

7
  1. 01Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  2. 02Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  3. 03Coop: A small language model pretrained by volunteersEN
  4. 04Inspect: An open-source framework for large language model evaluationsEN
  5. 05PSSA: A non-transformer language model written from scratch in RustEN
  6. 06US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
  7. 07OpenAI delays IPO over AI safety concernsEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。