开放权重走向小型化:Phonon-2、Kumo Tabular 与志愿者训练的模型同日发布
Fermion Research 于 9 月 30 日发布 Phonon-2。这是一个开放语音识别模型,下载包只有 164 MB,在 Open ASR Leaderboard 的七个英语数据集上平均词错误率为 5.21%。几小时内,Nvidia 的 Kumo Tabular 和一个由志愿者训练的 145M 参数语言模型也相继发布。

一天之内有三个开放权重模型发布,没有一个在拼规模。Fermion Research 于 9 月 30 日发布 Phonon-2。这是一个英语语音识别模型,把每个编码器权重存为五个学习电平之一,约 2.1 比特,文件大小 164 MB。公司称它在各个数据集上与 2.5 GB 的全精度教师模型持平,在会议和议会演讲数据上还更好,在 MacBook Air 上转录一小时音频约需 20 秒。权重放在 Hugging Face 上,采用 CC-BY-4.0 许可,与 Nvidia 的 Parakeet TDT 0.6B v3 相同,Phonon-2 正是由它衍生而来。
最后这点很关键。小型开放模型的竞争,很大程度上是教师模型和许可的竞争。
Fermion 称,在 Open ASR Leaderboard 七个英语数据集上得分更高的开放模型,体积至少是它的 5.8 倍。这一领先在噪声条件下依然成立,超过同尺寸的另一个低比特模型 Parakeet Redux。速度数据附有条件:一次只处理一段音频,包含 log-mel 计算,不包含模型加载时间。每条快速路径只有在配对自举检验(对音频片段重采样 4000 次)下词错误率与精确路径的差距落在噪声范围内时才会发布。
Kumo Tabular 直指树模型的生命周期
Nvidia 于 9 月 29 日发布 Kumo Tabular。这是一个用于表格分类和回归的开放基础模型,一次前向传播即可预测新行,无需训练、调参或特征工程。它有三个尺寸,从 28M 到 215M 参数,采用 OpenMDW-1.1 许可,可商用。据 Hugging Face 帖子所述,它在四个基准上排名第一:TabArena、BeyondArena、TALENT 和 ScoringBench。
架构借鉴了 TabICL 和 TabPFN,包含列注意力、行注意力和上下文注意力。公司称它只用人工数据预训练,避开了用客户表格训练带来的隐私问题。它能否在生产环境取代梯度提升树,与基准排名是两回事,Nvidia 的帖子没有回答。
一个用 GitHub Actions 和捐赠硬件训练的语言模型
Coop 项目是一个 9 月 30 日上线的 GitHub 仓库,尝试的事情更奇怪:没有服务器、没有资金,预训练一个小语言模型。第二阶段是一个约 145M 参数的纯解码器 Transformer,从零开始在 FineWeb-Edu 上训练。工作节点从 Hugging Face 下载检查点,在个人数据分片上跑本地 AdamW 步骤,再把伪梯度作为拉取请求提交到公开数据集仓库。一个无状态的 GitHub Actions 定时任务每五分钟运行一次,用截尾均值或几何中位数汇总提交,并执行一次 Nesterov 外层更新。
第一阶段就是证明:一个 15M 参数模型由志愿者在六天内训练,超出了 Chinchilla 最优预算,验证损失从 9.01 降到 2.8。权重保持可获取。项目自己的文档在评估问题上异常坦诚,指出单个验证损失数字说明不了什么,因为外层更新让它上升的次数和下降的次数差不多,方向是一整个序列的性质,而不是某一个点。
这个窗口里还有另外两个开放发布。英国 AI 安全研究所和 Meridian Labs 发布了 Inspect。这是一个评估框架,带有 200 多个预置评估,并能在 Docker、Kubernetes 和 Modal 中沙箱化运行不可信的模型代码。Sparticle62ops 发布了 PSSA,一个用 Rust 写的非 Transformer 语言模型,底下没有任何机器学习框架,声称在相同参数下比 Transformer 学得更快,在同一 CPU 上生成文本约快十二倍。
开放权重并不是全部。同样在 9 月 30 日,FTC 对 Anthropic、OpenAI 和研究机构 Metr 展开全行业调查,这是美国针对失控 AI 代理的首次官方执法行动,据 The Guardian 报道。与此同时,OpenAI 推迟 IPO,并出于安全考虑暂缓发布一个模型,据 Ars Technica 报道。对比很难忽略:顺利发布的都是小模型,被审查的都是估值最高的公司。
资料来源
7- 01Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 02Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 03Coop: A small language model pretrained by volunteersEN
- 04Inspect: An open-source framework for large language model evaluationsEN
- 05PSSA: A non-transformer language model written from scratch in RustEN
- 06US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
- 07OpenAI delays IPO over AI safety concernsEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。