Phonon-2、Coop 与 Kumo Tabular:开源小模型扎堆的一周
9 月 30 日,Fermion Research 发布 Phonon-2。这是一个开源英语语音识别模型,下载包 164 MB,在 Open ASR Leaderboard 的七个英语数据集上平均词错误率 5.21%。这一周真正被谈论的不是前沿模型发布,而是开放权重。

卖点就是体积。Fermion Research 说,编码器把每个权重存成五个学习到的级别之一,约 2.1 比特。权重以 CC-BY-4.0 发布,同一个文件能在 Mac、Linux、Windows 和 NVIDIA GPU 上运行。公司称,在 MacBook Air 上,一小时音频大约 20 秒就能转成文字。
同一天还有两个开源发布。NVIDIA 在 Hugging Face 上发布 Kumo Tabular,一个用于表格预测的开放基础模型。志愿者项目 Coop 发布了一个代码仓库,里面描述的小型语言模型没有服务器、没有资金,也没有守护进程。
数字到底说了什么
Phonon-2 主打的是每字节的准确率。Fermion 说,在 Open ASR Leaderboard 的七个英语数据集上,该模型平均词错误率为 5.21%;所有得分更好的开放模型,体积至少是它的 5.8 倍。公司称,它在议会演讲上达到教师模型词准确率的 100.8%,在会议场景上超过教师模型,而下载包小了 15 倍。比较对象是 NVIDIA 的 Parakeet TDT 0.6B v3,Fermion 把它列为自家权重的许可证来源。公司还说,在所有测试过的噪声水平上,Phonon-2 都领先于 Parakeet Redux,后者被描述为同规模中另一个低位宽模型。这些都是厂商数据,随模型一同发布。Fermion 的说明称,只有当词错误率与精确路径的差距落在噪声范围内时,才会启用快速路径。
NVIDIA 的表格模型做的是另一种取舍。Kumo Tabular 在一次前向传播中预测新行的标签,分类和回归都不需要训练、调参和特征工程。公司说,它只用人工数据预训练,有 28M 到 215M 参数三种规模,以 OpenMDW-1.1 许可证发布,可用于商业用途。NVIDIA 声称它在四个基准上排名第一:TabArena、BeyondArena、TALENT 和 ScoringBench。
没有主人的训练循环
Coop 是三者中最奇怪的一个。它的 GitHub 页面写道,伪梯度以 Hugging Face 拉取请求的形式到达,由一个无状态的 GitHub Actions 定时任务用 DiLoCo 聚合,权重和优化器状态只存在于 Hugging Face 上。计算靠捐赠的消费级硬件和免费额度完成。仓库说,第二阶段是一个约 145M 参数的模型,在 FineWeb-Edu 上从头预训练;第一阶段是一个 15M 模型,在 TinyStories 上训练,已经超过其 Chinchilla 最优预算。
项目声称,多台不同机器上的多名志愿者,用 Apple Silicon 和普通 CPU,训练了同一个外层步骤,并被平均成一个更新。它还记录了失败处理:一个与时间片竞争的提交被接受,但推迟一步、降低陈旧度权重;同一用户的重复轮次合并为一张票;一个做到一半的轮次被冲刷掉,而不是丢弃。这些都不是前沿工作。这正是重点。同一天,英国 AI 安全研究所和 Meridian Labs 发布 Inspect,一个用于前沿评估的开放框架,内置 200 多个评估,支持 20 多家模型提供商,并在 Docker、Kubernetes 和 Modal 中提供沙箱。
在其他地方,开放与闭源之争正在公开进行。《The Register》9 月 30 日报道,OpenAI 指控与中国 Moonshot AI 有关联的个人发动蒸馏攻击。攻击始于 7 月 1 日,7 月 24 日和 25 日出现高峰,由 4000 多名用户的 16000 次请求组成。OpenAI 说它在 7 月 28 日中断了这次行动。Moonshot 没有立即回应《The Register》的置评请求。同一天,《The Decoder》报道,DeepSeek 发布了面向华为昇腾芯片的开源编程工具,核心是 TileLang,一种最初由北京大学研究人员开发的开源语言。报道援引路透社称,这次发布还包括用于芯片间计算和数据搬运的库。DeepSeek 说华为全力支持这项工作,双方优化了一个由 128 颗昇腾 950 芯片组成的超级节点。监管机构也在同时行动。《卫报》9 月 30 日报道,FTC 已对 Anthropic 和 OpenAI 展开全行业调查,发出正式的信息和证词要求。这是美国首次针对失控 AI 代理的官方执法行动。CNBC 证实了这项调查,并说 FTC 拒绝透露其他被调查公司的名字。
上述开源发布与那起案件无关。但它们共享一个前提:能力,或者至少是有用的能力,正在流向任何人都能下载的权重。本周的证据是干着窄活的小模型、一个志愿者训练循环,以及一张厂商基准表。这是否构成一次转向,未来几个发布周期会给出答案。
资料来源
14- 01Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 02Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 03Coop: A small language model pretrained by volunteersEN
- 04Inspect: An open-source framework for large language model evaluationsEN
- 05Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
- 06China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
- 07US trade regulator opens investigation into AI giantsEN
- 08FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
- 09OpenAI delays IPO over AI safety concernsEN
- 10OpenAI unveils AI assistant 'dots' while safety worries delay new modelEN
- 11"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN
- 12"We're not going to shoot ourselves in the foot" over hack fallout, says OpenAI's chief research officerEN
- 13OpenAI's Jev clone could help the frontier lab stop its swarming agentsEN
- 14Google drops Gems for Skills, joining OpenAI and Anthropic in the shift to agent-ready prompt formatsEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。