开源权重周报:英伟达 Kumo Tabular 领衔一周小型开源发布
英伟达9月30日发布 Kumo Tabular,这是一个用于表格预测的开源基础模型。公司称它无需训练、调参或特征工程,在四项基准测试中排名第一。这一周开源权重发布密集,从164 MB 的语音模型到志愿者预训练的145M参数语言模型,都在其中。

英伟达的 Kumo Tabular 是这批发布里名气最大的一个,但它不是语言模型。给它一张带标签行的表格,它在一次前向传播中就能预测新行的标签。公司称它有三种规模,从28M到215M参数,预训练只用了人工数据。它按 OpenMDW-1.1 许可证发布,可用于商业用途。英伟达称它在 TabArena、BeyondArena、TALENT 和 ScoringBench 上排名第一。
小模型,小体积下载
本周最引人注目的成果并不是能力最强的那个。Fermion Research 9月30日发布 Phonon-2,这是一个开源英语语音识别模型,下载体积只有164 MB。公司称它在 Open ASR Leaderboard 的七个英语测试集上平均词错率为5.21%,而所有表现更好的开源模型,体积至少是它的5.8倍。其权重采用 CC-BY-4.0 许可,源自英伟达的 Parakeet TDT 0.6B v3。
工程细节很具体:每个编码器权重存储为五个学习到的电平之一,约2.1比特每权重,以三进制数字打包,每字节五个。Fermion 称,在 MacBook Air 上,一小时音频约20秒转成文字。在开源权重谱系的低端,这种体积与准确率的取舍就是全部卖点。
与此同时,一个名为 Coop 的志愿者项目发布了一个145M参数的纯解码器 Transformer。据其 GitHub 仓库称,预训练没有服务器,也没有资金。做法很不寻常:工作者从 Hugging Face 下载检查点,在个人数据分片上运行本地 AdamW 步骤,然后把伪梯度作为拉取请求提交到公开的 Hugging Face 数据集仓库。一个 GitHub Actions 定时任务每五分钟聚合一次提交。不过 README 指出,GitHub 的共享调度器实际触发间隔从几分钟到几小时不等。
Coop 更早的阶段是一个15M参数模型,由志愿者用 TinyStories 在六天内训练完成,验证损失从9.01降到2.8。项目自己的文档对能证明什么很谨慎:单个验证损失说明不了问题,所以排行榜对整条序列拟合斜率,横轴用 token 数而非外层步数,并给出标准误。
工具链与芯片
基础设施层也在动。英国人工智能安全研究所和 Meridian Labs 9月30日发布 Inspect,这是一个用于前沿 AI 评估的开源框架。它自带200多项预置评估、一个基于网页的 Inspect View 工具、一个 VS Code 扩展,以及一套沙箱系统,可在 Docker、Kubernetes、Modal、Proxmox 或 Vagrant 中运行不受信任的模型代码。它支持20多家模型供应商,还支持用 HuggingFace、vLLM 和 SGLang 做本地推理。
时机很关键,因为评估如今是个政治话题。9月30日,《卫报》报道美国联邦贸易委员会已对 Anthropic、OpenAI 及其他 AI 实验室展开行业范围调查。这是该机构首次针对失控 AI 智能体的正式执法行动。据该报援引的多家报道,联邦贸易委员会计划强制 Anthropic、OpenAI 和研究机构 Metr 的高管作证。三方均拒绝对《卫报》置评。《纽约邮报》最先报道了这一消息。
然后是芯片层。据 The Decoder 9月30日报道,Deepseek 正在为华为昇腾芯片发布开源编程工具,消息来自该公司官方微信公众号。核心是 TileLang,一种最初由北京大学研究人员开发的编程语言。Deepseek 认为它提供了比英伟达 CUDA 更简单的模型。路透社报道称,这套软件包含计算和数据搬运库,Deepseek 将其全部开源。Deepseek 称华为全力支持这项工作,双方优化了一个由128颗昇腾950芯片组成的超节点。
并非所有人都接受这套说法。研究机构 SemiAnalysis 测试了 OpenAI 的 Jalapeno 推理芯片,称 CUDA 的护城河“可能已死”。不过它提醒说,自己只测试了约8000输入 token 和1000输出 token 的场景,尚未运行其 AgentX 基准。今年8月,该机构还发现英伟达在智能体负载上大幅领先。
这些发布没有解决的问题
开源权重不等于开源流程。Coop 的聚合器会丢弃过期提交,其余的用截尾均值或几何中位数裁剪,然后才做一次 Nesterov 步。Inspect 的沙箱之所以存在,正是因为模型代码不可信。Phonon-2 的许可证继承自另一家公司的模型。
而一致性也不等于准确率。据 The Register 9月29日报道,开源工具 Jevstiller 把 Jev 的输出蒸馏进本地模型,报告与上游服务的一致率达到98%,同时对熟悉请求的响应最快只要15毫秒。其开发者在自己的文档里说得很直白:“一致不等于准确。”这句话可以放在本周大多数发布的下方。
政治背景更不确定。据 Ars Technica 报道,OpenAI 首席执行官 Sam Altman 在周二公司开发者日告诉记者,在能够“做出有把握的安全决策”之前不会上市。Ars Technica 援引知情人士称,公司正洽谈以约1.4万亿估值融资300亿或更多,300亿的目标最早由彭博报道。BBC News 报道了同一场活动,并指出 Altman 称名为 dots 的新智能体是“能力惊人、始终在线的智能体,几乎能处理你能想到的任何事情”。
对这一周还有另一种解读:开源权重只是更便宜的发行方式。英伟达希望 Kumo Tabular 进入企业流水线。Fermion 希望 Phonon-2 装在笔记本上。Deepseek 希望华为芯片有软件可用。Coop 想证明训练循环能在捐赠硬件上跑起来。共同点不是意识形态,而是算术:更小的产物、更少的 token 消耗、更少要租的基础设施。
这套算术是否提升了安全性,是另一个问题,而本周没有给出干净的答案。
资料来源
9- 01Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 03Coop: A small language model pretrained by volunteersEN
- 04Inspect: An open-source framework for large language model evaluationsEN
- 05US trade regulator opens investigation into AI giantsEN
- 06China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
- 07Jevstiller: Open-source tool distills Jev so you can run it locallyEN
- 08OpenAI delays IPO over AI safety concernsEN
- 09OpenAI unveils AI assistant 'dots' while safety worries delay new modelEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。