跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

开放权重接连落地:164 MB 语音模型、145M 参数志愿算力项目,以及中国的 CUDA 替代方案

英伟达 9 月 29 日在 Hugging Face 发布开放基础模型 Kumo Tabular,用于表格预测。次日,Fermion Research 放出 164 MB 的语音模型 Phonon-2。与此同时,美国联邦贸易委员会对 AI 实验室展开全行业调查,OpenAI 则搁置了自己的 IPO。

人工智能与模型分析王雅琴发布: 2026年9月30日3 分钟阅读资料来源 6
开放权重接连落地:164 MB 语音模型、145M 参数志愿算力项目,以及中国的 CUDA 替代方案

英伟达 9 月 29 日把 Kumo Tabular 放上 Hugging Face。帖子标注日期为 9 月 29 日,9 月 30 日发到博客。按帖子的说法,模型一次前向传播就能给出新行的标签,不用训练,不用微调,也不用做特征工程。它有三个规模,从 28M 到 215M 参数,只用人工数据预训练,以 OpenMDW-1.1 许可证发布,可商用。英伟达称它在 TabArena、BeyondArena、TALENT 和 ScoringBench 上排名第一。

这个说法范围很窄,英伟达自己也没往大了说:只做表格分类和回归,也就是存放客户记录、交易和传感器日志的那些表格。卖点是把上下文学习用在行上,而不是用在文本上。模型在数百万张表格上预训练过,读入一张带标签的表格作为上下文,返回类别概率;回归则返回 999 个分位数,由此得到点预测和不确定性估计。

Fermion Research 9 月 30 日发布 Phonon-2,称它是 900 MB 以下最准确的开放语音识别模型。

下载包 164 MB,编码器把每个权重存成约 2.1 位,权重采用 CC-BY-4.0 许可证,它派生自的英伟达 Parakeet TDT 0.6B v3 用的也是这个许可证。Fermion 报告,在 Open ASR Leaderboard 的七个英语数据集上平均词错误率为 5.21 %;得分更好的开放模型,体积至少是它的 5.8 倍。在 MacBook Air 上,一小时音频转成文字约需 20 秒。这些数字来自厂商页面,排行榜名次只能算厂商声称,没有独立核实。

志愿者,以及一个无状态定时任务

同样在 9 月 30 日,GitHub 项目 Coop 上线第二阶段:一个约 145M 参数的纯解码器 Transformer,在 FineWeb-Edu 上从零开始预训练,算力全部来自捐赠的消费级硬件,外加 Hugging Face 和 GitHub Actions 的免费额度。没有服务器,也没有守护进程。工作节点下载检查点,在自己的数据分片上跑本地 AdamW 步骤,再把伪梯度作为拉取请求提交到公共数据集仓库。

一个无状态的 GitHub Actions 定时任务负责每轮聚合:丢弃过期提交,对其余的做裁剪和余弦门控,聚合,走一步 Nesterov 外层更新,再上传新的检查点。仓库称,一个 15M 参数的第一阶段模型曾在六天内于 TinyStories 上预训练超过其 Chinchilla 最优预算,验证损失从 9.01 降到 2.8。这是机制验证,不是有竞争力的模型。

中国的推进是更大的战略故事。据 The Decoder 和路透社 9 月 30 日报道,Deepseek 在其微信频道发帖,发布了面向华为昇腾芯片的开源编程工具。核心是 TileLang,一门最初由北京大学开发的开源语言,Deepseek 称它提供了比 CUDA 更简单的编程模型。Deepseek 说华为“全力支持”这项工作,双方优化了一个 128 颗昇腾 950 芯片的超级节点。

背景是英伟达的开发者护城河:约四百万 CUDA 开发者。The Decoder 还引用 SemiAnalysis 的测试,后者测试了 OpenAI 的 Jalapeno 推理芯片,称 CUDA 护城河“可能已死”,同时提醒它只测了约 8000 输入 token 和 1000 输出 token 这类相对容易的场景。华为的芯片不在那次对比中。

权重出货之时,监管也在行动

这些都不是在真空里发生的。《卫报》9 月 30 日报道,美国联邦贸易委员会正在对 Anthropic、OpenAI 及其他实验室展开全行业调查,并计划强制包括 Metr 在内的高管作证。《纽约邮报》最先报道此事。与此同时,OpenAI 搁置了自己的上市:Ars Technica 9 月 30 日报道,Sam Altman 表示在公司能够“做出有把握的安全决策”之前不会上市;同一天,LASST 在加州提起诉讼。

上述开放权重发布都很小、很便宜、很具体。值得关注的是这个模式,而不是那些基准表格。

评论 0

资料来源

6
  1. 01Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  2. 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  3. 03Coop: A small language model pretrained by volunteersEN
  4. 04China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
  5. 05US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
  6. 06OpenAI delays IPO over AI safety concernsEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。