跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

开放权重继续出货:Inspect、Phonon-2、Kumo Tabular,以及一个志愿者训练的 145M 模型

9 月 30 日,英国人工智能安全研究所与 Meridian Labs 发布开源评测框架 Inspect,内置 200 多项现成评测。近期开放发布接连不断,同批的还有 Fermion Research 的 Phonon-2 语音模型和 Nvidia 的 Kumo Tabular。

人工智能与模型分析王雅琴发布: 2026年9月30日3 分钟阅读资料来源 7
开放权重继续出货:Inspect、Phonon-2、Kumo Tabular,以及一个志愿者训练的 145M 模型

项目官网显示,发布时间是 9 月 30 日 15:20 UTC。Inspect 由英国人工智能安全研究所与 Meridian Labs 打造,用于前沿人工智能评测,主打覆盖面:编程、智能体任务、推理、知识、行为和多模态理解,全在一个工具里。

框架自带可组合的数据集、智能体、工具和评分器,还有一个 200 多项现成评测的库。配套工具包括网页版 Inspect View 和 VS Code 扩展。沙箱通过扩展 API,在 Docker、Kubernetes、Modal、Proxmox 或 Vagrant 中运行不受信任的模型代码。项目称支持 20 多家模型提供商,本地推理可用 HuggingFace、vLLM 和 SGLang。

评测工具是开放权重里不讨喜的那一半。权重没有度量手段,就只是一堆文件。

一个 164 MB 的语音模型,和一个不用训练的表格模型

Fermion Research 于 9 月 30 日发布 Phonon-2,称它是 900 MB 以下最准确的开放语音识别模型。下载体积 164 MB。公司表示,它在 Open ASR Leaderboard 的七个英语数据集上平均词错误率 5.21%,而得分更高的开放模型,体积至少是它的 5.8 倍。

编码器把每个权重存成五个学习电平之一,约 2.1 比特,按三进制数字打包,每字节五个。权重采用 CC-BY-4.0 许可,和它的来源模型 Nvidia Parakeet TDT 0.6B v3 一样。Fermion 称,在 MacBook Air 上一小时音频约 20 秒转成文字;在 H100 上按 128 批量处理,每天音频耗时 13 秒。

Nvidia 拿出的则是另一种压缩。Kumo Tabular 于 9 月 29 日发布在 Hugging Face 上,一次前向传播就能从带标签的表格预测标签,不用训练、不用调参、不用特征工程,分类和回归都能做。它有三个规模,从 28M 到 215M 参数,只用人工数据预训练,以 OpenMDW-1.1 许可发布,可商用。Nvidia 称它在 TabArena、BeyondArena、TALENT 和 ScoringBench 上排名第一。

志愿者、Rust,以及一个用定时任务训练的 145M 模型

更小的项目也在推进。GitHub 项目 Coop 于 9 月 30 日更新,用捐赠的消费级硬件,加上 Hugging Face 和 GitHub Actions 的免费额度,在 FineWeb-Edu 上预训练一个约 145M 参数的纯解码器 Transformer。伪梯度以拉取请求的形式提交到公开数据集仓库。一个无状态的 GitHub Actions 定时任务负责聚合,理论上每五分钟做一次 DiLoCo 式的外层步骤,不过项目指出 GitHub 调度器实际触发间隔从几分钟到几小时不等。第一阶段在 TinyStories 上训练 15M 模型,六天后超出 Chinchilla 最优预算,验证损失从 9.01 降到 2.8。

另一个 Rust 项目 PSSA 也在 9 月 30 日更新,描述的是一种非 Transformer 架构:选择性状态空间递归、情景记忆库、逐 token 权重更新。作者称,参数量相同时它比 Transformer 学得更快,在同一 CPU 上生成速度约快十二倍。仓库里没有独立基准测试。

本周的开放发布,正撞上更严厉的监管环境。《卫报》9 月 30 日报道,美国联邦贸易委员会已对 Anthropic、OpenAI 等公司启动行业范围调查,这是美国首次针对失控人工智能智能体的官方执法行动。Ars Technica 同日报道,OpenAI 因安全顾虑推迟 IPO。开放权重不是这两项行动的对象,但监管的审视态度,给与之同行的所有发布定下了基调。

评论 0

资料来源

7
  1. 01Inspect: An open-source framework for large language model evaluationsEN
  2. 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  3. 03Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  4. 04Coop: A small language model pretrained by volunteersEN
  5. 05PSSA: A non-transformer language model written from scratch in RustEN
  6. 06US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
  7. 07OpenAI delays IPO over AI safety concernsEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。