跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

Jev 式决策模型走向端侧:Qevi-2B 与 d1 瞄准封闭式问题

周二,一个 2B 参数的图像分类器被发布到 Hugging Face。它声称,回答关于照片的封闭式问题时,速度最高可达其微调所依据的基础模型的 21 倍。Jev 式决策模型格式正从文本扩散到其他领域,这是最新的一个迹象。

人工智能与模型新闻王雅琴发布: 2026年9月29日5 分钟阅读资料来源 6
Jev 式决策模型走向端侧:Qevi-2B 与 d1 瞄准封闭式问题

9 月 29 日发布的 Qevi-2B 模型卡描述了对 Qwen3-VL-2B-Instruct 的一次全量微调,这个模型从不生成句子。问它图里有没有梯子,它返回 P(Yes) = 0.97。这个数字直接读自语言模型头的 logits,位置正是基础模型本该开始作答的地方。模型卡明确指出,调用 .generate() 再解析文本,无法复现所报告的数字,因为那并不是模型微调时走的路径。

所声称的提升在于准确率和校准,而非原始能力。

在同一批图像上,用完全相同的读出路径与基础 Qwen3-VL-2B-Instruct 对比,Qevi-2B 在域内得分为 0.977,基础模型为 0.855;在 12 个留出图像域上为 0.889,基础模型为 0.745。留出数据上的期望校准误差从 0.160 降至 0.054。

一次前向传播,多个问题

速度上的说法来自问题打包。随附的 qevi 引擎让多个问题共用同一次图像编码,并用块对角注意力掩码把它们隔开。模型卡称,这样得到的答案与分开提问完全相同,且经过逐位验证。仓库同时提醒,评分题类型从未出现在训练语料中。所谓评分题,就是在评分量表上给出有序评级。语料包含 57000 道 noul(是/否)题和 28500 道 choice 题。评分题的准确率与校准被描述为未测量、未测试。

这套问题类型的词汇并非 Qevi 首创。Liquid AI 于 9 月 29 日更新的决策模型文档定义了同样的三种形态:noul 表示 0 到 1 之间的是/否概率,choice 表示在具名选项上的分布,score 表示在有序量表上的概率加权位置。文档明确写道,决策模型生成零个 token。一个投诉分类的示例请求返回 noul: 0.999,并带有 output_tokens: 0。

Liquid 自己说明了何时该用哪种类型,这段话值得引用,因为它正对应端侧部署的说辞。文档写道:“如果你的代码按类别分支,就用 Choice。如果它要与连续量上的阈值比较,就用 Score。如果它按布尔值做门控,就用 Noul。” 一个返回已校准浮点数的分类器,在移动应用里比一个答案还得解析的生成式模型更容易做阈值判断。

推理版本走的是另一个方向

并非所有人都在朝更少参数、更少思考的方向推进。PostHog 于 9 月 29 日发布在 GitHub 上的 Jeeves 仓库,拿一个 9B 的类 Jev 模型(Qwen3.5-9B 加 LoRA 和一个指针头),用 CISPO 训练它先思考再决策。README 报告称,在留出测试集上得分为 0.889,Jev 为 0.857,Kev-9B 为 0.822;在 JevBench 公开层级上为 0.935,Jev 为 0.866。

代价是延迟。

Jeeves 在不思考时每个请求约 0.3 秒,思考时在单张 H100 上以 FP8 精度中位数为 3.3 秒。README 还指出,同一个检查点在不思考时于作者测试集上得 0.804,思考时为 0.840。在 M4 Pro 上,一个问题思考时大约每秒 20 个 token,FP8 下约 38 个。权重在 bf16 下占用 21 GB,量化后为 11.5 GB。README 称这需要一台 48 GB 的 Mac,并要更小的缓存以避免换页。

这与 Qevi-2B 是不同的部署目标,两个项目在同一种底层格式上朝相反方向发力。

这个格式从何而来

Sebastian Raschka 9 月 29 日的解释文章梳理了从词袋表示和朴素贝叶斯,经循环网络和卷积网络,到 Transformer 时代分类器的谱系,并认为 Jev 处在一个尴尬的中间位置。他写道,最先进的大语言模型能完成同样的分类任务,“同时还具备通用得多的决策能力”,但 Jev 处理得更快、更便宜。在窄端,一个专门构建的分类器在定义明确的问题上能与它匹敌。Raschka 声明自己与 Jev 没有关联,也没有获得免费使用权。

他的历史梳理也为这股热潮提供了一个有用的清醒参照。用朴素贝叶斯做文本分类至少可以追溯到 1961 年,当时用来给计算机摘要分类。Raschka 还指出,Gmail 最初的垃圾邮件过滤器据称就在词袋表示上使用了一个朴素贝叶斯模型。在固定位置读取 logits 是一种较新的工程选择,而不是关于分类是什么的新想法。

校准才是值得盯住的说法

对端侧使用而言,Qevi-2B 模型卡里有意思的数字不是准确率,而是校准表。作者报告称,在微调之上再做温度缩放会让校准变差,因为训练时的标签平滑已经去掉了基础模型的过度自信:T = 1.0 时 ECE 为 0.054,T = 1.5 时为 0.051,T = 2.45 时又回到 0.160,这基本就是基础模型的留出数值。模型卡更早的版本曾推荐 2.45,那是针对微调前的基础模型拟合的。模型卡现在说,这些推荐不应再使用。

有两点需要提醒。

Qevi-2B 和 Jeeves 都发布自己的数字。Jeeves README 中 Jev 和 Kev 两列被描述为 Kev 公布的数字,且限于相同的公开基准条目;密封评审层被排除在外。这些数字中任何一个的独立复现都不在这份材料里。

关于基准分数到底意味着什么,还有一场正在进行的争论。微软开发者博客 9 月 29 日的一篇文章引用了古德哈特定律,“当一个度量变成目标,它就不再是好的度量”,并指向公开基准任务与训练语料之间的数据重叠。文章认为,一个在 SWE-bench 上得 92% 的模型,“并不能说明同一个模型在你内部的认证库上工作时会不会写出正确的代码”。同样的怀疑也适用于 JevBench 各层级。

不过方向已经足够清楚。一个从 logits 返回阈值化概率的 2B 视觉模型,一个先推理再分类的 9B 文本模型,以及一个按零输出 token 计费的托管 API,是同一个赌注的三种实现:许多生产环境中的决策根本不需要生成的散文。

评论 0

资料来源

6
  1. 01Qevi-2B: A Jev-style finetuned model for image classificationEN
  2. 02d1: Liquid AI's First Decision ModelEN
  3. 03Jeeves. Reasoning improves Jev-like decision modelsEN
  4. 04Language Models for Text Classification: From Bag-of-Words to JevEN
  5. 05What AI benchmarks are not telling youEN
  6. 06AI models keep posting screenshots showing sensitive data from inside tech companiesEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。