跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

小型决策模型走向端侧,Jev 式运行器不断增多

9 月 29 日,Liquid AI 公布了首个决策模型 d1 的文档。这套 API 一次调用就能返回固定结果上的校准概率,生成的 token 数为零。同一天,Hugging Face 上的一份发布展示了一个 2B 视觉模型在端侧读取自身 logits。

人工智能与模型分析王雅琴发布: 2026年9月29日4 分钟阅读资料来源 10
小型决策模型走向端侧,Jev 式运行器不断增多

Liquid AI 的 d1 文档 9 月 29 日上线。它把每次查询归入三种带类型的形式之一:noul 是一个是非问题,返回 0 到 1 之间的概率;choice 是在若干具名选项上取一的分布;score 是在一套有序评分标准上按概率加权的位置。文档举的例子中,一条客户投诉在 noul 门上返回 0.999。同一个请求可以同时携带多个问题一起评估。端侧阵营等的正是这种形态。

它在手机或笔记本上为什么重要,答案在算术里。模型只输出一个数字,不输出一段文本,就完全跳过了解码循环,延迟不再随答案长度增长。输出也因此可以被阈值化:0.92 的概率是一个分支条件,不需要解析器去解读。

9 月 29 日在 Hugging Face 上发布的 Qevi-2B,是最清晰的小模型例子。它是对 Qwen3-VL-2B-Instruct 的完整微调,回答关于图像的带类型封闭问题时,读取回复位置上 LM head 的 logits,而不是生成文本。模型卡报告,域内准确率为 0.977,基座 Qwen3-VL-2B 为 0.855;留出域准确率为 0.889,后者为 0.745;留出数据上的期望校准误差为 0.054,后者为 0.160。

模型卡对那个坑说得很直白:这些数字只有通过 logit 读取才能复现,大约 30 行普通 transformers 代码,调用 .generate() 不会得到相同结果,因为模型微调时走的不是这条路径。它还提醒,该模型不是聊天模型。问图像里有没有梯子,它返回 P(Yes) = 0.97,而不是一句话。它宣称的回报是,针对一张图像提很多问题时,推理最多快约 21 倍。三个独立问题可以共用一次编码,再用块对角注意力掩码隔离出来,并已与逐个提问做过逐位验证。训练覆盖了 57000 个 noul 问题和 28500 个 choice 问题。

推理能力让小模型重回赛道

最明显的反对意见是准确率。Jev 式分类器便宜且经过校准,但正如一份实现说明所指出的,它们在低准确率场景下很弱,所以流水线会保留一个推理模型作为兜底。PostHog 的 Jeeves 仓库 9 月 29 日推送,正面攻击这一点:一个 9B 的类 Jev 模型(Qwen3.5-9B、LoRA、指针头),先思考再决定,用 SFT 和 CISPO 训练,外加一个 block-4 扩散起草器。公布的表格显示,Jeeves 在留出测试数据上为 0.889,Jev 为 0.857,Kev-9B 为 0.822;在 JevBench 公开分层上为 0.935,Jev 为 0.866。它报告单张 H100 上 fp8 精度下,不思考时每次请求约 0.3 秒,思考时中位数 3.3 秒,并且能在 Apple Silicon 上以 bf16 或 FP8 运行。

Sebastian Raschka 9 月 29 日发表的文本分类史梳理了整波浪潮,从词袋和朴素贝叶斯,经 RNN 和 transformer,一直追到他所说的类 Jev API。他主张 Jev 的优势在分类上的速度与成本,而不是原始能力。Evan Schwartz 在同一天写作,把部署这件事讲得很具体:他在 Scour 上每月对约 110 万份文档跑 54 个问题,问题大约占输入 token 的 88%,总账单保持在每月 150 美元以下。他向厂商要的是提示缓存或可复用的问题集。

并非所有人都相信这些输出可信。Casco 用 2449 条安全发现对照自己公布的 CVSS 3.1 分数测试了八个模型,发现每个模型都高估了严重程度。Jev 给一个只含 55 条公布严重发现的数据集打了 550 个 critical 分,平均带符号误差为 +3.30 分;GPT-6 Astra 最准,平均绝对误差 1.92 分,Jev 以 3.40 排第七。同样的过度诊断风险,适用于任何按阈值触发的端侧门。

基础设施也在跟进。微软开发者博客 9 月 29 日主张,公开的编程基准并不能预测模型在你自己的代码库上的表现,这和小决策模型要在你自己的输入上评估是同一个道理。JuliaHub 同一天报告,在模型保持不变的情况下换掉 agent 运行框架,分数从 0.533 升到 0.899,比它在四个前沿模型之间测到的差距还大一倍多。Tuneloop 给评估本身定了数:重放 30 个任务、约 55 美元,就能把差距锁定在正负 6 分以内,这足以支撑把例行工作以 2.5% 的成本路由给更便宜的模型。对一个端侧分类器来说,这就是决定小模型能否上线的测试。

评论 0

资料来源

10
  1. 01d1: Liquid AI's First Decision ModelEN
  2. 02Qevi-2B: A Jev-style finetuned model for image classificationEN
  3. 03Jeeves. Reasoning improves Jev-like decision modelsEN
  4. 04Language Models for Text Classification: From Bag-of-Words to JevEN
  5. 05Please add prompt caching to Jev-style modelsEN
  6. 06Every model (incl. Jev) we tested inflates security finding severityEN
  7. 07What AI benchmarks are not telling youEN
  8. 08The Best AI Models Fail at Physics: Coding Harnesses are to BlameEN
  9. 09How many tasks does it take to trust a cheaper model?EN
  10. 10Tango: Simple AI's Conversational Awareness ModelEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。