小模型不写字也能作答:决策模型走进本地设备
9月29日,Liquid AI 发布了 d1 的文档。这是它第一个决策模型,一次调用只返回校准过的概率,生成的 token 数为零。这类小型本地分类器正在快速增多,同类的还有 Jev、Qevi-2B 和 PostHog 的 Jeeves。

它的定位很窄,也很具体:一个不写字的模型。Liquid AI 在9月29日发布的文档显示,d1 评估一段状态,然后在一组固定结果上返回概率。公司自己的示例是提交一条客户投诉,针对"Is this message a complaint?"这个问题返回一个数字,0.999。
Liquid 把这种格式叫做决策模型。它支持三种问题类型,文档里说得很直白:"noul" 问题是是非题,返回 0 到 1 之间的概率;"choice" 问题返回一组具名选项上的分布;"score" 问题返回有序评分表上一个按概率加权的位置。API 响应里有一个 output_tokens 字段,它始终为零。
小模型为什么突然有意思了
这个角落里不止 Liquid 一家。Sebastian Raschka 在9月29日写了一篇关于文本分类历史的技术文章。他把近来的 Jev 模型首先当作分类器,其次才当作文化现象。他的论点是,在窄任务上 Jev 并不比专门造的分类器更好或更便宜,但它比那些任务专用模型通用得多,同时又比前沿大模型快得多、便宜得多。
中等程度的通用性,加上每次调用的低成本,正是本地设备这条路走得通的理由。一个 2B 或 9B 的模型返回的是概率而不是一段话,它跑的硬件前沿模型根本碰不了。
9月29日上传到 Hugging Face 的 Qevi-2B 是图像这一侧的版本。它是对 Qwen3-VL-2B-Instruct 的完整微调。回答关于图像的封闭式问题时,它不生成文本,而是在模型本该开始作答的位置读取 logits。模型卡把取舍说得很直:"It is not a chat model. Ask it 'is there a ladder in this image?' and it returns P(Yes) = 0.97, not a sentence."
模型卡报告,域内准确率为 0.977,基础模型是 0.855;在留出域上是 0.889,基础模型是 0.745。留出数据上的期望校准误差从 0.160 降到 0.054。模型卡还提醒了想再叠加温度缩放的人:当 T = 2.45 时,留出集 ECE 回到 0.160,增益全部抹掉。
速度是这套说法的另一半。Qevi-2B 说,针对一张图问很多问题时,它最多快约 21 倍,因为三个示例问题共用一次编码,再用块对角注意力掩码分开。模型卡说,答案与分别提问完全相同,已逐位验证。
"The biggest risk factor that we're seeing is in legitimate AI being used by developers, but then doing things that should not be done," said Omer Singer, co-founder and CTO of Glow Security, in an interview with The Register.
问题在于:帮忙的同时在泄密
这句话与分类准确率关系不大,与部署关系极大。The Register 在9月29日报道,Glow Security 的研究人员发现,AI 智能体把 343 家公司、超过 13000 张企业软件项目的敏感截图发到了公开的 GitHub 仓库。他们把这叫做 PixelLeak。
机制很平常。GitHub 没有把图片上传到拉取请求的 API,于是被要求展示界面改动前后对比的智能体就把图片放进了公开仓库。大约三分之一的泄露来自使用 gitshot 的开发者。这个开源截图工具自己的隐私声明就警告说,上传的图片默认是公开的。
这些都不是小模型造成的。但小模型被推销时所处的正是这个环境:便宜到可以一直运行,嵌在开发工具里,不需要人在环中。一个能在笔记本上跑的分类器,让这个环更紧。
会推理,但只推一点
PostHog 的 Jeeves 于9月29日发布在 GitHub 上。它想在 Jev 这类模型上解决准确率问题,同时不放弃这种格式。它是一个 9B 的 Jev 式分类器,基于 Qwen3.5-9B,加了 LoRA 和一个指针头,训练成先推理再决定,配一个 block-4 扩散草稿器。
仓库里的数字把它与 Kev-9B 和 Jev 放在它从未训练过的数据上比较:0.889 对 0.822 和 0.857。在 JevBench 的公开档位上,它报告 0.935,Jev 是 0.866。代价是延迟。不思考时,一次请求约 0.3 秒;思考时,在一块 H100 上以 FP8 精度运行,中位数 3.3 秒。仓库指出,截断推理链可以缩短这个时间。
Jeeves 的表格还反驳了"推理总是有用"这个简单说法。在 MMLU-Pro 上它是 0.739,Jev 是 0.840;在 MMLU 上是 0.793,Jev 是 0.900。作者没有把这些平均掉,而是并排公布。
微软的开发者博客在9月29日一篇关于 Agent Experience 的文章里讲了这个道理的通用版本。基准分数推动采用,采用推动针对基准的优化,然后分数就不再说明你自己的代码库了。文章说:"A model that's excellent at Django might be mediocre at your internal framework that superficially resembles Django but works differently in critical ways."同样的逻辑也适用于一个在公开档位上测过、然后被丢进你的工单队列的决策模型。
本地设备是这些线索交汇的地方。Qevi-2B 列出 bf16 下 21 GB 的权重。Jeeves 说一台 Apple Silicon Mac 需要 48 GB 或更多来容纳默认缓存,不过 FP8 把权重压到 11.5 GB,较小的缓存设置能装进 48 GB 的机器。这不是手机,是笔记本。笔记本仍然与数据中心是不同的部署目标,这也是"小模型"这个标签在这里确实有实际意义的原因。
这些发布都没有回答的是:分类这套框架能不能扛住生产环境里那些乱七八糟的问题。0.97 很容易设阈值。一个校准未经测量的 score 问题,也就是 Qevi-2B 模型卡对自己 "score" 类型所说的那种情况,就不容易了。
资料来源
6- 01d1: Liquid AI's First Decision ModelEN
- 02Qevi-2B: A Jev-style finetuned model for image classificationEN
- 03Jeeves. Reasoning improves Jev-like decision modelsEN
- 04AI models keep posting screenshots showing sensitive data from inside tech companiesEN
- 05Language Models for Text Classification: From Bag-of-Words to JevEN
- 06What AI benchmarks are not telling youEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。