小模型走向端侧:Liquid AI 发布 d1,Qevi-2B 直接读 logits 而不生成文本
9 月 29 日,Liquid AI 公布了 d1 的文档。文档描述的是一类决策模型:一次调用就能在一组固定结果上给出校准后的概率,生成的 token 数为零。同一天,一个名为 Qevi-2B 的 2B 视觉模型出现在 Hugging Face 上,它输出的是 logit 读数,而不是生成的文本。

Liquid AI 的 d1 文档 9 月 29 日上线。文档说,这类模型从不写句子。它接收一个状态(文本或 JSON 对象)和一个或多个带类型的问题,然后返回概率。问题类型有三种:noul 对应是或否,choice 对应从多个选项中选一个,score 对应有序评分。一个三级问题可能返回 1.85,落在 Medium 和 High 之间。文档页面写道:“决策模型是一类全新的 AI 模型,专为结构化决策而打造。”
这样的定位并非 Liquid 独有。9 月 29 日星期二还出现了 Qevi-2B,这是 MeerDevelopment 在 Hugging Face 上发布的 Qwen3-VL-2B-Instruct 全量微调版本。它通过读取模型自身的 logits 来回答关于图像的封闭式问题。问它照片里有没有梯子,它返回 P(Yes) = 0.97,而不是一句话。模型卡报告称,域内准确率为 0.977,基座 Qwen3-VL-2B 为 0.855;留出域准确率为 0.889,基座为 0.745;留出数据上的期望校准误差为 0.054,基座为 0.160。模型卡还声称,针对一张图像提出多个问题时,推理速度最高可提升约 21 倍。
为什么有意思的是小模型
经济账比架构更重要。Evan Schwartz 运营一个名为 Scour 的个性化内容流。他在 9 月 29 日写道,他每月针对约 110 万份文档发出 54 个问题(50 个 noul、3 个 choice、1 个 score)。他的问题集约 2150 个 token,占每次请求输入 token 的约 88%,因为这些问题每次都会被原样重发。他的总账单每月不到 150 美元。他说通用 LLM 在这个量级上做不到。他呼吁各家实验室加入 prompt caching 或可复用问题集,并指向 TypeSafe SDK 仓库上的一个公开请求。
其他人已经在做变通方案。9 月 29 日发布到 GitHub 的项目 Jeb 能把任何兼容 OpenAI 的端点变成 Jev 风格的决策服务:读取 token 的对数概率,并在 POST /v1/systemone 返回结构化 JSON。它的 README 直白地说明了依赖问题:一个 API 在普通聊天上可以兼容 OpenAI,却缺少 Jeb 需要的 logprobs,所以在选择服务商之前必须确认这一能力。PostHog 同一天发布了 Jeeves,一个 9B 的 Qwen3.5-9B 模型,带有 LoRA 和一个指针头,先推理再决策,另有一个 block-4 扩散草稿器。它在自己的留出测试集上报告 0.889,Jev 为 0.857,Kev-9B 为 0.822;在 JevBench 公开层级上为 0.935,Jev 为 0.866。每次请求 0.3 秒的数字是不启用思考时的结果。启用思考后,在单张 H100 上以 fp8 运行,中位数为 3.3 秒。
9 月 28 日,Casco 提供了一个值得警惕的数据点。这家安全公司把 2449 条发现交给八个模型,包括 Jev、Claude 和 GPT,要求每个模型选出 CVSS 3.1 的八个基础指标。所有模型的平均得分都高于 Casco 公布的参考值。Jev 给一个只包含 55 条已公布严重发现的数据库打出了 550 个 critical 评级。GPT-6 Astra 的平均绝对误差最低,为 1.92 分;Jev 以 3.40 排在第七。结构化输出并没有转化为更好的严重性判断。
9 月 29 日还有别的内容。Sebastian Raschka 发表了一篇关于文本分类的长篇技术史,试图把 Jev 放进脉络中。他指出,词袋加朴素贝叶斯至少可以追溯到 1961 年,据说连 Gmail 最初的垃圾邮件过滤器也用过它。他的评价很克制:对于一个狭窄且定义明确的问题,Jev 风格的模型大概赢不了专用分类器,但它通用得多。Simple AI 也在当天推出了 Tango,一个用于轮次结束检测的音频原生模型。该公司称,在相同的轮次结束覆盖率下,Tango 比传统语音活动检测器中位提前 300 毫秒触发,且在说话中途的误触发次数比 Smart Turn 少 3.7 到 4.7 倍。在公开的 LiveKit 基准上,它在 400 个真实轮次结束中漏掉 15 个,Soniox 漏掉 54 个,Deepgram Flux 漏掉 197 个。
贯穿始终的一点是:端侧和小模型这一层才是部署真正发生的地方,也是现在测量争论发生的地方。Qevi-2B 的模型卡明确指出,它的数字只有通过 logit 读数才能复现,通过 .generate() 无法复现:“如果你调用 .generate() 并解析文本,你不会复现这些数字,因为那不是模型微调时所走的路径。”对于任何要给这些系统做基准测试的人来说,这是一句有用的提醒。一个模型可能仅仅因为被要求开口说话,就显得比实际更差。
资料来源
12- 01d1: Liquid AI's First Decision ModelEN
- 02Qevi-2B: A Jev-style finetuned model for image classificationEN
- 03Please add prompt caching to Jev-style modelsEN
- 04Jeb: Turn any OpenAI API into a decision modelEN
- 05Jeeves. Reasoning improves Jev-like decision modelsEN
- 06Every model (incl. Jev) we tested inflates security finding severityEN
- 07Language Models for Text Classification: From Bag-of-Words to JevEN
- 08Tango: Simple AI's Conversational Awareness ModelEN
- 09The System One models ecosystemEN
- 10AI models keep posting screenshots showing sensitive data from inside tech companiesEN
- 11OpenAI announces 'dots' agent after scrapping launch of new AI model over safety concernsEN
- 12Language Models Act on Hidden ValenceEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。