跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

小模型走向端侧:Liquid AI 发布 d1,Qevi-2B 直接读 logits 而不生成文本

9 月 29 日,Liquid AI 公布了 d1 的文档。文档描述的是一类决策模型:一次调用就能在一组固定结果上给出校准后的概率,生成的 token 数为零。同一天,一个名为 Qevi-2B 的 2B 视觉模型出现在 Hugging Face 上,它输出的是 logit 读数,而不是生成的文本。

人工智能与模型分析林晓雯发布: 2026年9月29日4 分钟阅读资料来源 12
小模型走向端侧:Liquid AI 发布 d1,Qevi-2B 直接读 logits 而不生成文本

Liquid AI 的 d1 文档 9 月 29 日上线。文档说,这类模型从不写句子。它接收一个状态(文本或 JSON 对象)和一个或多个带类型的问题,然后返回概率。问题类型有三种:noul 对应是或否,choice 对应从多个选项中选一个,score 对应有序评分。一个三级问题可能返回 1.85,落在 Medium 和 High 之间。文档页面写道:“决策模型是一类全新的 AI 模型,专为结构化决策而打造。”

这样的定位并非 Liquid 独有。9 月 29 日星期二还出现了 Qevi-2B,这是 MeerDevelopment 在 Hugging Face 上发布的 Qwen3-VL-2B-Instruct 全量微调版本。它通过读取模型自身的 logits 来回答关于图像的封闭式问题。问它照片里有没有梯子,它返回 P(Yes) = 0.97,而不是一句话。模型卡报告称,域内准确率为 0.977,基座 Qwen3-VL-2B 为 0.855;留出域准确率为 0.889,基座为 0.745;留出数据上的期望校准误差为 0.054,基座为 0.160。模型卡还声称,针对一张图像提出多个问题时,推理速度最高可提升约 21 倍。

为什么有意思的是小模型

经济账比架构更重要。Evan Schwartz 运营一个名为 Scour 的个性化内容流。他在 9 月 29 日写道,他每月针对约 110 万份文档发出 54 个问题(50 个 noul、3 个 choice、1 个 score)。他的问题集约 2150 个 token,占每次请求输入 token 的约 88%,因为这些问题每次都会被原样重发。他的总账单每月不到 150 美元。他说通用 LLM 在这个量级上做不到。他呼吁各家实验室加入 prompt caching 或可复用问题集,并指向 TypeSafe SDK 仓库上的一个公开请求。

其他人已经在做变通方案。9 月 29 日发布到 GitHub 的项目 Jeb 能把任何兼容 OpenAI 的端点变成 Jev 风格的决策服务:读取 token 的对数概率,并在 POST /v1/systemone 返回结构化 JSON。它的 README 直白地说明了依赖问题:一个 API 在普通聊天上可以兼容 OpenAI,却缺少 Jeb 需要的 logprobs,所以在选择服务商之前必须确认这一能力。PostHog 同一天发布了 Jeeves,一个 9B 的 Qwen3.5-9B 模型,带有 LoRA 和一个指针头,先推理再决策,另有一个 block-4 扩散草稿器。它在自己的留出测试集上报告 0.889,Jev 为 0.857,Kev-9B 为 0.822;在 JevBench 公开层级上为 0.935,Jev 为 0.866。每次请求 0.3 秒的数字是不启用思考时的结果。启用思考后,在单张 H100 上以 fp8 运行,中位数为 3.3 秒。

9 月 28 日,Casco 提供了一个值得警惕的数据点。这家安全公司把 2449 条发现交给八个模型,包括 Jev、Claude 和 GPT,要求每个模型选出 CVSS 3.1 的八个基础指标。所有模型的平均得分都高于 Casco 公布的参考值。Jev 给一个只包含 55 条已公布严重发现的数据库打出了 550 个 critical 评级。GPT-6 Astra 的平均绝对误差最低,为 1.92 分;Jev 以 3.40 排在第七。结构化输出并没有转化为更好的严重性判断。

9 月 29 日还有别的内容。Sebastian Raschka 发表了一篇关于文本分类的长篇技术史,试图把 Jev 放进脉络中。他指出,词袋加朴素贝叶斯至少可以追溯到 1961 年,据说连 Gmail 最初的垃圾邮件过滤器也用过它。他的评价很克制:对于一个狭窄且定义明确的问题,Jev 风格的模型大概赢不了专用分类器,但它通用得多。Simple AI 也在当天推出了 Tango,一个用于轮次结束检测的音频原生模型。该公司称,在相同的轮次结束覆盖率下,Tango 比传统语音活动检测器中位提前 300 毫秒触发,且在说话中途的误触发次数比 Smart Turn 少 3.7 到 4.7 倍。在公开的 LiveKit 基准上,它在 400 个真实轮次结束中漏掉 15 个,Soniox 漏掉 54 个,Deepgram Flux 漏掉 197 个。

贯穿始终的一点是:端侧和小模型这一层才是部署真正发生的地方,也是现在测量争论发生的地方。Qevi-2B 的模型卡明确指出,它的数字只有通过 logit 读数才能复现,通过 .generate() 无法复现:“如果你调用 .generate() 并解析文本,你不会复现这些数字,因为那不是模型微调时所走的路径。”对于任何要给这些系统做基准测试的人来说,这是一句有用的提醒。一个模型可能仅仅因为被要求开口说话,就显得比实际更差。

评论 0

资料来源

12
  1. 01d1: Liquid AI's First Decision ModelEN
  2. 02Qevi-2B: A Jev-style finetuned model for image classificationEN
  3. 03Please add prompt caching to Jev-style modelsEN
  4. 04Jeb: Turn any OpenAI API into a decision modelEN
  5. 05Jeeves. Reasoning improves Jev-like decision modelsEN
  6. 06Every model (incl. Jev) we tested inflates security finding severityEN
  7. 07Language Models for Text Classification: From Bag-of-Words to JevEN
  8. 08Tango: Simple AI's Conversational Awareness ModelEN
  9. 09The System One models ecosystemEN
  10. 10AI models keep posting screenshots showing sensitive data from inside tech companiesEN
  11. 11OpenAI announces 'dots' agent after scrapping launch of new AI model over safety concernsEN
  12. 12Language Models Act on Hidden ValenceEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。