跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

小型决策模型走向端侧:Liquid AI 的 d1、Jev 类模型与一个 2B 视觉分类器

Liquid AI 于 9 月 29 日发布了首个“决策模型”d1 的文档。这类小型端侧模型正在快速增多,它们返回的是经过校准的概率,而不是生成的文本。

人工智能与模型新闻王雅琴发布: 2026年9月29日5 分钟阅读资料来源 12
小型决策模型走向端侧:Liquid AI 的 d1、Jev 类模型与一个 2B 视觉分类器

文档描述了三种问题类型。Noul 回答是或否,返回 0 到 1 之间的概率;Choice 从多个选项中选一个,返回命名选项上的概率分布;Score 返回以概率加权的有序评分。示例调用把一条客户投诉发送给模型“d1:free”,在“这条消息是来自客户的投诉吗?”这个问题上返回 0.999。

这和聊天机器人是两种不同形态的模型。它不生成任何内容。Liquid 的文档称,决策模型“评估一种情况,在一次调用中针对一组固定结果返回经过校准的概率,生成的 token 数为零”,并且可以在同一个请求中针对同一状态评估多个问题。

这类模型为什么会出现

在资料库最新的来源中,同样的模式反复出现。Sebastian Raschka 于 9 月 29 日发表了一篇长篇技术解析,梳理文本分类从词袋模型、RNN、CNN 到 transformer,再到他所说的“Jev 类 API”的发展过程。他认为这类方案吸引人之处在于成本和速度,而不是原始准确率。“Jev 的优势在于它能以快得多的速度、低得多的成本处理这些分类任务,”他写道。但他也提醒,对于定义明确的狭窄问题,专门构建的分类器在三个方面仍然都会胜出。

PostHog 的 Jeeves 仓库同样发布于 9 月 29 日,为这种取舍给出了数字。Jeeves 是一个 9B 的 Jev 类模型,基于 Qwen3.5-9B 构建,带有 LoRA 和一个指针头,用 SFT 和 CISPO 训练,先推理再判断。仓库报告称,在其自己的留出测试集上得分为 0.889,而 Jev 为 0.857,Kev-9B 为 0.822;在 JevBench 的公开层级上得分为 0.935,Jev 为 0.866。推理在单张 H100 上以 fp8 运行,不进行思考时每个请求约 0.3 秒,进行思考时中位数为 3.3 秒。它也能在 Apple Silicon 上以 bf16 或 FP8 运行,需要 48GB 或更多内存。

运营个性化内容流 Scour 的 Evan Schwartz 于 9 月 29 日发布请求,希望这类 API 支持提示缓存。他的问题集现在有 54 个问题(50 个 Noul、3 个 Choice、1 个 Score),大约 2,150 个 token,其中约 260 个 token 是固定开销。这些问题每月随大约 110 万份文档的每个请求原样发送,占他输入 token 的约 88%。他的账单每月不到 150 美元,但他说缓存会让批量工作流更便宜。

端侧这一头:一个 2B 视觉分类器

这批发布中最清晰的小模型是 Qevi-2B,于 9 月 29 日发布到 Hugging Face。它是对 Qwen3-VL-2B-Instruct 的完整微调,通过读取模型自身的 logits 而不是生成文本来回答关于图像的封闭式问题。问它一张图里有没有梯子,它返回 P(Yes) = 0.97,而不是一句话。

模型卡报告称,域内准确率从基础模型的 0.855 升到 0.977,留出域准确率从 0.745 升到 0.889,留出数据上的期望校准误差从 0.160 降到 0.054。推理速度列明,在针对一张图像提出多个问题时最多快约 21 倍。模型卡明确指出,模型必须通过 logit 读取来使用,而不能用 .generate()。三种受支持的问题类型可以共用对图像的一次编码,由块对角注意力掩码隔开,答案与逐个提问的结果按位比对一致。

资料库中有一项评估与这股热情相悖。安全公司 Casco 把 2,449 条发现交给包括 Jev、Claude 和 GPT 在内的八个模型,将它们的 CVSS 3.1 评分与自家已发布的评分对比。每个模型的平均分都高于参考值。Jev 给一个只含 55 条已发布严重发现的数据库打出了 550 个严重级别评分,其中 500 个在 Casco 的参考中低于严重级别。按平均绝对误差,GPT-6 Astra 以 1.92 分排第一,Jev 以 3.40 分排第七。Casco 的报告日期为 9 月 28 日。

同样在 9 月 29 日这批里,小模型这条线索也出现在不那么显眼的地方。9 月 24 日在 OpenRouter 上架的一个免费预览模型 space-bunny-alpha 声称有一百万 token 的上下文,并称在相同基准上只用了 Qwen3.8 Flash 约三分之一的输出 token,按其自家网站的说法是 305,989 对 913,989。Simple AI 推出了 Tango,一个用于判断话轮结束的音频原生模型。它声称比常规语音活动检测器发现停顿早 300ms 做出中位判断,在公开的 LiveKit 基准上 400 次中漏掉 15 次话轮结束,而 Soniox 为 54 次,Deepgram Flux 为 197 次。这些是厂商在公开基准上自行运行的对比,不是独立审计。

同一时间窗口里还有两个发布指向同一方向:Jeb,一个把任何兼容 OpenAI 的 API 变成决策模型的 GitHub 项目;以及 DesktopBrain,一个 Mac 上的端侧文件整理工具。在现有材料中,两者都没有公布基准数字。

模式是一致的。过去 72 小时里有意思的小模型不是微型聊天机器人。它们狭窄、经过校准,在那些前沿模型显得荒唐的地方运行成本很低:一部手机、一台笔记本、一个 2B 视觉编码器、一个每月用不到 150 美元回答 54 个问题的分类器。它们对所指派的工作是否足够准确是另一个问题,而 Casco 的结果说明答案并不总是肯定的。

评论 0

资料来源

12
  1. 01d1: Liquid AI's First Decision ModelEN
  2. 02Qevi-2B: A Jev-style finetuned model for image classificationEN
  3. 03Language Models for Text Classification: From Bag-of-Words to JevEN
  4. 04Jeeves. Reasoning improves Jev-like decision modelsEN
  5. 05Every model (incl. Jev) we tested inflates security finding severityEN
  6. 06Please add prompt caching to Jev-style modelsEN
  7. 07Space-bunny-alpha a reasoning model from an anonymous providerEN
  8. 08Tango: Simple AI's Conversational Awareness ModelEN
  9. 09Jeb: Turn any OpenAI API into a decision modelEN
  10. 10DesktopBrain - AI File Organizer for Mac and All Folders - Private On-Device AIEN
  11. 11Language Models Act on Hidden ValenceEN
  12. 12Needed 1+1, built a functional programming languageEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。