跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

决策模型不再生成文本,小型端侧AI改读logit

9月29日发布的两个模型指向同一个思路:小型模型不生成token,直接返回校准后的概率。Liquid AI的d1和Qwen3-VL-2B微调版Qevi-2B都走这条路。

人工智能与模型分析王雅琴发布: 2026年9月29日4 分钟阅读资料来源 6
决策模型不再生成文本,小型端侧AI改读logit

两者在周二相隔六分钟先后出现。Liquid AI在20:09 UTC发布d1的文档,称它是公司首个决策模型。MeerDevelopment在20:16 UTC把Qevi-2B推上Hugging Face。两者都不生成文本。

Liquid AI的文档把机制说得很直白。决策模型“评估一个情境,在一次调用中针对一组固定结果返回校准后的概率,生成的token数为零”。API提供三种提问形式:noul(是/否,返回一个浮点数)、choice(从具名选项中挑一个)和score(在有序评分表上给出按概率加权的定位)。文档示例中,字符串“I have been waiting over three weeks for my order and nobody has responded to my emails”对问题“Is this message a complaint from the customer?”返回的noul为0.999。响应里usage.output_tokens也报告为0。

读logit,跳过句子

Qevi-2B走的是另一条路,终点相同。它是对Qwen3-VL-2B-Instruct的完整微调。回答关于图像的封闭式问题时,它读取模型即将开始作答那个位置上的LM-head logit,并限定在允许的答案token内。问它照片里有没有梯子,它返回P(Yes) = 0.97。模型卡提醒说,调用.generate()再解析文本不会复现公布的数字,“因为那不是模型微调所走的路径”。

宣称的提升幅度很大,也很具体。与走同一条读数路径的基础Qwen3-VL-2B相比,Qevi-2B的域内准确率为0.977,基础模型是0.855;在留出域上是0.889,基础模型是0.745。留出数据上的期望校准误差从0.160降到0.054。模型卡还报告,对一张图提出许多问题时推理速度约快21倍,因为问题打包共用一次图像编码。

有一处提醒值得仔细看。训练语料只覆盖noul和choice两类问题,score类型没有经过测试。模型卡还明确收回了早前的温度建议:在T = 2.45时,留出集上的ECE回到0.160,校准带来的全部收益被抹平。

小、快,专攻分类

这就是端侧论证当前的样子。Ailoitte在过去12小时内发布的小模型开发指南从成本角度切入:服务一个7B模型,在延迟、能耗和算力上可能比70B到175B的模型“便宜10到30倍”,并引用了NVIDIA 2025年的一份立场文件。指南还指出小模型可以本地部署,这对医疗和金融数据很重要。

Sebastian Raschka在9月29日关于文本分类的文章从另一头说了同一件事。他把Jev描述成一个“过去两周在技术社区里造成相当文化现象”的模型,本质上是一个文本分类器,在分类任务上比通用大模型更快更便宜,同时比任务专用模型更通用。他特意说明自己与Jev没有关联,也没有免费使用权。

PostHog的jeeves仓库在9月29日更新,给这个模式加上了推理。Jeeves是一个9B的类Jev模型,基于Qwen3.5-9B,加了LoRA和一个pointer head,用SFT和CISPO训练。它在留出测试集上总体得0.889,Jev为0.857,Kev-9B为0.822;在JevBench公开档位上得0.935,Jev为0.866。思考要花时间:在单张H100上以fp8运行,每个请求中位耗时约3.3秒,不开思考则是0.3秒。

这些数字并不都指向同一边。Jeeves总体胜过Jev,但在Transfer上落后(0.746对0.800),在MMLU-Pro 10-way上也落后(0.739对0.840)。它对不可知问题的回答中有5.5%给出p ≥ 0.9,好于Jev的9.0%,但差于Kev-9B的0.0%。

这一品类的市场预测差异很大,值得点明而不是取平均。MarketsandMarkets给出的SLM市场2025年为9.3亿美元,到2032年升至54.5亿美元,复合年增长率28.7%;wizr.ai引用的数字则是2023年77.6亿美元,2024年至2030年增长15.6%。这两个估计描述的是规模不同的市场。

9月29日这两次发布所指向的东西更窄也更具体:在分类形态的工作里,输出格式本身正在围绕概率重新设计,而不是围绕散文。

评论 0

资料来源

6
  1. 01d1: Liquid AI's First Decision ModelEN
  2. 02Qevi-2B: A Jev-style finetuned model for image classificationEN
  3. 03Jeeves. Reasoning improves Jev-like decision modelsEN
  4. 04Language Models for Text Classification: From Bag-of-Words to JevEN
  5. 05Small Language Model Development: Lower Cost, More PrivacyEN
  6. 06The Rise of Small Language Models in Enterprise AI Adoption [2026]EN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。