决策模型不再生成文本,小型端侧AI改读logit
9月29日发布的两个模型指向同一个思路:小型模型不生成token,直接返回校准后的概率。Liquid AI的d1和Qwen3-VL-2B微调版Qevi-2B都走这条路。

两者在周二相隔六分钟先后出现。Liquid AI在20:09 UTC发布d1的文档,称它是公司首个决策模型。MeerDevelopment在20:16 UTC把Qevi-2B推上Hugging Face。两者都不生成文本。
Liquid AI的文档把机制说得很直白。决策模型“评估一个情境,在一次调用中针对一组固定结果返回校准后的概率,生成的token数为零”。API提供三种提问形式:noul(是/否,返回一个浮点数)、choice(从具名选项中挑一个)和score(在有序评分表上给出按概率加权的定位)。文档示例中,字符串“I have been waiting over three weeks for my order and nobody has responded to my emails”对问题“Is this message a complaint from the customer?”返回的noul为0.999。响应里usage.output_tokens也报告为0。
读logit,跳过句子
Qevi-2B走的是另一条路,终点相同。它是对Qwen3-VL-2B-Instruct的完整微调。回答关于图像的封闭式问题时,它读取模型即将开始作答那个位置上的LM-head logit,并限定在允许的答案token内。问它照片里有没有梯子,它返回P(Yes) = 0.97。模型卡提醒说,调用.generate()再解析文本不会复现公布的数字,“因为那不是模型微调所走的路径”。
宣称的提升幅度很大,也很具体。与走同一条读数路径的基础Qwen3-VL-2B相比,Qevi-2B的域内准确率为0.977,基础模型是0.855;在留出域上是0.889,基础模型是0.745。留出数据上的期望校准误差从0.160降到0.054。模型卡还报告,对一张图提出许多问题时推理速度约快21倍,因为问题打包共用一次图像编码。
有一处提醒值得仔细看。训练语料只覆盖noul和choice两类问题,score类型没有经过测试。模型卡还明确收回了早前的温度建议:在T = 2.45时,留出集上的ECE回到0.160,校准带来的全部收益被抹平。
小、快,专攻分类
这就是端侧论证当前的样子。Ailoitte在过去12小时内发布的小模型开发指南从成本角度切入:服务一个7B模型,在延迟、能耗和算力上可能比70B到175B的模型“便宜10到30倍”,并引用了NVIDIA 2025年的一份立场文件。指南还指出小模型可以本地部署,这对医疗和金融数据很重要。
Sebastian Raschka在9月29日关于文本分类的文章从另一头说了同一件事。他把Jev描述成一个“过去两周在技术社区里造成相当文化现象”的模型,本质上是一个文本分类器,在分类任务上比通用大模型更快更便宜,同时比任务专用模型更通用。他特意说明自己与Jev没有关联,也没有免费使用权。
PostHog的jeeves仓库在9月29日更新,给这个模式加上了推理。Jeeves是一个9B的类Jev模型,基于Qwen3.5-9B,加了LoRA和一个pointer head,用SFT和CISPO训练。它在留出测试集上总体得0.889,Jev为0.857,Kev-9B为0.822;在JevBench公开档位上得0.935,Jev为0.866。思考要花时间:在单张H100上以fp8运行,每个请求中位耗时约3.3秒,不开思考则是0.3秒。
这些数字并不都指向同一边。Jeeves总体胜过Jev,但在Transfer上落后(0.746对0.800),在MMLU-Pro 10-way上也落后(0.739对0.840)。它对不可知问题的回答中有5.5%给出p ≥ 0.9,好于Jev的9.0%,但差于Kev-9B的0.0%。
这一品类的市场预测差异很大,值得点明而不是取平均。MarketsandMarkets给出的SLM市场2025年为9.3亿美元,到2032年升至54.5亿美元,复合年增长率28.7%;wizr.ai引用的数字则是2023年77.6亿美元,2024年至2030年增长15.6%。这两个估计描述的是规模不同的市场。
9月29日这两次发布所指向的东西更窄也更具体:在分类形态的工作里,输出格式本身正在围绕概率重新设计,而不是围绕散文。
资料来源
6- 01d1: Liquid AI's First Decision ModelEN
- 02Qevi-2B: A Jev-style finetuned model for image classificationEN
- 03Jeeves. Reasoning improves Jev-like decision modelsEN
- 04Language Models for Text Classification: From Bag-of-Words to JevEN
- 05Small Language Model Development: Lower Cost, More PrivacyEN
- 06The Rise of Small Language Models in Enterprise AI Adoption [2026]EN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。