跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

小模型端侧部署:论文称91%的token熵信号不可用

7月21日提交的一篇arXiv预印本指出,参数量低于30亿的小语言模型里,token级置信度信号基本失灵。研究覆盖的数据集与模型组合中,有91%的平均token熵接近零,答案对错都一样。

人工智能与模型分析王雅琴发布: 2026年9月28日4 分钟阅读资料来源 6
小模型端侧部署:论文称91%的token熵信号不可用

论文作者是Prashant Mudgal。他测了七种方法,涉及7组模型配对和5个标准NLU基准,全部跑在消费级硬件上。结论很直接:这个规模上,靠token级熵做提前停止行不通。语义熵能恢复出可用信号,做法是多次采样生成,再按含义把答案聚类。把不确定的查询转交给更大的专家模型,准确率最多提升50个百分点。

跨模型家族路由平均提升22.0%,同家族配对只有6.8%。论文举的例子是SmolLM 360M把任务交给Phi-3.5-mini。论文的立论是:小模型里熵方法的价值不在于省下多少算力,而在于把算力分配到哪里。

端侧工作为何持续增长

时间点很关键。9月27日,Nvidia发布Nemotron 3 Diarization,约1亿参数,用来识别对话中谁在说话,权重可免费下载,The Decoder报道了此事。它最多区分八位说话人,并标记出重叠语音。在VoiceArena的Diarization-Bench上,它目前以14.72%的错误率排第一,第二名系统是19.3%。搭配Parakeet之类的语音识别系统,它能生成带匿名说话人标签的转写文本。参与人数增加、背景噪声或混响都会推高错误率。

延迟是设计上的取舍,不是白捡的便宜。音频缓冲可以设为四档,从30.4秒到0.32秒,缓冲越短通常越影响准确率。Nvidia称,在1.04秒缓冲下,与上一代Streaming Sortformer相比,该模型在八个测试场景中平均把错误率降低41%。模型必须在本地而不是数据中心运行时,这类数字才有意义。

同一周还有一个大得多的项目,但关于自动化的结论要窄得多。一个包括中国复旦大学研究人员的团队研究了自己构建Atria Dawn Preview的工作,这是一个基于混合专家架构的智能体语言模型,参数量7440亿,The Decoder报道了此事。分析覆盖56名参与者的700多条任务日志。被审查的任务中有96.5%用到了AI,智能体动作与人类输入的比值中位数在四周内从11升到28.5。作者提醒不要把这读成自主性:人类的每一次决策只是触发了更多智能体步骤。

参与者被问及,如果没有AI,他们能否以同样的范围和完成质量做完自己那部分任务。在455个完成的AI辅助任务中,有151个被评为离开AI就无法完成,约占三分之一,分布在56名参与者中的27人身上。

在方法和参数上,人类仍然做出了85.5%的决策,AI做出9.2%;在目标和范围上,93.4%的情况由人类做最终决定。在588个记录了难度的任务中,出现问题时,76%靠人工介入继续推进,23%由智能体独自解决。论文警告说,当每一个决策都依赖一条比任何人都能审查的更长的智能体工作链时,监督就会退化成盖章。

便宜的模型,昂贵的问题

成本正在重塑哪些模型会被用上。CNBC在9月26日报道,9月14日那一周,中国模型占OpenRouter上token使用量的57%到67%,2月时只有6%到13%;8月在Vercel上达到55%,1月时是11%。OpenRouter洞察负责人Peter Walker告诉CNBC,今年发布的中国开源模型能够可信地处理高级智能体任务,尤其是编程,这在2025年底还做不到,而且价格远低于美国实验室的大多数模型。Vercel智能体基础设施负责人Harpreet Arora表示,一旦模型跨过某项工作的质量门槛,价格就变得很有吸引力。

华盛顿在盯着这件事。美国众议院两个委员会正在调查这一采用趋势,CNBC指出美国前沿模型在总支出上仍然更高。新美国安全中心的Daniel Remler对该媒体说,担忧在于这种整合会把各国拉进中国的技术圈。CNBC引用的数据并不整齐:OpenRouter上约一半的token来自美国公司,而OpenRouter归为全球南方的82个国家的企业,把67%的token发给了中国模型。

小模型在这场争夺里位置尴尬。它们在设备上运行,这绕开了部分出口管制的论点,但它们的可靠性恰恰是这篇arXiv论文质疑的地方。它的路由结果表明,实际的答案不是单独一个更好的小模型,而是一个知道何时求助的小模型。

评论 0

资料来源

6
  1. 01Do small language models know what they don't know?EN
  2. 02Nvidia drops a free 100M-parameter model that identifies up to eight speakers in real timeEN
  3. 03AI agents do more of the work in model development, but humans still make the decisionsEN
  4. 04Chinese AI models surge in global popularity — and Washington is worriedEN
  5. 05OpenAI halts training of latest models as reports mount of AI agents going rogueEN
  6. 06OpenAI pauses training of its 'most capable models'EN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。