小语言模型走向端侧,置信度信号却跟不上
苹果的 OpenELM 系列覆盖 2.7亿到 30亿参数,谷歌的 Gemma 3n 已支持文本、图像、视频和音频输入。但一篇 2026 年的 arXiv 论文报告说,在 30亿参数以下的模型里,词元级熵实际上已经失效。

端侧小语言模型不再只是研究上的新鲜事。两年时间里,它们从 Hugging Face 上的概念验证权重,变成带检索、函数调用和多模态输入的正式库。卖点始终一致:把推理留在手机或笔记本上,削减服务器成本,让用户数据留在本地。
没有跟上的是另一套工具:告诉这些模型自己何时出错。
从八个微型模型到一个库
苹果在 2024 年 4 月 24 日开启了这个阶段。据 Ars Technica 报道,当天它发布了八个源码可得的语言模型,名为 OpenELM,即 Open-source Efficient Language Models。这些模型参数从 2.7亿到 30亿不等,分为四个预训练版本和四个指令微调版本。作为参照,Ars Technica 指出当时 Meta 的 Llama 3 系列最高为 700亿参数,还有 4000亿的版本在开发中,而 OpenAI 2020 年的 GPT-3 是 1750亿参数。
苹果强调的不只是规模。公司称其分层缩放策略在各层之间更高效地分配参数。白皮书报告说,在预训练词元用量只有 Allen AI 的 OLMo 1B 一半的情况下,准确率提高了 2.36%。苹果还公开了 CoreNet 训练库和可复现的训练配方,Ars Technica 称这对一家大型科技公司来说并不常见。这些模型支持 2048 词元的上下文窗口,训练数据包括 RefinedWeb、去重后的 PILE、RedPajama 的一个子集和 Dolma v1.6 的一个子集,总计约 18000亿词元。
这些模型在回应用户提示时,有可能产生不准确、有害、带有偏见或令人反感的内容,苹果在论文中提醒道,Ars Technica 引用了这段话。
随着这些模型走出实验室,这条提醒变得更要紧。
谷歌把小语言模型变成平台
到 2025 年 5 月,话题已经从发布模型转向支撑生态。谷歌 AI Edge 团队说,它把端侧支持从最初的四个模型扩展到十几个,托管在新的 LiteRT Hugging Face 社区里,其中包括 Gemma 3 和 Gemma 3n。
Gemma 3n 以早期预览形式出现,被描述为 Gemma 首个多模态端侧小语言模型,有 2B 和 4B 两个参数版本,支持文本、图像、视频和音频。谷歌说文本和图像模态已在 Hugging Face 上提供,音频随后跟进。公司还提到 529MB 的 Gemma 3 1B,称它在移动 GPU 上预填充速度可达每秒 2585 个词元,足以在一秒内处理一页内容。
这次发布更重要的部分在基础设施。谷歌推出了端侧检索增强生成库,上线时可在 Android 上使用,还推出了端侧函数调用库,同样优先支持 Android。RAG 库让模型无需微调就能调用应用专属数据,谷歌说它可以从 1000 页信息或 1000 张照片中找出最相关的片段。函数调用库让模型自行判断何时调用预定义的函数或 API。谷歌的示例应用演示了从口述语音填充表单、语音转文本、提取字段并调用应用函数。
谷歌还介绍了新的 int4 训练后量化方案,称相比 bf16 可把模型体积缩小 2.5 到 4 倍,同时降低延迟和峰值内存占用。正是这类工程细节决定一个模型是能上线,还是停留在演示阶段。
SlimLM 与三星设备上的基准测试
学术界的进展同步进行。一篇 2024 年 11 月 15 日提交到 arXiv、修改至 11 月 25 日的论文提出了 SlimLM,一组面向移动设备文档辅助任务优化的小语言模型。作者 Thang M. Pham、Phat T. Nguyen、Seunghyun Yoon、Viet Dac Lai、Franck Dernoncourt 和 Trung Bui 在三星 Galaxy S24 上做实验,梳理了模型规模(从 125M 到 7B 参数)、上下文长度和推理时间之间的取舍。
SlimLM 在 SlimPajama-627B 上预训练,并在 DocAssist 上微调,后者是作者为摘要、问答和建议任务自建的数据集。摘要说,最小的模型在 S24 上运行高效,更大的版本则在移动端限制内提供更强能力,这项工作与现有小语言模型相比表现良好。作者还发布了 Android 应用,并把收益归结为服务器成本下降和端侧处理带来的更好隐私。
置信度问题
接下来是这些模型是否知道自己不知道什么。一篇 2026 年 7 月 21 日由 Prashant Mudgal 提交到 arXiv 的论文,考察了参数少于 30亿的小语言模型中基于熵的置信度信号,全部在消费级硬件上运行。它评估了七种方法,覆盖 7 个模型组合和 5 个标准 NLU 基准。
主要结论并不令人舒服。词元级熵实际上失效:在 91% 的数据集与模型组合中,无论答案对错,平均词元熵都接近零。论文说,这让基于词元的置信度信号在这个规模上无法使用。
语义熵表现更好。通过生成多个样本、按含义对答案聚类并测量分布不确定性,该方法恢复出可用的置信度信号。用它把不确定的查询路由到更大的专家模型,准确率提升最多达 50 个百分点。跨家族路由,论文举的例子是 SmolLM 360M 到 Phi-3.5-mini,平均提升 22.0%,而同家族路由只有 6.8%。作者的结论是,熵方法在小模型中的价值不在于节省算力,而在于智能地分配算力,把更多词元花在最要紧的地方。
不用语言推理
另一条研究路线在问,小模型是否必须把推理过程写出来。Science News 在 2026 年 9 月 22 日报道,一个名为 BDH-CQ 的小型实验系统,其中 DH 指 Dragon Hatchling,能在不写出中间步骤的情况下解出一些推理谜题。论文 8 月 10 日提交到 arXiv,尚未经过同行评审。
BDH-CQ 不把示例留在上下文里,而是用每个示例更新一块固定大小的记忆。复杂性科学家、AI 公司 Pathway 首席执行官 Zuzanna Stamirowska 对 Science News 说,查询一到,模型根本不把思考过程写成文字。她说:“中间过程从不转成语言。”
Stamirowska 和同事报告说,在公开的 ARC-AGI-1 评测集上,模型有两次尝试机会时解出了近十个谜题中的三个。它能处理部分旋转图形和移动图形的任务,但在颜色变化和某些规则组合上吃力。在看到难度相近的示例后,它对更难的排序和嵌套谜题表现更好。
成本说法很显眼。研究者估算每次谜题查询的运行成本约为 0.00070 美元,大约是同一基准上 GPT-5.6 Luna 的十一分之一,不过 Science News 指出两者的成本计算方式不同。外部研究者的反应比较克制。滑铁卢大学的 Yuntian Deng 称这是一个有趣的效率结果,但说它并未表明底层架构优于其他方法,并指出没有写出的推理过程,模型更难被检查。ELLIS 研究所图宾根和马克斯·普朗克智能系统研究所的 Jonas Geiping 说,这个模型是专为 ARC 类问题构建的,因此很难与通用系统直接比较。不过他称这一方法很巧妙,并指出它无需重新训练就能应对测试问题。
发布跑在理解前面
Imbue 的 Bouncer 展示了实际部署的样子,这是一个 2026 年 4 月 8 日发布的 Twitter 信息流过滤器。该工具用开源模型对帖子分类,博客文章称其为 Gemma 4 26B-A4B,说它大到足以理解上下文,又小到能跟上滚动速度。Imbue 说目前从自己的数据中心提供模型服务,同时在做直接在笔记本和手机上运行的版本。Bouncer 已作为 Chrome 扩展、Firefox 附加组件和 iPhone 应用提供,并承诺支持 Reddit、LinkedIn 和 Safari。
这些项目的模式一致。能力和分发跑得比评测快。苹果发布权重时坦率地提醒输出可能不准确或有偏见。谷歌发布检索和函数调用,让模型能对应用数据采取行动。SlimLM 在真实硬件上对文档任务做了基准测试。Mudgal 的论文发现最便宜的置信度信号在 30亿参数以下不起作用,而更贵的那种可以。BDH-CQ 表明有些推理可以不经语言发生,研究者同时提醒,没有说出口的推理更难审计。
资料来源
6- 01Apple releases eight small AI language models aimed at on-device useEN
- 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
- 03On-device small language models with multimodality, RAG, and Function CallingEN
- 04Do small language models know what they don't know?EN
- 05Can AI reason without words? A small model puts the idea to the testEN
- 06Show HN: Control your X/Twitter feed using a small on-device LLMEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。