跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

小语言模型走向端侧,研究却还没跟上

苹果的 OpenELM 系列覆盖 2.7 亿到 30 亿参数,谷歌 Gemma 3 1B 体积为 529MB,但一篇 2026 年的论文发现,在 91% 的数据集与模型组合中,token 级置信度信号几乎为零。

人工智能与模型解释王雅琴发布: 2026年9月28日4 分钟阅读资料来源 6
小语言模型走向端侧,研究却还没跟上

小语言模型指的是参数不到 30 亿、能跑在手机上而不是数据中心里的那一类模型。从研究里的新鲜玩意到真正出货的产品,它们只用了大约两年。卖点很简单:模型留在本地,省下服务器成本,用户数据不落到别人的硬件上。但证据比宣传要复杂得多。

苹果的贡献是最清楚的起点。2024 年 4 月 24 日,Ars Technica 报道称,苹果以 OpenELM 之名发布了八个模型,OpenELM 是 Open-source Efficient Language Models 的缩写,托管在 Hugging Face 上,采用 Apple Sample Code License。Ars Technica 指出,该许可证带有一些限制,可能不符合通常认可的开源定义,不过源代码可以获取。这些模型参数从 2.7 亿到 30 亿不等,分为四个预训练版本和四个指令微调版本,最大上下文窗口为 2048 个 token。苹果的白皮书称,一种“逐层缩放策略”让准确率比 Allen AI 的 OLMo 1B 提高了 2.36 个百分点,而预训练 token 用量只有后者的一半。

Ars Technica 给出了背景:当时 Meta 的 Llama 3 系列最高为 700 亿参数,另有 4000 亿参数的版本在开发中,而 OpenAI 2020 年的 GPT-3 参数为 1750 亿。参数规模只是粗略的衡量,不是判决书。

基准论文究竟测了什么

2024 年 11 月 15 日提交到 arXiv 的 SlimLM 走的是更窄的路:文档辅助。作者 Thang M. Pham 和四位合著者在三星 Galaxy S24 上测试了从 125M 到 7B 参数的模型,预训练使用 SlimPajama-627B,并在他们自建的数据集 DocAssist 上微调,任务包括摘要、问答和建议。论文摘要声称其表现与现有小模型相当或更好,并把一个 Android 应用描述为部署参考。这是一个有用的数据点,因为它同时点明了硬件、任务和模型规模,而多数端侧宣称都做不到这一点。

谷歌的 AI Edge 团队铺得更广。在 2025 年 5 月 20 日的开发者博客文章中,Mark Sherwood、Matthew Chan、Marissa Ikonomidis 和 Milen Ferev 宣布支持十多个模型,包括 Gemma 3 和 Gemma 3n,托管在新的 LiteRT Hugging Face 社区上。Gemma 3 1B 体积为 529MB,在移动 GPU 上预填充速度可达每秒 2585 个 token,谷歌称这使它能在不到一秒内处理最多一页内容。Gemma 3n 有 2B 和 4B 两个版本,被描述为 Gemma 首个多模态端侧小语言模型,支持文本、图像、视频和音频,其中文本和图像先上线。文章还介绍了端侧 RAG 和函数调用库,两者在发布时均可在 Android 上使用。

然后还有怀疑的一层。一篇题为“Do small language models know what they don't know?”的论文由 Prashant Mudgal 于 2026 年 7 月 21 日提交到 arXiv。它评估了七种基于熵的置信度方法,覆盖 7 个模型对和 5 个 NLU 基准。主要发现很直接:在小模型中,token 级熵实际上等于失灵,无论答案是否正确,它在 91% 的数据集与模型组合中都接近零。语义熵通过对答案采样并按含义聚类来计算,能恢复出可用的信号。把不确定的查询转给更大的专家模型,准确率最多提升 50 个百分点,其中跨家族路由平均提升 +22.0%,同家族路由为 +6.8%。

不写推理过程的推理

Science News 在 2026 年 9 月 22 日报道了 BDH-CQ,这是一个小型实验系统,于 8 月 10 日提交到 arXiv,能在不写出中间步骤的情况下解出部分推理谜题。复杂性科学家、AI 公司 Pathway 首席执行官 Zuzanna Stamirowska 对 Science News 说:“查询一到,模型根本不用文字写出它的思考过程。”在公开的 ARC-AGI-1 评测集上,该模型用两次尝试解出了将近十分之三的谜题。Stamirowska 和同事估计,每次谜题查询的运行成本约为 0.00070 美元,大约是同一基准上 GPT-5.6 Luna 的十一分之一,不过 Science News 指出,两项成本的计算方式不同,而且该研究尚未经过同行评审。

并非所有人都买账。滑铁卢大学的计算机科学家 Yuntian Deng 对 Science News 说,这个结果是“一个有趣的效率结果”,但并不能说明该架构优于其他方法,而且没有写出来的推理过程,模型更难被检查。图宾根 ELLIS 研究所和马克斯·普朗克智能系统研究所的 Jonas Geiping 称这种方法“巧妙”,但表示 BDH-CQ 是专门为 ARC 类问题构建的,因此很难与通用系统直接比较。

部署已经跑在论文前面。Imbue 的 Bouncer 是一个 2026 年 4 月 8 日发布的 Twitter 信息流过滤器,使用该公司称为 Gemma 4 26B-A4B 的开源模型做分类,目前由 Imbue 自己的数据中心提供服务。工程师 Millan Philipose 写道,团队正努力让它直接跑在笔记本电脑和手机上。这个目标与手机上 529MB 模型之间的差距,就是下一轮宣称要接受检验的地方。

评论 0

资料来源

6
  1. 01Apple releases eight small AI language models aimed at on-device useEN
  2. 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
  3. 03On-device small language models with multimodality, RAG, and Function CallingEN
  4. 04Do small language models know what they don't know?EN
  5. 05Can AI reason without words? A small model puts the idea to the testEN
  6. 06Show HN: Control your X/Twitter feed using a small on-device LLMEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。