小语言模型走向终端:数字说明了什么
小语言模型正走出数据中心,进入手机。已公布的结果显示进展并不均衡:苹果 OpenELM 系列覆盖 2.7亿 到 30亿 参数,谷歌一款模型下载包 529MB,在移动 GPU 上最高跑到每秒 2585 个 token。

据 Ars Technica 报道,苹果 2024 年 4 月 24 日发布八个小语言模型,统称 OpenELM,即 Open-source Efficient Language Models 的缩写。参数规模从 2.7亿 到 30亿 不等,以苹果 Sample Code License 放在 Hugging Face 上。Ars Technica 指出,该许可证带有使用限制。源代码虽然可以获取,这次发布可能并不符合通常意义上的开源定义。
八个模型分两类:四个预训练,四个指令微调。最大上下文窗口 2048 个 token。苹果说训练数据来自 RefinedWeb、去重后的 PILE 版本、RedPajama 的一个子集和 Dolma v1.6 的一个子集,总计约 1.8万亿 个 token。公司白皮书称,逐层缩放策略相比 Allen AI 的 OLMo 1B 带来 2.36% 的准确率提升,预训练 token 只用了一半。苹果还发布了训练库 CoreNet 和可复现的训练配方。论文摘要写道,大语言模型的可复现性与透明度对推进开放研究至关重要。
规模上的对比最直观。Ars Technica 列出 Meta Llama 3 最大的一次发布为 700亿 参数,另有 4000亿 版本在路上,OpenAI 2020 年的 GPT-3 为 1750亿 参数。参数量只是能力的大致尺度,不是最终结论。
手机基准测试显示了什么
SlimLM 于 2024 年 11 月 15 日提交到 arXiv,11 月 25 日修订,是一系列用于文档辅助的小语言模型。作者在三星 Galaxy S24 上做实验,考察模型规模(125M 到 7B 参数)、上下文长度和推理时间之间的取舍。SlimLM 在 SlimPajama-627B 上预训练,在 DocAssist 上微调,后者是作者为摘要、问答和建议任务自建的数据集。论文附带一个 Android 应用。作者给出的动机是降低服务器成本,以及通过端侧处理改善隐私。
谷歌的贡献更接近产品形态,见其 2025 年 5 月 20 日的开发者博客。Google AI Edge 的支持范围从最初四个模型扩展到十多个,包括 Gemma 3 和 Gemma 3n,托管在 LiteRT 的 Hugging Face 社区。Gemma 3 1B 为 529MB,在移动 GPU 上预填充阶段最高每秒 2585 个 token,谷歌称这足以在一秒内处理一页内容。Gemma 3n 处于早期预览阶段,是 Gemma 首个多模态端侧小语言模型,有 2B 和 4B 两个参数版本,支持文本、图像、视频和音频输入。文本和图像已在 Hugging Face 上,音频随后跟进。
谷歌还推出了端侧 RAG 库,可在 Android 上使用,以及端侧函数调用库,同样先在 Android 上线。公司称 int4 训练后量化相比 bf16 可将语言模型缩小 2.5 到 4X,同时降低延迟和峰值内存。
"一旦查询到达,模型根本不会用文字写出它的思考过程。中间没有任何东西会转换成语言,"AI 公司 Pathway 首席执行官、复杂性科学家 Zuzanna Stamirowska 对 Science News 说。
这段话针对的是 BDH-CQ,一个实验性系统,见 8 月 10 日提交到 arXiv 的论文,Science News 于 9 月 22 日报道。该模型用每个样本更新一块固定大小的记忆,而不是把样本留在上下文里。Stamirowska 和同事称,它在公开的 ARC-AGI-1 评测集上两次尝试内解出了近十分之三的谜题。他们估算每次查询成本约 0.00070 美元,约为同一基准上 GPT-5.6 Luna 的十一分之一。Science News 指出,两者的成本计算方式不同,该研究尚未经过同行评审。
在研究实验室之外,这些说法更难核实。Bouncer 是 Imbue 于 2026 年 4 月 8 日发布的 Twitter 信息流过滤器,使用博客中称为 Gemma 4 26B-A4B 的开源模型做分类。帖子称该模型目前由 Imbue 自己的数据中心提供服务,正在推进让它跑在笔记本电脑和手机上。
怀疑是有理由的,其中一些来自研究者本人。滑铁卢大学的 Yuntian Deng 对 Science News 说,BDH-CQ 是"一个有趣的效率结果",并未证明其架构优于其他方法。他说需要更多测试才能把设计本身与训练方法分开,一个不写出推理过程的模型也更难检查。ELLIS Institute Tübingen 和马克斯·普朗克智能系统研究所的 Jonas Geiping 说,BDH-CQ 专为 ARC 类问题构建,很难与通用系统直接比较。他仍称这一方法"精巧"。
尚未解决的问题是,这些成果有多少能经受住实际产品的检验。按苹果在 OpenELM 论文中的自我定位,这些模型属于研究发布。谷歌自己的提醒是 Gemma 3n 仍为早期预览。基准表格与口袋里那部手机之间的差距,仍是没有人公布过数字的部分。
资料来源
5- 01Apple releases eight small AI language models aimed at on-device useEN
- 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
- 03On-device small language models with multimodality, RAG, and Function CallingEN
- 04Can AI reason without words? A small model puts the idea to the testEN
- 05Show HN: Control your X/Twitter feed using a small on-device LLMEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。