小语言模型走向端侧:苹果、谷歌、Imbue 和 Cactus 推动本地 AI
苹果、谷歌和一批较小的厂商正把小语言模型装进手机、笔记本和可穿戴设备。它们押注推理能在本地跑,不必送进数据中心。

2024 年 4 月,苹果发布八个源码可获取的小语言模型,名字叫 OpenELM。据 Ars Technica 报道,参数量从 2.7 亿到 30 亿不等。模型放在 Hugging Face 上,采用 Apple Sample Code License。Ars Technica 指出,这份许可带有若干限制,可能不符合通常被接受的开放源代码定义,尽管源代码可以拿到。
八个模型里,四个是预训练模型,四个是指令微调模型。它们共用 2048 token 的最大上下文窗口。训练数据包括 RefinedWeb、去重后的 PILE、RedPajama 的一个子集和 Dolma v1.6 的一个子集。苹果称总量约 1.8 万亿 token。
苹果的白皮书称,逐层缩放策略让 OpenELM 的准确率比 Allen AI 的 OLMo 1B 高 2.36%,而预训练 token 只用了后者的一半。苹果还发布了训练库 CoreNet 和可复现的训练配方,权重因此可以复现。Ars Technica 说,这在当时对一家大型科技公司并不常见。
参数量只是衡量能力的粗略指标。苹果的模型远低于最大的那些系统。Meta 的 Llama 3 系列已经做到 700 亿参数,4000 亿参数的版本还在开发。OpenAI 的 GPT-3 在 2020 年发布时有 1750 亿参数。这项研究的赌注是:小模型如今能做到大模型几年前做到的事。
谷歌补上多模态、RAG 和函数调用
2025 年 5 月 20 日,谷歌 AI Edge 团队说,端侧小语言模型的支持已从最初的四个扩展到十多个,其中包括 Gemma 3 和 Gemma 3n,托管在新的 LiteRT Hugging Face 社区上。Gemma 3n 以早期预览形式发布。谷歌称它是 Gemma 首个多模态端侧小语言模型,有 2B 和 4B 两个参数版本,支持文本、图像、视频和音频输入。文本和图像先在 Hugging Face 上线,音频随后跟进。
谷歌也给出了压缩工作的数字。它说,与 bf16 相比,int4 训练后量化能把语言模型压缩 2.5 到 4 倍,同时降低延迟和峰值内存。Gemma 3 1B 体积 529MB,在移动 GPU 上预填充速度可达每秒 2585 token。谷歌说,这足以在一秒内处理一页内容。
随模型一起发布的还有两个库。AI Edge RAG 库发布时已在 Android 上可用,模型不用微调就能调用应用专属数据。谷歌说,它可以从 1000 页文档或 1000 张照片里挑出最相关的片段。函数调用库同样先上 Android,模型自己决定何时调用预定义函数。附带的示例应用能根据口述语音填写医疗表单。
大语言模型的可复现性和透明度,对于推进开放研究、确保结果可信,以及支持对数据和模型偏见及潜在风险的调查,都至关重要。
这段话出自苹果 OpenELM 论文摘要,由 Ars Technica 引用。苹果还提醒,模型是在公开来源的数据集上训练的,可能产生不准确、有害、有偏见或令人反感的输出。Ars Technica 报道称,预计 6 月在 WWDC 亮相的 iOS 18 有传言会包含端侧 AI 功能,苹果也有可能聘请谷歌或 OpenAI 处理更重的云端计算。
手机上的基准测试,以及信息流的过滤器
2024 年 11 月的一篇 arXiv 论文提出了 SlimLM,作者包括 Thang M. Pham。这是一系列为移动端文档辅助调优的模型。作者在三星 Galaxy S24 上做实验,寻找模型规模(从 125M 到 7B 参数)、上下文长度和推理时间之间的取舍。SlimLM 在 SlimPajama-627B 上预训练,在 DocAssist 上微调。DocAssist 是作者为摘要、问答和建议任务自建的数据集。他们还发布了一个 Android 应用。
Imbue 的 Bouncer 走的是另一条路。它发布于 2026 年 4 月 8 日,2026 年 9 月 25 日更新,用一段自然语言描述过滤 X/Twitter 信息流,所用开源模型被公司称为 Gemma 4 26B-A4B。Imbue 说,目前在自己的数据中心提供该模型,同时努力让它直接跑在笔记本或手机上。Bouncer 有 Chrome 扩展、Firefox 附加组件和 iPhone 应用。Reddit、LinkedIn 和 Safari 的支持被列为即将推出。
Cactus Compute 的 Needle 3 于 2026 年 9 月 18 日发布,规模更小。公司称它是 29-121M 参数的阶梯式模型,生成 9 到 29 MB 的 CQ2 位二进制文件,在 Raspberry Pi 5 上解码速度每秒 400 到 4000 token,预填充速度每秒 1 到 1 万 token。Cactus 说,在下游任务上微调一个 epoch 后,这个 4 层子网络可以媲美 DeepSeek V4 Flash。
Needle 3 面向工具调用、结构化抽取和文本嵌入。文中列举的用例包括智能家居、机器人、手机、可穿戴设备、AR 眼镜、汽车和 PC。每个响应都带一个来自校准头的置信度分数。引擎设了 0.1 的下限,低于该值的调用会被扣下,放进 suppressed_calls 字段。
有一项研究结果给这股热情泼了冷水。Prashant Mudgal 在 2026 年 7 月 21 日提交的一篇论文发现,在参数量低于 30 亿的模型里,token 级熵实际上是失灵的:在 91% 的数据集与模型组合中,无论答案是否正确,平均 token 熵都接近零。语义熵通过采样多个答案并按含义聚类,能恢复出可用的信号。把不确定的查询路由给更大的专家模型,准确率最多提升 50 个百分点。跨家族路由平均提升 22.0%,同家族路由为 6.8%。
论文对本地推理的含义说得很直接。它认为,熵方法在小模型中的价值不在于省算力,而在于智能地分配算力:把更多 token 花在最要紧的地方。就目前而言,端侧 AI 的说辞仍建立在隐私、延迟和成本之上,可靠性这个更难的问题还没有答案。
资料来源
6- 01Apple releases eight small AI language models aimed at on-device useEN
- 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
- 03On-device small language models with multimodality, RAG, and Function CallingEN
- 04Do small language models know what they don't know?EN
- 05Show HN: Control your X/Twitter feed using a small on-device LLMEN
- 06Show HN: Cactus Needle 3: 8-29MB automation models can match DeepSeek V4 FlashEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。