Coop 的 145M 志愿者训练模型与小型模型浪潮
据项目 9 月 30 日更新的 GitHub 仓库,一个拥有 145 百万参数的语言模型正在捐赠的消费级硬件上从头开始预训练,没有服务器,也没有资金。

该项目名为 Coop。其仓库描述了一个训练循环,完全运行在志愿者机器以及 Hugging Face 和 GitHub Actions 的免费层级上。
第二阶段已上线:一个约 145M 参数的模型正在 FineWeb-Edu 上进行预训练。第一阶段是一个在 TinyStories 上运行的 15M 参数模型,目前已完成训练,超出了 Chinchilla 最优令牌预算。志愿者下载检查点,在个人数据分片上运行若干本地 AdamW 步骤,并将伪梯度作为拉取请求提交到公共 Hugging Face 数据集仓库。一个每五分钟调度的 GitHub Actions 定时任务读取开放的拉取请求,丢弃过期的,对剩余的进行裁剪和门控,用修剪均值或几何中位数聚合,执行一次 Nesterov 步骤并上传新的检查点。仓库指出,GitHub 的共享调度器实际触发间隔从几分钟到几小时不等,该协议容忍任何频率。
该项目声称其循环是经过生产验证的,而非设计出来的。多名志愿者在 Apple Silicon 和纯 CPU 上训练了相同的外层步骤,并将其平均到一次更新中。一个与时间片竞争提交的请求在减少陈旧性权重后于下一步被接受,来自同一用户的重复轮次合并为单个投票,一个未完成的轮次被刷新而非丢弃。
这一点很重要,因为市场低端正变得越来越拥挤。10 月 2 日,Microsoft AI 发布了 MAI-Transcribe-2-Streaming,一个覆盖 60 种语言的实时转录模型,首次部分结果返回时间仅为 100 毫秒多一点,The Decoder 报道。同一发布还包括 MAI-Voice-2.1,它用一种声音说 23 种语言,以及一个延迟 150 毫秒、每百万字符 15 美元的 Flash 变体,价格从 22 美元下降。
决策模型是另一个战线。AWS 发布了 Strands Decider 2B,一个基于 Qwen3.5-2B 构建的开源模型,返回校准后的选择而非文本,TechCrunch 于 10 月 1 日报道。Amazon 杰出工程师 Marc Brooker 告诉 TechCrunch,这类模型是“工作流步骤的完美决策者”。TypeSafe 将其 Jev 模型以经济学家 William Stanley Jevons 命名,正在开发未来版本;CEO Diogo Almeida 告诉 TechCrunch,他尚未看到真正的竞争出现。
硬件是约束条件。Apple 现在在配备 M1 芯片或更新芯片的 Mac 上搭载 Foundation Model,在设置 Apple Intelligence 后,可通过终端命令 fm 访问,t3n 于 10 月 2 日报道。该模型在本地回答,且不在提示之间携带上下文。
研究正在探究这些系统在哪里失效。一篇 9 月 29 日提交的论文追踪了扩散语言模型智能体中的重试循环,将其归因于掩码解码,并提出了一种无需训练的逆评分规则,称为 Reflect Reverse,据 arXiv 摘要。另一篇 10 月 1 日提交的论文报告称,模型排名在不同智能体框架间发生反转:在 Terminal-Bench 4 中,Claude 在 OpenHands 中领先 GPT 7.94 分,但在 PI 中落后 30.16 分,跨 66 个评估配置,作者写道。
国际象棋成为提示优化的新廉价测试平台,拥有 1118 个 Lichess 谜题,总研究成本约 800 美元,据 9 月 30 日提交的论文。评估中最强的模型 Gemini 3.5 Flash,作为元模型使用,仅能解决约 55% 的谜题。在别处,一种基于排名的内存控制器在 Synthetic Graph World 上相对于图内存基线将提示令牌减少 5.9%,将下半部分尾部预测误差降低 13.6%,并在 LongMemEval 上实现 24.48% 的令牌减少且准确率持平,据其作者。
Coop 位于该曲线的远端:没有数据中心,没有预算线,一个针对令牌而非外层步骤拟合的验证损失排行榜。仓库指出,单一的验证损失说明不了什么,因为外层步骤同样可能使其上升或下降。方向是序列的属性。
资料来源
8- 01Coop: A small language model pretrained by volunteersEN
- 02Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
- 03Amazon releases its own Jev clone as decision models flood the webEN
- 04Versteckter KI-Chatbot auf dem Mac: So greifst du auf Apples lokales Modell zuDE
- 05Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model AgentsEN
- 06Finding the Right Fit: Model-Harness Interactions across Agent TasksEN
- 07Benchmarking Prompt Optimization of Large Language Models With ChessEN
- 08Heavy-Tailed Memory Traces in Long-Horizon Language AgentsEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。