志愿者用闲置硬件训练出145M参数语言模型,没有服务器也没有经费
志愿项目 Coop 于9月30日上线第二阶段模型:一个145M参数的语言模型,预训练完全靠捐赠的消费级硬件和免费云服务额度完成。

项目代码托管在 GitHub 的 commonsense-ai/coop。仓库说明称,整个训练流程不需要服务器,不需要常驻进程,也没有任何经费。参与者从 Hugging Face 的模型仓库下载当前检查点,在自己的数据分片上跑本地 AdamW 步,再把一份伪梯度作为拉取请求提交到公开的 Hugging Face 数据集仓库。GitHub Actions 定时任务每五分钟触发一次,把收到的提交汇总起来,执行一次 Nesterov 外层步,然后上传新的检查点。
第二阶段是一个仅含解码器的 transformer,12 层、14 个头、d=896、上下文长度 1024 个 token,训练数据为 FineWeb-Edu。
第一阶段是一个 15M 参数的模型,在 TinyStories 上训练了六天。项目自己的 README 显示,它最终在超过 Chinchilla 最优预算后收尾,验证损失从 9.01 降到 2.8。
志愿者究竟验证了什么
README 对失败情形的描述异常具体,工程细节也正在这里。一次与聚合周期撞车的提交会在下一个步被接受,但陈旧度权重会被调低。同一用户的重复轮次会合并为一张票,项目称这是防止刷 token 的措施。coop stop 命令会把进行到一半的轮次冲刷掉,而不是直接丢弃。每个周期收件箱都会清空归零。多名使用 Apple Silicon 和普通 CPU 的志愿者算出了同一个外层步,并被平均成一次更新。
贡献者不需要任何许可。任何拥有写入 token 的免费 Hugging Face 账号都可以发起提交,维护者不授予任何特殊权限。
权重和优化器状态只以 safetensors 格式保存在 Hugging Face 上。Git 则在一个专门的分支上保存代码、配置和贡献者账本。
项目对自己的数字意味着什么也很谨慎。每个周期都会在固定的留出数据切片上用固定随机种子评估新检查点,因此步与步之间的变化反映的是模型本身,而不是采样。排行榜拟合的是验证损失对 token 数的斜率,而不是对外层步数的斜率,因为一个步里究竟做了多少工作,取决于那一周期碰巧有多少算力到位。README 说明,只有斜率超过两个标准误才算下降,达不到就如实标注。
放在整个领域里看
小模型方向已经很拥挤。TechCrunch 在9月30日报道,谷歌通过 Fairwind 计划向一批精选的网络合作伙伴发布了 Gemini 4 Argon,这是前沿模型而非小模型。CNBC 同一天报道,Argon 已经在谷歌数据中心内部用于优化内存。对比本身就是重点:Coop 的145M参数比前沿发布低了大约三个数量级,而且跑在志愿者自己已经拥有的硬件上。
这个方向上的努力不止 Coop 一个,不过现有材料只能直接支撑 Coop 自己的说法。
它真正展示出来的,是一套可行的分布式训练机制,而且没有中心化的基础设施预算。README 说这套循环是经过生产验证的,而不是设计出来的,并逐一列出了它扛住的具体边界情况。
Coop 提供一个可通过 uv 安装的命令行工具,coop run latest 命令会下载当前检查点并根据提示词生成文本。
项目建议改跑已经完成的第一阶段 TinyStories 模型,称它比仍在进行中的训练连贯得多。
资料来源
5- 01Coop: A small language model pretrained by volunteersEN
- 02Google releases Gemini 4 Argon, called its most powerful model yetEN
- 03Google rolls out Gemini 4 Argon, its most advanced AI modelEN
- 04OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
- 05OpenAI announces 'dots' agent after scrapping launch of new AI model over safety concernsEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。