跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

Coop 的 145M 志愿者训练模型与小型模型浪潮

据项目 9 月 30 日更新的 GitHub 仓库,一个拥有 145 百万参数的语言模型正在捐赠的消费级硬件上从头开始预训练,没有服务器,也没有资金。

人工智能与模型分析王雅琴发布: 2026年10月2日3 分钟阅读资料来源 8
Coop 的 145M 志愿者训练模型与小型模型浪潮

该项目名为 Coop。其仓库描述了一个训练循环,完全运行在志愿者机器以及 Hugging Face 和 GitHub Actions 的免费层级上。

第二阶段已上线:一个约 145M 参数的模型正在 FineWeb-Edu 上进行预训练。第一阶段是一个在 TinyStories 上运行的 15M 参数模型,目前已完成训练,超出了 Chinchilla 最优令牌预算。志愿者下载检查点,在个人数据分片上运行若干本地 AdamW 步骤,并将伪梯度作为拉取请求提交到公共 Hugging Face 数据集仓库。一个每五分钟调度的 GitHub Actions 定时任务读取开放的拉取请求,丢弃过期的,对剩余的进行裁剪和门控,用修剪均值或几何中位数聚合,执行一次 Nesterov 步骤并上传新的检查点。仓库指出,GitHub 的共享调度器实际触发间隔从几分钟到几小时不等,该协议容忍任何频率。

该项目声称其循环是经过生产验证的,而非设计出来的。多名志愿者在 Apple Silicon 和纯 CPU 上训练了相同的外层步骤,并将其平均到一次更新中。一个与时间片竞争提交的请求在减少陈旧性权重后于下一步被接受,来自同一用户的重复轮次合并为单个投票,一个未完成的轮次被刷新而非丢弃。

这一点很重要,因为市场低端正变得越来越拥挤。10 月 2 日,Microsoft AI 发布了 MAI-Transcribe-2-Streaming,一个覆盖 60 种语言的实时转录模型,首次部分结果返回时间仅为 100 毫秒多一点,The Decoder 报道。同一发布还包括 MAI-Voice-2.1,它用一种声音说 23 种语言,以及一个延迟 150 毫秒、每百万字符 15 美元的 Flash 变体,价格从 22 美元下降。

决策模型是另一个战线。AWS 发布了 Strands Decider 2B,一个基于 Qwen3.5-2B 构建的开源模型,返回校准后的选择而非文本,TechCrunch 于 10 月 1 日报道。Amazon 杰出工程师 Marc Brooker 告诉 TechCrunch,这类模型是“工作流步骤的完美决策者”。TypeSafe 将其 Jev 模型以经济学家 William Stanley Jevons 命名,正在开发未来版本;CEO Diogo Almeida 告诉 TechCrunch,他尚未看到真正的竞争出现。

硬件是约束条件。Apple 现在在配备 M1 芯片或更新芯片的 Mac 上搭载 Foundation Model,在设置 Apple Intelligence 后,可通过终端命令 fm 访问,t3n 于 10 月 2 日报道。该模型在本地回答,且不在提示之间携带上下文。

研究正在探究这些系统在哪里失效。一篇 9 月 29 日提交的论文追踪了扩散语言模型智能体中的重试循环,将其归因于掩码解码,并提出了一种无需训练的逆评分规则,称为 Reflect Reverse,据 arXiv 摘要。另一篇 10 月 1 日提交的论文报告称,模型排名在不同智能体框架间发生反转:在 Terminal-Bench 4 中,Claude 在 OpenHands 中领先 GPT 7.94 分,但在 PI 中落后 30.16 分,跨 66 个评估配置,作者写道。

国际象棋成为提示优化的新廉价测试平台,拥有 1118 个 Lichess 谜题,总研究成本约 800 美元,据 9 月 30 日提交的论文。评估中最强的模型 Gemini 3.5 Flash,作为元模型使用,仅能解决约 55% 的谜题。在别处,一种基于排名的内存控制器在 Synthetic Graph World 上相对于图内存基线将提示令牌减少 5.9%,将下半部分尾部预测误差降低 13.6%,并在 LongMemEval 上实现 24.48% 的令牌减少且准确率持平,据其作者。

Coop 位于该曲线的远端:没有数据中心,没有预算线,一个针对令牌而非外层步骤拟合的验证损失排行榜。仓库指出,单一的验证损失说明不了什么,因为外层步骤同样可能使其上升或下降。方向是序列的属性。

评论 0

资料来源

8
  1. 01Coop: A small language model pretrained by volunteersEN
  2. 02Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
  3. 03Amazon releases its own Jev clone as decision models flood the webEN
  4. 04Versteckter KI-Chatbot auf dem Mac: So greifst du auf Apples lokales Modell zuDE
  5. 05Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model AgentsEN
  6. 06Finding the Right Fit: Model-Harness Interactions across Agent TasksEN
  7. 07Benchmarking Prompt Optimization of Large Language Models With ChessEN
  8. 08Heavy-Tailed Memory Traces in Long-Horizon Language AgentsEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。