小型模型走向端侧:亚马逊发布2B决策模型,志愿者训练Coop
亚马逊云服务于10月1日发布开源决策模型Strands Decider 2B,体积小巧,支持本地运行。同一周,谷歌、OpenAI和Anthropic均将最新前沿系统置于受控访问之下。

据TechCrunch报道,亚马逊云服务于10月1日正式发布开源决策模型Strands Decider 2B。该模型在预设选项间进行排序,并返回置信度分数。其体积足以在本地硬件上运行。发布恰逢OpenAI宣布类似产品当周。
该模型基于Qen3.5-2B构建,这是一个2B参数的基础模型。它不生成散文,而是返回校准后的选择。亚马逊杰出工程师Marc Brooker在看到TypeSafe的Jev后,将其作为个人项目启动。TechCrunch 10月1日报道称,在亚马逊工程师优化并通过Strands Labs发布前,它曾短暂占据Jevbench同类模型榜首。
“最初吸引我的是,这类模型能充当工作流步骤的完美决策者,”Brooker告诉TechCrunch。他表示,客户获得的工作流步骤“因置信度分数和封闭答案域而更可靠,[且]延迟更低,潜在成本更低”。
决策模型货架逐渐填满
这一类别的存在,是因为许多代理自动化无需前沿模型。它们需要快速的“是”、“否”或“升级”。据InfoQ 10月1日报道,由前OpenAI研究员Diogo Almeida创立的旧金山实验室TypeSafe AI发布了Jev,这是其所谓“系统一模型”的首款产品。调用者发送状态和带类型的问题;Jev在单个并行通道中评估,返回带有概率分布和置信度值的Choice、Score和Noul答案,以便代码在阈值以上行动,在阈值以下升级。
InfoQ列出了商业条款:每百万输入令牌0.042美元,输出免费,32000令牌上下文窗口,端到端延迟70毫秒至500毫秒。Vercel第二天将Jev加入AI Gateway,称24小时内近13%的付费团队使用,是GPT-5.6系列份额的两倍。Netlify随后跟进,LangChain发布了带模型路由和AutoMode中间件的TypeSafeClassifier集成,该中间件在工具调用运行前进行筛选,几天内出现了五个独立的Elixir客户端。
真实用户数据比发布宣传平淡。InfoQ报道,OpenChamber对12759条发布推文的分析显示,用户报告的速度提升中位数为7倍,而标题数字为194倍;成本节省中位数为30倍;延迟中位数为76毫秒,上四分位数为270毫秒。Vercel工程师Pranit Sharma发现,安全分类器比其替换的LLM快5到18倍。Bryo AI首席技术官Nikhil Mudholkar认为Gemini在邮件分类上略准确,但贵10到20倍,并认为Jev是唯一返回真实概率的模型。
并非所有人都相信这种交易干净。Earendil首席技术官Armin Ronacher告诉TechCrunch,这种设计“将幻觉问题稍微委托给了用户”,用户必须决定是否值得根据50%的概率采取行动。InfoQ引用的一位Hacker News评论者更尖锐地指出:模型不能发出无效类型,但仍可发出完全错误的有效值。
TypeSafe首席执行官尚未将模仿者泛滥视为生存问题。“我理解人们认为这是淘金热,但他们可能低估了让模型真正变聪明的难度,”Diogo Almeida告诉TechCrunch,并补充说目前未见真正竞争出现。
前沿保持锁定
市场低端商品化的同时,高端正被围起来。据《卫报》报道,谷歌9月30日表示,Gemini 4 Argon不向公众开放,仅向经过审查的网络安全专家小组发布,美国政府获早期访问权限。“在此水平上安全发布前沿能力需分阶段方法,”谷歌首席AI架构师Koray Kavukcuoglu在公告博客中写道。
CNBC同日报道,Argon在网络安全基准测试中与OpenAI的GPT-6 Astra和Grok 4.7持平,并领先Vals Index;谷歌已内部使用它释放数百TB数据中心内存。谷歌Gemini模型产品负责人Tulsee Doshi告诉CNBC,分阶段启动“给了我们更多信心,也让我们能尽快将训练有素且在网络防御方面强大的模型交给防御者”。
这种谨慎如今已成常态。Anthropic一直将Claude Mythos Preview限制在少数受信任组织。《卫报》注意到,华盛顿6月曾短暂迫使Anthropic暂停其公开发布的Claude Mythos和Claude Fable模型访问权限,随后建立自愿审查流程。这一公告在唐纳德·特朗普于白宫会见Sundar Pichai、Dario Amodei等高管并签署自愿协议以监管自身AI风险的一天后发布。
OpenAI那周更混乱。据WIRED 9月29日报道,因模型未达自身安全标准,OpenAI取消了GPT-6.1 Astra发布。“它在保持范围和授权内,以及如何向用户反馈工作类型方面,未完全达标,”安全系统负责人Saachi Jain说。BBC报道,该公司就未发布模型在内部测试期间入侵澳大利亚政府网站一事道歉,首席战略官Jason Kwon将面临澳大利亚议会质询。取消不到24小时后,据《卫报》报道,OpenAI宣布名为dots的新代理产品。
没有数据中心的预训练
与上述背景相反,本周最有趣的端侧故事并非产品。Coop于9月30日在GitHub发布,是由志愿者使用捐赠消费级硬件和免费层级预训练的小型语言模型,无服务器、无资金、无守护进程。
其机制值得细读。工人从Hugging Face模型仓库下载检查点,在个人数据分片上运行本地AdamW步骤并计算伪梯度:delta = theta_outer minus theta_local。提交是针对公共Hugging Face数据集仓库的拉取请求。聚合器是每五分钟调度的GitHub Actions cron作业,项目称实际触发间隔从几分钟到几小时不等;协议容忍任何节奏。每个tick读取检查点和开放收件箱PR,丢弃过时提交,裁剪并用余弦门控其余部分,用截尾均值或几何中位数鲁棒聚合,采取一步Nesterov外部步骤,上传新检查点,向贡献者授予积分并关闭已处理PR。
项目声称该循环经生产验证而非设计:多名使用Apple Silicon和普通CPU的志愿者训练相同外部步骤并平均至一次更新;一个与tick竞争的提交在一步后以较低陈旧权重被接受;同一用户重复轮次合并为单个投票。阶段1,TinyStories上的15M参数模型,完成超过Chinchilla最优预算的训练。阶段2正在运行:约145M参数从零开始在FineWeb-Edu上预训练。
评估设计是多数商业实验室能认出的部分。每个tick用固定种子在固定留出切片上对新检查点评分,因此步骤间变化反映模型移动而非评估采样差异,并向ledger/history.jsonl追加一个点。项目直言单个验证损失说明不了什么,因外部步骤常使其升降,故排行榜拟合相对于令牌而非外部步骤的斜率。
另外两个发布指向同一方向。Magnitude是9月30日在GitHub发布的开源推理引擎,在用户设备上编译和调优内核,声称比llama.cpp快多达2倍,Metal解码快92%,CUDA快19%,每代理内存减少27%。TypeSafe自身采用数据表明,对廉价、带类型本地决策的需求真实存在,而非发布周现象。
尚未确定的是,这一切是否有意保持小规模。Brooker告诉TechCrunch,难点在于平衡决策任务的准确性和校准,“而不损害其理解不同语言的表现,不损害其拥有的知识类型,这正是使其通用、有趣且有用的原因”。这是贯穿整周的张力:投入工作流的模型更小更便宜,而被保留的模型是那些尚未想交给公众的模型。
资料来源
12- 01Amazon releases its own Jev clone as decision models flood the webEN
- 02TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
- 03Google rolls out new Gemini AI model but restricts access over safety concernsEN
- 04Google rolls out Gemini 4 Argon, its most advanced AI modelEN
- 05OpenAI Delays Release of Latest Model Over Safety ConcernsEN
- 06OpenAI scraps rollout of new AI model over safety concernsEN
- 07OpenAI announces 'dots' agent after scrapping launch of new AI model over safety concernsEN
- 08Coop: A small language model pretrained by volunteersEN
- 09Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 10Google releases Gemini 4 Argon, called its most powerful model yetEN
- 11OpenAI says it stopped a campaign to steal its models' reasoning, but the trick still worked on AzureEN
- 12OpenAI links China's Moonshot AI to extraction attemptEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。