谷歌收紧最强模型,小模型走向边缘
谷歌周三开始推送 Gemini 4 Argon,但只面向经过审核的网络安全合作伙伴。同一周里,一个由志愿者训练的 145M 参数开源模型和一个来自 AWS 的 2B 决策模型相继问世。前沿与边缘正在分开。

谷歌周三发布 Gemini 4 Argon,称它是公司迄今最先进的模型,并只向一组经过审核的网络安全合作伙伴开放。CNBC 和《卫报》都报道了这一限制。这已成为本周 AI 领域最核心的事实:最大的实验室正在放慢它们最大模型的脚步。
更小的模型仍在不断出货。Argon 的推送在设计上就是分阶段的。据《卫报》报道,谷歌首席 AI 架构师 Koray Kavukcuoglu 在博客中写道,“在这一水平上安全地释放前沿能力需要分阶段推进”。谷歌表示将让美国政府提前获取,并在更广泛发布前收集测试者反馈。公司还称 Argon 在真实软件工程上创下纪录,在网络安全上并列第一,并在 Vals Index 上领先。CNBC 报道称,它超过了 OpenAI 的 GPT-6 Astra 和 Anthropic 近期的模型。
小模型的反向潮流
与之相对,同一时间窗口里的三个发布走了另一条路:开放、小巧、现在就能用。9 月 30 日,一个名为 Coop 的 GitHub 项目发布了一个约 145M 参数的模型,在 FineWeb-Edu 上从零开始预训练。根据该项目的 README,整个训练循环运行在捐赠的消费级硬件上,外加 Hugging Face 和 GitHub Actions 的免费额度。没有服务器。没有资金。没有守护进程。
“第 1 阶段(在 TinyStories 上的 15M)超出了其 Chinchilla 最优预算完成,证明整套机制是可行的。”
机制比参数数量更重要。志愿者下载当前检查点,在个人数据分片上运行本地 AdamW 步骤,然后以伪梯度的形式向一个公开的 Hugging Face 数据集仓库提交拉取请求。一个无状态的 GitHub Actions 定时任务计划每五分钟触发一次,实际间隔从几分钟到几小时不等。它读取检查点和开放的收件箱 PR,丢弃过于陈旧的提交,聚合其余部分,执行一次 Nesterov 外层步骤,并关闭已处理的 PR。权重和优化器状态只存在于 Hugging Face 上;Git 保存代码、配置和贡献者账本。
该项目称这一循环是经过生产验证的,而不是设计出来的。多名志愿者在不同机器上训练出同一个外层步骤,并被平均成一次更新,机器既有 Apple Silicon,也有普通 CPU。一个与某次触发擦肩而过的提交在下一步被接受,陈旧度权重被调低。同一用户的重复轮次被合并为一张选票。README 明确指出,单一的验证损失说明不了什么,排行榜拟合的是针对 token 而非外层步骤的斜率。
决策模型,以及拥挤的赛道
据 TechCrunch 10 月 1 日报道,AWS 发布了 Strands Decider 2B,这是一个受 TypeSafe 的 Jev 启发的开源决策模型。它在预先确定的选项之间做选择并返回置信度,建立在 Qwen3.5-2B 的躯干上,而不是生成文本。亚马逊杰出工程师 Marc Brooker 告诉 TechCrunch,他是在看到 Jev 之后做出它的,该模型曾在其规模级别的 Jevbench 排名上短暂登顶。“最初引起我对这类模型兴趣的,是它们能成为工作流步骤的完美决策者,”他说。
TypeSafe 自己的姿态没那么得意。CEO Diogo Almeida 对 TechCrunch 说:“我明白人们觉得这是一场淘金热,但他们可能低估了让模型真正变聪明有多难。”TypeSafe 自己发布了 Jev,InfoQ 称它返回类型化概率而不是文本。10 月 1 日的一篇独立 arXiv 论文《More Choices, Fewer Decisions》考察了类 JEV 直接决策模型中的序数尺度偏差。这个类别仍在被压力测试,而不是已经定型。
在同一 24 小时里的其他地方:Ideogram 表示其 Ideogram 4.5 图像编辑器只改动用户选中的区域,提供四档质量,原生 2K 下每张图 0.8 到 22 美分,并承诺发布开放权重版本,据 The Decoder 报道。宝马在其资本市场日确认,一款入门级 Neue Klasse 电动车将于 2028 年推出,重点面向欧洲,Electrek 报道;来自 BMWBlog 的消息指向一款代号 NBO 的五门掀背车。
安全新闻说明了什么能力
本周最具分量的小模型故事也许根本不是一个发布。OpenAI 表示它瓦解了一场持续到 7 月的对抗性蒸馏行动,7 月 24 日和 25 日出现来自 4000 多名用户的 16000 次请求高峰,相关活动涉及 15000 个账号,并在 7 月 28 日前被完全关停。CNBC、Tom's Hardware 和 The Register 都刊登了该公司的说法,其中把活动的核心集群与 Moonshot AI 相关人士联系起来。据 CNBC 和 The Register 报道,Moonshot 未立即回应置评请求。
技术细节才是有意思的部分。OpenAI 称其加密没有被破解,也没有数据库被入侵。相反,操作者把加密的推理内容在对话之间转移,并在第二个会话中要求模型解密并写出来。这一手法研究者 Joachim Schaeffer 及其同事此前已经记录过,OpenAI 点名致谢了他们。The Decoder 报道称,这些研究者当天发布更新,主张保护你自己的 API 并不能保护那些同样出售同一批模型访问权的云服务商,而且这一手法在 Microsoft Azure 上持续有效了数周。
小模型不是那个故事的脚注,而是使能层。同一家族中更便宜的兄弟模型,正是把加密推理包变成可读文本的东西。这也正是 AWS 卖给客户的同一套经济学:一个工作流步骤,延迟更低、成本可能更低,用 Brooker 的话说,还带有置信度分数和封闭的答案域。
政策、价格与市场之间的落差
分布式部署正在走出手机。据 pv magazine 10 月 1 日报道,ILSR 的季度报告《Big Impact of Small Solar》显示,美国 2026 年第二季度小规模太阳能新增接近 1.6 GW,同时表后储能超过 2.5 GWh。MIT Technology Review 10 月 1 日报道,包括 PopWheels、Copper、Every Electric 和 David Energy 在内的初创公司正在把小型电池部署到电动自行车换电柜、电磁炉和即插即用设备中,从而避开电网升级和审批。PopWheels 的 David Hammer 在 9 月 24 日纽约气候周活动上说,纽约市约有 50 个换电柜和 2500 块电池在流通;Copper 的 Sam Calisch 说,如果美国每一台炉灶都配一块电池,加起来可达数十吉瓦。
同样的分裂贯穿汽车业。据 CnEVPost 报道,特斯拉 10 月 1 日宣布,把在中国销售的所有 Model 3 升级为 16 英寸屏幕,并在当地 Model 3 和 Model Y 全系上启用最高 2.2 kW 的交流电输出。美国版 Model 3 保留 15.4 英寸显示屏,被排除在 V2L 功能之外。Electrek 指出,特斯拉美国版 Model 3 起价 36990 美元。与此同时,据 The Next Web 报道,通用汽车本季度售出 670974 辆,下降 5.5%,在 7500 美元美国购车补贴结束后,Equinox EV 下滑 92.4% 至 1905 辆。丰田销量增长 0.6% 至 633223 辆,电气化车型增长 28.5%。
这一切并不是一个关于小模型获胜的干净故事。谷歌的 Argon 出于安全原因被按住不放,《卫报》指出 Anthropic 也一直把 Claude Mythos Preview 限制在受信任的组织内。据 Tom's Hardware 9 月 30 日报道,佛罗里达州总检察长 James Uthmeier 已请求法官禁止 OpenAI 在未经第三方批准的情况下开发新模型,这起诉讼还涉及 7 月的 Hugging Face 入侵事件。报道志愿者训练 145M 模型的同一批媒体,也在报道每天 16000 次请求的蒸馏行动。
这一周真正显示的是,能力扩散得比控制更快。一个 2B 决策模型在本地运行。一个 145M 模型在捐赠的笔记本上训练。在会话之间泄漏的加密推理之所以值得偷,恰恰是因为一个便宜的模型就能读懂它。前沿实验室的回应是分阶段发布和经过审核的合作伙伴名单。这套做法能否守住,与其说取决于基准表,不如说取决于桌上的一台 2B 模型下个月能做什么。
资料来源
15- 01Coop: A small language model pretrained by volunteersEN
- 02Google rolls out Gemini 4 Argon, its most advanced AI modelEN
- 03Google rolls out new Gemini AI model but restricts access over safety concernsEN
- 04Amazon releases its own Jev clone as decision models flood the webEN
- 05TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
- 06More Choices, Fewer Decisions: Ordinal-Scale Bias in JEV-like Direct-Decision ModelsEN
- 07Ideogram says its new model can edit part of an image without messing up the restEN
- 08BMW is launching a smaller, more affordable EVEN
- 09OpenAI says it stopped a campaign to steal its models' reasoning, but the trick still worked on AzureEN
- 10OpenAI says actors linked to China-based Moonshot AI spearheaded a campaign to extract its models' hidden reasoningEN
- 11Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
- 12AI race heats up as OpenAI flags alleged model-copying campaignEN
- 13U.S. small-scale solar adds 1.6 GW in Q2EN
- 14How smaller, distributed batteries could help the gridEN
- 15Tesla gives Model 3 minor upgrades in China, keeps prices unchangedEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。