跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

谷歌收紧最强模型,小模型走向边缘

谷歌周三开始推送 Gemini 4 Argon,但只面向经过审核的网络安全合作伙伴。同一周里,一个由志愿者训练的 145M 参数开源模型和一个来自 AWS 的 2B 决策模型相继问世。前沿与边缘正在分开。

人工智能与模型分析林晓雯发布: 2026年10月2日7 分钟阅读资料来源 15
谷歌收紧最强模型,小模型走向边缘

谷歌周三发布 Gemini 4 Argon,称它是公司迄今最先进的模型,并只向一组经过审核的网络安全合作伙伴开放。CNBC 和《卫报》都报道了这一限制。这已成为本周 AI 领域最核心的事实:最大的实验室正在放慢它们最大模型的脚步。

更小的模型仍在不断出货。Argon 的推送在设计上就是分阶段的。据《卫报》报道,谷歌首席 AI 架构师 Koray Kavukcuoglu 在博客中写道,“在这一水平上安全地释放前沿能力需要分阶段推进”。谷歌表示将让美国政府提前获取,并在更广泛发布前收集测试者反馈。公司还称 Argon 在真实软件工程上创下纪录,在网络安全上并列第一,并在 Vals Index 上领先。CNBC 报道称,它超过了 OpenAI 的 GPT-6 Astra 和 Anthropic 近期的模型。

小模型的反向潮流

与之相对,同一时间窗口里的三个发布走了另一条路:开放、小巧、现在就能用。9 月 30 日,一个名为 Coop 的 GitHub 项目发布了一个约 145M 参数的模型,在 FineWeb-Edu 上从零开始预训练。根据该项目的 README,整个训练循环运行在捐赠的消费级硬件上,外加 Hugging Face 和 GitHub Actions 的免费额度。没有服务器。没有资金。没有守护进程。

“第 1 阶段(在 TinyStories 上的 15M)超出了其 Chinchilla 最优预算完成,证明整套机制是可行的。”

机制比参数数量更重要。志愿者下载当前检查点,在个人数据分片上运行本地 AdamW 步骤,然后以伪梯度的形式向一个公开的 Hugging Face 数据集仓库提交拉取请求。一个无状态的 GitHub Actions 定时任务计划每五分钟触发一次,实际间隔从几分钟到几小时不等。它读取检查点和开放的收件箱 PR,丢弃过于陈旧的提交,聚合其余部分,执行一次 Nesterov 外层步骤,并关闭已处理的 PR。权重和优化器状态只存在于 Hugging Face 上;Git 保存代码、配置和贡献者账本。

该项目称这一循环是经过生产验证的,而不是设计出来的。多名志愿者在不同机器上训练出同一个外层步骤,并被平均成一次更新,机器既有 Apple Silicon,也有普通 CPU。一个与某次触发擦肩而过的提交在下一步被接受,陈旧度权重被调低。同一用户的重复轮次被合并为一张选票。README 明确指出,单一的验证损失说明不了什么,排行榜拟合的是针对 token 而非外层步骤的斜率。

决策模型,以及拥挤的赛道

据 TechCrunch 10 月 1 日报道,AWS 发布了 Strands Decider 2B,这是一个受 TypeSafe 的 Jev 启发的开源决策模型。它在预先确定的选项之间做选择并返回置信度,建立在 Qwen3.5-2B 的躯干上,而不是生成文本。亚马逊杰出工程师 Marc Brooker 告诉 TechCrunch,他是在看到 Jev 之后做出它的,该模型曾在其规模级别的 Jevbench 排名上短暂登顶。“最初引起我对这类模型兴趣的,是它们能成为工作流步骤的完美决策者,”他说。

TypeSafe 自己的姿态没那么得意。CEO Diogo Almeida 对 TechCrunch 说:“我明白人们觉得这是一场淘金热,但他们可能低估了让模型真正变聪明有多难。”TypeSafe 自己发布了 Jev,InfoQ 称它返回类型化概率而不是文本。10 月 1 日的一篇独立 arXiv 论文《More Choices, Fewer Decisions》考察了类 JEV 直接决策模型中的序数尺度偏差。这个类别仍在被压力测试,而不是已经定型。

在同一 24 小时里的其他地方:Ideogram 表示其 Ideogram 4.5 图像编辑器只改动用户选中的区域,提供四档质量,原生 2K 下每张图 0.8 到 22 美分,并承诺发布开放权重版本,据 The Decoder 报道。宝马在其资本市场日确认,一款入门级 Neue Klasse 电动车将于 2028 年推出,重点面向欧洲,Electrek 报道;来自 BMWBlog 的消息指向一款代号 NBO 的五门掀背车。

安全新闻说明了什么能力

本周最具分量的小模型故事也许根本不是一个发布。OpenAI 表示它瓦解了一场持续到 7 月的对抗性蒸馏行动,7 月 24 日和 25 日出现来自 4000 多名用户的 16000 次请求高峰,相关活动涉及 15000 个账号,并在 7 月 28 日前被完全关停。CNBC、Tom's Hardware 和 The Register 都刊登了该公司的说法,其中把活动的核心集群与 Moonshot AI 相关人士联系起来。据 CNBC 和 The Register 报道,Moonshot 未立即回应置评请求。

技术细节才是有意思的部分。OpenAI 称其加密没有被破解,也没有数据库被入侵。相反,操作者把加密的推理内容在对话之间转移,并在第二个会话中要求模型解密并写出来。这一手法研究者 Joachim Schaeffer 及其同事此前已经记录过,OpenAI 点名致谢了他们。The Decoder 报道称,这些研究者当天发布更新,主张保护你自己的 API 并不能保护那些同样出售同一批模型访问权的云服务商,而且这一手法在 Microsoft Azure 上持续有效了数周。

小模型不是那个故事的脚注,而是使能层。同一家族中更便宜的兄弟模型,正是把加密推理包变成可读文本的东西。这也正是 AWS 卖给客户的同一套经济学:一个工作流步骤,延迟更低、成本可能更低,用 Brooker 的话说,还带有置信度分数和封闭的答案域。

政策、价格与市场之间的落差

分布式部署正在走出手机。据 pv magazine 10 月 1 日报道,ILSR 的季度报告《Big Impact of Small Solar》显示,美国 2026 年第二季度小规模太阳能新增接近 1.6 GW,同时表后储能超过 2.5 GWh。MIT Technology Review 10 月 1 日报道,包括 PopWheels、Copper、Every Electric 和 David Energy 在内的初创公司正在把小型电池部署到电动自行车换电柜、电磁炉和即插即用设备中,从而避开电网升级和审批。PopWheels 的 David Hammer 在 9 月 24 日纽约气候周活动上说,纽约市约有 50 个换电柜和 2500 块电池在流通;Copper 的 Sam Calisch 说,如果美国每一台炉灶都配一块电池,加起来可达数十吉瓦。

同样的分裂贯穿汽车业。据 CnEVPost 报道,特斯拉 10 月 1 日宣布,把在中国销售的所有 Model 3 升级为 16 英寸屏幕,并在当地 Model 3 和 Model Y 全系上启用最高 2.2 kW 的交流电输出。美国版 Model 3 保留 15.4 英寸显示屏,被排除在 V2L 功能之外。Electrek 指出,特斯拉美国版 Model 3 起价 36990 美元。与此同时,据 The Next Web 报道,通用汽车本季度售出 670974 辆,下降 5.5%,在 7500 美元美国购车补贴结束后,Equinox EV 下滑 92.4% 至 1905 辆。丰田销量增长 0.6% 至 633223 辆,电气化车型增长 28.5%。

这一切并不是一个关于小模型获胜的干净故事。谷歌的 Argon 出于安全原因被按住不放,《卫报》指出 Anthropic 也一直把 Claude Mythos Preview 限制在受信任的组织内。据 Tom's Hardware 9 月 30 日报道,佛罗里达州总检察长 James Uthmeier 已请求法官禁止 OpenAI 在未经第三方批准的情况下开发新模型,这起诉讼还涉及 7 月的 Hugging Face 入侵事件。报道志愿者训练 145M 模型的同一批媒体,也在报道每天 16000 次请求的蒸馏行动。

这一周真正显示的是,能力扩散得比控制更快。一个 2B 决策模型在本地运行。一个 145M 模型在捐赠的笔记本上训练。在会话之间泄漏的加密推理之所以值得偷,恰恰是因为一个便宜的模型就能读懂它。前沿实验室的回应是分阶段发布和经过审核的合作伙伴名单。这套做法能否守住,与其说取决于基准表,不如说取决于桌上的一台 2B 模型下个月能做什么。

评论 0

资料来源

15
  1. 01Coop: A small language model pretrained by volunteersEN
  2. 02Google rolls out Gemini 4 Argon, its most advanced AI modelEN
  3. 03Google rolls out new Gemini AI model but restricts access over safety concernsEN
  4. 04Amazon releases its own Jev clone as decision models flood the webEN
  5. 05TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
  6. 06More Choices, Fewer Decisions: Ordinal-Scale Bias in JEV-like Direct-Decision ModelsEN
  7. 07Ideogram says its new model can edit part of an image without messing up the restEN
  8. 08BMW is launching a smaller, more affordable EVEN
  9. 09OpenAI says it stopped a campaign to steal its models' reasoning, but the trick still worked on AzureEN
  10. 10OpenAI says actors linked to China-based Moonshot AI spearheaded a campaign to extract its models' hidden reasoningEN
  11. 11Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
  12. 12AI race heats up as OpenAI flags alleged model-copying campaignEN
  13. 13U.S. small-scale solar adds 1.6 GW in Q2EN
  14. 14How smaller, distributed batteries could help the gridEN
  15. 15Tesla gives Model 3 minor upgrades in China, keeps prices unchangedEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。