跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

幻觉基准测试趋严,Gemini 4 Argon 小范围发布

9月30日周三,Google 开始向经过审核的网络安全专家团队推出 Gemini 4 Argon。这是其迄今最强大的模型。出于滥用担忧,该模型暂不对公众开放。

人工智能与模型分析林晓雯发布: 2026年10月2日8 分钟阅读资料来源 13
幻觉基准测试趋严,Gemini 4 Argon 小范围发布

9月30日周三,Google 开始向经过审核的网络安全专家团队推出 Gemini 4 Argon。这是其迄今最强大的模型。出于滥用担忧,该模型暂不对公众开放。据 The Guardian 报道,Google 在博客文章中称,其自愿向美国政府提供早期访问权限,并将在更广泛可用之前收集测试者的反馈。

这种谨慎态度与 Google 对该模型的主张形成尴尬对比。在由 TechCrunch 引用的发布博客中,该公司称 Argon 在多项 AI 基准测试中得分显著高于 OpenAI 的 GPT-6 Astra 以及 Anthropic 的 Fable 和 Opus,并引用了基准测试初创公司 Vals 的数据。它还表示 Argon 能够自主发现、验证并修补关键软件漏洞。这些是能力主张,而非可靠性主张。两者并不相同。

幻觉问题在此处变得尖锐。一个在推理或编码基准测试中得分高的模型,仍可能自信地给出错误答案。近期档案中与幻觉相关的材料指向两个方向。一项关于统一多模态模型中梯度冲突指标的受控审计 于 9 月 29 日提交至 arXiv,是近期论文中更有趣的一篇。它测试一个广泛使用的代理指标是否真的预测研究者假设它预测的东西。结果发现它并没有。

作者构建了一个名为 GRIDUMM 的测试平台,镜像了统一多模态模型训练的关键结构成分,同时使理解与生成之间的真值权衡可精确计算。在 63 种配置和 372 个测量检查点中,没有方向性冲突指标达到与置信区间排除零的 0.3 绝对 Spearman 相关。一种单调抑制冲突的剂量反应干预使权衡保持平坦,从而将相关性与因果性分离。功能性干扰指标优于方向性冲突指标,训练损失强烈跟踪权衡。作者并不声称冲突无用。他们声称其作为诊断目标的有效性必须被确立,而非被假设。

这是一个关于狭窄模型类别的狭窄结果。它也是那种应让阅读排行榜的人暂停一下的发现。

新基准测试实际测量了什么

同一时间窗口内提交的两篇 arXiv 论文采取了类似的怀疑立场。ChartDensity-Bench 于 9 月 30 日提交,评估多模态大语言模型在受控视觉密度下从科学图表重建数值数据的能力,变化同时显示的图表数量,k 等于 1、3、6 和 9。对五个近期 MLLM 的实验显示,随着视觉密度增加,数值重建退化,且这种退化的幅度在模型间差异显著。论文的图表级配对比较发现,同一源图表嵌入更密集的视觉上下文时可能产生更高的重建误差。这是一种具有清晰测量的幻觉相邻失败模式。模型并非拒绝回答。它在产生数字。

第三篇论文 扩散语言模型智能体的反向评分 于 9 月 29 日提交,追踪了基于扩散的语言模型智能体中的一个特定失败。它们陷入重试循环,在动作失败很久后重新发出该动作。作者将此归因于掩码解码提交了其最自信的位置,而推迟不确定的位置,因此在失败状态下,上下文已经为推迟的决策提供了自信的填充,即失败的动作本身。他们将这种扭曲建模为任务盲破坏,并提出了一种名为 Reflect Reverse 的无需训练补救方法,在四个多轮具身基准测试上进行了评估。

这三篇论文中存在一个模式。每一篇都隔离了模型自信出错的一种特定方式,在受控条件下测量它,并发现流行的代理指标并未跟踪结果。它们中没有一篇提供通用的幻觉分数。它们都暗示通用幻觉分数所做的工作比其发布者暗示的要少。

为了了解基准测试如何推动对话,看看决策模型空间。InfoQ 报道 TypeSafe AI 发布了 Jev,它根本不生成文本,而是返回带有置信度值的类型化概率决策,因此调用代码可以在阈值以上行动,并在阈值以下升级。输入成本为每百万 token 0.042 美元,输出免费,上下文窗口为 32000 token,TypeSafe 引用端到端延迟为 70ms 到 500ms。Vercel 在第二天将 Jev 添加到 AI Gateway,并表示在 24 小时内达到了付费团队的近 13%,是 GPT-5.6 系列份额的两倍。

Amazon 随后跟进。TechCrunch 报道 称,10 月 1 日 AWS 发布了 Strands Decider 2B,这是一个受 Jev 启发的开源决策模型,构建在 Qwen3.5-2B 的基础上。它在预决定选项之间排序并返回置信度度量。Amazon 杰出工程师 Marc Brooker 告诉 TechCrunch,该模型曾短暂达到其尺寸模型在 Jevbench 排名中的首位,其吸引力在于由于置信度分数和封闭答案域,工作流步骤更可靠,延迟更低,潜在成本也更低。

TypeSafe 创始人 Diogo Almeida 对这种拥挤直言不讳。“我理解人们认为这是一场淘金热,但他们可能低估了让模型真正聪明的难度,”他告诉 TechCrunch。他说当前这批“看起来更像”一波模仿者。无论这是否成立,方向是明确的:一些构建者正在通过缩小输出空间而非承诺更好的通用模型来应对可靠性问题。

安全论证先于证据到来

Google 自己限制 Argon 的框架是,这一级别的前沿能力需要分阶段方法。Google 首席 AI 架构师 Koray Kavukcuoglu 在宣布该模型的博客文章中写道,Argon 被设计为拒绝可能帮助实施网络攻击或开发化学、生物或核武器的请求,并且它监控模型的推理以阻止其偏离用户意图,这是研究者称为错位(misalignment)的风险。

The Guardian 报道,这种谨慎的推出反映了 Anthropic,后者一直将 Claude Mythos Preview 限制在少数受信任组织内。华盛顿 6 月曾短暂强制 Anthropic 暂停对其公开发布的 Claude Mythos 和 Claude Fable 模型的访问,并随后建立了在发布前审核最强大 AI 模型的自愿流程。这一公告是在 Donald Trump 在白宫接待顶级科技高管(包括 Sundar Pichai 和 Anthropic 的 Dario Amodei)的第二天,他们签署了一份自愿协议,承诺监管其自身 AI 系统的风险。

Google 称早期测试者使用 Argon 发现了全球医院使用的软件中的一个缺陷,该缺陷暴露了敏感个人信息,而其他先进模型未能发现。这是一个来自供应商的轶事,关于一个未广泛流通的模型。将其视为利益相关方的能力主张。

来源之争正在并行进行。CNBC 报道,OpenAI 称其识别并破坏了一个协调行动,旨在从其模型中提取受保护的推理,并将活动的核心集群与中国初创公司 Moonshot AI 联系起来。该活动始于 7 月初,并在两天内激增至来自超过 4000 名用户的 16000 个请求,相关活动涉及超过 15000 名用户。OpenAI 称运营者未违反其加密、数据库或存储的用户对话,并且已在 7 月 28 日完全破坏了该行动。

The Register 指出,鉴于 OpenAI 自身在网页数据上训练的历史,这一投诉显得尴尬,并报道 The Register 询问 OpenAI 7 月哪些模型被针对,但未收到回复。它还报道 Trump 的科技与科学助理 Michael Kratsios 在 7 月下旬指责 Moonshot AI 通过蒸馏 Anthropic 的 Fable 创建了其 Kimi K3 模型。Anthropic 的 Claude Opus 5.5 在该报告发布前一周发布,搭载了一种名为 preserved thinking 的防蒸馏防御,随 Fable 5.1 引入。

Moonshot 未立即回应 CNBC 的置评请求,The Register 也表示未立即收到回应。因此,核心指控在公开记录中仍是单方面的。

另一个值得关注的线索是训练数据的来源及其条款。The Guardian 报道,10 月 1 日 Anthropic 敦促 Albanese 政府考虑在退出模型下对澳大利亚版权作品进行训练的条件批准,在承认无法获得全面版权豁免后。ABC 和 SBS 在联邦议会调查的提交中提出反对,ABC 警告澳大利亚新闻行业将被蚕食,两家广播公司均建议将 AI 公司纳入新闻谈判激励中。

Anthropic 的提交声称该技术可以改变澳大利亚经济,同时也警告对国家安全和关键基础设施韧性的严重影响。AI 联合特别委员会下周在悉尼举行听证会,Anthropic 和 OpenAI 高管预计出席。

这些都没有确定任何特定模型是否可靠。它们确实暗示行业现在发布可靠性主张的速度快于发布检查它们的方式,而存在的检查往往狭窄、受控,并对所有人引用的代理指标不利。

评论 0

资料来源

13
  1. 01Google rolls out new Gemini AI model but restricts access over safety concernsEN
  2. 02Google releases Gemini 4 Argon, called its most powerful model yetEN
  3. 03Does Gradient Conflict Predict the Understanding-Generation Trade-off? A Controlled Audit of Conflict-Metric Validity in Unified Multimodal ModelsEN
  4. 04ChartDensity-Bench: Benchmarking MLLMs for Numerical Data Reconstruction under Visual DensityEN
  5. 05Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model AgentsEN
  6. 06TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
  7. 07Amazon releases its own Jev clone as decision models flood the webEN
  8. 08AI race heats up as OpenAI flags alleged model-copying campaignEN
  9. 09Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
  10. 10Anthropic pushes for opt-out model for Australian content as ABC warns of 'cannibalisation' of newsEN
  11. 11Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
  12. 12Ideogram says its new model can edit part of an image without messing up the restEN
  13. 13ThreatsDay: AI-Powered Zero-Day Chain, 543K Live Secrets, Model Inspection RCE and 13 More StoriesEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。