跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

脆弱的决策:模型的正确选择有多容易被推翻

九月的四篇论文暴露了语言模型的软肋。一段简短、读起来自然的上下文,就能把原本正确的决策带偏。模型内部编码了什么,实际又用到了什么,两者之间的差距往往很大。

科学解释郑雪莉发布: 2026年9月25日7 分钟阅读资料来源 4
脆弱的决策:模型的正确选择有多容易被推翻

决策模型把文本映射成有限选项上的概率分布,如今越来越多地直接驱动现实操作:分派工单、挑选工具、触发动作。论文《JevOut》问的是另一件事:如果往输入里塞一段简短、读起来自然、又不改变正确答案的文字,这个决策会怎样。

上下文与答案

作者的做法很直接。对每个原本答对的任务,他们先锁定一个错误的目标选项,再优化附加的上下文,让它读起来通顺,同时把选择推向那个选项。来源、问题、答案集合和正确答案都不动。模型 Jev 原本答对的 508 个决策里,有 312 个被带偏,占 61.4%。其中 229 个案例,模型给那个既定错误选项的概率至少是 0.7。换到另外三个决策系统上测试,带偏成功率在 64.9% 到 73.2% 之间。作者的结论很硬:这些模型把语言直接变成决策,那它们的概率就不该被当成可靠的决策接口。

理由到底起不起作用

第二个项目看的是更基本的情形。模型否决某个候选,给出的理由却是档案里根本没有的事实,比如缺少导演或死亡日期。这句话不用任何裁判就能核验:把语料里提到该事实的句子放进档案,再问一次即可。三次运行中规模最大的一次用了六个开源模型,数据集是 2WikiMultihopQA。提供被指出的事实时,选择偏移比按长度匹配的无关附加内容更强,优势比 3.57,区间 1.54 到 8.26,Holm 校正后为 0.0210。去掉任意单个模型,结果依然成立。

但最有趣的效果跟内容无关。同一个无关附加内容,放在被指出的对手旁边时,对选择的推动比放在模型没提到的第三个选项旁边更强,Holm 校正后为 0.0008。也就是说,起作用的一部分是句子的位置,不是它的内容。作者还报告,测量规则的验证查出八处缺陷。最严重的一处是选择解析规则,它在 17.1% 的可判定回答里返回了恰好被否决的选项,这会把存活的对比数从四个虚高到六个。

线性与重复性

另外两篇论文谈的是模型本身的性质。帕维尔·季霍诺夫(Paweł Tichonow)的团队发现,transformer 虽然由高度非线性的组件搭成,却表现出基本的线性:把来自不同文本流的输入线性相加,下一个 token 的分布就是各条流分布的叠加。作者称之为叠加线性假说,并认为这是架构的属性,不是训练的结果。预训练越往后,这一现象越弱,轻量微调又能把线性找回来。这带来一个有意思的用法:受控解码可以拆开叠加,从一次前向传播里生成两段连贯的续写。

最后一篇论文谈文本退化,也就是模型的重复。作者不去裁决数据解释和网络解释谁对,而是换一种测量:短窗口内最大概率映射的不动点结构,用了 96 个随机的双 token 起点和十七个现成模型。行为类别在十七个案例中的十七个里都保持稳定,但在固定语料和规模下并不确定:有的模型家族形成漏斗,有的不形成。十七个模型中的八个、来自五个语料的七个家族表现出漏斗。结论落在方法上:把重复性说成某个具体模型的特性,现在还太早。

评论 0

资料来源

4
  1. 01JevOut: Natural Context Can Flip Decision ModelsEN
  2. 02Does a model's stated reason for rejecting a candidate do any work?EN
  3. 03Superposition Linearity HypothesisEN
  4. 04What a Cross-Model Fixed-Point Census Can and Cannot Arbitrate About RepetitionEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

郑雪莉

郑雪莉

科学与健康

郑雪莉负责FLASH24科学与健康版块,日常从论文预印本、期刊官网和机构通报中抓取信息,只盯数据来源和实验设计是否站得住。她习惯把每项统计数字与原始数据集交叉比对,遇到百分比先算清分母再决定是否采用。她常联系一线研究人员核实细节,也会在日历上标记大型队列研究的发布节点,提前比对不同团队的结果。私下她学材料物理,还自己架望远镜观测,这让她对测量误差和观测条件格外敏感。她有一条硬规矩:样本量、利益冲突或方法说明缺一项,稿子就不发。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。