跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

医疗AI同时暴露两个问题:早期判断出错,训练数据泄露患者身份

相隔14个月发表的两项研究,指向医疗AI同一项任务的两端:一端是早期诊断,另一端是训练数据里患者的匿名性。

健康分析郑雪莉发布: 2026年9月27日4 分钟阅读资料来源 4
医疗AI同时暴露两个问题:早期判断出错,训练数据泄露患者身份

2026年4月15日,The Register报道了JAMA Network Open上的一项研究。研究团队用29个标准化临床病例测试了21个现成的AI模型。把完整的医疗信息交给模型、要求给出最终诊断时,这些模型的得分是91%。到了早期鉴别诊断阶段,也就是临床医生逐一排除或纳入各种可能性的环节,超过八成病例失败。

“我们测试的每一个模型都在绝大多数病例上失败了,”论文第一作者、哈佛医学院学生Arya Rao对The Register说。“那正是不确定性最要紧的阶段,也正是这些系统最薄弱的地方。”

共同作者、麻省总医院放射科医生Marc Succi博士说得更直接:“我们的结果表明,在没有结构化、全面的人工复核的情况下,不应信任当今的现成大语言模型去做面向患者的诊断推理。”Succi还说,模型“可以在没有展示稳健推理的情况下表现出自信”,而这会让本就为某个症状担忧的患者更加焦虑。

Rao对自己数据的解读要温和一些。论文所说的失败,指模型没有给出完全正确的鉴别诊断,而不是说它完全错了。原始准确率在63%到78%之间,她认为这说明模型常常部分正确。研究团队仍然主张更严格的指标才有意义,因为这些系统正被当作一线工具推销,用来在人类接手之前缩小诊断范围。

成员推断攻击,在个体层面几乎百发百中

第二个问题藏在第一个问题下面。2026年6月24日,德国研究人员在Nature发表论文,显示判别式医疗AI模型很容易暴露某位特定患者的记录是否曾出现在训练集中。这类模型用来分类数据,并对新输入做预测。

这种技术叫成员推断攻击。它之所以奏效,是因为模型对见过的输入往往更有把握。攻击者把患者数据喂进去,观察置信度,就能推断出这条记录是否被纳入训练。

研究团队在七个医疗数据集上做了测试,涵盖影像、心电图记录和电子健康档案,发现可以“几乎百发百中”地识别出个体患者。论文第一作者、慕尼黑工业大学的Moritz Knolle告诉The Register,来自代表性不足群体的患者更容易被指认出来,判断依据包括种族、保险状态、性别、成像方案或疾病状态。

“总的来说,模型的训练队列越特殊,成员推断攻击带来的隐私风险就越严重,”Knolle说。他举例说,有的数据集本身就会暴露成员患有某种潜伏的遗传病,比如亨廷顿病、抑郁症,或者曾在某家专科治疗机构就诊。

“在我们的论文中,我们证明只有部分访问权限的攻击者仍然可以成功实施成员推断攻击。”

Knolle还驳斥了匿名化记录就安全的常见说法。“实施成员推断攻击的攻击者不需要知道数据属于谁,”他说。“事实上,我们研究中使用的所有数据集都是匿名化的。”他补充说,部分血液检测结果就足够了,而考虑到医疗数据泄露的频率,拿到这些数据并不难。

研究者要求监管机构做什么

Nature论文的团队希望推动两项改变。第一,隐私审计应当在个体患者层面衡量风险,而不是在总体层面。用研究者的话说,标准流程无法充分反映“几乎百发百中的单患者攻击成功率”究竟意味着什么。第二,他们建议采用差分隐私框架,用数学方法限定模型可以从任何一条训练记录中泄露多少信息。Knolle说,他希望医疗AI界“开始认真对待隐私风险”。

再把视线转回准确率这一侧。据GeekWire报道,微软的MAI Diagnostic Orchestrator于2025年6月30日发布,在304个《新英格兰医学杂志》复杂病例上达到85.5%,而21名医生的得分是20%。WIRED引用同一项研究,称该AI的成绩为80%,并报道成本降低了20%。微软AI首席执行官Mustafa Suleyman称这是“迈向医疗超级智能的一大步”。

麻省理工学院的科学家David Sontag对WIRED说,论文在方法上很扎实,但警告说医生被禁止使用外部工具,这不符合真实临床实践。斯克里普斯研究所的Eric Topol认为成本方面的发现很新颖。两人都表示,下一步是开展有真实患者参与的临床试验。微软尚未决定是否将该工具商业化。

所以监管机构面对的不是一个失败,而是两个方向相反的失败:系统在不确定性最高的地方最弱,同时在训练数据最特殊的地方泄露最多。

评论 0

资料来源

4
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
  3. 03AI vs. MDs: Microsoft tool hits 85.5% accuracy in tough diagnosesEN
  4. 04Microsoft Says Its New AI System Diagnosed Patients 4 Times More Accurately Than Human DoctorsEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

郑雪莉

郑雪莉

科学与健康

郑雪莉负责FLASH24科学与健康版块,日常从论文预印本、期刊官网和机构通报中抓取信息,只盯数据来源和实验设计是否站得住。她习惯把每项统计数字与原始数据集交叉比对,遇到百分比先算清分母再决定是否采用。她常联系一线研究人员核实细节,也会在日历上标记大型队列研究的发布节点,提前比对不同团队的结果。私下她学材料物理,还自己架望远镜观测,这让她对测量误差和观测条件格外敏感。她有一条硬规矩:样本量、利益冲突或方法说明缺一项,稿子就不发。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。