训练集里的患者很容易被认出来,隐私审计却查不到
用患者病历训练出来的医疗 AI 模型,可以被问出谁在训练数据里。德国研究人员 6 月 24 日在《自然》发表论文,报告在单个患者层面达到了「近乎完美的攻击成功率」。

成员推断攻击(MIA)要回答的问题是:某条记录是否在模型的训练集里。The Register 在 6 月 24 日报道了这项发现。判别式医疗 AI 模型尤其容易中招。这类模型的任务就是分类,对见过的数据会变得更自信。
这份自信就是泄漏点。团队分析了七个医疗 AI 数据集,涵盖影像、心电图记录和一般电子健康记录。被这类攻击锁定的患者能被认出来,论文称成功率近乎完美。作者说,标准评估抓不到这个结果,因为它统计的是全部记录的攻击成功率,而不是每个人的。
离群者最容易暴露
训练队列里代表性不足的群体,比典型患者更容易被指认。种族、保险状态、性别、所用的成像方案,以及某些疾病状态,都能成为离群特征。
总的来说,模型的训练队列越特殊,MIA 带来的隐私风险就越严重。
说这话的是 Moritz Knolle。他在慕尼黑工业大学主持医疗与医学人工智能方向,也是这篇论文的负责人。他在与 The Register 的邮件往来中举了个例子:一份成员名单可能暴露某人患有亨廷顿病这类潜伏的遗传病、抑郁症,或者去过某家专门的诊疗机构。数据集更大反而更糟。论文指出,模型越大,患者层面风险的变化幅度此前并不清楚。
这种攻击需要的条件也比研究者过去以为的少。Knolle 告诉 The Register,攻击者通常需要接触到一个目标数据点,而论文表明部分接触就够了。血液检测结果,或者其中一部分,都可以。研究中用到的数据集全部经过匿名化处理,攻击者也不需要知道自己在测试谁的数据。
真正的障碍是拿到这些数据,不过门槛不高。Knolle 说,医疗数据并不总是被安全存储,所以做完一次常规血检之后,有人未经授权访问全科医生的数据库,并非不可想象。
作者希望改变什么
论文的建议针对流程,而不是对模型本身做技术修补。团队希望重写隐私审计标准,评估个人层面的风险,而不是汇总数字。他们还指出,差分隐私框架可以给出数学保证,让训练数据保持匿名。Knolle 另外建议,汇编训练数据时让代表性不足的群体得到更好的体现。
风险并非停留在理论上。另一项研究 4 月发表在 JAMA Network Open,The Register 也做了报道。研究发现,21 个现成 AI 模型在早期鉴别诊断中,10 例里有 8 例以上失败,不过领先模型在最终诊断上达到了 91% 的准确率。马萨诸塞州总医院放射科医生、共同作者 Marc Succi 表示,如果没有结构化、全面的人工复核,这类系统不应被信任用于面向患者的诊断推理。
Knolle 谈隐私问题时加了一个限定:很多时候,一次成功的成员推断攻击只代表轻微甚至可以忽略的侵害,也就是模型在包含健康人和病人的大型普通人群上训练的时候。难点在于,论文自己的结果显示,这些正是审计流程假定安全的条件,也正是作者说没有被正确衡量的条件。
资料来源
2- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。