跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

医学诊断AI会泄露训练数据来自谁,监管规则却抓不住

德国研究团队6月24日在《自然》发表论文:用于辅助诊断的医学AI模型能以“近乎完美的攻击成功率”认出训练数据来自哪些人。他们指出,现有隐私审计标准没有在真正出问题的层面衡量这一风险。

健康分析郑雪莉发布: 2026年9月27日5 分钟阅读资料来源 2
医学诊断AI会泄露训练数据来自谁,监管规则却抓不住

The Register在6月24日报道了这一发现。论文来自Moritz Knolle领导的团队,Knolle在慕尼黑工业大学负责医疗与医学AI方向。团队用七个医学AI数据集测试成员推断攻击(MIA),数据集包含影像、心电图记录和一般电子健康记录。这些模型属于判别式模型:对输入做分类,再根据训练时见过的东西给出预测。

MIA利用的是一个简单特性。模型对见过的输入往往更有把握。把一条记录喂进去,读出置信度分数,就能推断这条记录是否在训练集里。Knolle说:“实施MIA的攻击者不需要知道他们试图攻击的数据属于谁。”研究中使用的所有数据集都已匿名化。

代表性不足的患者更容易被识别

研究发现,数据集里的患者通常很容易被单独挑出来,训练数据中代表性不足的患者更容易。种族、保险状态、性别、所用的成像方案以及某些疾病状态,都可能成为异常值,让某个人凸显出来。

一般来说,模型的训练群体越具体,MIA带来的隐私风险就越严重。你可以想象……这样的情形:仅仅属于某个训练数据集,就暴露出某人患有亨廷顿病这类休眠遗传病、抑郁症,或者去过某家专门的诊疗机构。

这段话出自Knolle通过邮件对The Register的说明。含义并不抽象:知道某个人的数据位于一个专门的群体中,可能暴露出他从未选择公开的诊断,也可能在保险、就业等场合助长歧视。

规模让情况更糟,而不是更好。论文发现,数据集越大,记录越容易被暴露;在更大的模型中,“患者层面风险这一变化的幅度此前并不为人所知”。这与一个常见假设相悖:训练集越大,越能稀释任何个人的暴露程度。

审计数字没有抓住要害

监管层面的争论从这里开始。研究人员说,针对单个患者的近乎完美的成功率“没有被标准评估协议充分捕捉,该协议衡量的是跨记录的攻击成功总体情况”。一次审计可以报告很低的平均攻击成功率,而单个患者仍然轻易可被识别。团队的结论是,AI隐私审计的报告标准需要改变。

Knolle的建议覆盖两条路径。第一条是技术性的:差分隐私框架,其设计目的是给出训练数据保持匿名的数学保证。第二条是程序性的:把审计从总体隐私风险转向个体层面的风险。他还提出一个更直接的补救办法:汇编医学AI训练数据时,让代表性不足的群体从一开始就得到更好的体现。“我希望医学AI界开始认真对待隐私风险,并在必要的情况下使用风险缓解技术,”他对The Register说。

这一切都有一个现实前提。要实施MIA,攻击者至少需要属于目标的一些数据。Knolle说,论文表明并不需要完整的患者记录,这与之前的看法相反:“在论文中我们表明,只拥有部分访问权限的攻击者仍然可以成功实施MIA。”他举例说,血液检测结果或其中一部分就足以推断出是否被纳入,并指出医疗数据在泄露事件中经常暴露。“鉴于医疗数据并不总是被安全存储,攻击者获取访问权限并非不可想象,例如在你去全科医生那里做完常规血液检测后,未经授权进入其数据库,”他说。

Knolle谨慎地没有夸大每一种情况下的危害。“在很多情况下,一次成功的MIA只代表很小或可忽略的隐私侵犯,”他指出,并提到在大型、普通人群上训练的模型,健康人和患病人士都有足够数量的代表。风险集中在群体狭窄的地方。

诊断模型本身也很弱

隐私只是医学AI同一角落中可见的两个问题之一。4月发表于JAMA Network Open、由The Register于4月15日报道的研究,用29个标准化临床案例测试了21个现成的AI模型。当被提供完整的信息组合时,这些模型在最终诊断上的正确率为91%。在早期鉴别诊断阶段,也就是临床医生仍在排除和纳入各种可能性的阶段,它们在超过八成的病例中失败。

该研究由哈佛医学生Arya Rao领导。“我们测试的每一个模型都在绝大多数病例中失败,”Rao对The Register说。“那是最需要处理不确定性的阶段,也正是这些系统最弱的地方。”共同作者、麻省总医院放射科医生Marc Succi博士说,这些模型“可以在没有展示出强推理的情况下表现出自信,尤其是在鉴别诊断方面”,并警告说,这种自信可能加剧本就担心自身健康的患者的焦虑。Rao也指出,严格的失败指标有些苛刻:以原始准确率衡量,模型得分在63%到78%之间,往往是部分正确,而不是完全错误。

把两篇论文放在一起看,监管缺口更大。隐私论文说,审计衡量的是错误的东西、错误的层面,供应商需要有保护训练数据的激励。诊断论文说,把这些系统作为一线代理来营销,“恰恰在它们最不可靠的地方助长虚假的信心”,而且“LLM还不能在前线决策中被信任”。两个案例中的失败,都是总体基准和产品宣传可以掩盖的失败。

研究人员要求的比禁令要窄。改变隐私审计报告风险的方式,让单个患者被计入。在群体敏感的地方使用差分隐私。平衡训练数据,让异常值不再是异常值。并且把这些模型当作需要人工复核的工具,而不是把关者。这些都不需要新的科学。需要的是能够衡量真正可能伤害患者之事的评估制度。

评论 0

资料来源

2
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

郑雪莉

郑雪莉

科学与健康

郑雪莉负责FLASH24科学与健康版块,日常从论文预印本、期刊官网和机构通报中抓取信息,只盯数据来源和实验设计是否站得住。她习惯把每项统计数字与原始数据集交叉比对,遇到百分比先算清分母再决定是否采用。她常联系一线研究人员核实细节,也会在日历上标记大型队列研究的发布节点,提前比对不同团队的结果。私下她学材料物理,还自己架望远镜观测,这让她对测量误差和观测条件格外敏感。她有一条硬规矩:样本量、利益冲突或方法说明缺一项,稿子就不发。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。