跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

AI 诊断受到审视:患者数据被泄露,大模型在八成病例中失败

2026 年发表的两项研究显示,医疗诊断 AI 可能被套出哪些患者的数据曾用于训练它;主流语言模型在早期鉴别诊断中,十例里有八例以上失败。

健康解释郑雪莉发布: 2026年9月28日5 分钟阅读资料来源 4
AI 诊断受到审视:患者数据被泄露,大模型在八成病例中失败

2026 年发表的两条研究线索,勾勒出 AI 医疗诊断令人不安的图景。一条显示,诊断模型会泄露那些病历被用于训练的患者身份。另一条显示,人们常拿来询问自身症状的大型语言模型,在临床推理的早期阶段失败率超过 80%。两项研究均由 The Register 在论文发表时做了报道。

隐私问题来自 2026 年 6 月 24 日星期三发表在 Nature 上的一篇论文,据 The Register 报道。德国研究人员测试了七个医疗 AI 数据集,内容涵盖影像、心电图记录和一般电子健康档案。他们发现,判别式模型尤其容易受到成员推断攻击(MIA)的影响,这类模型负责对数据分类并作出预测。攻击的方式是查询模型,判断某个具体数据点是否属于它的训练集。团队报告称,单个患者可以被识别出来,攻击成功率“接近完美”。他们认为,标准的评估方案只在汇总层面衡量攻击是否成功,反映不出这种成功率。研究人员的结论是,AI 隐私审计的报告标准需要修改。

代表性不足的患者更容易被识别

同一篇论文指出,在医疗 AI 训练数据中代表性不足的患者,比数据本身不突出的患者更容易被识别。The Register 列举了种族、保险状态、性别、成像方案以及某些疾病状态等类别,这些都可以成为离群点,让个人更容易被指认出来。

“总的来说,模型的训练人群越特殊,MIA 带来的隐私风险就越严重,”慕尼黑工业大学医疗与医学中的人工智能讲席教授、论文第一作者 Moritz Knolle 在给 The Register 的邮件中写道。他描述了这样一些情形:训练数据集的成员身份可能暴露某人携带亨廷顿病这类休眠遗传病、患有抑郁症,或者曾去过某家专门的治疗诊所。

攻击本身利用的是机器学习模型的一个简单特性:当输入数据属于训练集时,模型往往更自信。攻击者手里有患者的部分数据,把它喂给模型,查看置信度,就能推断这名患者是否在训练集中。Knolle 说,论文表明攻击者并不需要完整掌握患者的数据点,这与过去的看法相反。“我们在论文中说明,只有部分访问权限的攻击者仍能成功实施 MIA,”他告诉 The Register。

“我希望医疗 AI 界开始认真对待隐私风险,在必要的情况下使用风险缓解技术。”慕尼黑工业大学 Moritz Knolle

研究人员建议采用差分隐私框架,这类框架在数学上保证训练数据保持匿名。他们还希望隐私审计标准把个体层面的风险纳入考量,而不只是汇总数字。Knolle 说,另一种办法是整理训练数据,让代表性不足的群体得到更好的覆盖。“在很多情况下,一次成功的 MIA 只代表轻微甚至可忽略的隐私侵犯,”他指出,这指的是在包含健康人和病人的大规模普通人群上训练的模型。

语言模型在早期失败,却显得很有把握

另外,2026 年 4 月发表在 JAMA Network Open 上的研究发现,21 个主流的现成 AI 模型在早期鉴别诊断中,十例里有八例以上失败。The Register 在 2026 年 4 月 15 日报道了这项研究,它用 29 个标准化临床病例对模型做了测试。当提供完整的医疗信息并要求给出最终诊断时,模型表现不错,领先模型的正确率达到 91%。但在早期鉴别诊断阶段,也就是临床医生权衡各种可能、逐一排除疾病的环节,失败率超过 80%。

“我们测试的每一个模型都在绝大多数病例上失败了,”领导这项研究的哈佛医学生 Arya Rao 在给 The Register 的邮件中说。“那是最需要处理不确定性的阶段,也正是这些系统最薄弱的地方。”

Rao 指出,失败并不总意味着答案完全错误。按答对比例计算的原始准确率,模型在 63% 到 78% 之间。但团队认为,更严格的失败指标仍然重要,尤其是因为 AI 工具被宣传成用来缩小诊断范围的一线助手。“把大模型宣传成诊断助手,恰恰可能在它们最不可靠的地方制造虚假的信心,”研究人员写道。

论文合著者、马萨诸塞总医院放射科医生 Marc Succi 博士告诉 The Register,最终诊断成功率更高并不值得安心。“真正的临床推理开始得更早,那时歧义最大,而这正是它们最薄弱的地方,”他说。他警告说,错误的鉴别诊断会导致治疗延误、不必要的检查、高额费用等问题。

两篇论文所处的监管环境仍在追赶。根据 IntuitionLabs 发布的一份行业分析,截至 2024 年年中,美国食品药品监督管理局已批准约 950 款 AI 医疗设备。同一份分析指出,获批的 AI 设备中只有极少数有随机试验或患者结局数据支持,FDA 也在 2024 年 12 月发布了预定变更控制计划指南。

MD+DI 发表的一篇访谈中,FDA 医疗器械律师 Suzanne Levy Friedman 指出,尽管 FDA 批准的 AI 设备超过一千款,但没有一款内置持续学习的模型。Friedman 说,该机构正在探索通往这一目标的路径,但它作为公共卫生机构的首要使命,意味着必须权衡创新与临床医生依赖未经验证工具的风险。

这两篇研究论文表明,验证不只是看模型最终答案对不对。它还包括模型是否守住了患者的身份,以及它能否在诊断尚未明确时处理不确定性。

评论 0

资料来源

4
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
  3. 03AI Medical Devices: 2025 Status, Regulation & ChallengesEN
  4. 04How Is FDA Regulating AI Medical Devices in 2026?EN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

郑雪莉

郑雪莉

科学与健康

郑雪莉负责FLASH24科学与健康版块,日常从论文预印本、期刊官网和机构通报中抓取信息,只盯数据来源和实验设计是否站得住。她习惯把每项统计数字与原始数据集交叉比对,遇到百分比先算清分母再决定是否采用。她常联系一线研究人员核实细节,也会在日历上标记大型队列研究的发布节点,提前比对不同团队的结果。私下她学材料物理,还自己架望远镜观测,这让她对测量误差和观测条件格外敏感。她有一条硬规矩:样本量、利益冲突或方法说明缺一项,稿子就不发。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。