跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

欧盟人工智能法案与医疗诊断人工智能:规则究竟怎么说

医疗诊断人工智能上市的速度,快过监管机构审查的速度。近期三项研究指向同一个核心问题:这些模型难以核查,难以保障安全,也难以量化。

健康解释郑雪莉发布: 2026年9月27日5 分钟阅读资料来源 5
欧盟人工智能法案与医疗诊断人工智能:规则究竟怎么说

监管要问的不是人工智能能不能诊断,而是有没有人能证明它诊断得有多准。相隔数月发表的两篇论文显示,这个缺口已经拉得很大。

2026年6月24日,慕尼黑工业大学的研究人员在《自然》杂志上报告,用于诊断的医疗人工智能模型容易受到成员推断攻击(MIA)。这类攻击通过查询,试图判断某位患者的记录是否属于训练集。The Register当天报道了这篇论文。团队测试了七个医疗人工智能数据集,涵盖影像、心电图记录和一般电子健康记录。结论是:个别患者可以被识别出来,作者称攻击成功率接近完美。

这是隐私问题,也是测量问题。研究人员指出,针对个别患者的接近完美的成功率,标准的评估方案并不能充分捕捉,因为该方案衡量的是跨记录的攻击总体成功率。说白了,一份只报告平均值的审计,可能完全漏掉个别案例。

规则要求什么,又漏掉了什么

欧盟人工智能法案是这场讨论中被引用最多的框架,而现有材料对其操作细节着墨很少。材料确实显示出的,是厂商使用的合规说辞与同期发表的安全研究之间存在缺口。

一个名为srta-ai-accountability的GitHub项目自称,是首个以94%的欧盟人工智能法案合规度解决可解释人工智能中“为什么”问题的系统。它被明确标注为研究原型和概念架构。至少对某些问责工具来说,现状就是这样:一个94%合规的说法,发布在代码仓库上,背后没有监管机构为这个数字背书。

慕尼黑那篇论文指向另一个方向。作者希望改变人工智能隐私审计的报告标准,让个别层面的风险也被计入,而不只是总体风险。他们还建议采用差分隐私框架,这类框架的设计目标是从数学上保证训练数据保持匿名。他们还提出,训练数据的构成可以让代表性不足的群体得到更好的体现。

第一作者Moritz Knolle对The Register说,模型的训练群体越具体,成员推断攻击带来的隐私风险就越严重。他举例说,某人属于某个训练数据集这一事实,可能泄露他患有亨廷顿病这类潜伏的遗传病、抑郁症,或者曾去过某家特定的专科治疗诊所。

监管机构必须权衡的准确率说法

诊断性能是监管问题的另一半,而这方面的数字格外混乱。

微软于2025年6月30日发布其人工智能诊断协调器(MAI-DxO)。GeekWire报道称,该工具在《新英格兰医学杂志》的复杂病例上击败了来自美国和英国的21位资深医生,得分85.5%,而医生为20%。WIRED在2025年7月1日报道同一项工作时给出的数字是80%对20%,并称该系统通过选择更便宜的检查把成本降低了20%。该基准由304个近期的《新英格兰医学杂志》病例构建而成。

这些数字带有两个报道中都出现的限定条件。研究中的医生不得咨询同事,也不得使用外部资源,而临床医生并不是这样工作的。麻省理工学院的科学家David Sontag对WIRED说,正是出于这个原因,微软的结论应当谨慎对待,而且该系统在实践中能否降低成本还有待观察。微软自己也表示,该工具在部署前需要临床测试和监管批准。

还有失败案例。2026年4月15日,The Register报道了《JAMA Network Open》上的一项研究,由哈佛医学生Arya Rao领衔。该研究用29个标准化临床病例测试了21个主流现成人工智能模型。在提供完整信息、要求给出最终诊断时,这些模型的正确率为91%。但在早期鉴别诊断阶段,也就是临床医生排除和确认各种可能性的阶段,它们在超过八成的情况下失败。

Rao对The Register说,我们测试的每一个模型在绝大多数病例上都失败了。那正是不确定性最要紧的阶段,也正是这些系统最薄弱的环节。

麻省总医院放射科医生、共同作者Marc Succi博士对同一家媒体说,如今的现成模型在面向患者的诊断推理中不应被信任,除非有结构化、全面的人工复核。他还说,最终诊断上更高的成功率不应让人安心,因为真正的临床推理开始得更早,那时歧义最大。

监管机构需要测试什么

把这三项发现放在一起,审计问题就变得具体了。

  • 隐私:训练集中的个别患者可以被高成功率地识别出来,而代表性不足的群体比其他人更容易被识别。总体报告掩盖了这一点。
  • 性能:同一类模型可以在最终诊断上得91%,却在超过80%的早期鉴别病例上失败。
  • 基准设计:微软的头条结果来自一场人类医生无法使用其日常资源的测试。

这些都不意味着医疗人工智能无法监管。它意味着现有工具测量的是错误的单位。一个总体隐私评分、一个最终答案准确率,以及一场在人为约束下跑出的基准测试,都容易发表,却难以证伪。

Knolle说,他希望医疗人工智能界开始认真对待隐私风险,并在必要之处使用风险缓解技术。他也指出,在很多情况下,一次成功的成员推断攻击只代表很小甚至可忽略的隐私侵犯,例如在庞大而普遍的人群上训练的模型。

尚未解决的问题是,谁来判断某个模型属于哪种情况。按照欧盟人工智能法案,这个判断应当由提供方和审计方作出,而不是由论文作者,也不是由一个给自己打94分的仓库作出。

评论 0

资料来源

5
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02Microsoft AI tool outperforms doctors in diagnosing complex medical casesEN
  3. 03Microsoft Says New AI Diagnosed Patients 4 Times More Accurately Than DoctorsEN
  4. 04LLMs fail in 8 out of 10 early differential diagnosis casesEN
  5. 05srta-ai-accountability: AI Accountability FrameworkEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

郑雪莉

郑雪莉

科学与健康

郑雪莉负责FLASH24科学与健康版块,日常从论文预印本、期刊官网和机构通报中抓取信息,只盯数据来源和实验设计是否站得住。她习惯把每项统计数字与原始数据集交叉比对,遇到百分比先算清分母再决定是否采用。她常联系一线研究人员核实细节,也会在日历上标记大型队列研究的发布节点,提前比对不同团队的结果。私下她学材料物理,还自己架望远镜观测,这让她对测量误差和观测条件格外敏感。她有一条硬规矩:样本量、利益冲突或方法说明缺一项,稿子就不发。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。