欧盟人工智能法案与医疗诊断人工智能:规则究竟怎么说
医疗诊断人工智能上市的速度,快过监管机构审查的速度。近期三项研究指向同一个核心问题:这些模型难以核查,难以保障安全,也难以量化。

监管要问的不是人工智能能不能诊断,而是有没有人能证明它诊断得有多准。相隔数月发表的两篇论文显示,这个缺口已经拉得很大。
2026年6月24日,慕尼黑工业大学的研究人员在《自然》杂志上报告,用于诊断的医疗人工智能模型容易受到成员推断攻击(MIA)。这类攻击通过查询,试图判断某位患者的记录是否属于训练集。The Register当天报道了这篇论文。团队测试了七个医疗人工智能数据集,涵盖影像、心电图记录和一般电子健康记录。结论是:个别患者可以被识别出来,作者称攻击成功率接近完美。
这是隐私问题,也是测量问题。研究人员指出,针对个别患者的接近完美的成功率,标准的评估方案并不能充分捕捉,因为该方案衡量的是跨记录的攻击总体成功率。说白了,一份只报告平均值的审计,可能完全漏掉个别案例。
规则要求什么,又漏掉了什么
欧盟人工智能法案是这场讨论中被引用最多的框架,而现有材料对其操作细节着墨很少。材料确实显示出的,是厂商使用的合规说辞与同期发表的安全研究之间存在缺口。
一个名为srta-ai-accountability的GitHub项目自称,是首个以94%的欧盟人工智能法案合规度解决可解释人工智能中“为什么”问题的系统。它被明确标注为研究原型和概念架构。至少对某些问责工具来说,现状就是这样:一个94%合规的说法,发布在代码仓库上,背后没有监管机构为这个数字背书。
慕尼黑那篇论文指向另一个方向。作者希望改变人工智能隐私审计的报告标准,让个别层面的风险也被计入,而不只是总体风险。他们还建议采用差分隐私框架,这类框架的设计目标是从数学上保证训练数据保持匿名。他们还提出,训练数据的构成可以让代表性不足的群体得到更好的体现。
第一作者Moritz Knolle对The Register说,模型的训练群体越具体,成员推断攻击带来的隐私风险就越严重。他举例说,某人属于某个训练数据集这一事实,可能泄露他患有亨廷顿病这类潜伏的遗传病、抑郁症,或者曾去过某家特定的专科治疗诊所。
监管机构必须权衡的准确率说法
诊断性能是监管问题的另一半,而这方面的数字格外混乱。
微软于2025年6月30日发布其人工智能诊断协调器(MAI-DxO)。GeekWire报道称,该工具在《新英格兰医学杂志》的复杂病例上击败了来自美国和英国的21位资深医生,得分85.5%,而医生为20%。WIRED在2025年7月1日报道同一项工作时给出的数字是80%对20%,并称该系统通过选择更便宜的检查把成本降低了20%。该基准由304个近期的《新英格兰医学杂志》病例构建而成。
这些数字带有两个报道中都出现的限定条件。研究中的医生不得咨询同事,也不得使用外部资源,而临床医生并不是这样工作的。麻省理工学院的科学家David Sontag对WIRED说,正是出于这个原因,微软的结论应当谨慎对待,而且该系统在实践中能否降低成本还有待观察。微软自己也表示,该工具在部署前需要临床测试和监管批准。
还有失败案例。2026年4月15日,The Register报道了《JAMA Network Open》上的一项研究,由哈佛医学生Arya Rao领衔。该研究用29个标准化临床病例测试了21个主流现成人工智能模型。在提供完整信息、要求给出最终诊断时,这些模型的正确率为91%。但在早期鉴别诊断阶段,也就是临床医生排除和确认各种可能性的阶段,它们在超过八成的情况下失败。
Rao对The Register说,我们测试的每一个模型在绝大多数病例上都失败了。那正是不确定性最要紧的阶段,也正是这些系统最薄弱的环节。
麻省总医院放射科医生、共同作者Marc Succi博士对同一家媒体说,如今的现成模型在面向患者的诊断推理中不应被信任,除非有结构化、全面的人工复核。他还说,最终诊断上更高的成功率不应让人安心,因为真正的临床推理开始得更早,那时歧义最大。
监管机构需要测试什么
把这三项发现放在一起,审计问题就变得具体了。
- 隐私:训练集中的个别患者可以被高成功率地识别出来,而代表性不足的群体比其他人更容易被识别。总体报告掩盖了这一点。
- 性能:同一类模型可以在最终诊断上得91%,却在超过80%的早期鉴别病例上失败。
- 基准设计:微软的头条结果来自一场人类医生无法使用其日常资源的测试。
这些都不意味着医疗人工智能无法监管。它意味着现有工具测量的是错误的单位。一个总体隐私评分、一个最终答案准确率,以及一场在人为约束下跑出的基准测试,都容易发表,却难以证伪。
Knolle说,他希望医疗人工智能界开始认真对待隐私风险,并在必要之处使用风险缓解技术。他也指出,在很多情况下,一次成功的成员推断攻击只代表很小甚至可忽略的隐私侵犯,例如在庞大而普遍的人群上训练的模型。
尚未解决的问题是,谁来判断某个模型属于哪种情况。按照欧盟人工智能法案,这个判断应当由提供方和审计方作出,而不是由论文作者,也不是由一个给自己打94分的仓库作出。
资料来源
5- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02Microsoft AI tool outperforms doctors in diagnosing complex medical casesEN
- 03Microsoft Says New AI Diagnosed Patients 4 Times More Accurately Than DoctorsEN
- 04LLMs fail in 8 out of 10 early differential diagnosis casesEN
- 05srta-ai-accountability: AI Accountability FrameworkEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。