医疗AI监管:诊断工具的研究到底说明了什么
德国研究人员2026年6月24日在《自然》杂志报告,用于诊断的医疗AI模型可以被诱导,泄露某位患者的数据是否曾用于训练。与此同时,微软的一套系统声称诊断准确率达到85.5%,高于医生。监管机构仍在追赶。

两项研究结果相隔约一年发表,摆在一起却并不协调。一项说医疗AI能在疑难诊断上胜过医生。另一项说同一类模型会泄露它学习过的患者信息。两者都指向同一个尚未解决的问题:医疗AI的监管究竟应该要求什么?
第一项结果来自微软。据GeekWire报道,公司于2025年6月30日发布了MAI Diagnostic Orchestrator,简称MAI-DxO。测试用的是《新英格兰医学杂志》的复杂病例,对手是美国和英国的21名经验丰富的医生。该工具在85.5%的病例中给出了正确诊断,医生的正确率是20%。
微软的基准测试测了什么,没测什么
测试集是304个近期的NEJM病例研究,被改造成微软所称的Sequential Diagnosis Benchmark。WIRED报道说,一个语言模型把每个病例拆解成医生会遵循的分步流程。MAI-DxO随后查询多个前沿模型,包括OpenAI的GPT、谷歌的Gemini、Anthropic的Claude、Meta的Llama和xAI的Grok。整个设置意在模拟多位专家辩论。GeekWire称,MAI-DxO搭配OpenAI的o3表现最好。
WIRED给出的准确率数字是80%,而不是85.5%,并称该系统通过安排更便宜的检查把成本降低了20%。这两个数字来自同一个项目,但出自不同的报道。GeekWire引用的是85.5%和医生的20%,WIRED引用的是80%和20%。任何引用这项基准测试的人都该确认自己用的是哪组数字。
据GeekWire报道,微软AI首席执行官Mustafa Suleyman在LinkedIn帖子中说:“我们正朝着医疗超级智能迈出一大步。”
外部研究人员的态度更为克制。麻省理工学院的科学家David Sontag对WIRED说,这篇论文在方法上很扎实,但他提醒说,研究中的医生被要求不得使用任何额外工具,这不符合真实诊疗情况。斯克里普斯研究所的Eric Topol称这是一份关于复杂病例的出色报告。两人都表示,下一步验证应当是一项临床试验,让该系统与治疗真实患者的真实医生进行比较。WIRED报道说,微软尚未决定是否将该工具商业化,而临床部署需要安全测试和监管批准。
让一切复杂化的隐私发现
2026年6月24日,The Register报道了德国研究人员发表在《自然》上的一篇论文。团队针对七个医疗AI数据集测试了成员推断攻击,即MIA。这些数据集包含图像、心电图记录和一般电子健康记录。这类攻击通过查询模型,判断某个特定数据点是否在其训练集中。
结果是:针对单个患者,攻击的成功率被研究人员称为接近完美。论文认为,标准评估方案会漏掉这一点,因为它们衡量的是跨记录的攻击总体成功率。代表性不足的群体更容易被识别。种族、保险状况、性别、成像方案以及某些疾病状态都会成为异常值,让个人凸显出来。
Moritz Knolle是慕尼黑工业大学AI in Healthcare and Medicine讲席的负责人,也是这篇论文的第一作者。他对The Register说,训练队列越具体,隐私风险就越高。他举例说,某人在数据集中的成员身份可能泄露其患有亨廷顿病这类处于休眠状态的遗传病、抑郁症,或曾到某家专科治疗诊所就诊。
但有一个实际限制。要实施攻击,攻击者至少需要掌握其想识别之人的部分数据。Knolle对The Register说,论文表明部分访问就足够了,这与早先的假设相反。他设想了一种情形:攻击者在一次常规血液检查后未经授权获取了全科医生的数据库。
Knolle说:“我希望医疗AI界开始认真对待隐私风险,并在必要的情况下使用风险缓解技术。”
研究人员建议采用差分隐私框架,其目标是提供数学保证,使训练数据保持匿名。他们还建议修改隐私审计标准,使其评估个人层面的风险,而不是总体风险。此外,他们建议在汇编训练数据时让代表性不足的群体得到更好的体现。Knolle指出,许多成功的攻击只代表很小甚至可忽略的隐私侵犯,例如模型是在包含健康人和病人的大规模普通人群上训练的。
模型在最关键的早期阶段失效的证据
第三项研究与前述热情相悖。2026年4月,The Register报道了发表在JAMA Network Open上的研究,由哈佛医学生Arya Rao领衔。团队用29个标准化临床情景测试了21个现成AI模型。当给出完整的医疗信息并索要最终诊断时,领先模型的正确率为91%。在早期鉴别诊断阶段,也就是临床医生在不确定性最高时排除和纳入各种可能性的阶段,超过八成病例失败。
Rao对The Register说,所有受测模型在绝大多数病例上都失败了,而早期鉴别诊断正是这些系统最薄弱的环节。共同作者、麻省总医院放射科医生Marc Succi说,结果表明,在没有结构化、全面的人工复核的情况下,不应信任现成的大语言模型去做面向患者的诊断推理。他还说,这些模型可能在不展示可靠推理的情况下表现出自信,这会加重患者的焦虑。
Rao也提出了一个限定:按论文的严格定义判定失败,并不总意味着模型答错了。若按每个病例正确答案的比例来衡量原始准确率,得分在63%到78%之间,说明模型往往部分正确。团队仍然认为更严格的指标有意义,因为大语言模型正被宣传为一线工具,在人类接手之前缩小诊断范围。
监管现状
这三篇论文都不是监管文件,本文所依据的材料中也不包含任何医疗AI规则的文本。它展示的是监管者所面对问题的形状。在精选病例上的诊断准确率可能看起来很强,而早期推理却失败。隐私审计可能通过,而单个患者仍可被识别。
微软的工作指向一个方向:先在临床试验中证明系统,再寻求批准。《自然》论文指向另一个方向:改变隐私审计的写法,并在部署前采用差分隐私等技术。JAMA研究则指向标注和营销,认为把大语言模型描述为诊断主体,恰恰在它们最不可靠的地方制造了虚假信心。
对任何读到某款医疗AI产品的人来说,从上述证据可以引出三个问题。它是在临床环境中对真实患者测试的,还是对已发表病例研究测试的?它的隐私评估看的是单个患者,还是只看总体风险?它声称能诊断,还是辅助仍需负责的临床医生?答案通常在论文里,不在新闻稿里。
资料来源
4- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02Microsoft AI tool outperforms doctors in diagnosing complex medical casesEN
- 03Microsoft Says Its New AI System Diagnosed Patients 4 Times More Accurately Than Human DoctorsEN
- 04LLMs fail in 8 out of 10 early differential diagnosis casesEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。