Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Régulation de l'IA médicale : ce que les études montrent vraiment sur les outils de diagnostic

Des chercheurs allemands ont montré dans Nature, le 24 juin 2026, qu'on peut amener des modèles d'IA médicale à révéler si les données d'un patient ont servi à leur entraînement. Un système de Microsoft revendiquait par ailleurs 85,5 % de diagnostics corrects face à des médecins. Les régulateurs, eux, courent toujours après.

SantéExpliquéAmélie BernardPublié le: 27 septembre 20266 min de lectureSources 4
Régulation de l'IA médicale : ce que les études montrent vraiment sur les outils de diagnostic

Deux résultats de recherche, publiés à un an d'intervalle, se juxtaposent mal. Le premier affirme que l'IA médicale bat les médecins sur des diagnostics difficiles. Le second affirme que la même famille de modèles laisse fuir des informations sur les patients qui ont servi à leur apprentissage. Tous deux butent sur la même question : que devrait exiger la régulation de l'IA médicale ?

Le premier résultat vient de Microsoft. Selon GeekWire, l'entreprise a annoncé le 30 juin 2025 le MAI Diagnostic Orchestrator, ou MAI-DxO. L'outil a été testé face à 21 médecins expérimentés des États-Unis et du Royaume-Uni, sur des cas complexes tirés du New England Journal of Medicine. Il a produit un diagnostic correct dans 85,5 % des cas. Les médecins ont atteint 20 %.

Ce que le banc d'essai de Microsoft a mesuré, et ce qu'il n'a pas mesuré

Le jeu de test comptait 304 études de cas récentes du NEJM, transformées en ce que Microsoft a appelé le Sequential Diagnosis Benchmark. WIRED a rapporté qu'un modèle de langage découpait chaque cas selon le processus étape par étape qu'un médecin suivrait. MAI-DxO interrogeait ensuite plusieurs modèles de pointe, dont GPT d'OpenAI, Gemini de Google, Claude d'Anthropic, Llama de Meta et Grok de xAI, dans un dispositif censé ressembler à un débat entre experts. Selon GeekWire, c'est MAI-DxO associé à o3 d'OpenAI qui a obtenu les meilleurs résultats.

WIRED a fixé le chiffre de précision à 80 %, et non à 85,5 %, et a indiqué que le système réduisait les coûts de 20 % en prescrivant des examens moins chers. Les deux chiffres proviennent du même projet mais de rédactions différentes : GeekWire cite 85,5 % et 20 % pour les médecins, WIRED cite 80 % et 20 %. Quiconque cite ce banc d'essai doit vérifier quel chiffre il utilise.

« Nous faisons un grand pas vers la superintelligence médicale », a déclaré Mustafa Suleyman, PDG de Microsoft AI, dans une publication LinkedIn, selon GeekWire.

Les chercheurs extérieurs se sont montrés plus mesurés. Le scientifique du MIT David Sontag a déclaré à WIRED que l'article était solide sur la méthodologie, mais a averti que les médecins de l'étude avaient consigne de ne pas utiliser d'outils supplémentaires, ce qui ne reflète pas la pratique réelle. Eric Topol, du Scripps Research Institute, a qualifié le travail de rapport impressionnant sur des cas complexes. Tous deux ont estimé qu'un essai clinique comparant le système à de vrais médecins traitant de vrais patients serait l'étape de validation suivante. Selon WIRED, Microsoft n'a pas décidé s'il commercialiserait l'outil, et un déploiement clinique exigerait des tests de sécurité et une autorisation réglementaire.

Le résultat sur la vie privée qui complique tout

Le 24 juin 2026, The Register a rapporté un article de Nature signé de chercheurs allemands. L'équipe a testé des attaques par inférence d'appartenance, ou MIA, contre sept jeux de données d'IA médicale contenant des images, des enregistrements d'ECG et des dossiers de santé électroniques généraux. Ces attaques interrogent un modèle pour déterminer si un point de données précis figurait dans son jeu d'entraînement.

Le constat : pour des patients pris individuellement, les attaques ont réussi avec ce que les chercheurs appellent un succès quasi parfait. L'article soutient que les protocoles d'évaluation standard passent à côté de ce phénomène parce qu'ils mesurent le succès des attaques de façon agrégée sur l'ensemble des dossiers. Les groupes sous-représentés étaient plus faciles à identifier. L'origine ethnique, le statut d'assurance, le sexe, le protocole d'imagerie et certains états pathologiques agissent tous comme des valeurs aberrantes qui font ressortir les individus.

Moritz Knolle, qui dirige la chaire AI in Healthcare and Medicine à l'université technique de Munich et est premier auteur de l'article, a déclaré à The Register que les risques pour la vie privée augmentent à mesure qu'une cohorte d'entraînement devient plus spécifique. Il a donné l'exemple d'une appartenance à un jeu de données révélant une maladie génétique dormante comme la maladie de Huntington, une dépression, ou la fréquentation d'une clinique de traitement spécialisée.

Il existe une limite pratique. Pour lancer l'attaque, il faut disposer d'au moins une partie des données appartenant à la personne que l'on veut identifier. Knolle a déclaré à The Register que l'article montre qu'un accès partiel suffit, contrairement aux hypothèses antérieures. Il a évoqué un scénario où un attaquant obtient un accès non autorisé à la base de données d'un généraliste après une prise de sang de routine.

« J'espère que la communauté de l'IA médicale commencera à prendre les risques pour la vie privée au sérieux et que des techniques de réduction des risques seront utilisées là où elles sont nécessaires », a déclaré Knolle.

Les chercheurs recommandent des cadres de confidentialité différentielle, qui visent à offrir des garanties mathématiques que les données d'entraînement restent anonymes, et des modifications des normes d'audit de la vie privée afin qu'elles évaluent le risque au niveau individuel plutôt que le risque agrégé. Ils suggèrent aussi de constituer les données d'entraînement de manière à mieux représenter les groupes sous-représentés. Knolle a noté que beaucoup d'attaques réussies représentent une atteinte à la vie privée faible ou négligeable, par exemple lorsque les modèles sont entraînés sur de vastes populations générales contenant à la fois des personnes saines et malades.

Les preuves que les modèles échouent tôt, là où cela compte

Une troisième étude va à l'encontre de l'enthousiasme. En avril 2026, The Register a rapporté des travaux publiés dans JAMA Network Open et dirigés par Arya Rao, étudiant en médecine à Harvard. L'équipe a testé 21 modèles d'IA du commerce sur 29 vignettes cliniques standardisées. Lorsqu'on leur donnait un dossier médical complet et qu'on leur demandait un diagnostic final, les principaux modèles étaient corrects dans 91 % des cas. Le diagnostic différentiel précoce, l'étape où les cliniciens écartent ou retiennent des hypothèses alors que l'incertitude est la plus forte, a échoué dans plus de 8 cas sur 10.

Rao a déclaré à The Register que chaque modèle testé avait échoué sur la grande majorité des cas, et que le diagnostic différentiel précoce est le point où ces systèmes sont les plus faibles. Le coauteur, le Dr Marc Succi, radiologue au Massachusetts General Hospital, a estimé que les résultats indiquent qu'il ne faut pas faire confiance aux LLM du commerce pour le raisonnement diagnostique destiné aux patients sans une revue humaine structurée et complète. Il a ajouté que les modèles peuvent afficher de l'assurance sans montrer de raisonnement fiable, ce qui peut nourrir l'anxiété des patients.

Rao a aussi nuancé : un échec selon la définition stricte de l'article ne signifiait pas toujours que le modèle avait tort. Mesurés en précision brute, par la proportion de bonnes réponses par cas, les scores allaient de 63 % à 78 %, ce qui signifie que les modèles étaient souvent partiellement corrects. L'équipe soutient malgré tout que la mesure plus stricte compte, parce que les LLM sont commercialisés comme des outils de première ligne qui réduisent le champ des diagnostics avant qu'un humain prenne le relais.

Où en est la régulation

Aucun de ces trois articles n'est un document réglementaire, et le dossier derrière cet article ne contient le texte d'aucune règle sur l'IA en médecine. Ce qu'il montre, c'est la forme du problème auquel les régulateurs font face. La précision diagnostique sur des cas sélectionnés peut paraître solide alors que le raisonnement précoce échoue, et des audits de vie privée peuvent être validés alors que des patients pris individuellement restent identifiables.

Le travail de Microsoft indique une voie : prouver le système dans un essai clinique, puis demander une autorisation. L'article de Nature en indique une autre : changer la rédaction des audits de vie privée et adopter des techniques comme la confidentialité différentielle avant le déploiement. L'étude du JAMA vise l'étiquetage et le marketing, en soutenant que décrire les LLM comme des agents diagnostiques crée une fausse confiance précisément là où ils sont les moins fiables.

Pour quiconque lit quelque chose sur un produit d'IA médicale, trois questions découlent des éléments ci-dessus. A-t-il été testé sur de vrais patients en milieu clinique, ou sur des études de cas publiées ? Son évaluation de la vie privée porte-t-elle sur des patients individuels ou seulement sur un risque agrégé ? Et prétend-il diagnostiquer, ou assister un clinicien qui reste responsable ? Les réponses figurent en général dans l'article, pas dans le communiqué de presse.

Commentaires 0

Sources

4
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02Microsoft AI tool outperforms doctors in diagnosing complex medical casesEN
  3. 03Microsoft Says Its New AI System Diagnosed Patients 4 Times More Accurately Than Human DoctorsEN
  4. 04LLMs fail in 8 out of 10 early differential diagnosis casesEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Amélie Bernard

Amélie Bernard

Science et santé

Amélie Bernard couvre les sciences et la santé pour FLASH24, en s'appuyant sur les publications évaluées par les pairs, les communiqués des agences et les données brutes des études, sans reprendre les reprises de presse. Elle vérifie chaque chiffre en remontant à la source, compare les méthodologies et signale les tailles d'échantillon douteuses. Elle interroge régulièrement des chercheurs et des soignants, et attend les mises à jour des revues à comité de lecture avant de publier. Sa formation en physique des matériaux lui sert à décrypter les résultats techniques, et elle observe le ciel avec son propre télescope. Elle ne publie pas une donnée qu'elle n'a pas pu reproduire.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.