Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

L'IA médicale a deux problèmes à la fois : elle se trompe tôt et laisse fuiter qui l'a entraînée

Deux travaux publiés à 14 mois d'intervalle montrent l'IA médicale en échec aux deux extrémités d'une même tâche : poser un diagnostic précoce, et garder anonymes les patients de ses données d'entraînement.

SantéAnalyseAmélie BernardPublié le: 27 septembre 20264 min de lectureSources 4
L'IA médicale a deux problèmes à la fois : elle se trompe tôt et laisse fuiter qui l'a entraînée

Le 15 avril 2026, The Register a rapporté les résultats d'une étude de JAMA Network Open. L'équipe a testé 21 modèles d'IA du commerce sur 29 vignettes cliniques standardisées. Avec un dossier médical complet et une demande de diagnostic final, les modèles ont atteint 91 pour cent. Le diagnostic différentiel précoce, l'étape où les cliniciens confirment ou écartent des hypothèses, a échoué dans plus de 8 cas sur 10.

« Tous les modèles que nous avons testés ont échoué sur la grande majorité des cas », a déclaré à The Register Arya Rao, première autrice de l'étude et étudiante en médecine à Harvard. « C'est l'étape où l'incertitude compte le plus, et c'est là que ces systèmes sont les plus faibles. »

Le Dr Marc Succi, radiologue au Massachusetts General Hospital et coauteur de l'étude, va plus loin : « Nos résultats suggèrent que les grands modèles de langue du commerce d'aujourd'hui ne devraient pas être utilisés pour le raisonnement diagnostique face au patient sans une revue humaine structurée et complète. » Succi ajoute que les modèles « peuvent afficher de l'assurance sans montrer de raisonnement solide », ce qui, selon lui, peut alimenter l'anxiété de patients déjà inquiets d'un symptôme.

Rao propose une lecture plus nuancée de ses propres données. Dans l'article, un échec signifie que le modèle n'a pas produit un différentiel entièrement correct, pas qu'il était totalement faux. La précision brute allait de 63 à 78 pour cent, ce qui, selon elle, indique que les modèles étaient souvent partiellement corrects. L'équipe soutient malgré tout que la mesure plus stricte compte, car ces systèmes sont commercialisés comme des agents de première ligne qui réduisent l'éventail des diagnostics avant qu'un humain prenne le relais.

Inférence d'appartenance, quasi parfaite au niveau individuel

Le second problème se situe sous le premier. Le 24 juin 2026, des chercheurs allemands ont publié un article dans Nature. Ils y montrent que les modèles médicaux discriminatifs, ceux qui servent à classer des données et à prédire sur de nouvelles entrées, révèlent facilement si le dossier d'un patient donné faisait partie de leur jeu d'entraînement.

La technique s'appelle une attaque par inférence d'appartenance. Elle fonctionne parce qu'un modèle a tendance à être plus confiant sur des entrées qu'il a déjà vues. L'attaquant lui soumet des données de patients, observe la confiance et en déduit l'inclusion.

Sur sept jeux de données médicaux couvrant des images, des enregistrements d'ECG et des dossiers de santé électroniques, l'équipe a constaté que des patients individuels pouvaient être identifiés avec un « succès de l'attaque quasi parfait ». Le premier auteur de l'article, Moritz Knolle, de l'université technique de Munich, a déclaré à The Register que les patients issus de groupes sous-représentés, par la race, le statut d'assurance, le sexe, le protocole d'imagerie ou le statut de la maladie, sont plus faciles à repérer que ceux qui ne se distinguent pas.

« De manière générale, les risques pour la vie privée liés aux attaques par inférence d'appartenance deviennent plus graves à mesure que la cohorte d'entraînement d'un modèle devient plus spécifique », a déclaré Knolle. Il cite l'exemple d'un jeu de données dont l'appartenance révèle en soi une maladie génétique latente comme la maladie de Huntington, une dépression, ou la fréquentation d'une clinique de soins spécialisée.

« Dans notre article, nous montrons qu'un attaquant disposant d'un accès partiel peut malgré tout mener à bien des attaques par inférence d'appartenance. »

Knolle réfute aussi la défense habituelle selon laquelle des dossiers anonymisés sont sûrs. « Un attaquant qui mène une attaque par inférence d'appartenance n'a pas besoin de savoir à qui appartiennent les données », dit-il. « En fait, tous les jeux de données que nous utilisons dans notre étude étaient anonymisés. » Des résultats partiels d'analyses sanguines suffiraient, ajoute-t-il, et vu la fréquence des fuites de données de santé, se les procurer n'a rien d'impossible.

Ce que l'on demande aux régulateurs

L'équipe de Nature veut deux changements. D'abord, les audits de confidentialité devraient mesurer le risque au niveau de chaque patient plutôt qu'en agrégé. Le protocole standard, selon les chercheurs, ne rend pas correctement compte de ce que signifie réellement un succès d'attaque quasi parfait par patient. Ensuite, ils recommandent des cadres de confidentialité différentielle, qui bornent mathématiquement ce qu'un modèle peut révéler sur un enregistrement d'entraînement donné. Knolle dit espérer que la communauté de l'IA médicale « commencera à prendre les risques pour la vie privée au sérieux ».

Mettons cela en regard du volet précision. Le MAI Diagnostic Orchestrator de Microsoft, annoncé le 30 juin 2025, a atteint 85,5 pour cent sur 304 cas complexes du New England Journal of Medicine, contre 21 médecins qui ont obtenu 20 pour cent, selon GeekWire. WIRED, citant les mêmes travaux, situe l'IA à 80 pour cent et rapporte une réduction des coûts de 20 pour cent. Le PDG de Microsoft AI, Mustafa Suleyman, y a vu « un grand pas vers la superintelligence médicale ».

Le scientifique du MIT David Sontag a déclaré à WIRED que l'article était solide sur la méthodologie. Il a toutefois averti que les médecins n'avaient pas le droit d'utiliser des outils externes, ce qui ne reflète pas la pratique réelle. Eric Topol, de Scripps, a qualifié de nouvelle la conclusion sur les coûts. Tous deux estiment qu'un essai clinique avec de vrais patients est l'étape suivante. Microsoft n'a pas décidé s'il commercialiserait l'outil.

Le tableau auquel les régulateurs font face n'est donc pas un échec mais deux, qui vont en sens opposés : des systèmes plus faibles là où l'incertitude est la plus forte, et des systèmes plus révélateurs là où leurs données d'entraînement sont les plus spécifiques.

Commentaires 0

Sources

4
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
  3. 03AI vs. MDs: Microsoft tool hits 85.5% accuracy in tough diagnosesEN
  4. 04Microsoft Says Its New AI System Diagnosed Patients 4 Times More Accurately Than Human DoctorsEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Amélie Bernard

Amélie Bernard

Science et santé

Amélie Bernard couvre les sciences et la santé pour FLASH24, en s'appuyant sur les publications évaluées par les pairs, les communiqués des agences et les données brutes des études, sans reprendre les reprises de presse. Elle vérifie chaque chiffre en remontant à la source, compare les méthodologies et signale les tailles d'échantillon douteuses. Elle interroge régulièrement des chercheurs et des soignants, et attend les mises à jour des revues à comité de lecture avant de publier. Sa formation en physique des matériaux lui sert à décrypter les résultats techniques, et elle observe le ciel avec son propre télescope. Elle ne publie pas une donnée qu'elle n'a pas pu reproduire.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.