Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Diagnostic par IA sous examen : des patients identifiables, les LLM échouent dans 80 % des cas

Deux études distinctes publiées en 2026 montrent que les IA de diagnostic médical peuvent être amenées à révéler quels patients ont servi à leur entraînement, et que les principaux modèles de langage échouent au diagnostic différentiel précoce dans plus de 8 cas sur 10.

SantéExpliquéAmélie BernardPublié le: 28 septembre 20265 min de lectureSources 4
Diagnostic par IA sous examen : des patients identifiables, les LLM échouent dans 80 % des cas

Deux axes de recherche publiés en 2026 dressent un tableau inquiétant du diagnostic médical assisté par IA. Le premier montre que des modèles de diagnostic laissent fuiter l'identité des patients dont les dossiers ont servi à leur entraînement. Le second montre que les grands modèles de langage, ces mêmes outils que l'on interroge sur ses symptômes, échouent aux premières étapes du raisonnement clinique dans plus de 80 % des cas. The Register a rendu compte des deux, au fil de leur parution.

Le problème de confidentialité vient d'un article de Nature publié le mercredi 24 juin 2026, selon The Register. Des chercheurs allemands ont testé sept jeux de données d'IA médicale contenant des images, des enregistrements d'ECG et des dossiers de santé électroniques généraux. Ils ont constaté que les modèles discriminatifs, ceux qui classent les données et produisent des prédictions, sont particulièrement vulnérables aux attaques par inférence d'appartenance (MIAs). Ces attaques interrogent un modèle pour déterminer si un point de données précis faisait partie de son jeu d'entraînement. L'équipe rapporte que des patients pris individuellement peuvent être identifiés avec un « succès quasi parfait ». Ce taux, soutient-elle, n'apparaît pas dans les protocoles d'évaluation standard, qui mesurent le succès des attaques de façon agrégée sur l'ensemble des dossiers. Les chercheurs concluent que les normes de déclaration des audits de confidentialité des IA doivent changer.

Les patients sous-représentés sont plus faciles à identifier

Les patients sous-représentés dans les données d'entraînement des IA médicales sont encore plus faciles à identifier que ceux dont les données ne se distinguent pas, selon le même article. The Register cite l'origine ethnique, le statut d'assurance, le sexe, le protocole d'imagerie et certains états pathologiques parmi les catégories qui peuvent jouer le rôle de valeurs aberrantes et rendre les individus plus faciles à repérer.

« D'une manière générale, les risques pour la vie privée liés aux MIAs deviennent plus graves à mesure que la cohorte d'entraînement d'un modèle devient plus spécifique », a déclaré Moritz Knolle, titulaire de la chaire IA en santé et médecine à l'université technique de Munich et premier auteur de l'article, à The Register par courriel. Il décrit des scénarios où l'appartenance à un jeu de données d'entraînement pourrait révéler qu'une personne porte une maladie génétique dormante comme la maladie de Huntington, souffre de dépression, ou a fréquenté une clinique spécialisée précise.

L'attaque elle-même repose sur une propriété simple des modèles d'apprentissage automatique : ils ont tendance à être plus confiants lorsque les données d'entrée faisaient partie de leur jeu d'entraînement. Un attaquant disposant de données partielles sur un patient peut les soumettre au modèle, vérifier le niveau de confiance et en déduire si ce patient figurait dans le jeu. Knolle indique que l'article montre qu'un attaquant n'a pas besoin d'un accès complet à un point de données patient, contrairement à ce que l'on croyait auparavant. « Dans notre article, nous montrons qu'un attaquant disposant d'un accès partiel peut tout de même mener à bien des MIAs », a-t-il déclaré à The Register.

« J'espère que la communauté de l'IA médicale commencera à prendre les risques pour la vie privée au sérieux et que des techniques d'atténuation seront utilisées là où elles sont nécessaires. » Moritz Knolle, université technique de Munich

Les chercheurs recommandent d'utiliser des cadres de confidentialité différentielle conçus pour garantir mathématiquement que les données d'entraînement restent anonymes. Ils souhaitent aussi que les normes d'audit de confidentialité prennent en compte le risque individuel, et pas seulement les chiffres agrégés. Autre option, selon Knolle : constituer les données d'entraînement de manière à mieux représenter les groupes sous-représentés. « Dans de nombreuses situations, une MIA réussie représente une atteinte à la vie privée faible ou négligeable », note-t-il, en référence aux modèles entraînés sur de vastes populations générales comprenant à la fois des personnes saines et malades.

Les modèles de langage échouent tôt et affichent leur assurance

Par ailleurs, des travaux publiés dans JAMA Network Open en avril 2026 ont montré que 21 grands modèles d'IA prêts à l'emploi échouaient au diagnostic différentiel précoce dans plus de 8 cas sur 10. L'étude, dont The Register a rendu compte le 15 avril 2026, a testé les modèles sur 29 vignettes cliniques standardisées. Les modèles s'en sortaient bien lorsqu'on leur donnait un dossier médical complet et qu'on leur demandait un diagnostic final, les meilleurs étant corrects dans 91 % des cas. Mais au diagnostic différentiel précoce, l'étape où les cliniciens écartent des hypothèses tout en pesant les possibilités, le taux d'échec dépassait 80 %.

« Tous les modèles que nous avons testés ont échoué sur la grande majorité des cas », a déclaré Arya Rao, étudiante en médecine à Harvard qui a dirigé la recherche, à The Register par courriel. « C'est l'étape où l'incertitude compte le plus, et c'est là que ces systèmes sont les plus faibles. »

Rao précise qu'un échec ne signifiait pas toujours une réponse entièrement fausse. Mesurés par la précision brute, en proportion de réponses correctes, les modèles se situaient entre 63 et 78 %. Mais l'équipe soutient que la mesure d'échec plus stricte compte encore, d'autant que les outils d'IA sont commercialisés comme des agents de première ligne censés affiner les diagnostics. « Présenter les LLM comme des agents de diagnostic risque d'entretenir une fausse confiance, précisément là où ils sont les moins fiables », écrivent les chercheurs.

Le Dr Marc Succi, radiologue au Massachusetts General Hospital et coauteur de l'article, a déclaré à The Register que des taux de réussite plus élevés sur le diagnostic final ne devraient pas rassurer. « Le vrai raisonnement clinique commence plus tôt, quand l'ambiguïté est à son maximum, et c'est exactement là qu'ils restent les plus faibles », a-t-il dit. Il avertit qu'un mauvais diagnostic différentiel peut entraîner des retards de prise en charge, des examens inutiles, des coûts élevés et davantage encore.

Les deux articles paraissent dans un environnement réglementaire qui reste à la traîne. À la mi-2024, la Food and Drug Administration américaine avait autorisé environ 950 dispositifs médicaux dotés d'IA, selon une analyse sectorielle publiée par IntuitionLabs. La même analyse relevait que seule une infime fraction des dispositifs d'IA autorisés s'appuie sur des essais randomisés ou des données de résultats pour les patients, et que la FDA a publié ses lignes directrices sur les Predetermined Change Control Plans en décembre 2024.

Un entretien publié par MD+DI avec Suzanne Levy Friedman, avocate spécialisée dans les dispositifs médicaux auprès de la FDA, notait qu'en dépit de plus de mille dispositifs dotés d'IA autorisés par la FDA, aucun n'intègre de modèle à apprentissage continu. Friedman indique que l'agence travaille à une voie en ce sens, mais que sa mission première d'agence de santé publique l'oblige à peser l'innovation face au risque que des cliniciens s'appuient sur des outils non validés.

Les deux articles de recherche suggèrent que la validation ne se limite pas à la justesse de la réponse finale. Elle porte aussi sur la capacité d'un modèle à garder secrète l'identité d'un patient, et à gérer l'incertitude avant qu'un diagnostic soit établi.

Commentaires 0

Sources

4
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
  3. 03AI Medical Devices: 2025 Status, Regulation & ChallengesEN
  4. 04How Is FDA Regulating AI Medical Devices in 2026?EN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Amélie Bernard

Amélie Bernard

Science et santé

Amélie Bernard couvre les sciences et la santé pour FLASH24, en s'appuyant sur les publications évaluées par les pairs, les communiqués des agences et les données brutes des études, sans reprendre les reprises de presse. Elle vérifie chaque chiffre en remontant à la source, compare les méthodologies et signale les tailles d'échantillon douteuses. Elle interroge régulièrement des chercheurs et des soignants, et attend les mises à jour des revues à comité de lecture avant de publier. Sa formation en physique des matériaux lui sert à décrypter les résultats techniques, et elle observe le ciel avec son propre télescope. Elle ne publie pas une donnée qu'elle n'a pas pu reproduire.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.