L'IA médicale peut nommer les patients sur lesquels elle a été entraînée, selon des chercheurs
Des modèles d'IA de diagnostic médical peuvent être amenés à révéler si les données d'un patient précis ont servi à leur entraînement, rapportent des chercheurs allemands dans un article publié mercredi dans Nature. Le taux de réussite est quasi parfait sur des patients pris individuellement. Cette conclusion arrive alors que la FDA, l'Union européenne et l'OMS écrivent encore les règles d'audit de ces dispositifs.

L'attaque s'appelle une attaque par inférence d'appartenance, ou MIA. The Register rapportait le 24 juin que l'équipe avait sondé sept jeux de données d'IA médicale, couvrant des images, des enregistrements d'ECG et des dossiers de santé électroniques généraux. Des patients individuels ciblés par de telles attaques peuvent être identifiés avec ce que les chercheurs appellent un succès quasi parfait. Ce chiffre échappe au protocole d'évaluation standard, précise l'article, parce que ce protocole mesure le succès de l'attaque de façon agrégée sur l'ensemble des dossiers.
Les IA médicales sont plus confiantes quand les données d'entrée figurent déjà dans leur ensemble d'entraînement. Un attaquant soumet au modèle les données d'un patient, lit le niveau de confiance et en conclut que le patient faisait partie de la cohorte d'entraînement.
Moritz Knolle, chercheur à l'université technique de Munich et premier auteur de l'article, a déclaré à The Register qu'un attaquant n'a pas besoin de savoir à qui appartiennent les données. « En fait, tous les jeux de données que nous utilisons dans notre étude étaient anonymisés », a-t-il dit. Un accès partiel suffit. « L'attaquant aurait simplement besoin d'accéder aux résultats d'analyse sanguine de quelqu'un, ou à une partie de ces résultats. »
Les cas isolés sont les plus faciles à pointer
Le schéma de qui se retrouve exposé est inconfortable. Les groupes sous-représentés dans les données d'entraînement médicales sont plus faciles à identifier que les patients dont les dossiers se fondent dans la masse. L'article cite la race, le statut d'assurance, le sexe, le protocole d'imagerie utilisé et certains états pathologiques comme catégories pouvant fonctionner comme des cas isolés. Résumé de Knolle à The Register : « De façon générale, les risques pour la vie privée liés aux MIA deviennent plus graves à mesure que la cohorte d'entraînement d'un modèle devient plus spécifique. »
Il a donné l'exemple d'une cohorte d'entraînement qui révèle une maladie génétique dormante comme la maladie de Huntington, ou une dépression, ou la fréquentation d'une clinique de traitement spécialisée. Autrement dit, l'appartenance elle-même laisse fuiter le diagnostic. L'article a aussi constaté que plus le jeu de données est grand, plus les dossiers sont faciles à exposer. L'ampleur de ce déplacement du risque au niveau du patient dans les grands modèles n'était pas connue jusqu'ici.
L'attaquant a besoin de quelques données médicales sur les personnes qu'il veut identifier. Les fuites de données de santé sont assez fréquentes pour que la barre ne soit pas haute. Knolle a évoqué le scénario d'un accès non autorisé à la base de données d'un médecin généraliste après une analyse sanguine de routine.
Son objectif déclaré est étroit : que la communauté de l'IA médicale prenne les risques pour la vie privée au sérieux et applique des mesures d'atténuation là où c'est nécessaire. L'article recommande des cadres de confidentialité différentielle, conçus pour offrir une garantie mathématique que les données d'entraînement restent anonymes. Il appelle aussi à réécrire les normes d'audit de la vie privée pour mesurer le risque individuel plutôt que le risque agrégé. Mieux représenter les groupes sous-représentés lors de la compilation des données d'entraînement est une autre option qu'il a soulevée.
Les régulateurs rattrapent encore les bases
Cela arrive dans un paysage réglementaire qui bouge, de façon inégale. IntuitionLabs, dans un rapport actualisé le 18 août, évalue à environ 950 le nombre de dispositifs d'IA et d'apprentissage automatique autorisés par la FDA à la mi-2024, avec environ 100 nouvelles autorisations par an. Des analystes de marché cités dans le même rapport estimaient les dispositifs médicaux dopés à l'IA à 13,7 milliards de dollars en 2024 et projetaient plus de 255 milliards de dollars d'ici 2033. La radiologie domine les autorisations, la cardiologie, la neurologie, l'anesthésiologie et l'ophtalmologie se développant.
Le même rapport note que les revues systématiques ne trouvent qu'une infime fraction des dispositifs d'IA autorisés appuyés par des essais randomisés ou des données de résultats patients. Des dysfonctionnements de dispositifs ont été liés à des blessures et, dans un cas rapporté, à un décès. Il cite un outil de tri en réanimation qui sous-identifiait les patients noirs pour des soins supplémentaires, et des études de coloscopie où les taux de détection des médecins baissaient lorsqu'ils s'appuyaient sur l'IA.
Sur la vie privée en particulier, l'exigence de l'article d'un audit au niveau individuel se heurte à un système bâti pour le reporting agrégé. Les résumés de décision de la FDA omettent souvent des détails critiques sur l'efficacité et la sécurité, selon la revue d'IntuitionLabs, et l'adhésion mondiale aux normes est inégale. Le règlement européen sur l'IA, en vigueur depuis 2024, classe de nombreux systèmes d'IA de santé comme à haut risque et ajoute du travail de conformité par-dessus le règlement sur les dispositifs médicaux. L'OMS a publié des recommandations en 2023 couvrant la transparence, la qualité des données et la surveillance du cycle de vie.
MD+DI a publié un entretien avec Suzanne Levy Friedman, avocate spécialisée dans les dispositifs médicaux auprès de la FDA. Le dernier décompte dont elle disposait dépassait un millier de dispositifs dopés à l'IA autorisés par la FDA, a-t-elle déclaré. Aucun n'intègre un modèle en apprentissage continu. Certains de ses clients plus récents en sont stupéfaits. Elle, non.
« Avec toute l'excitation de l'innovation, les gens oublient que la FDA est d'abord et avant tout une agence de santé publique », a déclaré Friedman à MD+DI. « Elle n'essaie pas d'être difficile, elle essaie de faire en sorte que les patients ne soient pas blessés et que les cliniciens disposent des bonnes informations et ne soient pas amenés par inadvertance à se fier à des choses qui pourraient ne pas être validées. »
Friedman a signalé deux lacunes antérieures à l'article sur la vie privée. Le logiciel itère plus vite que le cadre conçu pour le matériel, et la dérive des performances en conditions réelles peut frapper des produits validés dès que le mélange de patients change, comme cela s'est produit pendant le COVID. Le biais algorithmique s'y ajoute, et la FDA demande aux fabricants des détails granulaires sur leurs algorithmes, ce que certains jugent excessif.
Le problème des preuves cliniques juste à côté
La vie privée n'est pas le seul point faible de la base de preuves. The Register rapportait le 15 avril une étude de JAMA Network Open, dirigée par l'étudiant en médecine de Harvard Arya Rao, qui a testé 21 modèles d'IA du commerce sur 29 vignettes cliniques standardisées. Les modèles étaient corrects 91 pour cent du temps sur le diagnostic final lorsqu'on leur fournissait un portefeuille complet d'informations. Sur le diagnostic différentiel précoce, l'étape où les cliniciens écartent et retiennent des hypothèses dans l'incertitude, le taux d'échec dépassait 80 pour cent.
« Chaque modèle que nous avons testé a échoué sur la grande majorité des cas », a déclaré Rao à The Register. « C'est l'étape où l'incertitude compte le plus, et c'est là que ces systèmes sont les plus faibles. »
Le coauteur Marc Succi, radiologue au Massachusetts General Hospital, a averti que la confiance sans raisonnement est un danger en soi, particulièrement pour les patients anxieux. Il a aussi soutenu que de bons scores en diagnostic final peuvent créer un sentiment de sécurité trompeur, parce que le vrai raisonnement clinique commence plus tôt, quand l'ambiguïté est la plus forte. Rao a noté que la métrique d'échec plus stricte n'est pas la seule façon de lire les données : la précision brute allait de 63 à 78 pour cent, ce qui signifie que les modèles avaient souvent partiellement raison.
Les deux articles pointent dans la même direction sous des angles différents. L'un montre que les données d'entraînement derrière un modèle de diagnostic peuvent être interrogées pour identifier les patients qu'elles contiennent. L'autre montre que ces mêmes modèles, priés de raisonner comme les cliniciens, chutent au moment où les enjeux sont les plus élevés. Tous deux sont arrivés alors que les normes d'audit censées détecter ces problèmes sont encore en cours de rédaction.
La réserve de Knolle mérite d'être gardée. Il a déclaré à The Register qu'il existe de nombreuses situations où une MIA réussie représente une violation de la vie privée faible ou négligeable, à savoir les modèles entraînés sur de grandes populations générales comprenant à la fois des individus sains et malades. Le risque se concentre là où les cohortes sont étroites, et les cohortes étroites sont exactement ce dont l'IA médicale spécialisée a tendance à avoir besoin.
Sources
4- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
- 03AI Medical Devices: 2025 Status, Regulation & ChallengesEN
- 04How Is FDA Regulating AI Medical Devices in 2026?EN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.