Des modèles d'IA médicale laissent fuiter l'identité des patients qui les ont entraînés, selon une étude de Nature
Des chercheurs allemands ont montré qu'on peut interroger les modèles d'IA utilisés pour aider au diagnostic médical et savoir si les données d'un patient précis ont servi à leur entraînement. Selon eux, l'attaque réussit presque à tous les coups au niveau individuel.

Le résultat paraît dans un article de Nature daté du mercredi 24 juin, rapporté le jour même par The Register. Il porte sur sept jeux de données d'IA médicale : images, enregistrements d'ECG et dossiers de santé électroniques généraux. L'équipe affirme que les audits de confidentialité actuels passent à côté du risque, parce qu'ils mesurent le succès des attaques de façon agrégée et non patient par patient.
La classe d'attaque n'est pas nouvelle. Ce qui est nouveau, c'est son efficacité sur les modèles médicaux.
Les attaques par inférence d'appartenance (MIA) interrogent un modèle pour déterminer si un point de données particulier figurait dans son ensemble d'entraînement. Les modèles discriminatifs, ceux qui servent à classer des données et à faire des prédictions sur de nouvelles entrées, sont particulièrement faciles à sonder de cette manière, selon les chercheurs. Dans leur analyse, les patients individuels ciblés par de telles attaques pouvaient être identifiés avec ce que l'article appelle un succès quasi parfait. Une appartenance confirmée à l'ensemble d'entraînement est en soi une divulgation. Si un modèle a été entraîné sur une cohorte issue d'une clinique spécialisée, prouver que le dossier d'une personne se trouve dans cette cohorte peut révéler un diagnostic qu'elle n'a jamais choisi de partager.
Les patients sous-représentés sont plus faciles à repérer
L'article constate aussi que les patients qui sont des valeurs aberrantes dans un ensemble d'entraînement sont plus faciles à identifier que les autres. L'origine ethnique, le statut d'assurance, le sexe, le protocole d'imagerie utilisé et certains états pathologiques peuvent tous jouer ce rôle de valeur aberrante, selon les chercheurs.
Moritz Knolle dirige la chaire AI in Healthcare and Medicine à l'université technique de Munich et signe l'article en premier auteur. Il a résumé le compromis sans détour dans un échange d'e-mails avec The Register. « D'une manière générale, les risques pour la vie privée liés aux MIA deviennent plus graves à mesure que la cohorte d'entraînement d'un modèle devient plus spécifique », a-t-il déclaré. Il a donné un exemple : « On peut imaginer ... des scénarios où l'appartenance à un jeu de données d'entraînement révèle que quelqu'un a une maladie génétique dormante comme la maladie de Huntington, une dépression, ou qu'il a fréquenté une clinique de traitement spécialisée précise. »
Les chercheurs signalent un autre effet, qui va dans le mauvais sens. Des jeux de données plus volumineux rendent les dossiers plus faciles à exposer, et non plus difficiles. L'article indique que l'ampleur de ce déplacement du risque au niveau des patients n'avait pas été mesurée auparavant pour des modèles plus grands.
Ce dont un attaquant a réellement besoin
Rien de tout cela ne signifie qu'un inconnu peut pointer un modèle et en extraire des noms. Une MIA exige que l'attaquant détienne déjà un point de données qu'il veut tester. Knolle l'a confirmé, tout en notant que l'article réduit la quantité de données nécessaires.
« Pour mener une MIA, un attaquant doit avoir accès à un point de données cible », a-t-il dit à The Register. « Dans notre article, nous montrons qu'un attaquant disposant d'un accès partiel peut quand même mener des MIA avec succès. »
Le mécanisme repose sur la confiance. Les IA médicales ont tendance à être plus certaines lorsque l'entrée figurait dans leur ensemble d'entraînement. L'attaquant injecte donc des données de patient obtenues, lit le niveau de confiance et en déduit l'inclusion. Knolle a précisé que l'attaquant n'a pas besoin de savoir à qui appartiennent les données. Tous les jeux de données utilisés dans l'étude étaient anonymisés, a-t-il ajouté, ce qui ne protège pas contre ce type d'inférence. « L'attaquant aurait simplement besoin d'accéder aux résultats d'analyse de sang de quelqu'un, ou à une partie de ces résultats » pour déduire l'inclusion, a dit Knolle. Sur l'origine de ces données, il a évoqué une exposition routinière plutôt qu'une intrusion exotique : « Étant donné que les données médicales ne sont pas toujours stockées de manière sécurisée, il n'est pas impensable qu'un attaquant puisse y accéder, par exemple en obtenant un accès non autorisé à la base de données de votre médecin généraliste après qu'il a réalisé une analyse de sang de routine. »
Recommandations, et une réserve
Les recommandations de l'équipe ne sont pas exotiques. Elles veulent que des cadres de confidentialité différentielle soient utilisés là où le risque le justifie, que les normes d'audit de confidentialité soient réécrites pour évaluer le risque au niveau individuel plutôt qu'agrégé, et que les données d'entraînement soient constituées de manière à mieux représenter les groupes sous-représentés au lieu de les laisser comme valeurs aberrantes.
Knolle a formulé son objectif de façon étroite. « J'espère que la communauté de l'IA médicale commencera à prendre les risques pour la vie privée au sérieux et que des techniques d'atténuation des risques seront utilisées dans les situations où elles sont nécessaires », a-t-il dit. Il a aussi refusé de traiter toute attaque réussie comme un scandale. « Il existe de nombreuses situations où une MIA réussie représente une violation de la vie privée faible ou négligeable », a-t-il noté, en décrivant des modèles entraînés sur de grandes populations générales où apparaissent à la fois des individus sains et malades.
Le contexte réglementaire dans lequel s'inscrit l'article est encombré mais pauvre en précisions. Le rapport de The Register note que les normes de déclaration des audits de confidentialité de l'IA doivent changer, un appel qui s'adresse autant aux auditeurs et aux revues qu'aux fournisseurs. Rien dans l'article ne propose un nouveau régime de certification, et aucun régulateur n'est cité comme ayant adopté ses recommandations.
Un second ensemble de travaux, distinct, pointe dans la même direction sous un autre angle : ces systèmes devraient-ils rendre des avis diagnostiques ? Une étude dirigée par Arya Rao, étudiante en médecine à Harvard, publiée dans JAMA Network Open et couverte par The Register le 15 avril, a testé 21 modèles d'IA du commerce sur 29 vignettes cliniques standardisées. Les modèles étaient corrects dans 91 pour cent des cas lorsqu'on leur donnait un portefeuille complet d'informations et qu'on leur demandait un diagnostic final.
Le diagnostic différentiel précoce, l'étape où les cliniciens écartent et retiennent des hypothèses en pesant l'incertitude, a échoué dans plus de 8 cas sur 10 selon la définition stricte de l'article. « Chaque modèle que nous avons testé a échoué sur la grande majorité des cas », a dit Rao à The Register. « C'est l'étape où l'incertitude compte le plus, et c'est là que ces systèmes sont les plus faibles. »
Rao a aussi mis en garde contre une lecture du taux d'échec comme un effondrement total. Mesurés en précision brute par cas, les modèles ont obtenu entre 63 et 78 pour cent, ce qui suggère selon elle qu'ils avaient souvent partiellement raison. Le coauteur, le docteur Marc Succi, radiologue au Massachusetts General Hospital, a déclaré que des scores plus élevés en diagnostic final ne devaient rassurer personne. « Le vrai raisonnement clinique commence plus tôt, quand l'ambiguïté est la plus forte, et c'est exactement là qu'ils restent les plus faibles », a-t-il dit à The Register.
Mis côte à côte, les deux articles rendent la question réglementaire plus aiguë. Un modèle capable de laisser fuiter qui l'a entraîné et qui rate encore la plupart des diagnostics différentiels précoces est proposé pour le triage de première ligne. Or les audits utilisés pour le valider ne mesurent aucun de ces deux risques au niveau où ils mordent.
Sources
2- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.