Les patients du jeu d'entraînement sont faciles à repérer, et les audits de confidentialité ne le voient pas
Des chercheurs allemands ont montré qu'on peut interroger des modèles d'IA médicale entraînés sur des dossiers de patients pour savoir qui figure dans leurs données d'entraînement. Ils parlent d'un « succès quasi parfait » des attaques, patient par patient, dans un article publié dans Nature le 24 juin.

Les attaques par inférence d'appartenance (membership inference attacks, MIA) consistent à demander à un modèle si tel enregistrement a servi à son entraînement. The Register, qui a rapporté les résultats le 24 juin, note que les modèles d'IA médicale discriminatifs y sont particulièrement exposés. Ils apprennent à classer des entrées et deviennent nettement plus confiants sur les données qu'ils ont déjà vues.
Cette confiance est la fuite. L'équipe a analysé sept jeux de données d'IA médicale, avec des images, des tracés d'ECG et des dossiers de santé électroniques classiques. Les patients visés par ce type d'attaque pouvaient être identifiés avec ce que l'article appelle un succès quasi parfait. Les auteurs expliquent que l'évaluation standard ne le voit pas : elle mesure le succès des attaques de façon agrégée sur l'ensemble des enregistrements, pas personne par personne.
Les cas atypiques sont les plus faciles à exposer
Les groupes sous-représentés dans une cohorte d'entraînement sont plus faciles à désigner que les patients typiques. L'origine ethnique, le statut d'assurance, le sexe, le protocole d'imagerie utilisé et certains états pathologiques peuvent tous faire office de cas atypiques.
De manière générale, les risques pour la vie privée liés aux MIA deviennent plus graves à mesure que la cohorte d'entraînement d'un modèle devient plus spécifique.
Moritz Knolle préside l'IA en santé et médecine à l'université technique de Munich et a dirigé l'article. Il s'est exprimé par courriel auprès de The Register. Il donne l'exemple d'un modèle dont la liste d'appartenance révélerait qu'une personne souffre d'une maladie génétique dormante comme la maladie de Huntington, qu'elle fait une dépression, ou qu'elle a fréquenté telle clinique spécialisée. Les gros jeux de données n'arrangent rien, au contraire. L'article indique que l'ampleur du changement de risque au niveau du patient dans les modèles plus grands était jusqu'ici inconnue.
L'attaque demande aussi moins que ce que les chercheurs imaginaient. Knolle explique à The Register qu'un attaquant a normalement besoin d'accéder à un point de données cible, et que l'article montre qu'un accès partiel suffit. Des résultats d'analyses sanguines, ou une partie seulement, feraient l'affaire. Tous les jeux de données de l'étude étaient anonymisés, et l'attaquant n'a pas besoin de savoir à qui appartiennent les données qu'il teste.
Se procurer ces données reste l'obstacle pratique, mais il n'est pas très haut. Knolle rappelle que les données médicales ne sont pas toujours stockées de manière sécurisée. Un accès non autorisé à la base d'un médecin généraliste après une analyse de sang de routine n'a rien d'inimaginable.
Ce que les auteurs veulent voir changer
Les recommandations de l'article portent sur les procédures, pas sur des correctifs techniques à apporter aux modèles. L'équipe veut que les normes d'audit de confidentialité soient réécrites pour évaluer le risque au niveau individuel et non sur des chiffres agrégés. Elle cite les cadres de confidentialité différentielle, qui offrent des garanties mathématiques sur l'anonymat des données d'entraînement. Knolle suggère aussi de constituer les données d'entraînement de façon à mieux représenter les groupes sous-représentés.
Les enjeux ne sont pas théoriques. Une autre étude, publiée dans JAMA Network Open en avril et couverte par The Register, a constaté que 21 modèles d'IA prêts à l'emploi échouaient au diagnostic différentiel précoce dans plus de 8 cas sur 10, même si les meilleurs modèles atteignaient 91 % de précision sur le diagnostic final. Marc Succi, radiologue au Massachusetts General Hospital et coauteur, estime que de tels systèmes ne devraient pas être considérés comme fiables pour un raisonnement diagnostique face au patient sans un examen humain structuré et complet.
Knolle assortit le problème de confidentialité d'une réserve. Dans bien des situations, une attaque par inférence d'appartenance réussie représente une violation faible ou négligeable, notamment quand les modèles sont entraînés sur de grandes populations générales qui comprennent à la fois des personnes saines et malades. La difficulté, c'est que les résultats de l'article montrent que ce sont exactement les conditions dans lesquelles les protocoles d'audit présument la sécurité, et exactement celles que les auteurs disent mal mesurées.
Sources
2- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.