Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les IA de diagnostic médical laissent fuir l'identité de leurs données d'entraînement, et les règles ne le voient pas

Des chercheurs allemands ont montré que les modèles d'IA d'aide au diagnostic identifient les patients dont les données ont servi à les entraîner, avec un « taux de réussite quasi parfait ». Dans un article publié par Nature le 24 juin, ils affirment que les normes d'audit de confidentialité ne mesurent pas le risque là où il fait mal.

SantéAnalyseAmélie BernardPublié le: 27 septembre 20265 min de lectureSources 2
Les IA de diagnostic médical laissent fuir l'identité de leurs données d'entraînement, et les règles ne le voient pas

Le résultat, relayé par The Register le 24 juin, vient d'une équipe dirigée par Moritz Knolle, qui préside la chaire d'IA en santé et médecine à l'université technique de Munich. L'article teste des attaques par inférence d'appartenance (MIA) contre sept jeux de données d'IA médicale, composés d'images, d'enregistrements d'ECG et de dossiers de santé électroniques généraux. Ces modèles sont discriminatifs : ils classent des entrées et font des prédictions à partir de ce sur quoi ils ont été entraînés.

Une MIA exploite un travers simple. Un modèle est en général plus confiant sur des entrées qu'il a déjà vues. On lui soumet un dossier, on lit le score de confiance, et on peut déduire si ce dossier figurait dans le jeu d'entraînement. Selon Knolle, « une personne qui mène une MIA n'a pas besoin de savoir à qui appartiennent les données avec lesquelles elle tente de la mener ». Tous les jeux de données de l'étude étaient anonymisés.

Les patients sous-représentés sont plus faciles à identifier

L'étude montre que les patients d'un jeu de données sont en général faciles à isoler, et que ceux qui sont sous-représentés dans les données d'entraînement le sont plus encore. L'origine, le statut d'assurance, le sexe, le protocole d'imagerie utilisé et certains états pathologiques peuvent tous jouer le rôle de valeurs aberrantes qui font ressortir un individu.

D'une manière générale, les risques pour la vie privée liés aux MIA s'aggravent à mesure que la cohorte d'entraînement d'un modèle devient plus spécifique. On peut imaginer ... des scénarios où l'appartenance à un jeu de données d'entraînement révèle qu'une personne a une maladie génétique latente comme la maladie de Huntington, une dépression, ou qu'elle a fréquenté une clinique de soins spécialisée précise.

Cette citation vient de Knolle, interrogé par The Register par courriel. La conséquence n'est pas abstraite : savoir que les données d'une personne figurent dans une cohorte spécialisée peut révéler un diagnostic qu'elle n'a jamais choisi de divulguer, ou alimenter une discrimination en assurance, à l'embauche ou ailleurs.

L'échelle aggrave la situation au lieu de l'atténuer. L'article constate que plus le jeu de données est grand, plus il devient facile d'exposer des dossiers. Il ajoute que « l'ampleur de ce changement de risque au niveau du patient était jusqu'ici inconnue » dans les modèles plus grands. Cela va à l'encontre d'une idée répandue selon laquelle des jeux d'entraînement plus volumineux diluent l'exposition de chaque individu.

Les chiffres d'audit passent à côté de l'essentiel

C'est ici que commence l'argument réglementaire. Les chercheurs affirment qu'une réussite quasi parfaite contre des patients pris individuellement « n'est pas correctement prise en compte par le protocole d'évaluation standard, qui mesure le succès de l'attaque globalement, tous dossiers confondus ». Un audit peut donc afficher un faible taux moyen de réussite alors que des patients restent identifiables sans effort. L'équipe conclut que les normes de restitution des audits de confidentialité des IA doivent changer.

Les recommandations de Knolle couvrent deux volets. Le premier est technique : les cadres de confidentialité différentielle, conçus pour offrir une garantie mathématique que les données d'entraînement restent anonymes. Le second est procédural : faire passer les audits d'un risque agrégé à un risque au niveau individuel. Il propose aussi un correctif plus direct : constituer les données d'entraînement des IA médicales de façon à mieux représenter les groupes sous-représentés dès le départ. « J'espère que la communauté de l'IA médicale commencera à prendre les risques pour la vie privée au sérieux et que des techniques d'atténuation seront employées là où elles sont nécessaires », a-t-il déclaré à The Register.

Tout cela suppose une condition préalable. Pour mener une MIA, l'attaquant a besoin d'au moins quelques données appartenant à la cible. Knolle indique que l'article montre qu'un dossier patient complet n'est pas nécessaire, contrairement à ce que l'on croyait : « Dans notre article, nous montrons qu'un attaquant disposant d'un accès partiel peut tout de même mener des MIA avec succès. » Il cite l'exemple de résultats d'analyses sanguines, ou d'une partie d'entre eux, suffisants pour déduire l'inclusion. Il pointe aussi l'exposition courante des données de santé dans les violations de données. « Étant donné que les données médicales ne sont pas toujours stockées de façon sûre, il n'est pas impensable qu'un attaquant y accède, par exemple en pénétrant sans autorisation dans la base de données de votre médecin généraliste après une prise de sang de routine », dit-il.

Knolle se garde de surestimer le préjudice dans tous les cas. « Il existe de nombreuses situations où une MIA réussie représente une atteinte à la vie privée faible ou négligeable », note-t-il, en visant les modèles entraînés sur de grandes populations générales où les individus sains comme malades sont représentés en nombre suffisant. Le risque se concentre là où les cohortes sont étroites.

Les modèles de diagnostic eux-mêmes sont faibles

La confidentialité n'est qu'un des deux problèmes visibles dans le même coin de l'IA médicale. Des travaux publiés dans JAMA Network Open en avril, relayés par The Register le 15 avril, ont testé 21 modèles d'IA prêts à l'emploi sur 29 vignettes cliniques standardisées. Les modèles donnaient le bon diagnostic final dans 91 pour cent des cas lorsqu'on leur fournissait un dossier complet d'informations. Sur le diagnostic différentiel précoce, le stade où les cliniciens écartent encore des hypothèses, ils échouaient dans plus de 8 cas sur 10.

L'étude était dirigée par Arya Rao, étudiant en médecine à Harvard. « Tous les modèles que nous avons testés ont échoué sur la grande majorité des cas », a déclaré Rao à The Register. « C'est le stade où l'incertitude compte le plus, et c'est là que ces systèmes sont les plus faibles. » Le coauteur, le docteur Marc Succi, radiologue au Massachusetts General Hospital, estime que les modèles « peuvent afficher de l'assurance sans montrer de raisonnement solide, en particulier sur le diagnostic différentiel ». Il avertit que cette assurance peut nourrir l'anxiété de patients déjà inquiets pour leur santé. Rao note aussi que la mesure d'échec stricte est sévère : en précision brute, les modèles obtiennent entre 63 et 78 pour cent, souvent partiellement corrects plutôt que totalement faux.

Mettez les deux articles côte à côte et le vide réglementaire se creuse. L'article sur la confidentialité dit que les audits mesurent la mauvaise chose, au mauvais niveau, et que les fournisseurs ont besoin d'une incitation à sécuriser les données d'entraînement. L'article sur le diagnostic dit que la promotion de ces systèmes comme agents de première ligne « risque d'entretenir une fausse confiance précisément là où ils sont les moins fiables », et que « les LLM ne peuvent pas encore être considérés comme fiables dans la décision de première ligne ». Dans les deux cas, l'échec est de ceux que les benchmarks agrégés et les argumentaires produit peuvent masquer.

Ce que les chercheurs demandent est plus étroit qu'une interdiction. Changer la façon dont les audits de confidentialité rapportent le risque, pour que les patients pris individuellement comptent. Recourir à la confidentialité différentielle là où les cohortes sont sensibles. Équilibrer les données d'entraînement pour que les cas aberrants n'en soient plus. Et traiter les modèles comme des outils exigeant une relecture humaine, pas comme des gardiens. Rien de tout cela n'exige de nouvelle science. Il faut des régimes d'évaluation qui mesurent ce qui peut réellement nuire à un patient.

Commentaires 0

Sources

2
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Amélie Bernard

Amélie Bernard

Science et santé

Amélie Bernard couvre les sciences et la santé pour FLASH24, en s'appuyant sur les publications évaluées par les pairs, les communiqués des agences et les données brutes des études, sans reprendre les reprises de presse. Elle vérifie chaque chiffre en remontant à la source, compare les méthodologies et signale les tailles d'échantillon douteuses. Elle interroge régulièrement des chercheurs et des soignants, et attend les mises à jour des revues à comité de lecture avant de publier. Sa formation en physique des matériaux lui sert à décrypter les résultats techniques, et elle observe le ciel avec son propre télescope. Elle ne publie pas une donnée qu'elle n'a pas pu reproduire.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.