Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

IA médicale : les audits de vie privée ratent les fuites au niveau des patients, selon Nature

Un modèle médical discriminatif peut être interrogé pour savoir si les données d'un patient ont servi à son entraînement. Au niveau individuel, ces attaques réussissent « presque parfaitement », selon un article de Nature publié mercredi et relayé par The Register.

SantéAnalyseAmélie BernardPublié le: 27 septembre 20264 min de lectureSources 2
IA médicale : les audits de vie privée ratent les fuites au niveau des patients, selon Nature

Des chercheurs allemands ont testé sept jeux de données d'IA médicale : images, enregistrements d'ECG et dossiers de santé électroniques généraux. Les attaques par inférence d'appartenance (MIA) consistent à interroger un modèle pour déterminer si un point de données précis figure dans son ensemble d'entraînement. Chez des patients pris individuellement, elles ont bien mieux fonctionné que ne le laissent penser les mesures agrégées de vie privée, rapporte The Register le 24 juin.

La conclusion de l'article tombe mal pour qui audite une IA médicale selon les règles actuelles. « Le fait que les MIA puissent atteindre des taux de succès quasi parfaits pour des patients individuels n'est pas correctement pris en compte par le protocole d'évaluation standard, qui mesure le succès de l'attaque de manière agrégée sur l'ensemble des enregistrements », écrivent les chercheurs. Pour eux, les normes de reporting des audits de vie privée des IA doivent changer.

Qui est le plus facile à identifier

Les patients sous-représentés dans un ensemble d'entraînement sont les plus faciles à repérer. L'origine ethnique, le statut d'assurance, le sexe, le protocole d'imagerie utilisé et certains états pathologiques peuvent tous jouer le rôle de valeurs aberrantes qui renforcent une attaque, selon l'article.

Moritz Knolle dirige la chaire IA en santé et médecine à l'université technique de Munich et a mené ces travaux. Il a décrit les enjeux pratiques à The Register par courriel. « D'une manière générale, les risques pour la vie privée liés aux MIA deviennent plus graves à mesure que la cohorte d'entraînement d'un modèle devient plus spécifique », a-t-il déclaré. L'appartenance à un ensemble d'entraînement peut révéler une maladie génétique latente comme la maladie de Huntington, une dépression, ou la fréquentation d'une clinique spécialisée. Autrement dit, un ensemble d'entraînement divulgué peut exposer des pathologies que les personnes n'ont signalées nulle part ailleurs.

Deux autres résultats assombrissent le tableau. Plus le jeu de données est grand, plus il est facile d'exposer des enregistrements individuels. L'article indique que l'ampleur de ce déplacement du risque au niveau des patients dans les modèles plus grands n'avait jamais été mesurée.

Ce dont un attaquant a réellement besoin

L'attaque repose sur une particularité simple : une IA médicale a tendance à être plus confiante lorsque l'entrée faisait déjà partie de ses données d'entraînement. Un attaquant fournit des données de patient, lit le niveau de confiance et en déduit l'appartenance.

« Dans notre article, nous montrons qu'un attaquant disposant d'un accès partiel peut tout de même mener à bien des MIA », a déclaré Knolle à The Register.

Cela compte parce que l'hypothèse antérieure était qu'il fallait un dossier patient complet. Knolle précise qu'un attaquant aurait « simplement besoin d'accéder aux résultats d'analyse sanguine de quelqu'un, ou à une partie de ces résultats » pour déduire l'inclusion. Il ajoute que les jeux de données utilisés dans l'étude étaient anonymisés. Les données cibles, autrement dit, n'ont pas besoin de l'être.

Mettre la main sur ces données est la partie la plus difficile, mais pas insurmontable. Knolle évoque la fréquence des violations de données de santé. Un attaquant pourrait ainsi obtenir un accès non autorisé à la base de données d'un médecin généraliste après une analyse sanguine de routine.

Pourquoi les règles d'audit sont le cœur du sujet

L'article ne soutient pas que toute MIA réussie est un scandale. Knolle a déclaré à The Register que nombre d'attaques réussies représentent une atteinte à la vie privée faible ou négligeable. Il cite le cas de modèles entraînés sur de grandes populations générales, où les individus sains et malades sont tous bien représentés. Le problème est plus étroit et plus difficile à réguler : les cohortes spécifiques, les maladies rares et tout groupe qui apparaît trop rarement dans les données d'entraînement.

En avril, une étude distincte publiée dans JAMA Network Open et dirigée par Arya Rao, étudiant en médecine à Harvard, a testé 21 modèles d'IA du commerce sur 29 vignettes cliniques. Les modèles ont atteint un diagnostic final correct dans 91 pour cent des cas, mais ont échoué au diagnostic différentiel précoce dans plus de 8 cas sur 10, rapporte The Register le 15 avril. Le coauteur, le Dr Marc Succi, radiologue au Massachusetts General Hospital, a déclaré que de tels systèmes « peuvent afficher de la confiance sans démontrer un raisonnement solide ». Le schéma est celui qu'exploite l'article sur la vie privée : la confiance d'un modèle n'est pas un signal fiable, et elle est utilisée comme tel dans deux contextes très différents.

Les régulateurs bougent, mais la direction reste incertaine. Les titres récents rassemblés pour le contexte incluent une proposition britannique de régulation des IA de santé avec des « plaques L », une réglementation au niveau des États aux États-Unis, et des lignes directrices de l'agence australienne TGA sur les dispositifs médicaux d'IA. Rien de tout cela ne comble la lacune précise identifiée par l'équipe de Knolle. Cette lacune tient à la manière dont la vie privée est mesurée, et non à l'autorisation d'un dispositif.

Les chercheurs recommandent des cadres de confidentialité différentielle, qui visent à garantir mathématiquement que les données d'entraînement restent anonymes. Ils demandent aussi une réécriture des normes d'audit de vie privée, pour qu'elles évaluent le risque au niveau individuel plutôt qu'agrégé. Une troisième option évoquée par Knolle est plus directe : constituer les données d'entraînement de façon à ce que les groupes sous-représentés apparaissent plus souvent, ce qui réduit l'effet de valeur aberrante qui les rend identifiables au départ.

« J'espère que la communauté de l'IA médicale commencera à prendre les risques pour la vie privée au sérieux et que des techniques d'atténuation des risques seront utilisées dans les situations où elles sont nécessaires », a déclaré Knolle à The Register.

Commentaires 0

Sources

2
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Amélie Bernard

Amélie Bernard

Science et santé

Amélie Bernard couvre les sciences et la santé pour FLASH24, en s'appuyant sur les publications évaluées par les pairs, les communiqués des agences et les données brutes des études, sans reprendre les reprises de presse. Elle vérifie chaque chiffre en remontant à la source, compare les méthodologies et signale les tailles d'échantillon douteuses. Elle interroge régulièrement des chercheurs et des soignants, et attend les mises à jour des revues à comité de lecture avant de publier. Sa formation en physique des matériaux lui sert à décrypter les résultats techniques, et elle observe le ciel avec son propre télescope. Elle ne publie pas une donnée qu'elle n'a pas pu reproduire.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.