Des IA médicales peuvent confirmer quels patients ont servi à leur entraînement, selon une étude publiée dans Nature
Des modèles d'IA médicale discriminatifs peuvent être amenés à confirmer si le dossier d'un patient donné a fait partie de leurs données d'entraînement, rapportent des chercheurs allemands dans une étude publiée dans Nature le 24 juin, avec un taux de réussite quasi parfait sur des patients pris individuellement.

Le résultat, rapporté pour la première fois par The Register le 24 juin, importe moins pour ce qu'il démontre sur la sécurité des modèles en soi que pour ce qu'il implique sur les promesses de confidentialité que les hôpitaux, les assureurs et les fournisseurs d'IA font aux patients. Si l'appartenance à un ensemble d'entraînement peut être confirmée, cet ensemble devient lui-même un canal de divulgation. C'est la partie inconfortable.
Moritz Knolle dirige la chaire IA en santé et médecine à l'université technique de Munich. Il a mené l'étude et déclaré à The Register que l'exposition n'est pas hypothétique. « On peut imaginer des scénarios où l'appartenance à un jeu de données d'entraînement révèle que quelqu'un a une maladie génétique latente comme la maladie de Huntington, une dépression, ou qu'il a consulté une clinique spécialisée précise », a-t-il dit. Le scénario n'a rien d'exotique. C'est le quotidien de la tenue des dossiers cliniques.
La classe d'attaque n'est pas nouvelle. Les attaques par inférence d'appartenance, ou MIA, sont étudiées dans la littérature sur l'apprentissage automatique depuis des années. La forme générale de la technique est bien comprise : un modèle a tendance à être plus confiant sur les entrées qu'il a déjà vues, donc un attaquant qui peut interroger le modèle et lire ses scores de confiance peut en déduire l'inclusion. Ce que l'étude de Nature ajoute, c'est l'échelle et la spécificité clinique. L'équipe a testé sept jeux de données d'IA médicale couvrant des images, des enregistrements d'ECG et des dossiers de santé électroniques généraux. Elle a constaté que des patients pris individuellement pouvaient être identifiés avec ce qu'elle décrit comme un taux de réussite quasi parfait. Ce résultat n'est pas une curiosité de laboratoire. C'est une mesure du comportement de ces modèles quand on leur pose la bonne question.
Pourquoi les audits agrégés passent à côté
Ce résultat va à l'encontre de la façon dont ces modèles sont actuellement évalués. Les audits de confidentialité mesurent généralement le taux de réussite des attaques de façon agrégée sur un jeu de données, ce qui produit une moyenne rassurante. L'étude soutient que ce n'est pas la bonne unité d'analyse. « Le fait que les MIA puissent atteindre des taux de réussite quasi parfaits pour des patients individuels n'est pas correctement saisi par le protocole d'évaluation standard, qui mesure le taux de réussite des attaques de façon agrégée sur les dossiers », écrivent les chercheurs. Leur conclusion : les normes de déclaration des audits de confidentialité des IA doivent changer.
Un second résultat dérange à côté du premier. Les patients sous-représentés dans une cohorte d'entraînement sont plus faciles à identifier que les autres, parce que leurs points de données ressortent. L'origine ethnique, le statut d'assurance, le sexe, le protocole d'imagerie utilisé et certains états pathologiques peuvent tous fonctionner comme des valeurs aberrantes. Le résumé de Knolle est direct : « De manière générale, les risques de confidentialité liés aux MIA deviennent plus graves à mesure que la cohorte d'entraînement d'un modèle devient plus spécifique. »
Plus le jeu de données est grand, plus les dossiers individuels sont faciles à exposer, selon l'étude. Les chercheurs notent que l'ampleur de ce changement de risque au niveau du patient dans les modèles plus grands était jusqu'ici inconnue. C'est un résultat contre-intuitif pour qui suppose que l'échelle apporte l'anonymat. En imagerie médicale et en génomique, elle fait souvent l'inverse.
Ce dont un attaquant a réellement besoin
C'est là que le tableau pratique se complique, et que les réserves de l'étude comptent. Mener une MIA contre un modèle médical exige que l'attaquant détienne déjà certaines données appartenant à la personne qu'il veut identifier. Knolle le confirme. « Pour mener une MIA, un attaquant doit avoir accès à un point de données cible », a-t-il dit à The Register, tout en ajoutant que l'étude montre qu'un dossier patient complet n'est pas nécessaire, contrairement aux hypothèses antérieures. « Dans notre étude, nous montrons qu'un attaquant disposant d'un accès partiel peut tout de même mener une MIA avec succès. »
L'attaquant aurait simplement besoin d'accéder aux résultats d'une prise de sang, ou à une partie de ces résultats.
Cela abaisse considérablement la barre. L'attaque fonctionne en soumettant le dossier partiel au modèle, en lisant le niveau de confiance et en déduisant que le patient figure dans l'ensemble d'entraînement. Les jeux de données utilisés dans l'étude étaient anonymisés, et Knolle souligne que l'attaquant n'a pas besoin de savoir à qui appartiennent les données pour lancer la requête. Le lien entre des données d'entraînement anonymisées et une personne nommée doit venir d'ailleurs, mais cet ailleurs est souvent une violation de données.
Les fuites de données de santé sont assez fréquentes pour que le problème ne soit pas théorique. Knolle décrit le scénario simplement : un attaquant obtient un accès non autorisé à la base de données d'un médecin généraliste après une prise de sang de routine, et de là peut sonder le modèle.
Interrogé sur ce qu'il attend de cette recherche, Knolle dit espérer que la communauté de l'IA médicale prendra les risques de confidentialité au sérieux et appliquera les techniques d'atténuation là où elles sont nécessaires. L'étude recommande des cadres de confidentialité différentielle, conçus pour donner des garanties mathématiques que les données d'entraînement restent anonymes, et une norme d'audit remaniée qui rapporte le risque au niveau individuel plutôt que le risque agrégé. Une troisième option, évoquée par Knolle, consiste à constituer les données d'entraînement de façon à mieux représenter les groupes sous-représentés, ce qui réduit l'effet de valeur aberrante qui les rend faciles à identifier.
Il met aussi en garde contre le fait de traiter toute MIA réussie comme une violation grave. « Il existe de nombreuses situations où une MIA réussie représente une violation de confidentialité faible ou négligeable », note-t-il, en citant des modèles entraînés sur de grandes populations générales où les individus sains comme malades sont représentés.
Le vide réglementaire
Face au paysage réglementaire actuel, l'étude tombe dans un espace que les règles ont jusqu'ici eu du mal à combler. Les audits de confidentialité pour l'IA médicale ont tendance à porter sur la question de savoir si les données ont été collectées légalement et si les identifiants ont été retirés, pas sur la capacité du modèle lui-même à être interrogé pour reconstituer une appartenance. La confidentialité différentielle existe comme technique, mais elle n'est pas exigée uniformément, et l'argument de l'étude est essentiellement que le régime d'évaluation mesure la mauvaise chose.
Cette lacune n'est pas propre à l'Europe. Des régulateurs de plusieurs juridictions travaillent à la classification et à la supervision des outils d'IA utilisés en milieu clinique, avec des propositions allant de régimes d'autorisation avant mise sur le marché à des orientations plus légères pour les applications à faible risque. Aucun des cadres en circulation, pour autant que les auteurs de l'étude en jugent, ne traite le risque d'appartenance au niveau individuel que leurs expériences démontrent.
Un autre ensemble de travaux suggère que la performance diagnostique de ces systèmes est elle aussi plus faible que le marketing ne le laisse entendre. Des recherches publiées dans JAMA Network Open en avril, menées par Arya Rao, étudiante en médecine à Harvard, et couvertes par The Register le 15 avril, ont testé 21 modèles d'IA du commerce sur 29 vignettes cliniques standardisées. Les modèles ont bien performé lorsqu'on leur donnait un dossier d'informations complet et qu'on leur demandait un diagnostic final, les meilleurs modèles étant corrects dans 91 pour cent des cas. Le diagnostic différentiel précoce, l'étape où les cliniciens pèsent des possibilités concurrentes, a échoué dans plus de 8 cas sur 10.
« Tous les modèles que nous avons testés ont échoué sur la grande majorité des cas », a déclaré Rao à The Register. « C'est l'étape où l'incertitude compte le plus, et c'est là que ces systèmes sont les plus faibles. » Le Dr Marc Succi, radiologue au Massachusetts General Hospital et coauteur, a déclaré que les résultats suggèrent que les modèles du commerce actuels ne devraient pas être utilisés pour le raisonnement diagnostique face au patient sans une revue humaine structurée et complète.
Rao note aussi que la métrique d'échec plus stricte ne dit pas tout. Mesurée comme exactitude brute, la proportion de cas où un modèle donnait la réponse entièrement correcte allait de 63 à 78 pour cent, ce qui, selon elle, suggère que les modèles étaient souvent partiellement corrects même lorsqu'ils échouaient selon la définition plus stricte.
Les deux études pointent dans la même direction sous des angles différents. L'une montre que les modèles peuvent laisser fuiter qui figurait dans leurs données d'entraînement. L'autre montre qu'ils ne sont pas fiables au stade de raisonnement où la valeur clinique est la plus élevée. Aucun des deux résultats n'est fatal en soi, et aucun n'exclut un déploiement utile dans des cadres étroits et bien supervisés.
Ce qu'ils sapent, c'est l'hypothèse selon laquelle les audits de confidentialité et les référentiels de performance actuels suffisent ensemble à certifier une IA médicale comme sûre. Les auteurs de l'étude de Nature veulent que les normes d'audit soient réécrites pour rapporter le risque au niveau individuel. L'équipe de JAMA veut que les affirmations marketing sur les agents diagnostiques correspondent aux preuves. Les deux demandent la même chose : une évaluation qui reflète comment ces systèmes échouent, pas comment ils réussissent en moyenne.
Sources
2- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.