Conformité à l'AI Act et IA de diagnostic médical : ce que disent vraiment les règles
Les IA de diagnostic médical se vendent plus vite que les régulateurs ne peuvent les auditer. Trois études récentes pointent le même problème : ces modèles sont difficiles à vérifier, à sécuriser et à quantifier.

La question réglementaire n'est pas de savoir si une IA peut diagnostiquer. Elle est de savoir si quelqu'un peut prouver avec quelle fiabilité elle le fait. Deux articles parus à quelques mois d'intervalle montrent l'ampleur de l'écart.
Le 24 juin 2026, des chercheurs de l'université technique de Munich ont publié dans Nature un résultat inquiétant : les modèles d'IA médicale utilisés pour le diagnostic sont vulnérables aux attaques par inférence d'appartenance (MIA). Ces requêtes cherchent à déterminer si le dossier d'un patient donné a servi à l'entraînement du modèle. The Register a repris l'article le jour même. L'équipe a testé sept jeux de données d'IA médicale, couvrant des images, des enregistrements d'ECG et des dossiers de santé électroniques généraux. Des patients pris individuellement peuvent être identifiés, avec ce que les auteurs appellent un taux de réussite quasi parfait.
C'est un problème de vie privée. C'est aussi un problème de mesure. Les chercheurs le disent eux-mêmes : le protocole d'évaluation standard mesure le succès des attaques de manière agrégée sur l'ensemble des dossiers. Il ne rend donc pas compte de ces taux quasi parfaits pour des patients individuels. Autrement dit, un audit qui rapporte une moyenne peut passer à côté du cas individuel.
Ce que les règles exigent, et ce qu'elles manquent
L'AI Act européen est le cadre le plus souvent cité dans ce débat, et le dossier disponible ici reste pauvre sur son détail opérationnel. Ce que les sources montrent, c'est un écart entre le langage de conformité employé par les vendeurs et la recherche en sécurité publiée sur la même période.
Un projet GitHub, srta-ai-accountability, se présente comme le premier système à traiter les questions de pourquoi dans l'IA explicable, avec 94 % de conformité à l'AI Act. Il est explicitement étiqueté comme prototype de recherche et architecture conceptuelle. Voilà où en est au moins une partie de l'outillage de responsabilité : une affirmation de 94 % de conformité, publiée sur un dépôt de code, sans autorité de régulation rattachée au chiffre.
L'article de Munich va dans une autre direction. Ses auteurs veulent que les normes de déclaration des audits de confidentialité de l'IA changent, pour que le risque au niveau individuel compte, pas seulement le risque agrégé. Ils recommandent aussi des cadres de confidentialité différentielle, conçus pour garantir mathématiquement que les données d'entraînement restent anonymes. Ils suggèrent enfin que les données d'entraînement soient compilées de façon à mieux représenter les groupes sous-représentés.
L'auteur principal, Moritz Knolle, a déclaré à The Register que les risques de vie privée liés aux MIA deviennent plus graves à mesure que la cohorte d'entraînement d'un modèle devient plus spécifique. Il a donné l'exemple d'une appartenance à un jeu de données d'entraînement qui révèle qu'une personne a une maladie génétique dormante comme la maladie de Huntington, une dépression, ou qu'elle a fréquenté une clinique spécialisée précise.
Les affirmations de précision que les régulateurs devront peser
La performance diagnostique est l'autre moitié du problème réglementaire, et les chiffres ici sont particulièrement confus.
Microsoft a annoncé son AI Diagnostic Orchestrator (MAI-DxO) le 30 juin 2025. GeekWire a rapporté que l'outil a battu 21 médecins expérimentés des États-Unis et du Royaume-Uni sur des cas complexes du New England Journal of Medicine, avec un score de 85,5 % contre 20 % pour les médecins. WIRED, qui a couvert le même travail le 1er juillet 2025, avance le chiffre de 80 % contre 20 % et indique que le système réduisait les coûts de 20 % en sélectionnant des tests moins chers. Le banc d'essai a été construit à partir de 304 cas récents du NEJM.
Ces chiffres comportent une réserve, présente dans les deux comptes rendus. Les médecins de l'étude n'étaient pas autorisés à consulter des collègues ni à utiliser des ressources externes, ce qui ne correspond pas à la façon dont travaillent les cliniciens. Le scientifique du MIT David Sontag a déclaré à WIRED que les conclusions de Microsoft devaient être traitées avec prudence pour cette raison précise, et qu'il restait à voir si le système réduirait les coûts en pratique. Microsoft a elle-même indiqué que l'outil aurait besoin de tests cliniques et d'une autorisation réglementaire avant déploiement.
Il y a ensuite le cas d'échec. Le 15 avril 2026, The Register a rapporté une étude publiée dans JAMA Network Open, dirigée par l'étudiant en médecine de Harvard Arya Rao. Elle a testé 21 modèles d'IA courants du commerce contre 29 vignettes cliniques standardisées. Les modèles étaient corrects 91 % du temps lorsqu'on leur demandait un diagnostic final avec toutes les informations. Mais en diagnostic différentiel précoce, l'étape où les cliniciens incluent ou excluent des pathologies, ils ont échoué dans plus de 8 cas sur 10.
Tous les modèles que nous avons testés ont échoué sur la grande majorité des cas, a déclaré Rao à The Register. C'est l'étape où l'incertitude compte le plus, et c'est là que ces systèmes sont les plus faibles.
Le radiologue du Massachusetts General Hospital, le Dr Marc Succi, coauteur, a déclaré à la même publication que les modèles du commerce actuels ne devraient pas être utilisés pour le raisonnement diagnostique face au patient sans une revue humaine structurée et complète. Il a aussi affirmé que des taux de réussite plus élevés en diagnostic final ne devraient pas rassurer, parce que le vrai raisonnement clinique commence plus tôt, quand l'ambiguïté est la plus forte.
Ce qu'un régulateur devrait tester
Mettez les trois résultats côte à côte et le problème d'audit devient concret.
- Vie privée : des patients individuels d'un ensemble d'entraînement peuvent être identifiés avec un fort taux de réussite, et les groupes sous-représentés sont plus faciles à identifier que les autres. La déclaration agrégée masque ce fait.
- Performance : la même classe de modèle peut obtenir 91 % en diagnostic final et échouer dans plus de 80 % des cas de diagnostic différentiel précoce.
- Conception du banc d'essai : le résultat phare de Microsoft provient d'un test où les médecins humains travaillaient sans les ressources qu'ils utilisent normalement.
Rien de tout cela ne signifie que l'IA médicale ne peut pas être régulée. Cela signifie que les instruments actuels mesurent la mauvaise unité. Un score de confidentialité agrégé, un taux d'exactitude sur la réponse finale et un banc d'essai exécuté sous contraintes artificielles sont tous faciles à publier et difficiles à falsifier.
Knolle a dit espérer que la communauté de l'IA médicale commence à prendre les risques de vie privée au sérieux et que les techniques d'atténuation des risques soient utilisées là où elles sont nécessaires. Il a aussi noté qu'il existe de nombreuses situations où une MIA réussie représente une violation de la vie privée faible ou négligeable, par exemple des modèles entraînés sur de grandes populations générales.
La question non résolue est de savoir qui décide dans quelle situation se trouve un modèle donné. Selon l'AI Act européen, cette décision est censée revenir au fournisseur et à l'auditeur, pas aux auteurs de l'article ni à un dépôt qui s'attribue 94 %.
Sources
5- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02Microsoft AI tool outperforms doctors in diagnosing complex medical casesEN
- 03Microsoft Says New AI Diagnosed Patients 4 Times More Accurately Than DoctorsEN
- 04LLMs fail in 8 out of 10 early differential diagnosis casesEN
- 05srta-ai-accountability: AI Accountability FrameworkEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.