Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Medizinische Diagnose-KIs verraten, wer sie trainiert hat, und die Regeln greifen nicht

Medizinische KI-Modelle, die bei der Diagnose von Patienten helfen, erkennen mit "nahezu perfektem Angriffserfolg", wessen Daten sie trainiert haben. Das berichteten deutsche Forscher in einer am 24. Juni veröffentlichten Arbeit in Nature. Die Standards für Datenschutzprüfungen messen das Risiko nicht auf der Ebene, auf der es wirksam wird, sagen sie.

GesundheitAnalyseHanna VogtVeröffentlicht: 27. September 20265 Min. LesezeitQuellen 2
Medizinische Diagnose-KIs verraten, wer sie trainiert hat, und die Regeln greifen nicht

Die Erkenntnis, über die The Register am 24. Juni berichtete, stammt von einem Team unter der Leitung von Moritz Knolle. Er leitet den Lehrstuhl für KI in Gesundheitswesen an der Technischen Universität München. Die Arbeit testet Membership-Inference-Angriffe (MIAs) gegen sieben medizinische KI-Datensätze aus Bildern, EKG-Aufzeichnungen und allgemeinen elektronischen Gesundheitsakten. Die Modelle sind diskriminativ: Sie klassifizieren Eingaben und treffen Vorhersagen auf Basis dessen, womit sie trainiert wurden.

Ein MIA nutzt eine einfache Eigenheit. Ein Modell ist bei Eingaben, die es schon gesehen hat, tendenziell sicherer. Man gibt ihm eine Akte, liest den Konfidenzwert ab und kann daraus schließen, ob diese Akte im Trainingssatz war. Laut Knolle muss "ein Angreifer, der eine MIA durchführt, nicht wissen, wem die Daten gehören, mit denen er die MIA durchführen will". Alle in der Studie verwendeten Datensätze waren anonymisiert.

Unterrepräsentierte Patienten sind leichter zu identifizieren

Die Untersuchung ergab, dass sich Patienten in einem Datensatz generell leicht herausfiltern lassen. Bei denen, die in den Trainingsdaten unterrepräsentiert sind, geht das noch leichter. Herkunft, Versicherungsstatus, Geschlecht, das verwendete Bildgebungsprotokoll und bestimmte Krankheitszustände können als Ausreißer wirken und einen Einzelnen hervorheben.

Generell werden Datenschutzrisiken durch MIAs schwerwiegender, je spezifischer die Trainingskohorte eines Modells wird. Man kann sich Szenarien vorstellen, in denen die Zugehörigkeit zu einem Trainingsdatensatz verrät, dass jemand eine ruhende genetische Erkrankung wie Chorea Huntington oder eine Depression hat oder eine bestimmte Fachklinik besucht hat.

Das Zitat stammt von Knolle, der The Register per E-Mail antwortete. Die Folge ist nicht abstrakt: Wer weiß, dass die Daten einer Person in einer spezialisierten Kohorte liegen, kann damit eine Diagnose offenlegen, die diese Person nie preisgeben wollte. Das kann auch Diskriminierung bei Versicherungen, im Beruf oder anderswo begünstigen.

Die Größe macht es schlimmer, nicht besser. Die Arbeit ergab, dass sich Akten umso leichter offenlegen lassen, je größer der Datensatz ist. "Das Ausmaß dieser Veränderung des Risikos auf Patientenebene" sei bei größeren Modellen "zuvor unbekannt" gewesen. Das widerspricht der verbreiteten Annahme, dass größere Trainingssätze die Exposition des Einzelnen verdünnen.

Die Prüfzahlen verfehlen den Punkt

Hier beginnt das regulatorische Argument. Der nahezu perfekte Erfolg gegen einzelne Patienten werde "nicht ausreichend durch das Standardbewertungsprotokoll erfasst, das den Angriffserfolg aggregiert über die Akten misst", sagen die Forscher. Eine Prüfung kann also eine niedrige durchschnittliche Angriffserfolgsrate melden, während einzelne Patienten trivial identifizierbar bleiben. Das Team schließt daraus, dass sich die Berichtsstandards für KI-Datenschutzprüfungen ändern müssen.

Knolles Empfehlungen betreffen zwei Bereiche. Der erste ist technisch: Frameworks für differenziellen Datenschutz, die eine mathematische Garantie dafür geben sollen, dass Trainingsdaten anonym bleiben. Der zweite ist verfahrenstechnisch und verlagert Prüfungen vom aggregierten Datenschutzrisiko auf das Risiko auf Individualebene. Er schlägt außerdem eine direktere Korrektur vor: medizinische KI-Trainingsdaten so zusammenzustellen, dass unterrepräsentierte Gruppen von vornherein besser vertreten sind. "Ich hoffe, dass die medizinische KI-Community beginnen wird, Datenschutzrisiken ernst zu nehmen, und dass Techniken zur Risikominderung dort eingesetzt werden, wo sie nötig sind", sagte er zu The Register.

Für all das gibt es eine reale Voraussetzung. Um eine MIA durchzuführen, braucht ein Angreifer mindestens einige Daten, die zum Ziel gehören. Knolle sagte, die Arbeit zeige, dass eine vollständige Patientenakte nicht erforderlich ist, anders als bisher angenommen: "In unserer Arbeit zeigen wir, dass ein Angreifer mit teilweisem Zugang noch erfolgreich MIAs durchführen kann." Er nannte das Beispiel von Bluttestergebnissen oder Teilen davon, die ausreichen, um die Zugehörigkeit abzuleiten. Außerdem verwies er auf die routinemäßige Preisgabe von Gesundheitsdaten bei Datenschutzverletzungen. "Da medizinische Daten nicht immer sicher gespeichert sind, ist es nicht undenkbar, dass ein Angreifer Zugang erlangen könnte, zum Beispiel durch unbefugten Zugriff auf die Datenbank Ihres Hausarztes, nachdem dieser einen routinemäßigen Bluttest durchgeführt hat", sagte er.

Knolle war vorsichtig, den Schaden nicht in jedem Fall zu übertreiben. "Es gibt viele Situationen, in denen eine erfolgreiche MIA eine geringe oder vernachlässigbare Datenschutzverletzung darstellt", bemerkte er. Er verwies auf Modelle, die auf großen, allgemeinen Populationen trainiert wurden, in denen gesunde und kranke Personen in ausreichender Zahl vertreten sind. Das Risiko konzentriert sich dort, wo die Kohorten eng sind.

Auch die Diagnosemodelle selbst sind schwach

Datenschutz ist nur eines von zwei Problemen, die in derselben Ecke der medizinischen KI sichtbar sind. Eine im April in JAMA Network Open veröffentlichte Studie, über die The Register am 15. April berichtete, testete 21 handelsübliche KI-Modelle an 29 standardisierten klinischen Vignetten. Die Modelle lagen bei der endgültigen Diagnose in 91 Prozent der Fälle richtig, wenn sie ein vollständiges Informationsportfolio erhielten. Bei der frühen Differenzialdiagnose, der Phase, in der Kliniker Erkrankungen noch ausschließen und bestätigen, versagten sie in mehr als 8 von 10 Fällen.

Die Studie wurde von dem Harvard-Medizinstudenten Arya Rao geleitet. "Jedes Modell, das wir getestet haben, versagte in der überwiegenden Mehrheit der Fälle", sagte Rao zu The Register. "Das ist die Phase, in der Unsicherheit am wichtigsten ist, und dort sind diese Systeme am schwächsten." Mitautor Dr. Marc Succi, Radiologe am Massachusetts General Hospital, sagte, die Modelle "können Sicherheit ausstrahlen, ohne starkes Schlussfolgern zu zeigen, besonders bei der Differenzialdiagnose". Er warnte, dass diese Sicherheit die Angst von Patienten schüren kann, die sich ohnehin schon Sorgen um ihre Gesundheit machen. Rao merkte auch an, dass die strenge Fehlermetrik hart ist: Gemessen als reine Genauigkeit erreichten die Modelle Werte zwischen 63 und 78 Prozent, oft teilweise richtig statt völlig falsch.

Legt man die beiden Arbeiten nebeneinander, wird die regulatorische Lücke größer. Die Datenschutzarbeit sagt, Prüfungen messen das Falsche auf der falschen Ebene, und Anbieter bräuchten einen Anreiz, Trainingsdaten zu sichern. Die Diagnosearbeit sagt, die Vermarktung dieser Systeme als Frontlinien-Agenten "riskiert, falsches Vertrauen genau dort zu fördern, wo sie am wenigsten zuverlässig sind", und dass man "LLMs noch nicht für Entscheidungen an vorderster Front vertrauen kann". In beiden Fällen ist das Versagen eines, das aggregierte Benchmarks und Produktversprechen verbergen können.

Was die Forscher fordern, ist enger als ein Verbot. Ändert, wie Datenschutzprüfungen Risiken berichten, damit einzelne Patienten zählen. Nutzt differenziellen Datenschutz dort, wo Kohorten sensibel sind. Balanciert Trainingsdaten aus, damit Ausreißer keine Ausreißer sind. Und behandelt die Modelle als Werkzeuge, die menschliche Prüfung brauchen, statt als Torwächter. Nichts davon erfordert neue Wissenschaft. Es erfordert Bewertungsregime, die das messen, was einem Patienten tatsächlich schaden kann.

Kommentare 0

Quellen

2
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Hanna Vogt

Hanna Vogt

Wissenschaft und Gesundheit

Hanna Vogt schreibt für FLASH24 über Wissenschaft und Gesundheit und stützt sich dabei auf Primärstudien, Behördenberichte und Rohdaten statt auf Pressemitteilungen. Bei Zahlen prüft sie Stichprobengrößen, Konfidenzintervalle und ob die zitierte Quelle die Aussage tatsächlich deckt. Für ihre Texte spricht sie mit Studienautorinnen, wartet auf Peer-Review-Fassungen und vergleicht Vorabdrucke mit der finalen Publikation. Dass sie privat Materialphysik verfolgt und mit eigenem Teleskop den Himmel beobachtet, erklärt, warum sie bei Messmethoden und Instrumenten genau nachfragt. Sie publiziert keine Ergebnisse, deren Datengrundlage sie nicht selbst eingesehen hat.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.