Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Datenschutz-Audits für medizinische KI übersehen das Wichtigste: einzelne Patienten

Diagnostische KI-Modelle in der Medizin lassen sich dazu bringen, zu verraten, ob die Daten eines bestimmten Patienten Teil ihres Trainingssatzes waren. Deutsche Forscher sagen, die übliche Datenschutzprüfung solcher Modelle erfasst das nicht.

GesundheitAnalyseHanna VogtVeröffentlicht: 27. September 20265 Min. LesezeitQuellen 2
Datenschutz-Audits für medizinische KI übersehen das Wichtigste: einzelne Patienten

Deutsche Forscher haben am Mittwoch eine Arbeit in Nature veröffentlicht. Darin heißt es, diskriminative medizinische KI-Modelle seien besonders anfällig für Membership-Inference-Angriffe (MIA). Gemeint sind Modelle, die Daten klassifizieren und Vorhersagen über neue Eingaben treffen. The Register berichtete am 24. Juni über die Ergebnisse.

Bei einem MIA fragt ein Angreifer das Modell ab, um herauszufinden, ob ein bestimmter Datenpunkt im Trainingssatz enthalten war. Bei medizinischer KI heißt das: Ein Patient, dessen Akten zur Ausbildung des Modells beigetragen haben, kann exponiert werden. Details seiner Krankengeschichte und Diagnosen dringen dann nach außen. Das Team untersuchte sieben medizinische KI-Datensätze mit Bildern, EKG-Aufzeichnungen und allgemeinen elektronischen Gesundheitsakten. Einzelne Patienten, die Ziel solcher Angriffe waren, ließen sich nach Angaben der Autoren mit nahezu perfekter Erfolgsquote identifizieren.

Aggregierte Kennzahlen verdecken das Problem

Die Forscher argumentieren, dass die derzeitige Sicherheitsbewertung medizinischer KI-Modelle diese Erfolgsquote nicht erfasst. "Dass MIAs bei einzelnen Patienten nahezu perfekte Erfolgsquoten erreichen können, wird vom Standardbewertungsprotokoll nicht angemessen erfasst, das Angriffserfolg aggregiert über Datensätze misst", schrieben sie. Daraus folgern sie, dass sich die Berichtsstandards für Datenschutz-Audits von KI ändern müssen. Unterrepräsentierte Patienten sind leichter zu identifizieren als andere. Herkunft, Versicherungsstatus, Geschlecht, das bei der medizinischen Bildgebung verwendete Protokoll und bestimmte Krankheitszustände können laut der Arbeit als Ausreißer wirken. Diese Ausreißer erleichtern die Membership Inference.

"Generell werden die Datenschutzrisiken durch MIAs schwerwiegender, je spezifischer die Trainingskohorte eines Modells wird", sagte Moritz Knolle, Leiter des Lehrstuhls für KI in Gesundheit und Medizin an der Technischen Universität München und Erstautor der Arbeit, per E-Mail an The Register.

Knolle nannte Beispiele, was diese Spezifität offenlegen könnte. "Man kann sich Szenarien vorstellen, in denen die Zugehörigkeit zu einem Trainingsdatensatz verrät, dass jemand eine ruhende genetische Erkrankung wie Chorea Huntington hat, an Depressionen leidet oder eine bestimmte spezialisierte Behandlungsklinik aufgesucht hat", sagte er. Größere Datensätze lösen das Problem nicht. Laut dem Bericht von The Register über die Arbeit gilt: Je größer der Datensatz, desto leichter lassen sich Datensätze offenlegen. "Das Ausmaß dieser Veränderung des Risikos auf Patientenebene war zuvor unbekannt", heißt es dort mit Blick auf größere Modelle.

Was ein Angreifer tatsächlich braucht

Ein MIA ist kein Angriff aus der Ferne ohne Eingabe. Knolle bestätigte, dass ein Angreifer für dessen Durchführung Zugang zu einem Zieldatenpunkt benötigt. Die Forschung entkräftet jedoch auch eine Annahme, die diese Angriffe bisher unpraktikabel erscheinen ließ: Der Zugang zu einer vollständigen Patientenakte ist nicht nötig. "In unserer Arbeit zeigen wir, dass ein Angreifer mit teilweisem Zugang MIAs weiterhin erfolgreich durchführen kann", sagte Knolle zu The Register.

Der Angriff selbst nutzt die Konfidenz des Modells aus. Medizinische KI ist sich ihrer Vorhersagen tendenziell sicherer, wenn die Eingabedaten bereits Teil ihres Trainingssatzes waren. Ein Angreifer speist die von ihm beschafften Patientendaten in das Modell ein, prüft das Konfidenzniveau und schließt daraus, dass der Patient in den Trainingsdaten enthalten ist.

"Ein Angreifer, der eine MIA durchführt, muss nicht wissen, wem die Daten gehören, mit denen er die MIA durchführen will", sagte Knolle. "Tatsächlich waren alle Datensätze, die wir in unserer Studie verwenden, anonymisiert." Die Datensätze waren anonymisiert, die Zieldaten nicht. Die Arbeit berichtet, dass die MIA-Angriffe auf Ebene einzelner Patienten weitgehend fehlerfrei waren. Konfidenzniveaus sind also ein genaues Signal dafür, ob die Daten eines bestimmten Patienten in einem Trainingssatz liegen. In der Praxis, so Knolle, "müsste der Angreifer einfach Zugang zu den Bluttestergebnissen von jemandem haben, oder zu einem Teil dieser Ergebnisse", um auf die Zugehörigkeit zu schließen. Diese Daten zu beschaffen, ist die verbleibende Hürde, und aus Knolles Sicht keine große. "Da medizinische Daten nicht immer sicher gespeichert werden, ist es nicht undenkbar, dass ein Angreifer Zugang erlangen könnte, etwa durch unbefugten Zugriff auf die Datenbank des Hausarztes, nachdem dieser einen Routinebluttest durchgeführt hat", sagte er.

Empfehlungen und eine Einschränkung

Die Forscher geben mehrere Empfehlungen. Eine ist die Nutzung von Differential-Privacy-Frameworks, die mathematisch garantieren sollen, dass Trainingsdaten anonym bleiben. Eine weitere ist die Reform der Datenschutz-Auditstandards, damit sie Risiken auf individueller Ebene berücksichtigen und nicht nur aggregierte Datenschutzrisiken. Eine dritte Option, so Knolle, ist die Zusammenstellung medizinischer KI-Trainingsdaten so, dass unterrepräsentierte Gruppen besser vertreten sind. Knolle nannte auch eine Grenze dafür, wie alarmierend eine einzelne MIA sein sollte. "Es gibt viele Situationen, in denen eine erfolgreiche MIA einen geringen oder vernachlässigbaren Datenschutzverstoß darstellt", merkte er an und verwies auf KI-Modelle, die auf großen allgemeinen Populationen trainiert wurden, in denen sowohl gesunde als auch kranke Personen vertreten sind. Gefragt, was er sich von der Forschung erhofft, sagte Knolle, er wolle, dass die medizinische KI-Community Datenschutzrisiken ernst nimmt und Risikominderungstechniken einsetzt, wo sie nötig sind.

Der andere Fehlermodus

Datenschutz ist nicht die einzige dokumentierte Schwäche medizinischer KI. Im April berichtete The Register über eine in JAMA Network Open veröffentlichte Studie, die 21 führende Standard-KI-Modelle anhand von 29 standardisierten klinischen Vignetten untersuchte. Die Modelle schnitten bei der endgültigen Diagnose gut ab, wenn ihnen ein vollständiges Portfolio medizinischer Informationen vorlag, wobei führende Modelle in 91 Prozent der Fälle richtig lagen. Die frühe Differenzialdiagnose war eine andere Geschichte. Die Studie fand in dieser Phase eine Fehlerquote von über 80 Prozent. "Jedes Modell, das wir getestet haben, versagte in der überwiegenden Mehrheit der Fälle", sagte Erstautor Arya Rao, Medizinstudent in Harvard, zu The Register. "Das ist die Phase, in der Unsicherheit am wichtigsten ist, und genau dort sind diese Systeme am schwächsten."

Rao fügte hinzu, dass die strenge Fehlermetrik nicht die einzige Art sei, die Daten zu lesen. Die rohe Genauigkeit, als Anteil richtiger Fälle, lag zwischen 63 und 78 Prozent. Laut Rao deutet das darauf hin, dass Modelle oft teilweise richtig lagen, selbst wenn sie keine vollständig korrekte Differenzialdiagnose lieferten. Dr. Marc Succi, Radiologe am Massachusetts General Hospital und Mitautor, sagte, die höhere Erfolgsquote bei der endgültigen Diagnose sollte nicht beruhigen. "Echtes klinisches Denken beginnt früher, wenn die Mehrdeutigkeit am größten ist, und genau dort bleiben sie am schwächsten", sagte er zu The Register. Eine falsche Differenzialdiagnose kann zu Verzögerungen bei der Versorgung führen, zu unnötigen Eingriffen mit Komplikationen und zu hohen Kosten.

Beide Arbeiten zeigen dieselbe Lücke zwischen der Art, wie medizinische KI gemessen wird, und der Art, wie sie eingesetzt wird. Die eine misst Datenschutz aggregiert, während einzelne Patienten identifizierbar bleiben. Die andere bewertet endgültige Antworten, während die frühere, unsicherere Phase des Denkens unzuverlässig bleibt.

Kommentare 0

Quellen

2
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Hanna Vogt

Hanna Vogt

Wissenschaft und Gesundheit

Hanna Vogt schreibt für FLASH24 über Wissenschaft und Gesundheit und stützt sich dabei auf Primärstudien, Behördenberichte und Rohdaten statt auf Pressemitteilungen. Bei Zahlen prüft sie Stichprobengrößen, Konfidenzintervalle und ob die zitierte Quelle die Aussage tatsächlich deckt. Für ihre Texte spricht sie mit Studienautorinnen, wartet auf Peer-Review-Fassungen und vergleicht Vorabdrucke mit der finalen Publikation. Dass sie privat Materialphysik verfolgt und mit eigenem Teleskop den Himmel beobachtet, erklärt, warum sie bei Messmethoden und Instrumenten genau nachfragt. Sie publiziert keine Ergebnisse, deren Datengrundlage sie nicht selbst eingesehen hat.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.