Medizin-KI-Modelle verraten, welche Patienten sie trainiert haben
Forscher aus Deutschland haben gezeigt, dass sich medizinische KI-Modelle so abfragen lassen, dass sie verraten, ob die Daten eines bestimmten Patienten in ihrem Trainingssatz lagen. Auf der Ebene einzelner Personen sei das nahezu perfekt gelungen, schreiben sie.

Die Ergebnisse erschienen am Mittwoch, dem 24. Juni, in einem Nature-Aufsatz und wurden am selben Tag von The Register aufgegriffen. Sie umfassen sieben medizinische KI-Datensätze aus Bildern, EKG-Aufzeichnungen und allgemeinen elektronischen Gesundheitsakten. Das Team dahinter schreibt, aktuelle Datenschutzprüfungen übersähen das Risiko, weil sie den Angriffserfolg im Durchschnitt messen statt Patient für Patient.
Die Angriffsklasse ist nicht neu. Neu ist, wie gut sie bei medizinischen Modellen funktioniert.
Membership-Inference-Angriffe (MIA) fragen ein Modell ab, um herauszufinden, ob ein bestimmter Datenpunkt in seinem Trainingssatz lag. Diskriminative Modelle, also die Art, mit der Daten klassifiziert und Vorhersagen über neue Eingaben getroffen werden, lassen sich laut den Forschern besonders leicht auf diese Weise prüfen. In ihrer Analyse ließen sich einzelne Patienten, auf die solche Angriffe zielten, mit dem identifizieren, was der Aufsatz einen nahezu perfekten Angriffserfolg nennt. Das ist wichtig, weil eine bestätigte Zugehörigkeit zum Trainingssatz selbst schon eine Offenlegung ist. Wurde ein Modell auf einer Kohorte einer spezialisierten Klinik trainiert, kann der Nachweis, dass die Akte einer Person in dieser Kohorte liegt, eine Diagnose verraten, die sie nie teilen wollte.
Unterrepräsentierte Patienten lassen sich leichter herausfiltern
Der Aufsatz fand außerdem, dass Patienten, die in einem Trainingssatz Ausreißer sind, leichter zu identifizieren sind als andere. Hautfarbe, Versicherungsstatus, Geschlecht, das verwendete Bildgebungsprotokoll und bestimmte Krankheitszustände können laut den Forschern alle als Ausreißer wirken.
Moritz Knolle leitet den Lehrstuhl für KI in Gesundheit und Medizin an der Technischen Universität München und ist Erstautor des Aufsatzes. In einem E-Mail-Austausch mit The Register brachte er den Zielkonflikt auf den Punkt. "Im Allgemeinen werden Datenschutzrisiken durch MIA schwerwiegender, je spezifischer die Trainingskohorte eines Modells wird", sagte er. Ein Beispiel: "Man könnte sich ... Szenarien vorstellen, in denen die Zugehörigkeit zu einem Trainingsdatensatz verrät, dass jemand eine ruhende genetische Erkrankung wie Chorea Huntington oder Depressionen hat oder eine bestimmte, spezialisierte Behandlungsklinik besucht hat."
Die Forscher berichten von einem weiteren Effekt, der in die falsche Richtung läuft. Größere Datensätze machen Akten leichter angreifbar, nicht schwerer. Der Aufsatz stellt fest, dass das Ausmaß dieser Verschiebung des Risikos auf Patientenebene für größere Modelle bisher nicht gemessen worden war.
Was ein Angreifer tatsächlich braucht
Nichts davon bedeutet, dass ein Fremder auf ein Modell zeigen und Namen herausziehen kann. Ein MIA setzt voraus, dass der Angreifer bereits einen Datenpunkt besitzt, den er testen will. Knolle bestätigte das, merkte aber an, dass der Aufsatz eingrenzt, wie viele Daten dafür nötig sind.
"Für einen MIA braucht ein Angreifer Zugang zu einem Zieldatenpunkt", sagte er zu The Register. "In unserem Aufsatz zeigen wir, dass ein Angreifer mit teilweisem Zugang MIA weiterhin erfolgreich durchführen kann."
Der Mechanismus ist die Konfidenz. Medizinische KI ist meist sicherer, wenn die Eingabe in ihrem Trainingssatz lag. Ein Angreifer speist also beschaffte Patientendaten ein, liest das Konfidenzniveau ab und schließt daraus auf die Zugehörigkeit. Knolle sagte, der Angreifer müsse nicht wissen, wem die Daten gehören. Alle im Aufsatz verwendeten Datensätze seien anonymisiert gewesen, fügte er hinzu, was nicht vor dieser Art von Rückschluss schütze. "Der Angreifer müsste einfach Zugang zu den Bluttestergebnissen einer Person haben, oder zu einem Teil dieser Ergebnisse", um auf die Zugehörigkeit zu schließen, sagte Knolle. Woher diese Daten kommen, verortete er eher in der Routine als in exotischem Eindringen: "Da medizinische Daten nicht immer sicher gespeichert sind, ist es nicht undenkbar, dass ein Angreifer Zugang erlangen könnte, etwa durch unbefugten Zugriff auf die Datenbank Ihres Hausarztes, nachdem dieser einen Routinetest durchgeführt hat."
Empfehlungen und ein Vorbehalt
Die Empfehlungen des Teams sind nicht exotisch. Sie wollen Differential-Privacy-Rahmenwerke dort, wo das Risiko es rechtfertigt. Standards für Datenschutzprüfungen sollen neu geschrieben werden, damit sie das Risiko auf Individualebene statt im Durchschnitt bewerten. Trainingsdaten sollen so zusammengestellt werden, dass unterrepräsentierte Gruppen besser vertreten sind statt als Ausreißer zurückzubleiben.
Knolle fasste sein Ziel eng. "Ich hoffe, dass die medizinische KI-Community beginnt, Datenschutzrisiken ernst zu nehmen, und dass Techniken zur Risikominderung in Situationen eingesetzt werden, in denen sie nötig sind", sagte er. Er widersprach auch der Behandlung jedes erfolgreichen Angriffs als Skandal. "Es gibt viele Situationen, in denen ein erfolgreicher MIA einen kleinen oder vernachlässigbaren Datenschutzverstoß darstellt", merkte er an, und beschrieb Modelle, die auf großen, allgemeinen Populationen trainiert wurden, in denen gesunde und kranke Personen vorkommen.
Der regulatorische Kontext, in den der Aufsatz fällt, ist dicht, aber arm an Konkretem. Der Bericht von The Register merkt an, dass sich Berichtsstandards für KI-Datenschutzprüfungen ändern müssen, was ebenso eine Aufforderung an Prüfer und Fachzeitschriften ist wie an Anbieter. Nichts im Aufsatz schlägt ein neues Zertifizierungssystem vor, und keine Aufsichtsbehörde wird genannt, die seine Empfehlungen übernommen hätte.
Es gibt eine zweite, separate Arbeit, die aus einem anderen Blickwinkel in dieselbe Richtung weist: ob diese Systeme überhaupt diagnostische Entscheidungen treffen sollten. Eine Studie unter Leitung des Harvard-Medizinstudenten Arya Rao, veröffentlicht in JAMA Network Open und am 15. April von The Register behandelt, testete 21 handelsübliche KI-Modelle an 29 standardisierten klinischen Vignetten. Die Modelle lagen zu 91 Prozent richtig, wenn sie ein vollständiges Informationsportfolio erhielten und nach einer endgültigen Diagnose gefragt wurden.
Die frühe Differenzialdiagnose, also die Phase, in der Kliniker Erkrankungen abwägen und ausschließen und dabei Unsicherheit einordnen, scheiterte nach der strengen Definition des Aufsatzes in mehr als 8 von 10 Fällen. "Jedes Modell, das wir getestet haben, scheiterte in der überwiegenden Mehrheit der Fälle", sagte Rao zu The Register. "Das ist die Phase, in der Unsicherheit am wichtigsten ist, und dort sind diese Systeme am schwächsten."
Rao warnte auch davor, die Fehlerquote als völligen Zusammenbruch zu lesen. Gemessen als rohe Genauigkeit pro Fall erreichten die Modelle zwischen 63 und 78 Prozent, was laut ihr darauf hindeutet, dass sie oft teilweise richtig lagen. Mitautor Dr. Marc Succi, Radiologe am Massachusetts General Hospital, sagte, höhere Werte bei der endgültigen Diagnose sollten niemanden beruhigen. "Echtes klinisches Denken beginnt früher, wenn die Mehrdeutigkeit am größten ist, und genau dort bleiben sie am schwächsten", sagte er zu The Register.
Legt man die beiden Aufsätze nebeneinander, schärft sich die regulatorische Frage. Ein Modell, das verraten kann, wer es trainiert hat, und trotzdem die meisten frühen Differenziale verfehlt, wird für die Erstversorgung angepriesen. Die Prüfungen, mit denen es zugelassen wird, messen keines der beiden Risiken auf der Ebene, auf der es wirkt.
Quellen
2- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.