Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Medizinische KI verrät, welche Patienten im Training steckten

Medizinische Diagnose-KI lässt sich dazu bringen, preiszugeben, ob die Daten eines bestimmten Patienten zum Training verwendet wurden. Das berichten deutsche Forscher in einer am Mittwoch veröffentlichten Arbeit in Nature. Bei einzelnen Patienten gelingt das nahezu perfekt. Der Befund fällt in eine Zeit, in der FDA, EU und WHO die Regeln für die Prüfung solcher Geräte noch schreiben.

GesundheitAnalyseHanna VogtVeröffentlicht: 27. September 20266 Min. LesezeitQuellen 4
Medizinische KI verrät, welche Patienten im Training steckten

Der Angriff heißt Membership Inference Attack, kurz MIA. Wie The Register am 24. Juni berichtete, untersuchte das Team sieben medizinische KI-Datensätze mit Bildern, EKG-Aufzeichnungen und allgemeinen elektronischen Gesundheitsakten. Einzelne Patienten, auf die solche Angriffe zielen, lassen sich mit nahezu perfektem Angriffserfolg identifizieren, wie die Forscher es nennen. Diese Zahl erfasse das Standard-Evaluierungsprotokoll nicht, heißt es in der Arbeit, weil es den Angriffserfolg über alle Datensätze hinweg aggregiert misst.

Medizinische KI antwortet sicherer, wenn die Eingabedaten bereits in ihrem Trainingssatz liegen. Ein Angreifer speist Patientendaten in ein Modell ein, liest das Konfidenzniveau ab und schließt daraus, dass der Patient zur Trainingskohorte gehörte.

Moritz Knolle von der Technischen Universität München, Erstautor der Arbeit, sagte The Register, ein Angreifer müsse nicht wissen, wem die Daten gehören. "Tatsächlich waren alle Datensätze, die wir in unserer Studie verwenden, anonymisiert", sagte er. Teilzugriff reicht. "Der Angreifer bräuchte einfach Zugang zu den Bluttestergebnissen von jemandem, oder zu einem Teil dieser Ergebnisse."

Ausreißer lassen sich am leichtesten identifizieren

Das Muster, wer exponiert wird, ist unbequem. Unterrepräsentierte Gruppen in medizinischen Trainingsdaten sind leichter zu identifizieren als Patienten, deren Akten sich einfügen. Die Arbeit nennt Herkunft, Versicherungsstatus, Geschlecht, das verwendete Bildgebungsprotokoll und bestimmte Krankheitszustände als Kategorien, die als Ausreißer wirken können. Knolles Zusammenfassung für The Register: "Allgemein gesagt werden die Datenschutzrisiken durch MIAs schwerwiegender, je spezifischer die Trainingskohorte eines Modells wird."

Er nannte das Beispiel einer Trainingskohorte, die eine ruhende genetische Erkrankung wie Chorea Huntington verrät, oder eine Depression, oder den Besuch einer spezialisierten Behandlungsklinik. Die Mitgliedschaft selbst verrät also die Diagnose. Die Arbeit fand außerdem, dass größere Datensätze leichter zu exponieren sind. Wie stark sich das Risiko auf Patientenebene bei größeren Modellen verschiebt, war zuvor nicht bekannt.

Der Angreifer braucht einige medizinische Daten über die Personen, die er identifizieren will. Datenschutzverletzungen im Gesundheitswesen sind häufig genug, dass dies keine hohe Hürde ist. Knolle nannte das Szenario eines unbefugten Zugriffs auf die Datenbank eines Hausarztes nach einem Routinebluttest.

Sein erklärtes Ziel ist eng: dass die medizinische KI-Community Datenschutzrisiken ernst nimmt und Gegenmaßnahmen dort anwendet, wo sie nötig sind. Die Arbeit empfiehlt Frameworks für differenziellen Datenschutz. Sie sollen mathematisch garantieren, dass Trainingsdaten anonym bleiben. Außerdem fordert sie eine Neufassung der Datenschutz-Auditstandards, damit sie Risiken auf individueller Ebene messen statt aggregiert. Trainingsdaten so zusammenzustellen, dass unterrepräsentierte Gruppen besser vertreten sind, nannte er als weitere Option.

Die Regulierer holen noch die Grundlagen auf

Das fällt in ein regulatorisches Bild, das sich ungleichmäßig bewegt. IntuitionLabs beziffert in einem am 18. August aktualisierten Bericht die Zahl der von der FDA zugelassenen KI- und Machine-Learning-Geräte auf rund 950 bis Mitte 2024, mit etwa 100 neuen Zulassungen pro Jahr. Marktanalysten, die in demselben Bericht zitiert werden, bewerteten KI-gestützte Medizingeräte 2024 mit 13,7 Milliarden Dollar und prognostizierten mehr als 255 Milliarden Dollar bis 2033. Radiologie dominiert die Zulassungen, Kardiologie, Neurologie, Anästhesiologie und Ophthalmologie wachsen.

Derselbe Bericht merkt an, dass systematische Reviews nur einen winzigen Bruchteil der zugelassenen KI-Geräte durch randomisierte Studien oder Patientenergebnisdaten gestützt finden. Gerätefehlfunktionen wurden mit Verletzungen in Verbindung gebracht und in einem berichteten Fall mit einem Todesfall. Der Bericht zitiert ein ICU-Triage-Tool, das Schwarze Patienten für zusätzliche Betreuung unteridentifizierte, und Koloskopie-Studien, in denen die Erkennungsraten der Ärzte sanken, als sie sich auf KI stützten.

Speziell zum Datenschutz trifft die Forderung der Arbeit nach Audits auf individueller Ebene auf ein System, das für aggregierte Berichterstattung gebaut ist. FDA-Entscheidungszusammenfassungen lassen laut der IntuitionLabs-Überprüfung oft kritische Wirksamkeits- und Sicherheitsdetails weg, und die globale Einhaltung von Standards ist ungleichmäßig. Der AI Act der EU, seit 2024 in Kraft, stuft viele KI-Systeme im Gesundheitswesen als hochriskant ein und fügt der Medical Device Regulation zusätzlichen Compliance-Aufwand hinzu. Die WHO veröffentlichte 2023 Empfehlungen zu Transparenz, Datenqualität und Lebenszyklusaufsicht.

MD+DI veröffentlichte ein Interview mit der FDA-Anwältin für Medizingeräte Suzanne Levy Friedman. Sie sagte, ihre letzte Zählung habe über tausend von der FDA zugelassene KI-Geräte ergeben. Keines davon habe ein kontinuierlich lernendes Modell eingebaut, sagte sie. Einige ihrer neueren Klienten seien darüber schockiert. Sie nicht.

"Bei all der Aufregung über Innovation vergessen die Leute, dass die FDA in erster Linie eine Gesundheitsbehörde ist", sagte Friedman zu MD+DI. "Sie versuchen nicht, schwierig zu sein, sie versuchen sicherzustellen, dass Patienten nicht geschädigt werden und Kliniker die richtigen Informationen haben und nicht versehentlich dazu verleitet werden, sich auf Dinge zu verlassen, die möglicherweise nicht validiert sind."

Friedman benannte zwei Lücken, die älter sind als die Datenschutzarbeit. Software entwickelt sich schneller als das Framework, das für Hardware entworfen wurde. Leistungsdrift in der Praxis kann validierte Produkte treffen, sobald sich die Patientenzusammensetzung verschiebt, wie während COVID geschehen. Algorithmische Verzerrung steht daneben, und die FDA verlangt von Herstellern detaillierte Angaben zu ihren Algorithmen, was manche für übermäßig halten.

Das Problem der klinischen Evidenz nebenan

Datenschutz ist nicht die einzige Schwachstelle der Evidenzbasis. The Register berichtete am 15. April über eine Studie in JAMA Network Open unter Leitung des Harvard-Medizinstudenten Arya Rao. Sie testete 21 handelsübliche KI-Modelle gegen 29 standardisierte klinische Vignetten. Bei der endgültigen Diagnose lagen die Modelle zu 91 Prozent richtig, wenn sie ein vollständiges Informationsportfolio erhielten. Bei der frühen Differenzialdiagnose, der Phase, in der Kliniker unter Unsicherheit Erkrankungen ein- und ausschließen, lag die Fehlerquote über 80 Prozent.

"Jedes Modell, das wir testeten, versagte in der überwiegenden Mehrheit der Fälle", sagte Rao zu The Register. "Das ist die Phase, in der Unsicherheit am wichtigsten ist, und dort sind diese Systeme am schwächsten."

Mitautor Marc Succi, Radiologe am Massachusetts General Hospital, warnte, dass Konfidenz ohne Begründung eine eigene Gefahr sei, besonders für ängstliche Patienten. Er argumentierte außerdem, dass starke Werte bei der endgültigen Diagnose ein irreführendes Sicherheitsgefühl erzeugen können. Echtes klinisches Denken beginnt früher, wenn die Mehrdeutigkeit am größten ist. Rao merkte an, dass die strengere Fehlermetrik nicht die einzige Lesart der Daten ist: Die rohe Genauigkeit lag zwischen 63 und 78 Prozent, die Modelle lagen also oft teilweise richtig.

Die beiden Arbeiten weisen aus verschiedenen Blickwinkeln in dieselbe Richtung. Die eine zeigt, dass die Trainingsdaten hinter einem Diagnosemodell abgefragt werden können, um die Patienten darin zu identifizieren. Die andere zeigt, dass dieselben Modelle versagen, wenn man sie so denken lässt wie Kliniker, und zwar genau dort, wo der Einsatz am höchsten ist. Beide erschienen, während die Auditstandards, die solche Probleme aufdecken sollen, noch entworfen werden.

Knolles Einschränkung sollte man behalten. Er sagte The Register, es gebe viele Situationen, in denen eine erfolgreiche MIA einen kleinen oder vernachlässigbaren Datenschutzverstoß darstelle. Das gelte für Modelle, die auf großen, allgemeinen Populationen trainiert wurden, die sowohl gesunde als auch kranke Menschen umfassen. Das Risiko konzentriert sich dort, wo Kohorten eng sind, und enge Kohorten sind genau das, was spezialisierte medizinische KI tendenziell braucht.

Kommentare 0

Quellen

4
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
  3. 03AI Medical Devices: 2025 Status, Regulation & ChallengesEN
  4. 04How Is FDA Regulating AI Medical Devices in 2026?EN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Hanna Vogt

Hanna Vogt

Wissenschaft und Gesundheit

Hanna Vogt schreibt für FLASH24 über Wissenschaft und Gesundheit und stützt sich dabei auf Primärstudien, Behördenberichte und Rohdaten statt auf Pressemitteilungen. Bei Zahlen prüft sie Stichprobengrößen, Konfidenzintervalle und ob die zitierte Quelle die Aussage tatsächlich deckt. Für ihre Texte spricht sie mit Studienautorinnen, wartet auf Peer-Review-Fassungen und vergleicht Vorabdrucke mit der finalen Publikation. Dass sie privat Materialphysik verfolgt und mit eigenem Teleskop den Himmel beobachtet, erklärt, warum sie bei Messmethoden und Instrumenten genau nachfragt. Sie publiziert keine Ergebnisse, deren Datengrundlage sie nicht selbst eingesehen hat.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.