KI-Diagnose unter der Lupe: Patientendaten werden preisgegeben, Sprachmodelle versagen in 80 Prozent der Fälle
Zwei getrennte Studien aus dem Jahr 2026 zeigen, dass medizinische Diagnose-KIs dazu gebracht werden können, preiszugeben, welche Patientendaten zu ihrem Training dienten, und dass führende Sprachmodelle bei der frühen Differenzialdiagnose in mehr als 8 von 10 Fällen scheitern.

Zwei Forschungslinien aus dem Jahr 2026 zeichnen ein beunruhigendes Bild der medizinischen KI-Diagnose. Die eine zeigt, dass Diagnosemodelle die Identität von Patienten preisgeben, deren Akten zum Training verwendet wurden. Die andere zeigt, dass große Sprachmodelle in mehr als 80 Prozent der Fälle in den frühen Phasen der klinischen Schlussfolgerung versagen. Es sind dieselben Werkzeuge, die Menschen zu ihren Symptomen befragen. Über beide berichtete The Register, als die Arbeiten erschienen.
Das Datenschutzproblem stammt aus einer Nature-Arbeit, die laut The Register am Mittwoch, dem 24. Juni 2026, veröffentlicht wurde. Deutsche Forscher untersuchten sieben medizinische KI-Datensätze mit Bildern, EKG-Aufzeichnungen und allgemeinen elektronischen Gesundheitsakten. Sie stellten fest, dass diskriminative Modelle besonders anfällig für Membership-Inference-Angriffe (MIA) sind. Diese Modelle klassifizieren Daten und treffen Vorhersagen. Solche Angriffe fragen ein Modell ab, um festzustellen, ob ein bestimmter Datenpunkt Teil seines Trainingssatzes war. Das Team berichtete, dass einzelne Patienten mit „nahezu perfektem Angriffserfolg" identifiziert werden können. Diese Erfolgsquote, so argumentieren die Forscher, werde von den üblichen Evaluierungsprotokollen nicht erfasst, weil diese den Angriffserfolg über alle Datensätze hinweg aggregiert messen. Die Forscher kamen zu dem Schluss, dass sich die Berichtsstandards für KI-Datenschutzaudits ändern müssen.
Unterrepräsentierte Patienten sind leichter zu identifizieren
Patienten, die in medizinischen KI-Trainingsdaten unterrepräsentiert sind, lassen sich noch leichter identifizieren als jene, deren Daten nicht auffallen, heißt es in derselben Arbeit. The Register nannte Herkunft, Versicherungsstatus, Geschlecht, Bildgebungsprotokoll und bestimmte Krankheitszustände als Kategorien, die als Ausreißer wirken können. Dadurch werden Einzelpersonen leichter erkennbar.
„Allgemein gesprochen werden die Datenschutzrisiken durch MIA schwerwiegender, je spezifischer die Trainingskohorte eines Modells wird", sagte Moritz Knolle, Leiter des Lehrstuhls für KI in Gesundheit und Medizin an der Technischen Universität München und Erstautor der Arbeit, in einer E-Mail-Konversation zu The Register. Er beschrieb Szenarien, in denen die Zugehörigkeit zu einem Trainingsdatensatz verraten könnte, dass jemand eine ruhende genetische Erkrankung wie Chorea Huntington hat, an Depressionen leidet oder eine bestimmte spezialisierte Behandlungsklinik besucht hat.
Der Angriff selbst beruht auf einer einfachen Eigenschaft von Machine-Learning-Modellen: Sie sind in der Regel sicherer, wenn die Eingabedaten Teil ihres Trainingssatzes waren. Ein Angreifer mit unvollständigen Patientendaten kann diese dem Modell zuführen, das Konfidenzniveau prüfen und daraus ableiten, ob der Patient enthalten war. Knolle sagte, die Arbeit zeige, dass ein Angreifer keinen vollständigen Zugriff auf einen Patientendatenpunkt braucht, anders als bisher angenommen. „In unserer Arbeit zeigen wir, dass ein Angreifer mit teilweisem Zugriff MIA weiterhin erfolgreich durchführen kann", sagte er zu The Register.
„Ich hoffe, dass die medizinische KI-Community beginnt, Datenschutzrisiken ernst zu nehmen, und dass Techniken zur Risikominderung dort eingesetzt werden, wo sie nötig sind." Moritz Knolle, Technische Universität München
Die Forscher empfehlen den Einsatz von Differential-Privacy-Rahmenwerken, die mathematisch garantieren sollen, dass Trainingsdaten anonym bleiben. Außerdem sollen Datenschutzaudit-Standards das Risiko auf Individualebene berücksichtigen und nicht nur aggregierte Zahlen. Eine weitere Möglichkeit, so Knolle, sei es, Trainingsdaten so zusammenzustellen, dass unterrepräsentierte Gruppen besser vertreten sind. „Es gibt viele Situationen, in denen ein erfolgreicher MIA eine kleine oder vernachlässigbare Datenschutzverletzung darstellt", merkte er an, mit Blick auf Modelle, die auf großen allgemeinen Populationen trainiert wurden, die sowohl gesunde als auch kranke Menschen umfassen.
Sprachmodelle versagen früh und wirken dabei sicher
In einer separaten, im April 2026 in JAMA Network Open veröffentlichten Untersuchung scheiterten 21 führende, handelsübliche KI-Modelle bei der frühen Differenzialdiagnose in mehr als 8 von 10 Fällen. Die Studie, über die The Register am 15. April 2026 berichtete, testete die Modelle an 29 standardisierten klinischen Vignetten. Die Modelle schnitten gut ab, wenn ihnen ein vollständiges Portfolio medizinischer Informationen vorgelegt und nach einer endgültigen Diagnose gefragt wurde: Führende Modelle lagen zu 91 Prozent richtig. Doch bei der frühen Differenzialdiagnose, bei der Kliniker Erkrankungen ausschließen und Möglichkeiten abwägen, lag die Fehlerquote über 80 Prozent.
„Jedes Modell, das wir getestet haben, versagte in der überwiegenden Mehrheit der Fälle", sagte Arya Rao, Medizinstudentin in Harvard und Leiterin der Untersuchung, in einer E-Mail zu The Register. „Das ist die Phase, in der Unsicherheit am wichtigsten ist, und genau dort sind diese Systeme am schwächsten."
Rao merkte an, dass ein Scheitern nicht immer eine völlig falsche Antwort bedeutete. Gemessen an der reinen Trefferquote als Anteil richtiger Antworten lagen die Modelle zwischen 63 und 78 Prozent. Das Team argumentierte jedoch, dass die strengere Fehlermetrik weiterhin zählt, zumal KI-Werkzeuge als Frontlinien-Agenten vermarktet werden, die Diagnosen eingrenzen sollen. „Sprachmodelle als diagnostische Agenten zu vermarkten, riskiert falsches Vertrauen genau dort, wo sie am wenigsten verlässlich sind", schrieben die Forscher.
Dr. Marc Succi, Radiologe am Massachusetts General Hospital und Mitautor der Arbeit, sagte zu The Register, höhere Erfolgsquoten bei der endgültigen Diagnose sollten nicht beruhigen. „Echte klinische Schlussfolgerung beginnt früher, wenn die Mehrdeutigkeit am größten ist, und genau dort bleiben sie am schwächsten", sagte er. Er warnte, eine falsche Differenzialdiagnose könne zu Verzögerungen der Versorgung, unnötigen Eingriffen, hohen Kosten und mehr führen.
Beide Arbeiten fallen in ein regulatorisches Umfeld, das noch aufholt. Bis Mitte 2024 hatte die US-amerikanische Food and Drug Administration rund 950 KI-gestützte Medizinprodukte zugelassen, wie eine von IntuitionLabs veröffentlichte Branchenanalyse zeigt. Dieselbe Analyse merkte an, dass nur ein winziger Bruchteil der zugelassenen KI-Produkte durch randomisierte Studien oder Daten zu Patientenergebnissen gestützt ist, und dass die FDA ihre Leitlinie zu Predetermined Change Control Plans im Dezember 2024 herausgab.
Ein von MD+DI veröffentlichtes Interview mit der FDA-Anwältin für Medizinprodukte Suzanne Levy Friedman stellte fest, dass trotz mehr als tausend von der FDA zugelassener KI-gestützter Produkte keines ein kontinuierlich lernendes Modell eingebaut hat. Friedman sagte, die Behörde arbeite an einem Weg dorthin, doch ihre Hauptaufgabe als Gesundheitsbehörde bedeute, Innovation gegen das Risiko abzuwägen, dass Kliniker sich auf Werkzeuge verlassen, die möglicherweise nicht validiert sind.
Die beiden Forschungsarbeiten legen nahe, dass Validierung nicht nur die Frage ist, ob ein Modell die endgültige Antwort richtig trifft. Es geht auch darum, ob es die Identität eines Patienten geheim hält und ob es mit Unsicherheit umgehen kann, bevor eine Diagnose klar ist.
Quellen
4- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
- 03AI Medical Devices: 2025 Status, Regulation & ChallengesEN
- 04How Is FDA Regulating AI Medical Devices in 2026?EN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.