Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

KI-Diagnose unter der Lupe: Patientendaten werden preisgegeben, Sprachmodelle versagen in 80 Prozent der Fälle

Zwei getrennte Studien aus dem Jahr 2026 zeigen, dass medizinische Diagnose-KIs dazu gebracht werden können, preiszugeben, welche Patientendaten zu ihrem Training dienten, und dass führende Sprachmodelle bei der frühen Differenzialdiagnose in mehr als 8 von 10 Fällen scheitern.

GesundheitErklärtHanna VogtVeröffentlicht: 28. September 20265 Min. LesezeitQuellen 4
KI-Diagnose unter der Lupe: Patientendaten werden preisgegeben, Sprachmodelle versagen in 80 Prozent der Fälle

Zwei Forschungslinien aus dem Jahr 2026 zeichnen ein beunruhigendes Bild der medizinischen KI-Diagnose. Die eine zeigt, dass Diagnosemodelle die Identität von Patienten preisgeben, deren Akten zum Training verwendet wurden. Die andere zeigt, dass große Sprachmodelle in mehr als 80 Prozent der Fälle in den frühen Phasen der klinischen Schlussfolgerung versagen. Es sind dieselben Werkzeuge, die Menschen zu ihren Symptomen befragen. Über beide berichtete The Register, als die Arbeiten erschienen.

Das Datenschutzproblem stammt aus einer Nature-Arbeit, die laut The Register am Mittwoch, dem 24. Juni 2026, veröffentlicht wurde. Deutsche Forscher untersuchten sieben medizinische KI-Datensätze mit Bildern, EKG-Aufzeichnungen und allgemeinen elektronischen Gesundheitsakten. Sie stellten fest, dass diskriminative Modelle besonders anfällig für Membership-Inference-Angriffe (MIA) sind. Diese Modelle klassifizieren Daten und treffen Vorhersagen. Solche Angriffe fragen ein Modell ab, um festzustellen, ob ein bestimmter Datenpunkt Teil seines Trainingssatzes war. Das Team berichtete, dass einzelne Patienten mit „nahezu perfektem Angriffserfolg" identifiziert werden können. Diese Erfolgsquote, so argumentieren die Forscher, werde von den üblichen Evaluierungsprotokollen nicht erfasst, weil diese den Angriffserfolg über alle Datensätze hinweg aggregiert messen. Die Forscher kamen zu dem Schluss, dass sich die Berichtsstandards für KI-Datenschutzaudits ändern müssen.

Unterrepräsentierte Patienten sind leichter zu identifizieren

Patienten, die in medizinischen KI-Trainingsdaten unterrepräsentiert sind, lassen sich noch leichter identifizieren als jene, deren Daten nicht auffallen, heißt es in derselben Arbeit. The Register nannte Herkunft, Versicherungsstatus, Geschlecht, Bildgebungsprotokoll und bestimmte Krankheitszustände als Kategorien, die als Ausreißer wirken können. Dadurch werden Einzelpersonen leichter erkennbar.

„Allgemein gesprochen werden die Datenschutzrisiken durch MIA schwerwiegender, je spezifischer die Trainingskohorte eines Modells wird", sagte Moritz Knolle, Leiter des Lehrstuhls für KI in Gesundheit und Medizin an der Technischen Universität München und Erstautor der Arbeit, in einer E-Mail-Konversation zu The Register. Er beschrieb Szenarien, in denen die Zugehörigkeit zu einem Trainingsdatensatz verraten könnte, dass jemand eine ruhende genetische Erkrankung wie Chorea Huntington hat, an Depressionen leidet oder eine bestimmte spezialisierte Behandlungsklinik besucht hat.

Der Angriff selbst beruht auf einer einfachen Eigenschaft von Machine-Learning-Modellen: Sie sind in der Regel sicherer, wenn die Eingabedaten Teil ihres Trainingssatzes waren. Ein Angreifer mit unvollständigen Patientendaten kann diese dem Modell zuführen, das Konfidenzniveau prüfen und daraus ableiten, ob der Patient enthalten war. Knolle sagte, die Arbeit zeige, dass ein Angreifer keinen vollständigen Zugriff auf einen Patientendatenpunkt braucht, anders als bisher angenommen. „In unserer Arbeit zeigen wir, dass ein Angreifer mit teilweisem Zugriff MIA weiterhin erfolgreich durchführen kann", sagte er zu The Register.

„Ich hoffe, dass die medizinische KI-Community beginnt, Datenschutzrisiken ernst zu nehmen, und dass Techniken zur Risikominderung dort eingesetzt werden, wo sie nötig sind." Moritz Knolle, Technische Universität München

Die Forscher empfehlen den Einsatz von Differential-Privacy-Rahmenwerken, die mathematisch garantieren sollen, dass Trainingsdaten anonym bleiben. Außerdem sollen Datenschutzaudit-Standards das Risiko auf Individualebene berücksichtigen und nicht nur aggregierte Zahlen. Eine weitere Möglichkeit, so Knolle, sei es, Trainingsdaten so zusammenzustellen, dass unterrepräsentierte Gruppen besser vertreten sind. „Es gibt viele Situationen, in denen ein erfolgreicher MIA eine kleine oder vernachlässigbare Datenschutzverletzung darstellt", merkte er an, mit Blick auf Modelle, die auf großen allgemeinen Populationen trainiert wurden, die sowohl gesunde als auch kranke Menschen umfassen.

Sprachmodelle versagen früh und wirken dabei sicher

In einer separaten, im April 2026 in JAMA Network Open veröffentlichten Untersuchung scheiterten 21 führende, handelsübliche KI-Modelle bei der frühen Differenzialdiagnose in mehr als 8 von 10 Fällen. Die Studie, über die The Register am 15. April 2026 berichtete, testete die Modelle an 29 standardisierten klinischen Vignetten. Die Modelle schnitten gut ab, wenn ihnen ein vollständiges Portfolio medizinischer Informationen vorgelegt und nach einer endgültigen Diagnose gefragt wurde: Führende Modelle lagen zu 91 Prozent richtig. Doch bei der frühen Differenzialdiagnose, bei der Kliniker Erkrankungen ausschließen und Möglichkeiten abwägen, lag die Fehlerquote über 80 Prozent.

„Jedes Modell, das wir getestet haben, versagte in der überwiegenden Mehrheit der Fälle", sagte Arya Rao, Medizinstudentin in Harvard und Leiterin der Untersuchung, in einer E-Mail zu The Register. „Das ist die Phase, in der Unsicherheit am wichtigsten ist, und genau dort sind diese Systeme am schwächsten."

Rao merkte an, dass ein Scheitern nicht immer eine völlig falsche Antwort bedeutete. Gemessen an der reinen Trefferquote als Anteil richtiger Antworten lagen die Modelle zwischen 63 und 78 Prozent. Das Team argumentierte jedoch, dass die strengere Fehlermetrik weiterhin zählt, zumal KI-Werkzeuge als Frontlinien-Agenten vermarktet werden, die Diagnosen eingrenzen sollen. „Sprachmodelle als diagnostische Agenten zu vermarkten, riskiert falsches Vertrauen genau dort, wo sie am wenigsten verlässlich sind", schrieben die Forscher.

Dr. Marc Succi, Radiologe am Massachusetts General Hospital und Mitautor der Arbeit, sagte zu The Register, höhere Erfolgsquoten bei der endgültigen Diagnose sollten nicht beruhigen. „Echte klinische Schlussfolgerung beginnt früher, wenn die Mehrdeutigkeit am größten ist, und genau dort bleiben sie am schwächsten", sagte er. Er warnte, eine falsche Differenzialdiagnose könne zu Verzögerungen der Versorgung, unnötigen Eingriffen, hohen Kosten und mehr führen.

Beide Arbeiten fallen in ein regulatorisches Umfeld, das noch aufholt. Bis Mitte 2024 hatte die US-amerikanische Food and Drug Administration rund 950 KI-gestützte Medizinprodukte zugelassen, wie eine von IntuitionLabs veröffentlichte Branchenanalyse zeigt. Dieselbe Analyse merkte an, dass nur ein winziger Bruchteil der zugelassenen KI-Produkte durch randomisierte Studien oder Daten zu Patientenergebnissen gestützt ist, und dass die FDA ihre Leitlinie zu Predetermined Change Control Plans im Dezember 2024 herausgab.

Ein von MD+DI veröffentlichtes Interview mit der FDA-Anwältin für Medizinprodukte Suzanne Levy Friedman stellte fest, dass trotz mehr als tausend von der FDA zugelassener KI-gestützter Produkte keines ein kontinuierlich lernendes Modell eingebaut hat. Friedman sagte, die Behörde arbeite an einem Weg dorthin, doch ihre Hauptaufgabe als Gesundheitsbehörde bedeute, Innovation gegen das Risiko abzuwägen, dass Kliniker sich auf Werkzeuge verlassen, die möglicherweise nicht validiert sind.

Die beiden Forschungsarbeiten legen nahe, dass Validierung nicht nur die Frage ist, ob ein Modell die endgültige Antwort richtig trifft. Es geht auch darum, ob es die Identität eines Patienten geheim hält und ob es mit Unsicherheit umgehen kann, bevor eine Diagnose klar ist.

Kommentare 0

Quellen

4
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
  3. 03AI Medical Devices: 2025 Status, Regulation & ChallengesEN
  4. 04How Is FDA Regulating AI Medical Devices in 2026?EN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Hanna Vogt

Hanna Vogt

Wissenschaft und Gesundheit

Hanna Vogt schreibt für FLASH24 über Wissenschaft und Gesundheit und stützt sich dabei auf Primärstudien, Behördenberichte und Rohdaten statt auf Pressemitteilungen. Bei Zahlen prüft sie Stichprobengrößen, Konfidenzintervalle und ob die zitierte Quelle die Aussage tatsächlich deckt. Für ihre Texte spricht sie mit Studienautorinnen, wartet auf Peer-Review-Fassungen und vergleicht Vorabdrucke mit der finalen Publikation. Dass sie privat Materialphysik verfolgt und mit eigenem Teleskop den Himmel beobachtet, erklärt, warum sie bei Messmethoden und Instrumenten genau nachfragt. Sie publiziert keine Ergebnisse, deren Datengrundlage sie nicht selbst eingesehen hat.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.