Medizin-KI hat zwei Probleme zugleich: Sie rät früh falsch und verrät, wer sie trainiert hat
Zwei Forschungsarbeiten im Abstand von 14 Monaten zeigen, wie Medizin-KI an entgegengesetzten Enden derselben Aufgabe scheitert: bei der frühen Diagnose von Patienten und beim Schutz der Patienten in ihren Trainingsdaten.

Am 15. April 2026 berichtete The Register über eine Studie in JAMA Network Open. Darin traten 21 handelsübliche KI-Modelle gegen 29 standardisierte klinische Vignetten an. Bekamen die Modelle ein vollständiges Portfolio medizinischer Informationen und sollten eine endgültige Diagnose stellen, erreichten sie 91 Prozent. Die frühe Differenzialdiagnose dagegen, also die Phase, in der Kliniker Erkrankungen ein- und ausschließen, scheiterte in mehr als 8 von 10 Fällen.
„Jedes Modell, das wir getestet haben, versagte in der überwiegenden Mehrheit der Fälle“, sagte Erstautorin Arya Rao, Medizinstudentin in Harvard, dem Register. „Das ist die Phase, in der Unsicherheit am wichtigsten ist, und dort sind diese Systeme am schwächsten.“
Mitautor Dr. Marc Succi, Radiologe am Massachusetts General Hospital, ging weiter: „Unsere Ergebnisse legen nahe, dass man heutigen handelsüblichen LLMs ohne strukturierte umfassende menschliche Prüfung keine patientennahe diagnostische Schlussfolgerung anvertrauen sollte.“ Succi ergänzte, Modelle „können Sicherheit ausstrahlen, ohne robustes Schlussfolgern zu zeigen“. Bei Patienten, die sich ohnehin wegen eines Symptoms sorgen, könne das die Angst verstärken.
Rao las ihre eigenen Daten milder. Ein Scheitern bedeutete in der Arbeit, dass das Modell keine vollständig korrekte Differenzialdiagnose lieferte, nicht dass es völlig falsch lag. Die rohe Genauigkeit reichte von 63 bis 78 Prozent. Laut Rao deutet das darauf hin, dass die Modelle oft teilweise richtig lagen. Das Team hält dennoch an der strengeren Kennzahl fest. Diese Systeme werden als Frontsysteme vermarktet, die Diagnosen eingrenzen, bevor ein Mensch übernimmt.
Membership Inference fast perfekt auf individueller Ebene
Das zweite Problem liegt unter dem ersten. Am 24. Juni 2026 veröffentlichten deutsche Forscher eine Nature-Arbeit. Sie zeigt, dass diskriminative medizinische KI-Modelle ohne Weiteres preisgeben, ob die Akte eines bestimmten Patienten Teil ihres Trainingssatzes war. Gemeint ist die Art von Modell, die Daten klassifiziert und auf neue Eingaben vorhersagt.
Die Technik heißt Membership-Inference-Angriff. Sie funktioniert, weil ein Modell bei Eingaben, die es schon gesehen hat, tendenziell sicherer ist. Ein Angreifer speist Patientendaten ein, beobachtet die Sicherheit und schließt auf die Zugehörigkeit.
Das Team untersuchte sieben medizinische Datensätze mit Bildern, EKG-Aufzeichnungen und elektronischen Gesundheitsakten. Einzelne Patienten ließen sich darin mit „nahezu perfektem Angriffserfolg“ identifizieren. Der Erstautor der Arbeit, Moritz Knolle von der Technischen Universität München, sagte dem Register, Patienten aus unterrepräsentierten Gruppen seien leichter zu identifizieren als jene, die nicht auffallen. Er nennt Herkunft, Versicherungsstatus, Geschlecht, Bildgebungsprotokoll und Krankheitsstatus.
„Allgemein gesprochen werden Datenschutzrisiken durch MIAs schwerwiegender, je spezifischer die Trainingskohorte eines Modells wird“, sagte Knolle. Er nannte das Beispiel eines Datensatzes, dessen Zugehörigkeit selbst eine ruhende genetische Erkrankung verrät, etwa Chorea Huntington, eine Depression oder den Besuch einer spezialisierten Behandlungsklinik.
„In unserer Arbeit zeigen wir, dass ein Angreifer mit teilweisem Zugang MIAs dennoch erfolgreich durchführen kann.“
Knolle entkräftete zudem die übliche Verteidigung, anonymisierte Akten seien sicher. „Ein Angreifer, der eine MIA durchführt, muss nicht wissen, wem die Daten gehören“, sagte er. „Tatsächlich waren alle Datensätze, die wir in unserer Studie verwenden, anonymisiert.“ Teilweise Blutwerte würden ausreichen, fügte er hinzu. Und weil Gesundheitsdaten so häufig durchsickern, sei deren Beschaffung keine große Hürde.
Wozu die Regulierer aufgefordert werden
Das Nature-Team will zwei Änderungen. Erstens sollten Datenschutzaudits das Risiko auf Ebene des einzelnen Patienten messen statt aggregiert. Das Standardprotokoll, so die Forscher, erfasse nicht angemessen, was ein nahezu perfekter Angriffserfolg pro Patient tatsächlich bedeutet. Zweitens empfehlen sie Rahmenwerke für differenzielle Privatsphäre. Sie begrenzen mathematisch, was ein Modell über einen einzelnen Trainingsdatensatz verraten kann. Knolle sagte, er hoffe, die medizinische KI-Community „werde beginnen, Datenschutzrisiken ernst zu nehmen“.
Dem steht die Genauigkeitsseite gegenüber. Microsofts MAI Diagnostic Orchestrator wurde am 30. Juni 2025 angekündigt. Laut GeekWire erreichte er 85,5 Prozent bei 304 komplexen Fällen des New England Journal of Medicine, gegenüber 21 Ärzten, die 20 Prozent erzielten. WIRED setzte die KI unter Verweis auf dieselbe Arbeit bei 80 Prozent an und berichtete von einer Kostensenkung um 20 Prozent. Microsofts KI-Chef Mustafa Suleyman nannte es „einen großen Schritt in Richtung medizinischer Superintelligenz“.
Der MIT-Wissenschaftler David Sontag sagte WIRED, die Arbeit sei methodisch stark. Er warnte aber, den Ärzten sei die Nutzung externer Hilfsmittel untersagt gewesen, was nicht der realen Praxis entspreche. Eric Topol von Scripps nannte den Kostenbefund neuartig. Beide sagten, eine klinische Studie mit echten Patienten sei der nächste Schritt. Microsoft hat nicht entschieden, ob es das Werkzeug kommerzialisiert.
Das Bild, vor dem die Regulierer stehen, ist also nicht ein Versagen, sondern zwei, die in entgegengesetzte Richtungen laufen. Die einen Systeme sind genau dort am schwächsten, wo die Unsicherheit am größten ist. Die anderen verraten genau dort am meisten, wo ihre Trainingsdaten am spezifischsten sind.
Quellen
4- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
- 03AI vs. MDs: Microsoft tool hits 85.5% accuracy in tough diagnosesEN
- 04Microsoft Says Its New AI System Diagnosed Patients 4 Times More Accurately Than Human DoctorsEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.