Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Medizin-KI hat zwei Probleme zugleich: Sie rät früh falsch und verrät, wer sie trainiert hat

Zwei Forschungsarbeiten im Abstand von 14 Monaten zeigen, wie Medizin-KI an entgegengesetzten Enden derselben Aufgabe scheitert: bei der frühen Diagnose von Patienten und beim Schutz der Patienten in ihren Trainingsdaten.

GesundheitAnalyseHanna VogtVeröffentlicht: 27. September 20264 Min. LesezeitQuellen 4
Medizin-KI hat zwei Probleme zugleich: Sie rät früh falsch und verrät, wer sie trainiert hat

Am 15. April 2026 berichtete The Register über eine Studie in JAMA Network Open. Darin traten 21 handelsübliche KI-Modelle gegen 29 standardisierte klinische Vignetten an. Bekamen die Modelle ein vollständiges Portfolio medizinischer Informationen und sollten eine endgültige Diagnose stellen, erreichten sie 91 Prozent. Die frühe Differenzialdiagnose dagegen, also die Phase, in der Kliniker Erkrankungen ein- und ausschließen, scheiterte in mehr als 8 von 10 Fällen.

„Jedes Modell, das wir getestet haben, versagte in der überwiegenden Mehrheit der Fälle“, sagte Erstautorin Arya Rao, Medizinstudentin in Harvard, dem Register. „Das ist die Phase, in der Unsicherheit am wichtigsten ist, und dort sind diese Systeme am schwächsten.“

Mitautor Dr. Marc Succi, Radiologe am Massachusetts General Hospital, ging weiter: „Unsere Ergebnisse legen nahe, dass man heutigen handelsüblichen LLMs ohne strukturierte umfassende menschliche Prüfung keine patientennahe diagnostische Schlussfolgerung anvertrauen sollte.“ Succi ergänzte, Modelle „können Sicherheit ausstrahlen, ohne robustes Schlussfolgern zu zeigen“. Bei Patienten, die sich ohnehin wegen eines Symptoms sorgen, könne das die Angst verstärken.

Rao las ihre eigenen Daten milder. Ein Scheitern bedeutete in der Arbeit, dass das Modell keine vollständig korrekte Differenzialdiagnose lieferte, nicht dass es völlig falsch lag. Die rohe Genauigkeit reichte von 63 bis 78 Prozent. Laut Rao deutet das darauf hin, dass die Modelle oft teilweise richtig lagen. Das Team hält dennoch an der strengeren Kennzahl fest. Diese Systeme werden als Frontsysteme vermarktet, die Diagnosen eingrenzen, bevor ein Mensch übernimmt.

Membership Inference fast perfekt auf individueller Ebene

Das zweite Problem liegt unter dem ersten. Am 24. Juni 2026 veröffentlichten deutsche Forscher eine Nature-Arbeit. Sie zeigt, dass diskriminative medizinische KI-Modelle ohne Weiteres preisgeben, ob die Akte eines bestimmten Patienten Teil ihres Trainingssatzes war. Gemeint ist die Art von Modell, die Daten klassifiziert und auf neue Eingaben vorhersagt.

Die Technik heißt Membership-Inference-Angriff. Sie funktioniert, weil ein Modell bei Eingaben, die es schon gesehen hat, tendenziell sicherer ist. Ein Angreifer speist Patientendaten ein, beobachtet die Sicherheit und schließt auf die Zugehörigkeit.

Das Team untersuchte sieben medizinische Datensätze mit Bildern, EKG-Aufzeichnungen und elektronischen Gesundheitsakten. Einzelne Patienten ließen sich darin mit „nahezu perfektem Angriffserfolg“ identifizieren. Der Erstautor der Arbeit, Moritz Knolle von der Technischen Universität München, sagte dem Register, Patienten aus unterrepräsentierten Gruppen seien leichter zu identifizieren als jene, die nicht auffallen. Er nennt Herkunft, Versicherungsstatus, Geschlecht, Bildgebungsprotokoll und Krankheitsstatus.

„Allgemein gesprochen werden Datenschutzrisiken durch MIAs schwerwiegender, je spezifischer die Trainingskohorte eines Modells wird“, sagte Knolle. Er nannte das Beispiel eines Datensatzes, dessen Zugehörigkeit selbst eine ruhende genetische Erkrankung verrät, etwa Chorea Huntington, eine Depression oder den Besuch einer spezialisierten Behandlungsklinik.

„In unserer Arbeit zeigen wir, dass ein Angreifer mit teilweisem Zugang MIAs dennoch erfolgreich durchführen kann.“

Knolle entkräftete zudem die übliche Verteidigung, anonymisierte Akten seien sicher. „Ein Angreifer, der eine MIA durchführt, muss nicht wissen, wem die Daten gehören“, sagte er. „Tatsächlich waren alle Datensätze, die wir in unserer Studie verwenden, anonymisiert.“ Teilweise Blutwerte würden ausreichen, fügte er hinzu. Und weil Gesundheitsdaten so häufig durchsickern, sei deren Beschaffung keine große Hürde.

Wozu die Regulierer aufgefordert werden

Das Nature-Team will zwei Änderungen. Erstens sollten Datenschutzaudits das Risiko auf Ebene des einzelnen Patienten messen statt aggregiert. Das Standardprotokoll, so die Forscher, erfasse nicht angemessen, was ein nahezu perfekter Angriffserfolg pro Patient tatsächlich bedeutet. Zweitens empfehlen sie Rahmenwerke für differenzielle Privatsphäre. Sie begrenzen mathematisch, was ein Modell über einen einzelnen Trainingsdatensatz verraten kann. Knolle sagte, er hoffe, die medizinische KI-Community „werde beginnen, Datenschutzrisiken ernst zu nehmen“.

Dem steht die Genauigkeitsseite gegenüber. Microsofts MAI Diagnostic Orchestrator wurde am 30. Juni 2025 angekündigt. Laut GeekWire erreichte er 85,5 Prozent bei 304 komplexen Fällen des New England Journal of Medicine, gegenüber 21 Ärzten, die 20 Prozent erzielten. WIRED setzte die KI unter Verweis auf dieselbe Arbeit bei 80 Prozent an und berichtete von einer Kostensenkung um 20 Prozent. Microsofts KI-Chef Mustafa Suleyman nannte es „einen großen Schritt in Richtung medizinischer Superintelligenz“.

Der MIT-Wissenschaftler David Sontag sagte WIRED, die Arbeit sei methodisch stark. Er warnte aber, den Ärzten sei die Nutzung externer Hilfsmittel untersagt gewesen, was nicht der realen Praxis entspreche. Eric Topol von Scripps nannte den Kostenbefund neuartig. Beide sagten, eine klinische Studie mit echten Patienten sei der nächste Schritt. Microsoft hat nicht entschieden, ob es das Werkzeug kommerzialisiert.

Das Bild, vor dem die Regulierer stehen, ist also nicht ein Versagen, sondern zwei, die in entgegengesetzte Richtungen laufen. Die einen Systeme sind genau dort am schwächsten, wo die Unsicherheit am größten ist. Die anderen verraten genau dort am meisten, wo ihre Trainingsdaten am spezifischsten sind.

Kommentare 0

Quellen

4
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
  3. 03AI vs. MDs: Microsoft tool hits 85.5% accuracy in tough diagnosesEN
  4. 04Microsoft Says Its New AI System Diagnosed Patients 4 Times More Accurately Than Human DoctorsEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Hanna Vogt

Hanna Vogt

Wissenschaft und Gesundheit

Hanna Vogt schreibt für FLASH24 über Wissenschaft und Gesundheit und stützt sich dabei auf Primärstudien, Behördenberichte und Rohdaten statt auf Pressemitteilungen. Bei Zahlen prüft sie Stichprobengrößen, Konfidenzintervalle und ob die zitierte Quelle die Aussage tatsächlich deckt. Für ihre Texte spricht sie mit Studienautorinnen, wartet auf Peer-Review-Fassungen und vergleicht Vorabdrucke mit der finalen Publikation. Dass sie privat Materialphysik verfolgt und mit eigenem Teleskop den Himmel beobachtet, erklärt, warum sie bei Messmethoden und Instrumenten genau nachfragt. Sie publiziert keine Ergebnisse, deren Datengrundlage sie nicht selbst eingesehen hat.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.