Regulierung medizinischer KI: Was die Forschung zu Diagnosewerkzeugen tatsächlich zeigt
Medizinische KI-Modelle für die Diagnose lassen sich dazu bringen, zu verraten, ob die Daten eines bestimmten Patienten zum Training verwendet wurden. Das berichteten deutsche Forscher am 24. Juni 2026 in Nature. Ein separates Microsoft-System kam auf 85,5 Prozent diagnostische Treffsicherheit, die Ärzte im selben Test auf 20 Prozent. Die Regulierer hinken hinterher.

Zwei Forschungsergebnisse, etwa ein Jahr auseinander veröffentlicht, stehen unangenehm nebeneinander. Das eine besagt, medizinische KI könne Ärzte bei schwierigen Diagnosen schlagen. Das andere besagt, dieselbe Modellklasse gebe Informationen über die Patienten preis, von denen sie gelernt hat. Beide münden in dieselbe ungelöste Frage: Was sollte die Regulierung medizinischer KI eigentlich verlangen?
Das erste Ergebnis kam von Microsoft. Laut GeekWire stellte das Unternehmen am 30. Juni 2025 den MAI Diagnostic Orchestrator vor, kurz MAI-DxO. Das Werkzeug trat gegen 21 erfahrene Ärzte aus den USA und Großbritannien an, an komplexen Fällen aus dem New England Journal of Medicine. Es lieferte in 85,5 Prozent der Fälle eine korrekte Diagnose. Die Ärzte kamen auf 20 Prozent.
Was der Microsoft-Benchmark maß und was nicht
Der Testsatz umfasste 304 aktuelle NEJM-Fallstudien. Microsoft nannte das Ganze den Sequential Diagnosis Benchmark. WIRED berichtete, ein Sprachmodell habe jeden Fall in die schrittweise Abfolge zerlegt, die ein Arzt befolgen würde. MAI-DxO fragte dann mehrere Frontier-Modelle ab, darunter OpenAIs GPT, Googles Gemini, Anthropics Claude, Metas Llama und xAIs Grok. Der Aufbau sollte mehrere debattierende Experten nachahmen. MAI-DxO in Kombination mit OpenAIs o3 schnitt am besten ab, so GeekWire.
WIRED gab die Treffsicherheit mit 80 Prozent an, nicht mit 85,5 Prozent. Das System habe die Kosten um 20 Prozent gesenkt, weil es günstigere Tests anordnete, schrieb WIRED. Die beiden Zahlen stammen aus demselben Projekt, aber aus unterschiedlichen Berichten. GeekWire nennt 85,5 Prozent und 20 Prozent für die Ärzte, WIRED nennt 80 Prozent und 20 Prozent. Wer diesen Benchmark zitiert, sollte prüfen, welche Zahl er verwendet.
"Wir machen einen großen Schritt in Richtung medizinische Superintelligenz", sagte Mustafa Suleyman, CEO von Microsoft AI, in einem LinkedIn-Beitrag, laut GeekWire.
Externe Forscher urteilten zurückhaltender. Der MIT-Wissenschaftler David Sontag sagte WIRED, die Arbeit sei methodisch stark. Er warnte aber, die Ärzte der Studie hätten keine zusätzlichen Hilfsmittel verwenden dürfen. Das bilde die reale Praxis nicht ab. Eric Topol vom Scripps Research Institute nannte sie einen beeindruckenden Bericht über komplexe Fälle. Beide sagten, eine klinische Studie mit echten Ärzten an echten Patienten sei der nächste Validierungsschritt. Microsoft habe noch nicht entschieden, ob das Werkzeug kommerzialisiert werde, berichtete WIRED. Ein klinischer Einsatz würde Sicherheitstests und eine behördliche Zulassung erfordern.
Der Datenschutzbefund, der alles verkompliziert
Am 24. Juni 2026 berichtete The Register über eine Nature-Arbeit deutscher Forscher. Das Team testete Membership-Inference-Angriffe, kurz MIA, gegen sieben medizinische KI-Datensätze mit Bildern, EKG-Aufzeichnungen und allgemeinen elektronischen Gesundheitsakten. Diese Angriffe fragen ein Modell ab, um herauszufinden, ob ein bestimmter Datenpunkt in seinem Trainingssatz war.
Das Ergebnis: Bei einzelnen Patienten gelangen die Angriffe mit nahezu perfektem Erfolg, wie die Forscher es nannten. Die Arbeit argumentiert, Standard-Evaluierungsprotokolle übersähen dies, weil sie den Angriffserfolg über die Datensätze hinweg aggregiert messen. Unterrepräsentierte Gruppen ließen sich leichter identifizieren. Herkunft, Versicherungsstatus, Geschlecht, Bildgebungsprotokoll und bestimmte Krankheitszustände wirken alle als Ausreißer, die Einzelpersonen hervortreten lassen.
Moritz Knolle leitet den Lehrstuhl für KI in Gesundheitswesen und Medizin an der Technischen Universität München und ist Erstautor der Arbeit. Er sagte The Register, die Datenschutzrisiken wüchsen, je spezifischer eine Trainingskohorte werde. Als Beispiel nannte er die Zugehörigkeit zu einem Datensatz, die eine ruhende genetische Erkrankung wie Chorea Huntington, eine Depression oder den Besuch einer spezialisierten Behandlungsklinik verrate.
Es gibt eine praktische Grenze. Um den Angriff auszuführen, braucht ein Angreifer mindestens teilweise Daten der Person, die er identifizieren will. Knolle sagte The Register, die Arbeit zeige, dass teilweiser Zugang ausreiche, entgegen früheren Annahmen. Er skizzierte ein Szenario, in dem ein Angreifer nach einer Routine-Blutuntersuchung unbefugten Zugang zur Datenbank eines Hausarztes erlangt.
"Ich hoffe, dass die medizinische KI-Community beginnt, Datenschutzrisiken ernst zu nehmen, und dass Risikominderungstechniken dort eingesetzt werden, wo sie nötig sind", sagte Knolle.
Die Forscher empfehlen Frameworks für differenziellen Datenschutz. Sie sollen mathematische Garantien dafür geben, dass Trainingsdaten anonym bleiben. Außerdem fordern sie Änderungen an Datenschutz-Auditstandards, damit sie Risiken auf Individualebene bewerten statt aggregierte Risiken. Sie schlagen zudem vor, Trainingsdaten so zusammenzustellen, dass unterrepräsentierte Gruppen besser vertreten sind. Knolle merkte an, viele erfolgreiche Angriffe stellten einen kleinen oder vernachlässigbaren Datenschutzverstoß dar. Das gelte etwa, wenn Modelle auf großen Allgemeinbevölkerungen trainiert würden, die Gesunde und Kranke enthalten.
Die Belege dafür, dass Modelle früh versagen, wo es zählt
Eine dritte Studie läuft der Begeisterung zuwider. Im April 2026 berichtete The Register über Forschung, die in JAMA Network Open erschien und von Arya Rao geleitet wurde, einem Medizinstudenten in Harvard. Das Team testete 21 Standard-KI-Modelle an 29 standardisierten klinischen Vignetten. Bekamen sie ein vollständiges Portfolio medizinischer Informationen und wurden nach einer endgültigen Diagnose gefragt, lagen führende Modelle in 91 Prozent der Fälle richtig. Die frühe Differenzialdiagnose scheiterte in mehr als 8 von 10 Fällen. In dieser Phase schließen Kliniker Erkrankungen aus und ein, während die Unsicherheit am größten ist.
Rao sagte The Register, jedes getestete Modell sei in der überwiegenden Mehrheit der Fälle gescheitert. Die frühe Differenzialdiagnose sei die Schwachstelle der Systeme. Mitautor Dr. Marc Succi, Radiologe am Massachusetts General Hospital, sagte, die Ergebnisse legten nahe, dass man Standard-LLMs ohne strukturierte umfassende menschliche Prüfung nicht für patientengerichtete diagnostische Schlussfolgerungen vertrauen sollte. Er ergänzte, die Modelle könnten Sicherheit ausstrahlen, ohne verlässliches Schlussfolgern zu zeigen. Das könne bei Patienten Angst verstärken.
Rao machte auch eine Einschränkung: Ein Scheitern nach der strengen Definition der Arbeit bedeute nicht immer, dass das Modell falsch lag. Gemessen als rohe Trefferquote nach Anteil richtiger Antworten pro Fall lagen die Werte zwischen 63 und 78 Prozent. Die Modelle waren also oft teilweise richtig. Das Team argumentiert dennoch, die strengere Kennzahl sei wichtig, weil LLMs als Frontwerkzeuge vermarktet würden, die Diagnosen eingrenzen, bevor ein Mensch übernimmt.
Wo die Regulierung steht
Keine dieser drei Arbeiten ist ein Regulierungsdokument. Die Akte hinter diesem Artikel enthält auch nicht den Text einer Regelung zu KI in der Medizin. Was sie zeigt, ist die Form des Problems, vor dem Regulierer stehen. Diagnostische Treffsicherheit an kuratierten Fällen kann stark aussehen, während das Schlussfolgern in frühen Phasen scheitert. Datenschutz-Audits können bestehen, während einzelne Patienten identifizierbar bleiben.
Die Microsoft-Arbeit weist in eine Richtung: das System in einer klinischen Studie belegen, dann eine Zulassung anstreben. Die Nature-Arbeit weist in eine andere: ändern, wie Datenschutz-Audits geschrieben werden, und Techniken wie differenziellen Datenschutz vor dem Einsatz übernehmen. Die JAMA-Studie zielt auf Kennzeichnung und Vermarktung. Sie argumentiert, die Beschreibung von LLMs als diagnostische Agenten erzeuge falsches Vertrauen genau dort, wo sie am unzuverlässigsten sind.
Für jeden, der über ein medizinisches KI-Produkt liest, folgen drei Fragen aus den obigen Belegen. Wurde es an echten Patienten im klinischen Umfeld getestet oder an veröffentlichten Fallstudien? Betrachtet seine Datenschutzbewertung einzelne Patienten oder nur das aggregierte Risiko? Und beansprucht es zu diagnostizieren oder einen Kliniker zu unterstützen, der verantwortlich bleibt? Die Antworten stehen meist in der Arbeit, nicht in der Pressemitteilung.
Quellen
4- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02Microsoft AI tool outperforms doctors in diagnosing complex medical casesEN
- 03Microsoft Says Its New AI System Diagnosed Patients 4 Times More Accurately Than Human DoctorsEN
- 04LLMs fail in 8 out of 10 early differential diagnosis casesEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.