Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

EU AI Act und KI in der medizinischen Diagnose: Was die Regeln tatsächlich sagen

KI für medizinische Diagnosen wird schneller verkauft, als Aufsichtsbehörden sie prüfen können. Drei aktuelle Studien zeigen das Kernproblem: Die Modelle sind schwer zu überprüfen, schwer abzusichern und schwer zu beziffern.

GesundheitErklärtHanna VogtVeröffentlicht: 27. September 20265 Min. LesezeitQuellen 5
EU AI Act und KI in der medizinischen Diagnose: Was die Regeln tatsächlich sagen

Die regulatorische Frage lautet nicht, ob KI diagnostizieren kann. Sie lautet, ob jemand belegen kann, wie gut sie das tut. Zwei Arbeiten, die mit einigen Monaten Abstand erschienen sind, zeigen, wie weit die Lücke inzwischen ist.

Am 24. Juni 2026 berichteten Forscher der Technischen Universität München in Nature, dass medizinische KI-Modelle für Diagnosen anfällig für Membership-Inference-Angriffe (MIA) sind. Solche Abfragen versuchen herauszufinden, ob die Akte eines bestimmten Patienten Teil der Trainingsdaten war. The Register berichtete am selben Tag über die Arbeit. Das Team testete sieben medizinische KI-Datensätze mit Bildern, EKG-Aufzeichnungen und allgemeinen elektronischen Gesundheitsakten. Das Ergebnis: Einzelne Patienten lassen sich mit einer Erfolgsquote identifizieren, die die Autoren als nahezu perfekt bezeichnen.

Das ist ein Datenschutzproblem. Es ist zugleich ein Messproblem. Die Forscher formulieren es so: Nahezu perfekte Erfolgsquoten für einzelne Patienten erfasst das Standardprotokoll zur Bewertung nicht angemessen, weil es den Angriffserfolg über alle Datensätze hinweg aggregiert misst. Ein Audit, das einen Durchschnittswert ausweist, kann den Einzelfall vollständig verfehlen.

Was die Regeln verlangen und was sie übersehen

Der EU AI Act ist das Rahmenwerk, das in dieser Debatte am häufigsten genannt wird. Die operative Detailtiefe bleibt in diesem Dossier dünn. Die Quellen zeigen eine Lücke zwischen der Compliance-Sprache der Anbieter und der Sicherheitsforschung aus demselben Zeitraum.

Ein GitHub-Projekt namens srta-ai-accountability beschreibt sich selbst als erstes System, das Warum-Fragen in der erklärbaren KI mit 94 % EU-AI-Act-Konformität adressiert. Es ist ausdrücklich als Forschungsprototyp und konzeptionelle Architektur gekennzeichnet. So steht es zumindest um einen Teil der Accountability-Werkzeuge: eine Behauptung von 94 % Konformität, veröffentlicht in einem Code-Repository, ohne dass eine Aufsichtsbehörde hinter dieser Zahl steht.

Die Münchner Arbeit weist in eine andere Richtung. Ihre Autoren wollen die Berichtsstandards für Datenschutz-Audits von KI ändern, damit Risiken auf der Ebene einzelner Personen gezählt werden und nicht nur aggregiert. Sie empfehlen außerdem Framework für differenziellen Datenschutz, die mathematisch garantieren sollen, dass Trainingsdaten anonym bleiben. Und sie schlagen vor, Trainingsdaten so zusammenzustellen, dass unterrepräsentierte Gruppen besser vertreten sind.

Der Erstautor Moritz Knolle sagte gegenüber The Register, Datenschutzrisiken durch MIA würden schwerwiegender, je spezifischer die Trainingskohorte eines Modells sei. Er nannte das Beispiel, dass die Zugehörigkeit zu einem Trainingsdatensatz verraten kann, dass jemand eine ruhende genetische Erkrankung wie Chorea Huntington hat, an Depressionen leidet oder eine bestimmte spezialisierte Behandlungsklinik besucht hat.

Die Genauigkeitsversprechen, die Aufsichtsbehörden abwägen müssen

Die diagnostische Leistung ist die andere Hälfte des regulatorischen Problems. Die Zahlen sind hier ungewöhnlich unübersichtlich.

Microsoft kündigte seinen AI Diagnostic Orchestrator (MAI-DxO) am 30. Juni 2025 an. GeekWire berichtete, das Werkzeug habe 21 erfahrene Ärzte aus den USA und Großbritannien bei komplexen Fällen aus dem New England Journal of Medicine geschlagen, mit 85,5 % gegen 20 % bei den Ärzten. WIRED berichtete am 1. Juli 2025 über dieselbe Arbeit, nannte 80 % gegen 20 % und schrieb, das System senke die Kosten um 20 %, indem es günstigere Tests auswähle. Der Benchmark bestand aus 304 aktuellen Fällen des NEJM.

Diese Zahlen tragen einen Vorbehalt, der in beiden Darstellungen auftaucht. Die Ärzte in der Studie durften weder Kollegen konsultieren noch externe Ressourcen nutzen. So arbeiten Kliniker nicht. Der MIT-Wissenschaftler David Sontag sagte zu WIRED, Microsofts Ergebnisse seien aus genau diesem Grund mit Vorsicht zu behandeln, und es sei offen, ob das System in der Praxis Kosten senken würde. Microsoft selbst erklärte, das Werkzeug brauche klinische Tests und eine regulatorische Zulassung, bevor es eingesetzt werden könne.

Dann ist da der Fehlerfall. Am 15. April 2026 berichtete The Register über eine Studie in JAMA Network Open unter Leitung des Harvard-Medizinstudenten Arya Rao. Sie testete 21 führende Standard-KI-Modelle an 29 standardisierten klinischen Vignetten. Die Modelle lagen in 91 % der Fälle richtig, wenn sie mit vollständigen Informationen um eine endgültige Diagnose gebeten wurden. Bei der frühen Differenzialdiagnose aber, der Phase, in der Kliniker Erkrankungen in Betracht ziehen und ausschließen, versagten sie in mehr als 8 von 10 Fällen.

Jedes Modell, das wir getestet haben, versagte bei der überwiegenden Mehrheit der Fälle, sagte Rao zu The Register. Das ist die Phase, in der Unsicherheit am wichtigsten ist, und dort sind diese Systeme am schwächsten.

Der Radiologe Dr. Marc Succi vom Massachusetts General Hospital, ein Mitautor, sagte derselben Publikation, heutige Standardmodelle dürften ohne strukturierte umfassende menschliche Überprüfung nicht für diagnostische Schlussfolgerungen gegenüber Patienten herangezogen werden. Er sagte außerdem, höhere Erfolgsquoten bei der endgültigen Diagnose sollten nicht beruhigen, weil echtes klinisches Denken früher beginne, wenn die Unklarheit am größten sei.

Was eine Aufsichtsbehörde prüfen müsste

Legt man die drei Befunde nebeneinander, wird das Auditproblem konkret.

  • Datenschutz: Einzelne Patienten in einem Trainingsdatensatz lassen sich mit hoher Erfolgsquote identifizieren, und unterrepräsentierte Gruppen sind leichter zu identifizieren als andere. Aggregierte Berichte verbergen das.
  • Leistung: Dieselbe Modellklasse kann 91 % bei der endgültigen Diagnose erreichen und in mehr als 80 % der frühen Differenzialfälle versagen.
  • Benchmark-Design: Microsofts Schlagzeilergebnis stammt aus einem Test, in dem menschliche Ärzte ohne die Ressourcen arbeiteten, die sie normalerweise nutzen.

Nichts davon bedeutet, dass medizinische KI nicht regulierbar wäre. Es bedeutet, dass die derzeitigen Instrumente die falsche Einheit messen. Eine aggregierte Datenschutzkennzahl, eine Trefferquote bei der endgültigen Antwort und ein Benchmark unter künstlichen Bedingungen lassen sich leicht veröffentlichen und schwer widerlegen.

Knolle sagte, er hoffe, dass die Community der medizinischen KI Datenschutzrisiken ernst zu nehmen beginne und dass Risikominderungstechniken dort eingesetzt würden, wo sie nötig seien. Er merkte außerdem an, dass ein erfolgreicher MIA in vielen Situationen einen geringen oder vernachlässigbaren Datenschutzverstoß darstelle, etwa bei Modellen, die auf großen allgemeinen Populationen trainiert wurden.

Offen bleibt die Frage, wer entscheidet, in welcher Situation sich ein bestimmtes Modell befindet. Nach dem EU AI Act soll diese Entscheidung beim Anbieter und beim Auditor liegen, nicht bei den Autoren einer Arbeit und nicht bei einem Repository, das sich selbst 94 % bescheinigt.

Kommentare 0

Quellen

5
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02Microsoft AI tool outperforms doctors in diagnosing complex medical casesEN
  3. 03Microsoft Says New AI Diagnosed Patients 4 Times More Accurately Than DoctorsEN
  4. 04LLMs fail in 8 out of 10 early differential diagnosis casesEN
  5. 05srta-ai-accountability: AI Accountability FrameworkEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Hanna Vogt

Hanna Vogt

Wissenschaft und Gesundheit

Hanna Vogt schreibt für FLASH24 über Wissenschaft und Gesundheit und stützt sich dabei auf Primärstudien, Behördenberichte und Rohdaten statt auf Pressemitteilungen. Bei Zahlen prüft sie Stichprobengrößen, Konfidenzintervalle und ob die zitierte Quelle die Aussage tatsächlich deckt. Für ihre Texte spricht sie mit Studienautorinnen, wartet auf Peer-Review-Fassungen und vergleicht Vorabdrucke mit der finalen Publikation. Dass sie privat Materialphysik verfolgt und mit eigenem Teleskop den Himmel beobachtet, erklärt, warum sie bei Messmethoden und Instrumenten genau nachfragt. Sie publiziert keine Ergebnisse, deren Datengrundlage sie nicht selbst eingesehen hat.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.