Regulacje AI w medycynie: co badania faktycznie pokazują o narzędziach diagnostycznych
Modele AI do diagnostyki można nakłonić do ujawnienia, czy dane konkretnego pacjenta posłużyły do ich treningu. 24 czerwca 2026 roku donieśli o tym niemieccy badacze w Nature. Osobny system Microsoftu miał osiągnąć 85,5% skuteczności diagnostycznej wobec lekarzy. Regulatorzy wciąż za tym nie nadążają.

Dwa wyniki badań, opublikowane mniej więcej rok od siebie, niezręcznie leżą obok siebie. Jeden mówi, że medyczna AI potrafi pobić lekarzy w trudnych diagnozach. Drugi mówi, że ta sama klasa modeli ujawnia informacje o pacjentach, na których się uczyła. Oba prowadzą do tego samego nierozstrzygniętego pytania: czego właściwie powinny wymagać regulacje medycznej AI?
Pierwszy wynik pochodzi od Microsoftu. Jak podał GeekWire, firma ogłosiła MAI Diagnostic Orchestrator, czyli MAI-DxO, 30 czerwca 2025 roku. System zmierzył się z 21 doświadczonymi lekarzami ze Stanów Zjednoczonych i Wielkiej Brytanii, którzy rozwiązywali złożone przypadki z New England Journal of Medicine. Poprawną diagnozę postawił w 85,5% przypadków, lekarze osiągnęli 20%.
Co mierzył benchmark Microsoftu, a czego nie
Zbiór testowy to 304 niedawne studia przypadków z NEJM, zamienione w coś, co Microsoft nazwał Sequential Diagnosis Benchmark. WIRED podał, że model językowy rozbijał każdy przypadek na krok po kroku proces, który przeszedłby lekarz. MAI-DxO odpytwał następnie kilka wiodących modeli, w tym GPT od OpenAI, Gemini od Google, Claude od Anthropic, Llama od Meta i Grok od xAI. Układ miał przypominać dyskusję kilku ekspertów. MAI-DxO w parze z o3 od OpenAI wypadł najlepiej, podał GeekWire.
WIRED podał skuteczność na poziomie 80%, nie 85,5%, i napisał, że system obniżył koszty o 20%, zlecając tańsze badania. Obie liczby pochodzą z tego samego projektu, ale z różnych opisów. GeekWire podaje 85,5% i 20% dla lekarzy, WIRED podaje 80% i 20%. Ktokolwiek powołuje się na ten benchmark, powinien sprawdzić, którą wartość bierze.
"Robicie wielki krok w stronę medycznej superinteligencji" powiedział Mustafa Suleyman, dyrektor generalny Microsoft AI, w poście na LinkedIn, według GeekWire.
Zewnętrzni badacze byli bardziej powściągliwi. Naukowiec z MIT David Sontag powiedział WIRED, że praca jest mocna metodologicznie, ale ostrzegł, że lekarzom w badaniu kazano nie korzystać z żadnych dodatkowych narzędzi, co nie odzwierciedla realnej praktyki. Eric Topol ze Scripps Research Institute nazwał to imponującym raportem o złożonych przypadkach. Obaj stwierdzili, że kolejnym krokiem walidacji byłoby badanie kliniczne porównujące system z prawdziwymi lekarzami leczącymi prawdziwych pacjentów. Microsoft nie zdecydował, czy skomercjalizuje narzędzie, podał WIRED, a wdrożenie kliniczne wymagałoby testów bezpieczeństwa i zgody regulatora.
Odkrycie dotyczące prywatności, które wszystko komplikuje
24 czerwca 2026 roku The Register opisał pracę w Nature niemieckich badaczy. Zespół przetestował ataki wnioskowania o przynależności, czyli MIA, przeciwko siedmiu medycznym zbiorom danych AI zawierającym obrazy, zapisy EKG i ogólne elektroniczne dokumentacje medyczne. Ataki te odpytują model, żeby ustalić, czy konkretny punkt danych znajdował się w jego zbiorze treningowym.
Wynik: w przypadku pojedynczych pacjentów ataki udawały się z, jak to nazwali badacze, niemal doskonałą skutecznością. Praca przekonuje, że standardowe protokoły oceny tego nie wychwytują, bo mierzą skuteczność ataku zbiorczo, po wszystkich rekordach. Grupy niedoreprezentowane łatwiej było zidentyfikować. Rasa, status ubezpieczenia, płeć, protokół obrazowania i niektóre stany chorobowe działają jak wartości odstające, które wyróżniają jednostki.
Moritz Knolle, który kieruje katedrą AI w ochronie zdrowia i medycynie na Technical University of Munich i jest głównym autorem pracy, powiedział The Register, że ryzyko dla prywatności rośnie, gdy kohorta treningowa staje się bardziej specyficzna. Podał przykład przynależności do zbioru danych, która ujawnia ukrytą chorobę genetyczną, taką jak choroba Huntingtona, depresję albo uczęszczanie do specjalistycznej kliniki leczenia.
Istnieje praktyczne ograniczenie. Aby przeprowadzić atak, napastnik potrzebuje co najmniej częściowych danych osoby, którą chce zidentyfikować. Knolle powiedział The Register, że praca pokazuje, iż częściowy dostęp wystarcza, wbrew wcześniejszym założeniom. Zaproponował scenariusz, w którym napastnik uzyskuje nieautoryzowany dostęp do bazy lekarza rodzinnego po rutynowym badaniu krwi.
"Mam nadzieję, że środowisko medycznej AI zacznie traktować ryzyko dla prywatności poważnie i że techniki ograniczania ryzyka będą stosowane tam, gdzie są konieczne" powiedział Knolle.
Badacze zalecają ramy prywatności różnicowej, które mają dawać matematyczne gwarancje, że dane treningowe pozostają anonimowe, oraz zmiany w standardach audytu prywatności, żeby oceniały ryzyko na poziomie jednostki, a nie zbiorczo. Sugerują też takie zestawianie danych treningowych, żeby grupy niedoreprezentowane były lepiej reprezentowane. Knolle zauważył, że wiele udanych ataków oznacza niewielkie lub pomijalne naruszenie prywatności, na przykład gdy modele uczą się na dużych populacjach ogólnych obejmujących zarówno osoby zdrowe, jak i chore.
Dowody, że modele zawodzą wcześnie, tam gdzie to najważniejsze
Trzecie badanie tnie w poprzek entuzjazmu. W kwietniu 2026 roku The Register opisał badania opublikowane w JAMA Network Open, kierowane przez studenta medycyny Harvardu Aryę Rao. Zespół przetestował 21 gotowych modeli AI na 29 standaryzowanych winietach klinicznych. Gdy podano im pełny zestaw informacji medycznych i poproszono o ostateczną diagnozę, wiodące modele były poprawne w 91% przypadków. Wczesna diagnoza różnicowa, etap, na którym klinicyści włączają i wykluczają schorzenia, gdy niepewność jest największa, zawiodła w ponad 8 na 10 przypadków.
Rao powiedział The Register, że każdy testowany model zawiódł w zdecydowanej większości przypadków, a wczesna diagnoza różnicowa jest najsłabszym punktem tych systemów. Współautor, dr Marc Succi, radiolog w Massachusetts General Hospital, stwierdził, że wyniki sugerują, iż gotowym modelom LLM nie należy ufać w rozumowaniu diagnostycznym kierowanym do pacjenta bez ustrukturyzowanego, kompleksowego przeglądu przez człowieka. Dodał, że modele potrafią sprawiać wrażenie pewności siebie, nie pokazując rzetelnego rozumowania, co może nasilać lęk pacjentów.
Rao przedstawił też zastrzeżenie: porażka w ścisłym rozumieniu przyjętym w pracy nie zawsze oznaczała, że model się mylił. Mierzone jako surowa dokładność, czyli odsetek poprawnych odpowiedzi na przypadek, wyniki wahały się od 63% do 78%, co znaczy, że modele często były częściowo poprawne. Zespół nadal twierdzi, że surowsza miara ma znaczenie, bo modele LLM są reklamowane jako narzędzia pierwszej linii, które zawężają diagnozy, zanim przejmie je człowiek.
Jak wygląda stan regulacji
Żadna z tych trzech prac nie jest dokumentem regulacyjnym, a dossier stojące za tym artykułem nie zawiera tekstu żadnej reguły dotyczącej AI w medycynie. Pokazuje natomiast kształt problemu, przed którym stoją regulatorzy. Dokładność diagnostyczna na wyselekcjonowanych przypadkach może wyglądać mocno, gdy jednocześnie zawodzi rozumowanie na wczesnym etapie, a audyty prywatności mogą przechodzić, gdy poszczególni pacjenci pozostają identyfikowalni.
Praca Microsoftu wskazuje jeden kierunek: udowodnić działanie systemu w badaniu klinicznym, a potem starać się o zgodę. Praca w Nature wskazuje inny: zmienić sposób pisania audytów prywatności i przyjąć techniki takie jak prywatność różnicowa przed wdrożeniem. Badanie w JAMA wskazuje na etykietowanie i marketing, przekonując, że opisywanie modeli LLM jako agentów diagnostycznych tworzy fałszywą pewność dokładnie tam, gdzie są najmniej niezawodne.
Dla każdego, kto czyta o produkcie medycznej AI, z powyższych dowodów wynikają trzy pytania. Czy testowano go na prawdziwych pacjentach w warunkach klinicznych, czy na opublikowanych studiach przypadków? Czy jego ocena prywatności patrzy na pojedynczych pacjentów, czy tylko na ryzyko zbiorcze? I czy twierdzi, że diagnozuje, czy że wspiera klinicystę, który pozostaje odpowiedzialny? Odpowiedzi są zwykle w pracy, nie w komunikacie prasowym.
Źródła
4- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02Microsoft AI tool outperforms doctors in diagnosing complex medical casesEN
- 03Microsoft Says Its New AI System Diagnosed Patients 4 Times More Accurately Than Human DoctorsEN
- 04LLMs fail in 8 out of 10 early differential diagnosis casesEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.