Medyczna AI potrafi wskazać pacjentów, na których się uczyła
Modele AI do diagnozy medycznej można nakłonić do ujawnienia, czy dane konkretnego pacjenta posłużyły do ich treningu. Niemieccy naukowcy opisali to w pracy opublikowanej w środę w Nature. W przypadku pojedynczych pacjentów skuteczność ataku była niemal doskonała. Wyniki pojawiają się, gdy FDA, UE i WHO wciąż piszą zasady audytu takich urządzeń.

Atak nazywa się membership inference attack, w skrócie MIA. The Register informował 24 czerwca, że zespół przebadał siedem medycznych zbiorów danych AI: obrazy, zapisy EKG i ogólne elektroniczne dokumentacje medyczne. Pojedynczych pacjentów, których dotyczy taki atak, można zidentyfikować z niemal doskonałą skutecznością, jak określają to autorzy. Standardowy protokół oceny tego nie wychwytuje, bo mierzy skuteczność ataku zbiorczo, po wszystkich rekordach.
Medyczne modele AI są pewniejsze siebie, gdy dane wejściowe należały już do ich zbioru treningowego. Atakujący podaje modelowi dane pacjenta, odczytuje poziom pewności i wnioskuje, że pacjent był częścią kohorty treningowej.
Moritz Knolle z Uniwersytetu Technicznego w Monachium, główny autor pracy, powiedział The Register, że atakujący nie musi wiedzieć, do kogo należą dane. "Wszystkie zbiory, których używamy w naszym badaniu, były zanonimizowane" - stwierdził. Częściowy dostęp wystarcza. "Atakujący potrzebowałby po prostu dostępu do czyichś wyników badania krwi albo do części tych wyników."
Najłatwiej wskazać osoby odstające
Wzorzec tego, kto jest narażony, jest niewygodny. Grupy słabiej reprezentowane w medycznych danych treningowych łatwiej zidentyfikować niż pacjentów, których rekordy się nie wyróżniają. Praca wymienia rasę, status ubezpieczenia, płeć, zastosowany protokół obrazowania i niektóre schorzenia jako kategorie, które mogą działać jak wartości odstające. Knolle podsumował to dla The Register tak: "Ogólnie rzecz biorąc, ryzyko dla prywatności ze strony MIA rośnie, im bardziej specyficzna staje się kohorta treningowa modelu."
Podał przykład kohorty treningowej, która ujawnia utajoną chorobę genetyczną, taką jak choroba Huntingtona, depresję albo leczenie w wyspecjalizowanej klinice. Innymi słowy, sama przynależność do zbioru zdradza diagnozę. Praca wykazała też, że im większy zbiór danych, tym łatwiej ujawnić rekordy. Skali tej zmiany ryzyka na poziomie pacjenta w większych modelach wcześniej nie znano.
Atakujący potrzebuje pewnych danych medycznych o osobach, które chce zidentyfikować. Włamania do systemów ochrony zdrowia są na tyle częste, że nie jest to wysoka poprzeczka. Knolle przywołał scenariusz nieuprawnionego dostępu do bazy lekarza rodzinnego po rutynowym badaniu krwi.
Jego cel jest wąski: żeby środowisko medycznej AI poważnie traktowało ryzyko dla prywatności i stosowało środki zaradcze tam, gdzie są potrzebne. Praca zaleca ramy prywatności różnicowej, które mają dawać matematyczną gwarancję anonimowości danych treningowych, oraz przepisanie standardów audytu prywatności tak, by mierzyły ryzyko na poziomie jednostki, a nie zbiorczo. Knolle wspomniał też o innym rozwiązaniu: zestawianiu danych treningowych tak, by grupy słabiej reprezentowane były lepiej reprezentowane.
Regulatorzy wciąż nadrabiają podstawy
Te wyniki trafiają w obraz regulacyjny, który się zmienia, i to nierówno. IntuitionLabs w raporcie zaktualizowanym 18 sierpnia podaje, że FDA do połowy 2024 roku autoryzowała około 950 urządzeń AI i uczenia maszynowego, z około 100 nowymi autoryzacjami rocznie. Analitycy rynkowi cytowani w tym samym raporcie wycenili urządzenia medyczne oparte na AI na 13,7 mld dolarów w 2024 roku i prognozują ponad 255 mld dolarów do 2033 roku. Autoryzacje zdominowane są przez radiologię, a rozwijają się kardiologia, neurologia, anestezjologia i okulistyka.
Ten sam raport zauważa, że przeglądy systematyczne pokazują, iż tylko znikomą część autoryzowanych urządzeń AI potwierdzają randomizowane badania albo dane o wynikach pacjentów. Awarie urządzeń wiązano z obrażeniami ciała, w jednym zgłoszonym przypadku ze zgonem. Przywołuje narzędzie do triage'u na OIOM-ie, które zbyt rzadko wskazywało czarnoskórych pacjentów do dodatkowej opieki, oraz badania kolonoskopowe, w których wykrywalność lekarzy spadała, gdy opierali się na AI.
Jeśli chodzi o prywatność, postulat pracy, by audyt prowadzić na poziomie jednostki, zderza się z systemem zbudowanym pod raportowanie zbiorcze. Podsumowania decyzji FDA często pomijają kluczowe dane o skuteczności i bezpieczeństwie, wynika z przeglądu IntuitionLabs, a przestrzeganie standardów na świecie jest nierówne. Unijny AI Act, obowiązujący od 2024 roku, uznaje wiele systemów AI w ochronie zdrowia za wysokiego ryzyka i dokłada pracę zgodnościową na wierzch rozporządzenia o wyrobach medycznych. WHO opublikowała w 2023 roku zalecenia dotyczące przejrzystości, jakości danych i nadzoru nad cyklem życia.
MD+DI opublikowało wywiad z Suzanne Levy Friedman, prawniczką zajmującą się wyrobami medycznymi FDA. Powiedziała, że według jej ostatniego rachunku FDA autoryzowała ponad tysiąc urządzeń opartych na AI. Żadne z nich nie ma wbudowanego modelu uczącego się w trybie ciągłym, stwierdziła. Część jej nowszych klientów jest tym zaskoczona. Ona nie.
"Przy całym podnieceniu innowacją ludzie zapominają, że FDA to przede wszystkim agencja zdrowia publicznego" - powiedziała Friedman MD+DI. "Oni nie starają się być trudni, starają się, żeby pacjenci nie doznali krzywdy, a klinicyści mieli właściwe informacje i nie dali się przypadkiem namówić na poleganie na rzeczach, które mogą nie być zwalidowane."
Friedman wskazała dwie luki, które istniały przed pracą o prywatności. Oprogramowanie zmienia się szybciej niż ramy pomyślane dla sprzętu, a dryf rzeczywistej skuteczności może dotknąć zwalidowane produkty, gdy zmieni się struktura pacjentów, jak stało się w czasie COVID. Obok tego jest stronniczość algorytmów, a FDA prosi producentów o szczegółowe dane o ich algorytmach, co część uważa za nadmiarowe.
Sąsiedni problem z dowodami klinicznymi
Prywatność to nie jedyny słaby punkt bazy dowodowej. The Register informował 15 kwietnia o badaniu w JAMA Network Open, prowadzonym przez Aryę Rao, studenta medycyny na Harvardzie, które sprawdzało 21 gotowych modeli AI na 29 standaryzowanych winietach klinicznych. Modele miały rację w 91 procentach przypadków przy diagnozie końcowej, gdy dostawały pełny zestaw informacji. Przy wczesnej diagnozie różnicowej, na etapie, gdy klinicyści pod niepewnością włączają i wykluczają schorzenia, odsetek błędów przekroczył 80 procent.
"Każdy model, który testowaliśmy, zawiódł w zdecydowanej większości przypadków" - powiedział Rao The Register. "To etap, na którym niepewność liczy się najbardziej, i tu te systemy są najsłabsze."
Współautor Marc Succi, radiolog w Massachusetts General Hospital, ostrzegł, że pewność siebie bez rozumowania jest sama w sobie zagrożeniem, zwłaszcza dla zaniepokojonych pacjentów. Przekonywał też, że wysokie wyniki przy diagnozie końcowej mogą dawać mylne poczucie bezpieczeństwa, bo prawdziwe rozumowanie kliniczne zaczyna się wcześniej, gdy niejednoznaczność jest największa. Rao zauważył, że surowsza miara błędów to nie jedyny sposób czytania tych danych: surowa dokładność wynosiła od 63 do 78 procent, co znaczy, że modele często miały częściowo rację.
Obie prace wskazują ten sam kierunek z różnych stron. Jedna pokazuje, że dane treningowe stojące za modelem diagnostycznym można odpytać, by zidentyfikować pacjentów w nich zawartych. Druga pokazuje, że te same modele, poproszone o rozumowanie w sposób, w jaki robią to klinicyści, zawodzą tam, gdzie stawka jest najwyższa. Obie powstały, gdy standardy audytu, które mają wychwytywać takie problemy, wciąż są w fazie projektu.
Zastrzeżenie Knollego warto zapamiętać. Powiedział The Register, że w wielu sytuacjach udany MIA oznacza niewielkie albo pomijalne naruszenie prywatności, mianowicie w modelach trenowanych na dużych, ogólnych populacjach obejmujących zarówno osoby zdrowe, jak i chore. Ryzyko skupia się tam, gdzie kohorty są wąskie, a wąskie kohorty to dokładnie to, czego zwykle potrzebuje specjalistyczna medyczna AI.
Źródła
4- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
- 03AI Medical Devices: 2025 Status, Regulation & ChallengesEN
- 04How Is FDA Regulating AI Medical Devices in 2026?EN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.