Medyczne modele AI można przepytać i ustalić, czyje dane je trenowały
Niemieccy badacze pokazali, że dyskryminacyjne medyczne modele AI można nakłonić do potwierdzenia, czy dokumentacja konkretnego pacjenta trafiła do danych treningowych. Praca ukazała się w Nature 24 czerwca, a skuteczność ataku dla pojedynczych pacjentów była niemal doskonała.

O odkryciu pierwszy napisał The Register 24 czerwca. Ważniejsze od tego, co mówi o bezpieczeństwie modeli w ogóle, jest to, co wynika z niego dla obietnic prywatności, jakie szpitale, ubezpieczyciele i dostawcy AI składają pacjentom. Jeśli da się potwierdzić przynależność do zbioru treningowego, sam zbiór staje się kanałem ujawniania informacji. To właśnie jest niewygodne.
Moritz Knolle kieruje katedrą AI w ochronie zdrowia i medycynie na Uniwersytecie Technicznym w Monachium i stał na czele zespołu autorów pracy. Powiedział The Register, że zagrożenie nie jest hipotetyczne. „Można sobie wyobrazić scenariusze, w których przynależność do zbioru treningowego ujawnia, że ktoś ma uśpioną chorobę genetyczną, taką jak choroba Huntingtona, depresję, albo że uczęszczał do konkretnej, specjalistycznej kliniki leczenia” — powiedział. Scenariusz nie jest egzotyczny. To zwyczajna codzienność prowadzenia dokumentacji klinicznej.
Klasa ataków nie jest nowa. Ataki wnioskowania o przynależności, czyli MIA, są badane w literaturze uczenia maszynowego od lat, a ogólny kształt tej techniki jest dobrze znany: model bywa pewniejszy odpowiedzi na dane, które już widział, więc atakujący, który może odpytać model i odczytać jego wskaźniki pewności, jest w stanie wywnioskować przynależność. Praca w Nature dodaje skalę i kliniczną konkretność. Zespół przetestował siedem medycznych zbiorów danych AI obejmujących obrazy, zapisy EKG i ogólne elektroniczne dokumentacje zdrowotne. Ustalił, że pojedynczych pacjentów można zidentyfikować z niemal doskonałą skutecznością ataku. Ten wynik nie jest ciekawostką laboratoryjną. To pomiar tego, jak te modele zachowują się, gdy ktoś zada im właściwe pytanie.
Dlaczego audyty zbiorcze to przeoczają
Ten wynik przeczy temu, jak modele są dziś oceniane. Audyty prywatności mierzą zwykle skuteczność ataku zbiorczo w całym zbiorze danych, co daje uspokajającą średnią. Praca przekonuje, że to niewłaściwa jednostka analizy. „Fakt, że MIA mogą osiągać niemal doskonałą skuteczność dla pojedynczych pacjentów, nie jest należycie ujęty w standardowym protokole oceny, który mierzy skuteczność ataku zbiorczo na poziomie rekordów” — piszą badacze. Wniosek jest taki, że standardy raportowania audytów prywatności AI muszą się zmienić.
Jest drugie ustalenie, które nie pasuje do pierwszego. Pacjentów niedostatecznie reprezentowanych w kohorcie treningowej łatwiej zidentyfikować niż pozostałych, bo ich punkty danych się wyróżniają. Rasa, status ubezpieczenia, płeć, zastosowany protokół obrazowania i niektóre stany chorobowe mogą działać jak wartości odstające. Knolle podsumowuje ten wzorzec bez ogródek: „Ogólnie rzecz biorąc, ryzyko prywatności związane z MIA rośnie, gdy kohorta treningowa modelu staje się bardziej specyficzna”.
Im większy zbiór danych, tym łatwiej ujawnić pojedyncze rekordy — czytamy w pracy. Badacze zauważają, że skala tej zmiany ryzyka na poziomie pacjenta w większych modelach była wcześniej nieznana. To wynik sprzeczny z intuicją każdego, kto zakłada, że skala przynosi anonimowość. W obrazowaniu medycznym i genomice często dzieje się odwrotnie.
Czego naprawdę potrzebuje atakujący
Tu obraz praktyczny się komplikuje, a zastrzeżenia samych autorów nabierają znaczenia. Przeprowadzenie MIA przeciw modelowi medycznemu wymaga, by atakujący miał już jakieś dane należące do osoby, którą chce zidentyfikować. Knolle to potwierdził. „Aby przeprowadzić MIA, atakujący potrzebuje dostępu do docelowego punktu danych” — powiedział The Register. Dodał, że praca pokazuje, iż pełna dokumentacja pacjenta nie jest konieczna, wbrew wcześniejszym założeniom. „W naszej pracy pokazujemy, że atakujący z częściowym dostępem wciąż może skutecznie przeprowadzić MIA”.
Atakujący potrzebowałby po prostu dostępu do czyichś wyników badań krwi albo do ich części.
To znacznie obniża poprzeczkę. Atak działa tak, że częściowy rekord trafia do modelu, odczytuje się poziom pewności i wnioskuje, że pacjent jest w zbiorze treningowym. Zbiory użyte w badaniu były zanonimizowane, a Knolle zauważa, że atakujący nie musi wiedzieć, do kogo należą dane, żeby zadać pytanie. Powiązanie zanonimizowanych danych treningowych z konkretną osobą musi przyjść skądinąd, a tym skądinąd jest często wyciek.
Wycieki danych w ochronie zdrowia są wystarczająco częste, by nie było to rozważanie teoretyczne. Knolle opisuje scenariusz wprost: atakujący uzyskuje nieautoryzowany dostęp do bazy lekarza rodzinnego po rutynowym badaniu krwi i stamtąd może sondować model.
Zapytany, co miałby osiągnąć jego projekt, Knolle powiedział, że liczy na to, iż środowisko medycznej AI poważnie potraktuje ryzyko prywatności i zastosuje techniki ograniczające je tam, gdzie są potrzebne. Praca zaleca ramy prywatności różnicowej, które mają dawać matematyczne gwarancje anonimowości danych treningowych, oraz przebudowany standard audytu, raportujący ryzyko na poziomie jednostki, a nie zbiorczo. Trzecia możliwość, którą Knolle wymienił, to takie zestawienie danych treningowych, by grupy niedostatecznie reprezentowane były reprezentowane lepiej. Zmniejsza to efekt odstający, który czyni je łatwymi do zidentyfikowania.
Ostrzegł też przed traktowaniem każdego udanego MIA jako poważnego naruszenia. „Jest wiele sytuacji, w których udany MIA oznacza niewielkie lub pomijalne naruszenie prywatności” — zauważył, wskazując na modele trenowane na dużych, ogólnych populacjach, w których reprezentowani są zarówno zdrowi, jak i chorzy.
Luka regulacyjna
Na tle obecnych regulacji praca trafia w przestrzeń, którą przepisy jak dotąd słabo zapełniają. Audyty prywatności medycznej AI skupiają się zwykle na tym, czy dane zebrano zgodnie z prawem i czy usunięto identyfikatory. Nie sprawdzają, czy sam model można przepytać, by odtworzyć przynależność. Prywatność różnicowa jest dostępna jako technika, ale nie jest wymagana jednolicie, a argument pracy sprowadza się do tego, że reżim oceny mierzy niewłaściwą rzecz.
Ta luka nie dotyczy tylko Europy. Regulatorzy w kilku jurysdykcjach pracują nad tym, jak klasyfikować i nadzorować narzędzia AI używane w warunkach klinicznych. Propozycje sięgają od reżimów zatwierdzania przed wprowadzeniem na rynek po łagodniejsze wytyczne dla zastosowań o niższym ryzyku. Żadne z krążących ram, jeśli wierzyć autorom pracy, nie odpowiada na ryzyko przynależności na poziomie jednostki, które pokazują ich eksperymenty.
Istnieje równoległy zbiór dowodów sugerujących, że skuteczność diagnostyczna tych systemów jest także słabsza, niż wynika z marketingu. Badania opublikowane w JAMA Network Open w kwietniu, prowadzone przez studenta medycyny Harvardu Aryę Rao i opisane przez The Register 15 kwietnia, przetestowały 21 gotowych modeli AI na 29 standaryzowanych winietach klinicznych. Modele wypadały dobrze, gdy dostawały pełny zestaw informacji i pytano je o ostateczną diagnozę — wiodące modele były poprawne w 91 procentach przypadków. Wczesna diagnoza różnicowa, etap, na którym klinicyści ważą konkurencyjne możliwości, zawiodła w ponad 8 na 10 przypadków.
„Każdy model, który testowaliśmy, zawiódł w zdecydowanej większości przypadków” — powiedziała Rao The Register. „To etap, na którym niepewność ma największe znaczenie, i tu te systemy są najsłabsze”. Dr Marc Succi, radiolog w Massachusetts General Hospital i współautor, powiedział, że wyniki sugerują, iż dzisiejszym gotowym modelom nie należy ufać w rozumowaniu diagnostycznym kierowanym do pacjenta bez ustrukturyzowanego, kompleksowego przeglądu przez człowieka.
Rao zauważyła też, że surowsza miara porażki nie mówi całej historii. Mierzona jako surowa dokładność, proporcja przypadków, w których model podał w pełni poprawną odpowiedź, wynosiła od 63 do 78 procent. Jej zdaniem sugeruje to, że modele były często częściowo poprawne, nawet gdy zawodziły według surowszej definicji.
Obie prace wskazują ten sam kierunek z różnych stron. Jedna pokazuje, że modele mogą ujawniać, kto był w ich danych treningowych. Druga pokazuje, że są zawodne na etapie rozumowania, na którym wartość kliniczna jest najwyższa. Żadne z tych ustaleń samo w sobie nie jest rozstrzygające i żadne nie wyklucza użytecznego wdrożenia w wąskich, dobrze nadzorowanych zastosowaniach.
Podważają jednak założenie, że obecne audyty prywatności i wskaźniki skuteczności razem wystarczają, by uznać medyczną AI za bezpieczną. Autorzy pracy w Nature chcą przepisania standardów audytu tak, by raportowały ryzyko na poziomie jednostki. Zespół z JAMA chce, by twierdzenia marketingowe o agentach diagnostycznych odpowiadały dowodom. Jedni i drudzy proszą o to samo: ocenę, która odzwierciedla, jak te systemy zawodzą, a nie jak wypadają średnio.
Źródła
2- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.