Badanie Nature: medyczne modele AI zdradzają, na czyich danych je trenowano
Niemieccy naukowcy pokazali, że modele AI wspierające diagnostykę można odpytywać tak, by ustalić, czy dane konkretnego pacjenta trafiły do zbioru treningowego. Na poziomie pojedynczych osób skuteczność ataku określają jako niemal doskonałą.

Wyniki ukazały się w pracy w Nature w środę 24 czerwca, tego samego dnia opisał je The Register. Analiza obejmuje siedem medycznych zbiorów danych AI: obrazy, zapisy EKG oraz ogólne elektroniczne dokumenty medyczne. Zdaniem zespołu stosowane dziś audyty prywatności pomijają to ryzyko, bo mierzą skuteczność ataku zbiorczo, a nie pacjent po pacjencie.
Sama klasa ataku nie jest nowa. Nowe jest to, jak dobrze wypada na modelach medycznych.
Ataki wnioskowania o przynależności (membership inference attacks, MIA) polegają na odpytywaniu modelu, żeby ustalić, czy dany punkt danych był w zbiorze treningowym. Modele dyskryminacyjne, czyli te służące do klasyfikowania danych i przewidywania wyników dla nowych wejść, są szczególnie łatwe do sondowania, piszą autorzy. W ich analizie pojedyncze osoby, na które wymierzono taki atak, dało się zidentyfikować z niemal doskonałą skutecznością. Ma to znaczenie, bo samo potwierdzenie przynależności do zbioru treningowego jest ujawnieniem informacji. Jeśli model trenowano na kohorcie z wyspecjalizowanej kliniki, dowód, że czyjaś dokumentacja należy do tej kohorty, może ujawnić diagnozę, której ta osoba nie zamierzała zdradzać.
Pacjentów niedoreprezentowanych łatwiej wytropić
Praca wykazała też, że pacjenci będący odstającymi przypadkami w zbiorze treningowym są łatwiejsi do zidentyfikowania niż pozostali. Jak podają autorzy, jako odstające cechy mogą działać rasa, status ubezpieczenia, płeć, użyty protokół obrazowania oraz niektóre schorzenia.
Moritz Knolle, który kieruje katedrą AI in Healthcare and Medicine na Uniwersytecie Technicznym w Monachium i jest pierwszym autorem pracy, ujął ten kompromis wprost w wymianie mailowej z The Register. "Ogólnie rzecz biorąc, ryzyko dla prywatności ze strony MIA rośnie, gdy kohorta treningowa modelu staje się bardziej szczegółowa" - powiedział. Podał przykład: "Można sobie wyobrazić scenariusze, w których przynależność do zbioru treningowego ujawnia, że ktoś ma uśpioną chorobę genetyczną, taką jak choroba Huntingtona, depresję, albo że leczył się w konkretnej, wyspecjalizowanej klinice".
Autorzy opisują jeszcze jeden efekt działający w złą stronę. Większe zbiory danych ułatwiają ujawnienie dokumentacji, a nie utrudniają, a praca stwierdza, że skali tej zmiany ryzyka na poziomie pacjenta nie mierzono wcześniej dla większych modeli.
Czego naprawdę potrzebuje atakujący
Z tego wszystkiego nie wynika, że obcy może wskazać model i wyciągnąć z niego nazwiska. MIA wymaga, by atakujący miał już punkt danych, który chce sprawdzić. Knolle to potwierdził, zaznaczając zarazem, że praca zawęża, jak dużo danych potrzeba.
"Do przeprowadzenia MIA atakujący potrzebuje dostępu do docelowego punktu danych" - powiedział The Register. "W naszej pracy pokazujemy, że atakujący z częściowym dostępem nadal może skutecznie przeprowadzić MIA".
Mechanizm opiera się na pewności modelu. Medyczne modele AI są zwykle bardziej pewne, gdy wejście pochodziło ze zbioru treningowego, więc atakujący podaje zdobyte dane pacjenta, odczytuje poziom pewności i wnioskuje o przynależności. Knolle powiedział, że atakujący nie musi wiedzieć, do kogo należą dane. Wszystkie zbiory użyte w badaniu były anonimizowane, dodał, co nie chroni przed tego rodzaju wnioskowaniem. "Atakujący potrzebowałby po prostu dostępu do czyichś wyników badań krwi albo do ich części" - powiedział Knolle. Pytany, skąd takie dane, wskazał na rutynową ekspozycję, a nie egzotyczną intruzję: "Biorąc pod uwagę, że dane medyczne nie zawsze są bezpiecznie przechowywane, nie jest nie do pomyślenia, że atakujący zdobędzie dostęp, na przykład włamując się do bazy danych lekarza rodzinnego po rutynowym badaniu krwi".
Zalecenia i jedno zastrzeżenie
Zalecenia zespołu nie są egzotyczne. Chcą stosowania mechanizmów prywatności różnicowej tam, gdzie ryzyko to uzasadnia, przepisania standardów audytu prywatności tak, by oceniały ryzyko na poziomie jednostki, a nie zbiorczo, oraz składania danych treningowych tak, by grupy niedoreprezentowane były lepiej reprezentowane, a nie zostawały jako odstające przypadki.
Knolle określił swój cel wąsko. "Mam nadzieję, że środowisko medycznej AI zacznie poważnie traktować ryzyko dla prywatności i że techniki jego ograniczania będą stosowane tam, gdzie są konieczne" - powiedział. Sprzeciwił się też traktowaniu każdego udanego ataku jako skandalu. "Jest wiele sytuacji, w których udana MIA oznacza niewielkie lub pomijalne naruszenie prywatności" - zauważył, opisując modele trenowane na dużych, ogólnych populacjach, w których występują zarówno osoby zdrowe, jak i chore.
Kontekst regulacyjny, w który trafia praca, jest gęsty, ale ubogi w konkrety. Relacja The Register odnotowuje, że standardy raportowania audytów prywatności AI muszą się zmienić, co jest apelem do audytorów i czasopism tak samo jak do dostawców. Praca nie proponuje żadnego nowego reżimu certyfikacji i nie wskazuje regulatora, który przyjąłby jej zalecenia.
Jest jeszcze drugi, osobny nurt badań wskazujący w tę samą stronę z innej strony: czy te systemy w ogóle powinny stawiać diagnozy. Badanie pod kierunkiem Aryi Rao, studenta medycyny na Harvardzie, opublikowane w JAMA Network Open i opisane przez The Register 15 kwietnia, sprawdzało 21 gotowych modeli AI na 29 standaryzowanych winietach klinicznych. Modele miały rację w 91 procentach przypadków, gdy dostawały pełny zestaw informacji i pytanie o ostateczną diagnozę.
Wczesna diagnoza różnicowa, etap, na którym klinicyści wykluczają i uwzględniają schorzenia, ważąc niepewność, zawiodła w ponad 8 na 10 przypadków według ścisłej definicji z pracy. "Każdy model, który testowaliśmy, zawiódł w zdecydowanej większości przypadków" - powiedział Rao The Register. "To etap, na którym niepewność liczy się najbardziej, i właśnie na nim te systemy są najsłabsze".
Rao ostrzegł też przed czytaniem tego odsetka porażek jako całkowitego upadku. Mierzona jako surowa trafność na przypadek, modele wypadały między 63 a 78 procentami, co jej zdaniem sugeruje, że często miały częściowo rację. Współautor, dr Marc Succi, radiolog w Massachusetts General Hospital, powiedział, że wyższe wyniki dla ostatecznej diagnozy nie powinny nikogo uspokajać. "Prawdziwe rozumowanie kliniczne zaczyna się wcześniej, gdy niejednoznaczność jest największa, i dokładnie tam pozostają najsłabsze" - powiedział The Register.
Postaw obie prace obok siebie, a pytanie regulacyjne się wyostrza. Model, który potrafi zdradzić, na kim go trenowano, a mimo to myli większość wczesnych diagnoz różnicowych, jest proponowany do pierwszej linii triażu, a audyty, którymi się go dopuszcza, nie mierzą żadnego z tych dwóch rodzajów ryzyka tam, gdzie one naprawdę bolą.
Źródła
2- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.