Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Pacjentów ze zbioru treningowego łatwo rozpoznać, a audyty prywatności tego nie wychwytują

Modele medycznej sztucznej inteligencji trenowane na dokumentacji pacjentów można odpytać tak, by ujawniły, kto trafił do danych treningowych. Niemieccy badacze mówią o „niemal doskonałej skuteczności ataku” na poziomie pojedynczego pacjenta. Praca ukazała się w Nature 24 czerwca.

ZdrowieAnalizaRenata PawlakOpublikowano: 27 września 20263 min czytaniaŹródła 2
Pacjentów ze zbioru treningowego łatwo rozpoznać, a audyty prywatności tego nie wychwytują

Atak wnioskowania o członkostwie (membership inference attack, MIA) polega na tym, że model pytamy, czy konkretny rekord należał do jego zbioru treningowego. The Register, który opisał wyniki 24 czerwca, zwraca uwagę, że modele medyczne typu dyskryminacyjnego są na to szczególnie narażone. Uczą się klasyfikować dane wejściowe, więc zyskują mierzalnie większą pewność wobec danych, które już widziały.

Ta pewność jest wyciekiem. Zespół przeanalizował siedem medycznych zbiorów danych AI: obrazy, zapisy EKG i ogólne elektroniczne dokumentacje zdrowotne. Pacjentów wskazanych w takich atakach udawało się zidentyfikować z niemal doskonałą skutecznością, jak to określa praca. Autorzy twierdzą, że standardowa ocena tego nie wychwytuje, bo mierzy skuteczność ataku zbiorczo dla rekordów, a nie dla poszczególnych osób.

Najłatwiej ujawniają się osoby odstające

Grupy słabo reprezentowane w kohorcie treningowej wskazuje się prościej niż typowych pacjentów. Jako odstające mogą działać rasa, status ubezpieczenia, płeć, zastosowany protokół obrazowania oraz określone stany chorobowe.

Ogólnie rzecz biorąc, ryzyko dla prywatności związane z MIA rośnie, im bardziej specyficzna jest kohorta treningowa modelu.

Tak mówi Moritz Knolle, który kieruje katedrą AI w opiece zdrowotnej i medycynie na Uniwersytecie Technicznym w Monachium i stał na czele zespołu autorów pracy. Powiedział to w mailu do The Register. Podał przykład modelu, którego lista członków ujawniłaby, że ktoś ma uśpioną chorobę genetyczną, taką jak choroba Huntingtona, depresję, albo że leczył się w konkretnej specjalistycznej klinice. Większe zbiory danych pogarszały sytuację, nie poprawiały jej. Praca stwierdza, że skala zmiany ryzyka na poziomie pacjenta w większych modelach była wcześniej nieznana.

Atak wymaga też mniej, niż badacze kiedyś zakładali. Knolle powiedział The Register, że napastnik zwykle potrzebuje dostępu do docelowego punktu danych, a praca pokazuje, że wystarczy dostęp częściowy. Wyniki badań krwi albo ich część wystarczą. Wszystkie zbiory użyte w badaniu były zanonimizowane, a napastnik nie musi wiedzieć, czyje dane testuje.

Zdobycie takich danych to praktyczna przeszkoda, choć niewysoka. Knolle stwierdził, że dane medyczne nie zawsze są przechowywane bezpiecznie, więc nieuprawniony dostęp do bazy lekarza rodzinnego po rutynowym badaniu krwi nie jest nie do pomyślenia.

Co autorzy chcą zmienić

Zalecenia pracy dotyczą procedur, a nie technicznych poprawek samych modeli. Zespół chce przepisać standardy audytu prywatności tak, by oceniały ryzyko na poziomie jednostki, a nie zbiorcze liczby. Wskazuje też na ramy prywatności różnicowej jako sposób na matematyczne gwarancje, że dane treningowe pozostają anonimowe. Knolle zasugerował, że zbiory treningowe można kompilować tak, by grupy słabo reprezentowane były reprezentowane lepiej.

Stawka nie jest teoretyczna. Osobne badanie opublikowane w JAMA Network Open w kwietniu i opisane przez The Register wykazało, że 21 gotowych modeli AI zawiodło we wczesnej diagnostyce różnicowej w ponad 8 na 10 przypadków, choć wiodące modele osiągnęły 91 procent skuteczności w rozpoznaniu ostatecznym. Marc Succi, radiolog z Massachusetts General Hospital i współautor, powiedział, że takim systemom nie należy ufać w rozumowaniu diagnostycznym kierowanym do pacjenta bez ustrukturyzowanego, kompleksowego przeglądu przez człowieka.

Knolle opatrzył problem prywatności zastrzeżeniem: w wielu sytuacjach udany atak wnioskowania o członkostwie oznacza niewielkie lub pomijalne naruszenie, zwłaszcza gdy modele trenuje się na dużych, ogólnych populacjach obejmujących zarówno osoby zdrowe, jak i chore. Trudność w tym, że wyniki samej pracy pokazują, iż to dokładnie te warunki, w których protokoły audytu zakładają bezpieczeństwo, i dokładnie te, które według autorów nie są mierzone właściwie.

Komentarze 0

Źródła

2
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Renata Pawlak

Renata Pawlak

Nauka i zdrowie

Renata Pawlak zajmuje się w FLASH24 nauką i zdrowiem, opierając teksty na publikacjach recenzowanych, komunikatach instytucji i danych źródłowych, a nie na doniesieniach bez pokrycia. Przy każdej liczbie sprawdza metodologię badania, wielkość próby i jednostki, a wyniki porównuje z wcześniejszymi pracami na ten sam temat. Czeka na comiesięczne raporty GUS i NFZ, rozmawia z lekarzami oraz fizykami, a przed publikacją pyta autorów o ograniczenia ich wniosków. Prywatnie interesuje się fizyką materiałów i obserwuje niebo przez własny teleskop, co pomaga jej czytać prace z dziedzin ścisłych. Nie publikuje niczego, czego nie może potwierdzić w co najmniej dwóch niezależnych źródłach.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.