Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Gli audit sulla privacy dell'AI medica non vedono le fughe di dati dei singoli pazienti, secondo un articolo su Nature

I modelli discriminativi di AI medica si possono interrogare per capire se i dati di un singolo paziente sono stati usati per addestrarli. A livello individuale il "successo dell'attacco è quasi perfetto", secondo un articolo pubblicato mercoledì su Nature e ripreso da The Register.

SaluteAnalisiSara GalloPubblicato: 27 settembre 20264 min di letturaFonti 2
Gli audit sulla privacy dell'AI medica non vedono le fughe di dati dei singoli pazienti, secondo un articolo su Nature

Un gruppo di ricerca tedesco ha testato sette dataset di AI medica: immagini, tracciati ECG e cartelle cliniche elettroniche generiche. Gli attacchi di inferenza di appartenenza (MIA) interrogano un modello per capire se un dato specifico è finito nel suo set di addestramento. Sui singoli pazienti questi attacchi hanno funzionato molto meglio di quanto lascino pensare le metriche aggregate sulla privacy. The Register ne ha scritto il 24 giugno.

La conclusione dell'articolo mette in difficoltà chi valuta l'AI medica con le regole attuali. "Il fatto che le MIA possano raggiungere tassi di successo quasi perfetti sui singoli pazienti non viene colto adeguatamente dal protocollo di valutazione standard, che misura il successo dell'attacco in forma aggregata sui dati", scrivono i ricercatori. Secondo loro gli standard di rendicontazione degli audit sulla privacy dell'AI devono cambiare.

Chi è più facile identificare

I pazienti sottorappresentati in un set di addestramento sono i più facili da individuare. Secondo l'articolo, razza, stato assicurativo, sesso, protocollo di imaging usato e alcune condizioni patologiche possono fare da valori anomali e rendere l'attacco più efficace.

Moritz Knolle presiede l'AI in Healthcare and Medicine alla Technical University of Munich e ha guidato lo studio. A The Register ha descritto via email le implicazioni pratiche. "In generale, i rischi per la privacy legati alle MIA diventano più gravi man mano che la coorte di addestramento di un modello diventa più specifica", ha detto. L'appartenenza al set, ha aggiunto, potrebbe rivelare una condizione genetica latente come la malattia di Huntington, una depressione o il ricorso a una clinica specializzata. In altre parole, un set di addestramento divulgato può esporre condizioni che le persone non hanno rivelato altrove.

Altri due risultati peggiorano il quadro. Più grande è il dataset, più facile è esporre i singoli dati. L'articolo afferma che l'entità di questo spostamento nel rischio a livello di paziente nei modelli più grandi non era mai stata misurata prima.

Cosa serve davvero a un attaccante

L'attacco sfrutta una particolarità semplice: un'AI medica tende a essere più sicura quando l'input ha già fatto parte dei suoi dati di addestramento. Un attaccante inserisce i dati del paziente, legge il livello di sicurezza e ne deduce l'appartenenza.

"Nel nostro articolo mostriamo che un attaccante con accesso parziale può comunque condurre con successo le MIA", ha detto Knolle a The Register.

Questo conta perché in precedenza si presumeva che servisse una cartella clinica completa. Secondo Knolle a un attaccante basterebbe "accedere ai risultati delle analisi del sangue di qualcuno, o a parte di questi risultati" per dedurre l'inclusione. I dataset usati nello studio erano anonimizzati, ha precisato. I dati bersaglio, in altre parole, non devono esserlo.

Ottenere quei dati è la parte più difficile, ma non proibitiva. Knolle ha citato la frequenza delle violazioni nel settore sanitario e ha suggerito che un attaccante potrebbe ottenere accesso non autorizzato al database di un medico di base dopo un normale esame del sangue.

Perché le regole degli audit sono il punto

L'articolo non sostiene che ogni MIA riuscita sia uno scandalo. Knolle ha detto a The Register che molti attacchi riusciti rappresentano una violazione della privacy piccola o trascurabile. Ha citato il caso di modelli addestrati su grandi popolazioni generali, in cui individui sani e malati sono entrambi ben rappresentati. Il problema è più ristretto e più difficile da regolamentare: coorti specifiche, malattie rare e qualsiasi gruppo che compare troppo raramente nei dati di addestramento.

In aprile uno studio separato su JAMA Network Open, guidato dalla studentessa di medicina di Harvard Arya Rao, ha testato 21 modelli di AI pronti all'uso su 29 vignette cliniche. I modelli hanno raggiunto una diagnosi finale corretta nel 91 percento dei casi, ma hanno fallito nella diagnosi differenziale precoce in più di 8 casi su 10. The Register ne ha scritto il 15 aprile. Il coautore Dr. Marc Succi, radiologo al Massachusetts General Hospital, ha detto che questi sistemi "possono ostentare sicurezza senza mostrare un ragionamento solido". È lo stesso schema sfruttato dall'articolo sulla privacy: la sicurezza del modello non è un segnale affidabile, eppure viene usata come tale in due contesti molto diversi.

I regolatori si stanno muovendo, anche se la direzione non è definita. Tra i titoli recenti raccolti per contesto ci sono una proposta britannica per una regolamentazione dell'AI sanitaria con "L-plate", norme a livello statale negli Stati Uniti e linee guida dell'australiana TGA sui dispositivi medici con AI. Nulla di tutto ciò affronta il divario specifico individuato dal team di Knolle, perché il divario sta in come viene misurata la privacy, non in se un dispositivo viene approvato.

I ricercatori raccomandano quadri di privacy differenziale, che mirano a dare una garanzia matematica che i dati di addestramento restino anonimi, e una riscrittura degli standard di audit sulla privacy, perché valutino il rischio a livello individuale invece che aggregato. Knolle ha sollevato una terza opzione, più diretta: compilare i dati di addestramento in modo che i gruppi sottorappresentati compaiano più spesso, riducendo l'effetto anomalo che li rende identificabili in primo luogo.

"Spero che la comunità dell'AI medica inizi a prendere sul serio i rischi per la privacy e che le tecniche di mitigazione del rischio vengano usate nelle situazioni in cui sono necessarie", ha detto Knolle a The Register.

Commenti 0

Fonti

2
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Sara Gallo

Sara Gallo

Scienza e salute

Sara Gallo scrive di scienza e salute per FLASH24, partendo da studi originali, comunicati di enti di ricerca e dati di agenzie sanitarie, senza fermarsi ai titoli. Per ogni articolo controlla campioni, intervalli di confidenza e conflitti di interesse, confrontando i numeri con le serie storiche di ISS ed Eurostat. Segue le revisioni sistematiche in uscita e attende i briefing del ministero della Salute, parlando con ricercatori e clinici prima di pubblicare. La sua formazione in fisica dei materiali e il telescopio che usa nel tempo libero si ritrovano nella cura con cui legge misure e immagini. Non pubblica stime senza fonte primaria.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.