Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

I pazienti nel training set si riconoscono facilmente, e gli audit sulla privacy non se ne accorgono

I modelli di IA medica addestrati sulle cartelle dei pazienti si possono interrogare per scoprire chi compare nei loro dati di addestramento. I ricercatori tedeschi parlano di "near-perfect attack success" a livello del singolo paziente in un articolo su Nature pubblicato il 24 giugno.

SaluteAnalisiSara GalloPubblicato: 27 settembre 20263 min di letturaFonti 2
I pazienti nel training set si riconoscono facilmente, e gli audit sulla privacy non se ne accorgono

Gli attacchi di membership inference (MIA) chiedono a un modello se un record specifico ha fatto parte del suo training set. The Register, che ha riportato i risultati il 24 giugno, spiega che i modelli di IA medica discriminativi sono particolarmente esposti: sono addestrati a classificare input e diventano misurabilmente più sicuri sui dati che hanno già visto.

Quella sicurezza è la falla. Il gruppo ha analizzato sette dataset di IA medica, tra immagini, tracciati ECG e cartelle cliniche elettroniche generali. I pazienti presi di mira da questi attacchi si potevano identificare con quello che l'articolo descrive come un successo quasi perfetto. Secondo gli autori la valutazione standard non coglie questo risultato, perché misura il successo dell'attacco in forma aggregata sui record e non per singola persona.

Gli outlier sono i più facili da esporre

I gruppi sottorappresentati in una coorte di addestramento si individuano più facilmente dei pazienti tipici. Razza, stato assicurativo, sesso, protocollo di imaging utilizzato e alcune condizioni patologiche possono tutti funzionare come outlier.

In generale, i rischi per la privacy derivanti dalle MIA diventano più gravi man mano che la coorte di addestramento di un modello diventa più specifica.

Lo dice Moritz Knolle, che presiede AI in Healthcare and Medicine alla Technical University of Munich e ha guidato l'articolo, in uno scambio di email con The Register. Ha portato l'esempio di un modello la cui lista di appartenenza rivelerebbe che qualcuno ha una condizione genetica dormiente come la malattia di Huntington, una depressione, oppure che si è rivolto a una specifica clinica specializzata. I dataset più grandi hanno peggiorato le cose, non migliorato: l'articolo afferma che l'entità del cambiamento nel rischio a livello di paziente nei modelli più grandi era finora sconosciuta.

L'attacco richiede anche meno di quanto i ricercatori presumessero. Knolle ha detto a The Register che un attaccante di norma ha bisogno di accedere a un punto dati obiettivo, e che l'articolo dimostra che un accesso parziale è sufficiente. Bastano risultati di analisi del sangue, o parte di essi. Tutti i dataset usati nello studio erano anonimizzati, e l'attaccante non ha bisogno di sapere di chi siano i dati che sta testando.

Ottenere quei dati è l'ostacolo pratico, anche se non alto. Knolle ha detto che, poiché i dati medici non sono sempre conservati in modo sicuro, un accesso non autorizzato al database di un medico di base dopo un'analisi del sangue di routine non è impensabile.

Cosa vogliono cambiare gli autori

Le raccomandazioni dell'articolo riguardano interventi procedurali, non correzioni tecniche ai modelli stessi. Il gruppo vuole che gli standard di audit sulla privacy siano riscritti per valutare il rischio a livello individuale invece dei numeri aggregati, e indica i framework di differential privacy come modo per dare garanzie matematiche che i dati di addestramento restino anonimi. Knolle ha anche suggerito che i dati di addestramento potrebbero essere compilati in modo da rappresentare meglio i gruppi sottorappresentati.

La posta in gioco non è teorica. Uno studio separato pubblicato su JAMA Network Open in aprile e ripreso da The Register ha rilevato che 21 modelli di IA pronti all'uso hanno fallito la diagnosi differenziale precoce in più di 8 casi su 10, anche se i modelli leader hanno raggiunto il 91 percento di accuratezza sulla diagnosi finale. Marc Succi, radiologo al Massachusetts General Hospital e coautore, ha detto che sistemi del genere non dovrebbero essere considerati affidabili per il ragionamento diagnostico rivolto al paziente senza una revisione umana strutturata e completa.

Knolle ha inquadrato il problema della privacy con una precisazione: ci sono molte situazioni in cui un attacco di membership inference riuscito rappresenta una violazione piccola o trascurabile, cioè quando i modelli sono addestrati su popolazioni ampie e generali che includono sia persone sane sia malate. La difficoltà è che i risultati dell'articolo mostrano che proprio quelle sono le condizioni in cui i protocolli di audit presumono la sicurezza, e proprio le condizioni che secondo gli autori non vengono misurate in modo adeguato.

Commenti 0

Fonti

2
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Sara Gallo

Sara Gallo

Scienza e salute

Sara Gallo scrive di scienza e salute per FLASH24, partendo da studi originali, comunicati di enti di ricerca e dati di agenzie sanitarie, senza fermarsi ai titoli. Per ogni articolo controlla campioni, intervalli di confidenza e conflitti di interesse, confrontando i numeri con le serie storiche di ISS ed Eurostat. Segue le revisioni sistematiche in uscita e attende i briefing del ministero della Salute, parlando con ricercatori e clinici prima di pubblicare. La sua formazione in fisica dei materiali e il telescopio che usa nel tempo libero si ritrovano nella cura con cui legge misure e immagini. Non pubblica stime senza fonte primaria.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.