Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

I modelli AI medici rivelano quali pazienti li hanno addestrati, secondo uno studio su Nature

Ricercatori tedeschi hanno dimostrato che i modelli di AI usati per aiutare a diagnosticare patologie mediche possono essere interrogati per rivelare se i dati di un paziente specifico facevano parte del loro set di addestramento. A livello individuale, dicono, il successo è quasi perfetto.

SaluteNotiziaSara GalloPubblicato: 27 settembre 20265 min di letturaFonti 2
I modelli AI medici rivelano quali pazienti li hanno addestrati, secondo uno studio su Nature

La scoperta è pubblicata su Nature in un articolo di mercoledì 24 giugno, riportato da The Register lo stesso giorno. Riguarda sette dataset di AI medica fatti di immagini, tracciati ECG e cartelle cliniche elettroniche generiche. Secondo il team che ha firmato lo studio, gli audit sulla privacy in uso non vedono il rischio: misurano il successo degli attacchi in forma aggregata, non paziente per paziente.

La classe di attacco non è nuova. Nuovo è quanto bene funziona sui modelli medici.

Gli attacchi di inferenza di appartenenza (MIA) interrogano un modello per stabilire se un dato preciso era nel suo set di addestramento. Secondo i ricercatori, i modelli discriminativi, quelli che classificano dati e fanno previsioni su input nuovi, si prestano particolarmente a questo tipo di sondaggio. Nella loro analisi i singoli pazienti presi di mira potevano essere identificati con quello che l'articolo chiama un successo quasi perfetto. La cosa conta perché un'appartenenza confermata al set di addestramento è già di per sé una divulgazione. Se un modello è stato addestrato su una coorte di una clinica specializzata, dimostrare che la cartella di una persona sta in quella coorte può rivelare una diagnosi che quella persona non aveva mai scelto di condividere.

I pazienti sottorappresentati sono più facili da individuare

L'articolo rileva anche che i pazienti outlier in un set di addestramento sono più facili da identificare rispetto agli altri. Secondo i ricercatori, razza, stato assicurativo, sesso, protocollo di imaging usato e alcune condizioni patologiche possono tutti funzionare da outlier.

Moritz Knolle dirige la cattedra di AI in Healthcare and Medicine alla Technical University of Munich ed è primo autore dell'articolo. In uno scambio di email con The Register ha messo il compromesso in termini chiari. "In generale, i rischi per la privacy derivanti dalle MIA diventano più gravi man mano che la coorte di addestramento di un modello diventa più specifica", ha detto. Poi ha portato un esempio: "Si possono immaginare ... scenari in cui l'appartenenza a un dataset di addestramento rivela che qualcuno ha una condizione genetica dormiente come la malattia di Huntington, una depressione, o che ha frequentato una clinica di trattamento specifica e specializzata".

I ricercatori segnalano un altro effetto che va nella direzione sbagliata. Dataset più grandi rendono le cartelle più facili da esporre, non più difficili. L'articolo afferma che l'entità di questo spostamento nel rischio a livello di paziente non era stata misurata prima per modelli più grandi.

Cosa serve davvero a un attaccante

Niente di tutto questo significa che un estraneo possa indicare un modello e tirarne fuori dei nomi. Una MIA richiede che l'attaccante possieda già un dato che vuole testare. Knolle lo ha confermato, osservando però che l'articolo riduce la quantità di dati necessaria.

"Per condurre una MIA un attaccante deve avere accesso a un dato target", ha detto a The Register. "Nel nostro articolo mostriamo che un attaccante con accesso parziale può comunque condurre con successo delle MIA".

Il meccanismo è la confidenza. Le AI mediche tendono a essere più sicure quando l'input era nel loro set di addestramento. L'attaccante immette allora dati di pazienti ottenuti, legge il livello di confidenza e ne deduce l'inclusione. Knolle ha detto che non serve sapere a chi appartengono i dati. Tutti i dataset usati nello studio erano anonimizzati, ha aggiunto, e questo non protegge da questo tipo di inferenza. "All'attaccante basterebbe avere accesso ai risultati delle analisi del sangue di qualcuno, o a una parte di questi risultati" per dedurne l'inclusione, ha detto Knolle. Sull'origine di quei dati ha indicato l'esposizione ordinaria, non intrusioni esotiche: "Dato che i dati medici non sono sempre conservati in modo sicuro, non è impensabile che un attaccante possa accedervi, per esempio ottenendo accesso non autorizzato al database del vostro medico di base dopo che ha eseguito un esame del sangue di routine".

Raccomandazioni, e un'avvertenza

Le raccomandazioni del team non sono esotiche. Vogliono che si usino framework di privacy differenziale dove il rischio lo giustifica, che gli standard di audit sulla privacy siano riscritti per valutare il rischio a livello individuale invece che aggregato, e che i dati di addestramento siano compilati in modo che i gruppi sottorappresentati siano meglio rappresentati invece di restare outlier.

Knolle ha inquadrato il suo obiettivo in modo ristretto. "Spero che la comunità dell'AI medica inizi a prendere sul serio i rischi per la privacy e che le tecniche di mitigazione del rischio siano usate nelle situazioni in cui sono necessarie", ha detto. Ha anche respinto l'idea di trattare ogni attacco riuscito come uno scandalo. "Ci sono molte situazioni in cui una MIA riuscita rappresenta una violazione della privacy piccola o trascurabile", ha osservato, descrivendo modelli addestrati su popolazioni ampie e generiche in cui compaiono sia individui sani sia malati.

Il contesto regolatorio in cui arriva l'articolo è affollato ma povero di dettagli. Il resoconto di The Register nota che gli standard di rendicontazione per gli audit sulla privacy dell'AI devono cambiare, il che è un appello agli auditor e alle riviste tanto quanto ai fornitori. Nulla nell'articolo propone un nuovo regime di certificazione, e nessuna autorità di regolamentazione viene indicata come aver adottato le sue raccomandazioni.

C'è un secondo filone di lavoro, separato, che punta nella stessa direzione da un'angolazione diversa: se questi sistemi debbano affatto formulare giudizi diagnostici. Uno studio guidato da Arya Rao, studentessa di medicina ad Harvard, pubblicato su JAMA Network Open e trattato da The Register il 15 aprile, ha testato 21 modelli AI pronti all'uso contro 29 vignette cliniche standardizzate. I modelli erano corretti nel 91 per cento dei casi quando ricevevano un portfolio completo di informazioni e veniva chiesta una diagnosi finale.

La diagnosi differenziale precoce, la fase in cui i clinici includono ed escludono condizioni soppesando l'incertezza, ha fallito in più di 8 casi su 10 secondo la definizione rigorosa dell'articolo. "Ogni modello che abbiamo testato ha fallito nella stragrande maggioranza dei casi", ha detto Rao a The Register. "È la fase in cui l'incertezza conta di più, ed è dove questi sistemi sono più deboli".

Rao ha anche messo in guardia dal leggere il tasso di fallimento come un collasso totale. Misurati come accuratezza grezza per caso, i modelli hanno ottenuto tra il 63 e il 78 per cento, il che secondo lei suggerisce che erano spesso parzialmente corretti. Il coautore, il dottor Marc Succi, radiologo al Massachusetts General Hospital, ha detto che punteggi più alti nella diagnosi finale non dovrebbero rassicurare nessuno. "Il vero ragionamento clinico inizia prima, quando l'ambiguità è massima, ed è esattamente lì che restano più deboli", ha detto a The Register.

Mettendo i due articoli fianco a fianco, la questione regolatoria si fa più netta. Un modello che può rivelare chi lo ha addestrato e continua a mancare la maggior parte delle diagnosi differenziali precoci viene proposto per il triage di prima linea. Gli audit usati per autorizzarlo non misurano nessuno dei due rischi al livello in cui mordono.

Commenti 0

Fonti

2
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Sara Gallo

Sara Gallo

Scienza e salute

Sara Gallo scrive di scienza e salute per FLASH24, partendo da studi originali, comunicati di enti di ricerca e dati di agenzie sanitarie, senza fermarsi ai titoli. Per ogni articolo controlla campioni, intervalli di confidenza e conflitti di interesse, confrontando i numeri con le serie storiche di ISS ed Eurostat. Segue le revisioni sistematiche in uscita e attende i briefing del ministero della Salute, parlando con ricercatori e clinici prima di pubblicare. La sua formazione in fisica dei materiali e il telescopio che usa nel tempo libero si ritrovano nella cura con cui legge misure e immagini. Non pubblica stime senza fonte primaria.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.