L'AI medica può rivelare su quali pazienti è stata addestrata
I modelli di AI per la diagnosi medica possono essere indotti a rivelare se i dati di un singolo paziente sono serviti ad addestrarli. Lo riferiscono ricercatori tedeschi in un articolo pubblicato su Nature mercoledì, con un successo quasi perfetto sui singoli pazienti. La scoperta arriva mentre FDA, UE e OMS stanno ancora scrivendo le regole per la revisione di questi dispositivi.

L'attacco si chiama membership inference attack, o MIA. Il 24 giugno The Register ha riferito che il team ha esaminato sette dataset di AI medica, tra immagini, elettrocardiogrammi e cartelle cliniche elettroniche generali. I ricercatori hanno scoperto che i singoli pazienti presi di mira da questi attacchi possono essere identificati con quello che definiscono un successo quasi perfetto. Quel dato non viene rilevato dal protocollo di valutazione standard, si legge nell'articolo, perché quel protocollo misura il successo dell'attacco in modo aggregato sui vari record.
Le AI mediche sono più sicure di sé quando i dati in ingresso sono già presenti nel loro set di addestramento. Un attaccante fornisce a un modello i dati di un paziente, legge il livello di confidenza e conclude che il paziente faceva parte della coorte di addestramento.
Moritz Knolle, ricercatore dell'Università Tecnica di Monaco e primo autore dell'articolo, ha detto a The Register che un attaccante non ha bisogno di sapere a chi appartengono i dati. "In realtà, tutti i dataset che usiamo nel nostro studio erano anonimizzati", ha detto. Un accesso parziale è sufficiente. "L'attaccante avrebbe semplicemente bisogno di accedere ai risultati degli esami del sangue di qualcuno, o a una parte di questi risultati."
Gli outlier sono i più facili da individuare
Lo schema di chi viene esposto è scomodo. I gruppi sottorappresentati nei dati di addestramento medico sono più facili da identificare rispetto ai pazienti i cui record si confondono con gli altri. L'articolo elenca razza, stato assicurativo, sesso, il protocollo di imaging utilizzato e certi stati patologici come categorie che possono funzionare da outlier. Il riassunto di Knolle a The Register: "In generale, i rischi per la privacy derivanti dalle MIA diventano più gravi man mano che la coorte di addestramento di un modello diventa più specifica."
Ha fatto l'esempio di una coorte di addestramento che rivela una condizione genetica dormiente come la malattia di Huntington, o la depressione, o la frequenza di una clinica specializzata. In altre parole, l'appartenenza stessa fa trapelare la diagnosi. L'articolo ha anche rilevato che più grande è il dataset, più i record sono facili da esporre. L'entità di questo spostamento del rischio a livello di paziente nei modelli più grandi non era nota prima.
L'attaccante ha bisogno di alcuni dati medici sulle persone che vuole identificare. Le violazioni dei dati sanitari sono abbastanza frequenti perché questa non sia una soglia alta. Knolle ha sollevato lo scenario di un accesso non autorizzato al database di un medico di base dopo un esame del sangue di routine.
Il suo obiettivo dichiarato è ristretto: che la comunità dell'AI medica prenda sul serio i rischi per la privacy e applichi le mitigazioni dove servono. L'articolo raccomanda quadri di privacy differenziale, progettati per offrire una garanzia matematica che i dati di addestramento restino anonimi, e una riscrittura degli standard di audit della privacy per misurare il rischio a livello individuale invece del rischio aggregato. Un'altra opzione che ha sollevato è compilare i dati di addestramento in modo che i gruppi sottorappresentati siano meglio rappresentati.
I regolatori stanno ancora recuperando le basi
Questo arriva in un quadro normativo che si muove, in modo disomogeneo. IntuitionLabs, in un rapporto aggiornato il 18 agosto, stima il numero di dispositivi AI e di machine learning autorizzati dalla FDA a circa 950 entro la metà del 2024, con circa 100 nuove autorizzazioni all'anno. Gli analisti di mercato citati nello stesso rapporto valutavano i dispositivi medici abilitati all'AI 13,7 miliardi di dollari nel 2024 e prevedevano più di 255 miliardi di dollari entro il 2033. La radiologia domina le autorizzazioni, con cardiologia, neurologia, anestesiologia e oftalmologia in espansione.
Lo stesso rapporto osserva che le revisioni sistematiche rilevano che solo una piccola frazione dei dispositivi AI autorizzati è supportata da studi randomizzati o da dati sugli esiti dei pazienti. I malfunzionamenti dei dispositivi sono stati collegati a lesioni e, in un caso segnalato, a un decesso. Il rapporto cita uno strumento di triage per la terapia intensiva che identificava in misura insufficiente i pazienti neri per le cure aggiuntive, e studi sulla colonscopia in cui i tassi di rilevamento dei medici calavano quando si affidavano all'AI.
Sulla privacy nello specifico, la richiesta dell'articolo di un audit a livello individuale si scontra con un sistema costruito per la rendicontazione aggregata. Secondo la revisione di IntuitionLabs, i riassunti delle decisioni della FDA spesso omettono dettagli critici su efficacia e sicurezza, e l'adesione globale agli standard è disomogenea. L'AI Act dell'UE, in vigore dal 2024, classifica molti sistemi di AI sanitaria come ad alto rischio e aggiunge lavoro di conformità oltre al regolamento sui dispositivi medici. L'OMS ha pubblicato raccomandazioni nel 2023 che coprono trasparenza, qualità dei dati e supervisione del ciclo di vita.
MD+DI ha pubblicato un'intervista con Suzanne Levy Friedman, avvocato esperta di dispositivi medici per la FDA. L'ultimo conteggio in suo possesso, ha detto, era di oltre mille dispositivi abilitati all'AI autorizzati dalla FDA. Nessuno di essi ha un modello ad apprendimento continuo incorporato. Alcuni dei suoi clienti più recenti ne sono scioccati. Lei no.
"Con tutto l'entusiasmo per l'innovazione, la gente dimentica che prima di tutto la FDA è un'agenzia di sanità pubblica", ha detto Friedman a MD+DI. "Non cercano di essere difficili, cercano di assicurarsi che i pazienti non vengano danneggiati e che i clinici abbiano le informazioni giuste e non siano indotti per errore a fare affidamento su cose che potrebbero non essere validate."
Friedman ha segnalato due lacune che precedono l'articolo sulla privacy. Il software si evolve più rapidamente del quadro progettato per l'hardware. La deriva delle prestazioni nel mondo reale può colpire i prodotti validati una volta che cambia la composizione dei pazienti, come è accaduto durante il COVID. Il bias algoritmico si affianca a questo, e la FDA chiede ai produttori dettagli granulari sui loro algoritmi, cosa che alcuni trovano eccessiva.
Il problema delle prove cliniche qui accanto
La privacy non è l'unico punto debole nella base di prove. Il 15 aprile The Register ha riferito di uno studio su JAMA Network Open, guidato dalla studentessa di medicina di Harvard Arya Rao, che ha testato 21 modelli di AI pronti all'uso contro 29 vignette cliniche standardizzate. I modelli erano corretti nel 91 per cento dei casi sulla diagnosi finale quando ricevevano un portfolio completo di informazioni. Sulla diagnosi differenziale precoce, la fase in cui i clinici includono ed escludono condizioni in condizioni di incertezza, il tasso di fallimento superava l'80 per cento.
"Ogni modello che abbiamo testato ha fallito sulla stragrande maggioranza dei casi", ha detto Rao a The Register. "È la fase in cui l'incertezza conta di più, ed è dove questi sistemi sono più deboli."
Il coautore Marc Succi, radiologo al Massachusetts General Hospital, ha avvertito che la sicurezza di sé senza ragionamento è un pericolo a sé stante, in particolare per i pazienti ansiosi. Ha anche sostenuto che punteggi elevati sulla diagnosi finale possono creare un senso di sicurezza fuorviante, perché il ragionamento clinico reale inizia prima, quando l'ambiguità è massima. Rao ha osservato che la metrica di fallimento più severa non è l'unico modo di leggere i dati: l'accuratezza grezza variava dal 63 al 78 per cento, il che significa che i modelli erano spesso parzialmente corretti.
I due articoli puntano nella stessa direzione da angolazioni diverse. Uno mostra che i dati di addestramento dietro un modello diagnostico possono essere interrogati per identificare i pazienti al loro interno. L'altro mostra che gli stessi modelli, chiamati a ragionare come fanno i clinici, crollano nel punto in cui la posta in gioco è più alta. Entrambi sono arrivati mentre gli standard di audit pensati per intercettare questi problemi sono ancora in fase di stesura.
Il caveat di Knolle vale la pena di conservarlo. Ha detto a The Register che ci sono molte situazioni in cui una MIA riuscita rappresenta una violazione della privacy piccola o trascurabile, ovvero modelli addestrati su popolazioni ampie e generali che includono sia individui sani sia malati. Il rischio si concentra dove le coorti sono ristrette, e le coorti ristrette sono esattamente ciò di cui l'AI medica specialistica tende ad avere bisogno.
Fonti
4- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
- 03AI Medical Devices: 2025 Status, Regulation & ChallengesEN
- 04How Is FDA Regulating AI Medical Devices in 2026?EN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.