Diagnosi con l'AI sotto esame: i modelli rivelano i dati dei pazienti e sbagliano nell'80% dei casi
Due studi pubblicati nel 2026 mostrano che le AI diagnostiche possono essere indotte a rivelare quali dati dei pazienti le hanno addestrate e che i principali modelli linguistici sbagliano la diagnosi differenziale precoce in più di 8 casi su 10.

Due filoni di ricerca pubblicati nel 2026 delineano un quadro preoccupante della diagnosi medica affidata all'AI. Il primo mostra che i modelli diagnostici lasciano trapelare l'identità dei pazienti i cui dati sono serviti ad addestrarli. Il secondo mostra che i grandi modelli linguistici, gli stessi strumenti che le persone interrogano sui propri sintomi, sbagliano nelle fasi iniziali del ragionamento clinico in più dell'80 per cento dei casi. Di entrambi ha riferito The Register, che ha seguito i lavori al momento della pubblicazione.
Il problema della privacy arriva da un articolo di Nature pubblicato mercoledì 24 giugno 2026, secondo The Register. I ricercatori tedeschi hanno testato sette dataset di AI medica con immagini, tracciati ECG e cartelle cliniche elettroniche generiche. Hanno scoperto che i modelli discriminativi, quelli che classificano i dati e formulano previsioni, sono particolarmente vulnerabili agli attacchi di inferenza di appartenenza (membership inference attack, MIA). Questi attacchi interrogano un modello per stabilire se un determinato dato faceva parte del suo set di addestramento. Il team ha riferito che i singoli pazienti possono essere identificati con un "successo dell'attacco quasi perfetto". Questo tasso di successo, sostengono, non viene colto dai protocolli di valutazione standard, che misurano il successo dell'attacco in forma aggregata sui vari record. I ricercatori concludono che gli standard di rendicontazione per gli audit di privacy sull'AI devono cambiare.
I pazienti sottorappresentati sono più facili da identificare
I pazienti sottorappresentati nei dati di addestramento dell'AI medica sono ancora più facili da identificare rispetto a quelli i cui dati non si distinguono, secondo lo stesso articolo. The Register elenca razza, stato assicurativo, sesso, protocollo di imaging e alcune condizioni patologiche tra le categorie che possono funzionare da outlier, rendendo gli individui più facili da individuare.
"In generale, i rischi per la privacy derivanti dai MIA diventano più gravi man mano che la coorte di addestramento di un modello diventa più specifica", ha dichiarato a The Register, in uno scambio di email, Moritz Knolle, titolare della cattedra di AI in Healthcare and Medicine alla Technical University of Munich e primo autore dell'articolo. Ha descritto scenari in cui l'appartenenza a un dataset di addestramento potrebbe rivelare che qualcuno ha una condizione genetica dormiente come la malattia di Huntington, una depressione, oppure che si è rivolto a una specifica clinica specializzata.
L'attacco si basa su una proprietà semplice dei modelli di machine learning: tendono a essere più sicuri quando i dati in ingresso facevano parte del loro set di addestramento. Un attaccante con dati parziali di un paziente può sottoporli al modello, controllare il livello di confidenza e dedurre se quel paziente era incluso. Knolle ha detto che l'articolo mostra che un attaccante non ha bisogno dell'accesso completo al dato di un paziente, contrariamente a quanto si credeva prima. "Nel nostro articolo mostriamo che un attaccante con accesso parziale può comunque condurre con successo dei MIA", ha detto a The Register.
"Spero che la comunità dell'AI medica inizi a prendere sul serio i rischi per la privacy e che le tecniche di mitigazione del rischio vengano usate nelle situazioni in cui sono necessarie." Moritz Knolle, Technical University of Munich
I ricercatori raccomandano di usare framework di privacy differenziale progettati per garantire matematicamente che i dati di addestramento restino anonimi. Vogliono inoltre che gli standard di audit sulla privacy considerino il rischio a livello individuale, non solo i numeri aggregati. Un'altra opzione, ha detto Knolle, è compilare i dati di addestramento in modo che i gruppi sottorappresentati siano meglio rappresentati. "Ci sono molte situazioni in cui un MIA riuscito rappresenta una violazione della privacy piccola o trascurabile", ha osservato, riferendosi a modelli addestrati su grandi popolazioni generali che includono sia individui sani sia malati.
I modelli linguistici sbagliano presto e sembrano sicuri
Su un altro fronte, una ricerca pubblicata su JAMA Network Open nell'aprile 2026 ha rilevato che 21 tra i principali modelli di AI pronti all'uso hanno sbagliato la diagnosi differenziale precoce in più di 8 casi su 10. Lo studio, ripreso da The Register il 15 aprile 2026, ha testato i modelli su 29 vignette cliniche standardizzate. I modelli andavano bene quando ricevevano un quadro completo di informazioni mediche e veniva chiesta una diagnosi finale: i migliori erano corretti nel 91 per cento dei casi. Ma nella diagnosi differenziale precoce, la fase in cui i clinici escludono condizioni soppesando le possibilità, il tasso di errore ha superato l'80 per cento.
"Ogni modello che abbiamo testato ha sbagliato nella stragrande maggioranza dei casi", ha detto a The Register, in una email, Arya Rao, studentessa di medicina ad Harvard che ha guidato la ricerca. "È la fase in cui l'incertezza conta di più, ed è quella in cui questi sistemi sono più deboli".
Rao ha osservato che un errore non significava sempre una risposta del tutto sbagliata. Misurati con l'accuratezza grezza, cioè la proporzione di risposte corrette, i modelli andavano dal 63 al 78 per cento. Ma il team sostiene che la metrica di errore più severa conta comunque, soprattutto perché gli strumenti di AI vengono commercializzati come agenti di prima linea pensati per restringere le diagnosi. "Presentare i modelli linguistici come agenti diagnostici rischia di alimentare una falsa fiducia proprio dove sono meno affidabili", hanno scritto i ricercatori.
Il dottor Marc Succi, radiologo al Massachusetts General Hospital e coautore dell'articolo, ha detto a The Register che tassi di successo più alti sulla diagnosi finale non dovrebbero rassicurare. "Il ragionamento clinico reale inizia prima, quando l'ambiguità è massima, ed è esattamente lì che restano più deboli", ha affermato. Ha avvertito che una diagnosi differenziale sbagliata può portare a ritardi nelle cure, procedure inutili, costi elevati e altro ancora.
Entrambi gli articoli arrivano in un contesto normativo che sta ancora recuperando terreno. A metà 2024 la US Food and Drug Administration aveva autorizzato circa 950 dispositivi medici abilitati all'AI, secondo un'analisi di settore pubblicata da IntuitionLabs. La stessa analisi rilevava che solo una minuscola frazione dei dispositivi AI autorizzati è supportata da trial randomizzati o da dati sugli esiti dei pazienti, e che la FDA ha emesso la sua guida sui Predetermined Change Control Plans nel dicembre 2024.
Un'intervista pubblicata da MD+DI con Suzanne Levy Friedman, avvocato della FDA esperta di dispositivi medici, rilevava che, nonostante più di mille dispositivi abilitati all'AI autorizzati dalla FDA, nessuno integra un modello che apprende in modo continuo. Friedman ha detto che l'agenzia sta lavorando a un percorso in questa direzione, ma che la sua missione principale di agenzia di sanità pubblica la obbliga a soppesare l'innovazione con il rischio che i clinici si affidino a strumenti non ancora validati.
I due articoli di ricerca suggeriscono che la validazione non riguarda solo se un modello azzecca la risposta finale. Riguarda anche se mantiene segreta l'identità di un paziente e se sa gestire l'incertezza prima che una diagnosi sia chiara.
Fonti
4- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
- 03AI Medical Devices: 2025 Status, Regulation & ChallengesEN
- 04How Is FDA Regulating AI Medical Devices in 2026?EN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.