Regolamentazione dell'AI medica: cosa dice davvero la ricerca sugli strumenti diagnostici
I modelli di AI medica usati per la diagnosi possono essere indotti a rivelare se i dati di un singolo paziente li hanno addestrati. Lo hanno riferito ricercatori tedeschi su Nature il 24 giugno 2026. Un sistema di Microsoft, in parallelo, ha dichiarato un'accuratezza diagnostica dell'85,5% contro i medici. I regolatori sono ancora in ritardo.

Due risultati di ricerca, pubblicati a circa un anno di distanza, fanno fatica a convivere. Uno dice che l'AI medica può battere i medici su diagnosi difficili. L'altro dice che la stessa classe di modelli lascia trapelare informazioni sui pazienti da cui ha imparato. Entrambi alimentano la stessa domanda irrisolta: cosa dovrebbe richiedere davvero la regolamentazione dell'AI medica?
Il primo risultato arriva da Microsoft. Secondo GeekWire, l'azienda ha annunciato il MAI Diagnostic Orchestrator, o MAI-DxO, il 30 giugno 2025. Il sistema è stato testato su casi complessi tratti dal New England Journal of Medicine contro 21 medici esperti di Stati Uniti e Regno Unito, e ha prodotto una diagnosi corretta nell'85,5% dei casi. I medici si sono fermati al 20%.
Cosa ha misurato il benchmark di Microsoft, e cosa no
Il set di test comprendeva 304 casi di studio recenti del NEJM, trasformati in quello che Microsoft ha chiamato Sequential Diagnosis Benchmark. WIRED ha riferito che un modello linguistico ha scomposto ogni caso nel processo passo per passo che seguirebbe un medico. MAI-DxO ha poi interrogato diversi modelli di frontiera, tra cui GPT di OpenAI, Gemini di Google, Claude di Anthropic, Llama di Meta e Grok di xAI, in un assetto pensato per somigliare a diversi esperti che discutono. MAI-DxO abbinato a o3 di OpenAI ha ottenuto i risultati migliori, ha detto GeekWire.
WIRED ha indicato l'accuratezza all'80%, non all'85,5%, e ha scritto che il sistema ha ridotto i costi del 20% ordinando test più economici. I due numeri vengono dallo stesso progetto ma da articoli diversi: GeekWire cita 85,5% e 20% per i medici, WIRED cita 80% e 20%. Chi cita questo benchmark dovrebbe controllare quale cifra sta usando.
"Stiamo facendo un grande passo verso la superintelligenza medica", ha detto Mustafa Suleyman, CEO di Microsoft AI, in un post su LinkedIn, secondo GeekWire.
I ricercatori esterni sono stati più prudenti. Lo scienziato del MIT David Sontag ha detto a WIRED che il paper è solido sul piano metodologico, ma ha avvertito che ai medici dello studio è stato detto di non usare alcuno strumento aggiuntivo, cosa che non riflette la pratica reale. Eric Topol dello Scripps Research Institute lo ha definito un rapporto impressionante sui casi complessi. Entrambi hanno detto che il prossimo passo di validazione sarebbe uno studio clinico che confronti il sistema con medici reali che curano pazienti reali. Microsoft non ha deciso se commercializzare lo strumento, ha riferito WIRED, e l'impiego clinico richiederebbe test di sicurezza e approvazione regolatoria.
Il risultato sulla privacy che complica tutto
Il 24 giugno 2026, The Register ha riferito di un paper su Nature di ricercatori tedeschi. Il team ha testato attacchi di inferenza di appartenenza, o MIA, contro sette dataset di AI medica contenenti immagini, registrazioni ECG e cartelle cliniche elettroniche generali. Questi attacchi interrogano un modello per capire se un particolare dato era nel suo set di addestramento.
Il risultato: sui singoli pazienti, gli attacchi sono riusciti con quello che i ricercatori hanno definito un successo quasi perfetto. Il paper sostiene che i protocolli di valutazione standard non colgono questo aspetto, perché misurano il successo dell'attacco in forma aggregata sui vari record. I gruppi sottorappresentati erano più facili da identificare. Razza, stato assicurativo, sesso, protocollo di imaging e certi stati patologici agiscono tutti come valori anomali che fanno emergere gli individui.
Moritz Knolle, che dirige la cattedra AI in Healthcare and Medicine alla Technical University of Munich ed è primo autore del paper, ha detto a The Register che i rischi per la privacy crescono quando la coorte di addestramento diventa più specifica. Ha portato l'esempio dell'appartenenza a un dataset che rivela una condizione genetica dormiente come la malattia di Huntington, la depressione, o la frequentazione di una clinica specializzata.
C'è un limite pratico. Per eseguire l'attacco, un aggressore ha bisogno di almeno dati parziali appartenenti alla persona che vuole identificare. Knolle ha detto a The Register che il paper dimostra che l'accesso parziale è sufficiente, contrariamente a quanto si presumeva prima. Ha ipotizzato uno scenario in cui un aggressore ottiene accesso non autorizzato al database di un medico di base dopo un normale esame del sangue.
"Spero che la comunità dell'AI medica inizi a prendere sul serio i rischi per la privacy e che le tecniche di mitigazione del rischio siano usate nelle situazioni in cui sono necessarie", ha detto Knolle.
I ricercatori raccomandano quadri di privacy differenziale, che mirano a dare garanzie matematiche che i dati di addestramento restino anonimi, e modifiche agli standard di audit della privacy perché valutino il rischio a livello individuale invece del rischio aggregato. Suggeriscono anche di compilare i dati di addestramento in modo che i gruppi sottorappresentati siano meglio rappresentati. Knolle ha osservato che molti attacchi riusciti rappresentano una violazione della privacy piccola o trascurabile, per esempio quando i modelli sono addestrati su grandi popolazioni generali che contengono sia persone sane sia malate.
Le prove che i modelli falliscono presto, dove conta
Un terzo studio va contro l'entusiasmo. Nell'aprile 2026, The Register ha riferito di una ricerca pubblicata su JAMA Network Open e guidata dalla studentessa di medicina di Harvard Arya Rao. Il team ha testato 21 modelli di AI pronti all'uso su 29 vignette cliniche standardizzate. Quando ha dato loro un portfolio completo di informazioni mediche e ha chiesto una diagnosi finale, i modelli principali sono stati corretti nel 91% dei casi. La diagnosi differenziale precoce, la fase in cui i clinici includono ed escludono condizioni mentre l'incertezza è massima, ha fallito in più di 8 casi su 10.
Rao ha detto a The Register che ogni modello testato ha fallito sulla grande maggioranza dei casi, e che la diagnosi differenziale precoce è il punto in cui i sistemi sono più deboli. Il coautore dottor Marc Succi, radiologo al Massachusetts General Hospital, ha detto che i risultati suggeriscono che gli LLM pronti all'uso non dovrebbero essere considerati affidabili per il ragionamento diagnostico rivolto al paziente senza una revisione umana strutturata e completa. Ha aggiunto che i modelli possono proiettare sicurezza senza mostrare un ragionamento affidabile, cosa che può alimentare l'ansia nei pazienti.
Rao ha anche offerto una precisazione: il fallimento secondo la definizione rigorosa del paper non significava sempre che il modello sbagliasse. Misurato come accuratezza grezza, in proporzione di risposte corrette per caso, i punteggi andavano dal 63% al 78%, il che significa che i modelli erano spesso parzialmente corretti. Il team sostiene comunque che la metrica più rigorosa conti, perché gli LLM vengono commercializzati come strumenti di prima linea che restringono le diagnosi prima che subentri un umano.
A che punto è la regolamentazione
Nessuno di questi tre paper è un documento regolatorio, e il dossier dietro questo articolo non contiene il testo di alcuna norma sull'AI in medicina. Quello che mostra è la forma del problema che i regolatori hanno davanti. L'accuratezza diagnostica su casi selezionati può sembrare solida mentre il ragionamento precoce fallisce, e gli audit sulla privacy possono passare mentre i singoli pazienti restano identificabili.
Il lavoro di Microsoft indica una direzione: dimostrare il sistema in uno studio clinico, poi chiedere l'approvazione. Il paper su Nature ne indica un'altra: cambiare come vengono scritti gli audit sulla privacy, e adottare tecniche come la privacy differenziale prima dell'impiego. Lo studio su JAMA punta su etichettatura e marketing, sostenendo che descrivere gli LLM come agenti diagnostici crea falsa sicurezza proprio dove sono meno affidabili.
Per chiunque legga di un prodotto di AI medica, dalle prove sopra seguono tre domande. È stato testato su pazienti reali in un contesto clinico, o su casi di studio pubblicati? La sua valutazione della privacy guarda ai singoli pazienti o solo al rischio aggregato? E dichiara di diagnosticare, o di assistere un clinico che resta responsabile? Le risposte di solito sono nel paper, non nel comunicato stampa.
Fonti
4- 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
- 02Microsoft AI tool outperforms doctors in diagnosing complex medical casesEN
- 03Microsoft Says Its New AI System Diagnosed Patients 4 Times More Accurately Than Human DoctorsEN
- 04LLMs fail in 8 out of 10 early differential diagnosis casesEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.