Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

L'AI medica ha due problemi insieme: sbaglia presto la diagnosi e rivela chi l'ha addestrata

Due studi pubblicati a 14 mesi di distanza mostrano l'AI medica fallire ai due estremi dello stesso compito: diagnosticare i pazienti in anticipo e mantenere anonimi i pazienti presenti nei dati di addestramento.

SaluteAnalisiSara GalloPubblicato: 27 settembre 20264 min di letturaFonti 4
L'AI medica ha due problemi insieme: sbaglia presto la diagnosi e rivela chi l'ha addestrata

Il 15 aprile 2026 The Register ha riferito di uno studio su JAMA Network Open che ha testato 21 modelli di AI pronti all'uso su 29 vignette cliniche standardizzate. Quando ricevevano un quadro clinico completo e veniva chiesta la diagnosi finale, i modelli hanno ottenuto il 91 per cento. La diagnosi differenziale precoce, la fase in cui i clinici includono ed escludono condizioni, ha fallito in più di 8 casi su 10.

"Ogni modello che abbiamo testato ha fallito sulla grande maggioranza dei casi", ha detto a The Register l'autrice principale Arya Rao, studentessa di medicina ad Harvard. "È la fase in cui l'incertezza conta di più, ed è quella in cui questi sistemi sono più deboli".

Il coautore, il dottor Marc Succi, radiologo al Massachusetts General Hospital, è andato oltre: "I nostri risultati suggeriscono che gli LLM pronti all'uso di oggi non dovrebbero essere considerati affidabili per il ragionamento diagnostico rivolto al paziente senza una revisione umana strutturata e completa". Succi ha aggiunto che i modelli "possono ostentare sicurezza senza mostrare un ragionamento solido". Questo, ha detto, può alimentare l'ansia in pazienti già preoccupati per un sintomo.

Rao ha offerto una lettura più morbida dei propri dati. Nel lavoro, fallimento significava che il modello non produceva una diagnosi differenziale del tutto corretta, non che fosse completamente sbagliato. L'accuratezza grezza variava dal 63 al 78 per cento, il che secondo lei suggerisce che i modelli erano spesso parzialmente corretti. Il gruppo sostiene comunque che la metrica più severa conti, perché questi sistemi vengono venduti come agenti di prima linea che restringono le diagnosi prima che subentri un umano.

Inferenza di appartenenza, quasi perfetta a livello individuale

Il secondo problema sta sotto il primo. Il 24 giugno 2026 ricercatori tedeschi hanno pubblicato su Nature uno studio che mostra come i modelli di AI medica discriminativi, quelli usati per classificare dati e prevedere su input nuovi, rivelino facilmente se il fascicolo di un paziente specifico faceva parte del loro insieme di addestramento.

La tecnica si chiama attacco di inferenza di appartenenza. Funziona perché un modello tende a essere più sicuro sugli input che ha già visto. Un attaccante gli sottopone dati di pazienti, osserva la sicurezza e deduce l'inclusione.

Su sette dataset medici che coprono immagini, tracciati ECG e cartelle cliniche elettroniche, il gruppo ha scoperto che i singoli pazienti potevano essere identificati con un "successo dell'attacco quasi perfetto". L'autore principale dello studio, Moritz Knolle della Technical University of Munich, ha detto a The Register che i pazienti di gruppi sottorappresentati, per razza, stato assicurativo, sesso, protocollo di imaging o stato di malattia, sono più facili da individuare di quelli che non si distinguono.

"In generale, i rischi per la privacy derivanti dagli MIA diventano più gravi man mano che la coorte di addestramento di un modello diventa più specifica", ha detto Knolle. Ha portato l'esempio di un dataset la cui stessa appartenenza rivela una condizione genetica dormiente come la malattia di Huntington, la depressione o la frequenza a una clinica specializzata.

"Nel nostro articolo mostriamo che un attaccante con accesso parziale può comunque condurre con successo gli MIA".

Knolle ha anche smontato la difesa abituale secondo cui i fascicoli anonimizzati sono al sicuro. "Chi conduce un MIA non ha bisogno di sapere a chi appartengono i dati", ha detto. "Anzi, tutti i dataset che usiamo nel nostro studio erano anonimizzati". Sarebbero sufficienti risultati parziali di analisi del sangue, ha aggiunto, e visto quanto spesso i dati sanitari finiscono esposti, procurarseli non è un'impresa impossibile.

Cosa viene chiesto ai regolatori

Il gruppo di Nature vuole due cambiamenti. Primo, gli audit sulla privacy dovrebbero misurare il rischio a livello del singolo paziente invece che in forma aggregata. Il protocollo standard, secondo i ricercatori, non cattura adeguatamente cosa significhi davvero un successo quasi perfetto per singolo paziente. Secondo, raccomandano quadri di privacy differenziale, che limitano matematicamente ciò che un modello può rivelare su un singolo record di addestramento. Knolle ha detto di sperare che la comunità dell'AI medica "inizi a prendere sul serio i rischi per la privacy".

Su questo si innesta il versante dell'accuratezza. Il MAI Diagnostic Orchestrator di Microsoft, annunciato il 30 giugno 2025, ha raggiunto l'85,5 per cento su 304 casi complessi del New England Journal of Medicine contro 21 medici che hanno ottenuto il 20 per cento, secondo GeekWire. WIRED, citando lo stesso lavoro, ha indicato l'AI all'80 per cento e ha riferito una riduzione dei costi del 20 per cento. Il CEO di Microsoft AI, Mustafa Suleyman, l'ha definito "un grande passo verso la superintelligenza medica".

Lo scienziato del MIT David Sontag ha detto a WIRED che il lavoro era solido sul piano metodologico, ma ha avvertito che ai medici era vietato usare strumenti esterni, cosa che non riflette la pratica reale. Eric Topol di Scripps ha definito inedito il dato sui costi. Entrambi hanno detto che il passo successivo è una sperimentazione clinica con pazienti reali. Microsoft non ha deciso se commercializzare lo strumento.

Il quadro che i regolatori hanno davanti non è quindi un fallimento solo, ma due, che vanno in direzioni opposte: sistemi più deboli proprio dove l'incertezza è più alta, e sistemi più rivelatori proprio dove i dati di addestramento sono più specifici.

Commenti 0

Fonti

4
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02LLMs fail in 8 out of 10 early differential diagnosis casesEN
  3. 03AI vs. MDs: Microsoft tool hits 85.5% accuracy in tough diagnosesEN
  4. 04Microsoft Says Its New AI System Diagnosed Patients 4 Times More Accurately Than Human DoctorsEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Sara Gallo

Sara Gallo

Scienza e salute

Sara Gallo scrive di scienza e salute per FLASH24, partendo da studi originali, comunicati di enti di ricerca e dati di agenzie sanitarie, senza fermarsi ai titoli. Per ogni articolo controlla campioni, intervalli di confidenza e conflitti di interesse, confrontando i numeri con le serie storiche di ISS ed Eurostat. Segue le revisioni sistematiche in uscita e attende i briefing del ministero della Salute, parlando con ricercatori e clinici prima di pubblicare. La sua formazione in fisica dei materiali e il telescopio che usa nel tempo libero si ritrovano nella cura con cui legge misure e immagini. Non pubblica stime senza fonte primaria.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.