Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Conformità all'AI Act UE e IA per la diagnosi medica: cosa dicono davvero le regole

L'IA per la diagnosi medica viene venduta più in fretta di quanto i regolatori riescano a verificarla. Tre studi recenti indicano il problema di fondo: i modelli sono difficili da controllare, difficili da mettere in sicurezza e difficili da quantificare.

SaluteSpiegatoSara GalloPubblicato: 27 settembre 20265 min di letturaFonti 5
Conformità all'AI Act UE e IA per la diagnosi medica: cosa dicono davvero le regole

La questione normativa non è se l'IA possa diagnosticare. È se qualcuno possa dimostrare quanto bene lo faccia. Due lavori usciti a mesi di distanza mostrano quanto si sia allargata la distanza.

Il 24 giugno 2026, un gruppo dell'Università Tecnica di Monaco ha riferito su Nature che i modelli di IA medica usati per la diagnosi sono vulnerabili agli attacchi di inferenza di appartenenza (MIA), interrogazioni che cercano di stabilire se la cartella di un paziente specifico facesse parte del set di addestramento. The Register ha trattato il lavoro lo stesso giorno. Il gruppo ha testato sette dataset di IA medica, tra immagini, registrazioni ECG e cartelle cliniche elettroniche generali. Il risultato: i singoli pazienti possono essere identificati con quello che gli autori definiscono un successo dell'attacco quasi perfetto.

È un problema di privacy. È anche un problema di misurazione. Come lo formulano i ricercatori, tassi di successo quasi perfetti sui singoli pazienti non vengono catturati adeguatamente dal protocollo di valutazione standard, che misura il successo dell'attacco in modo aggregato sui diversi record. In parole semplici, un audit che riporta una media può mancare del tutto il caso individuale.

Cosa richiedono le regole, e cosa non coprono

L'AI Act UE è il quadro normativo più spesso citato in questo dibattito, e il dossier qui è scarno sul suo dettaglio operativo. Quello che le fonti mostrano è una distanza tra il linguaggio di conformità usato dai fornitori e la ricerca sulla sicurezza pubblicata nello stesso periodo.

Un progetto GitHub, srta-ai-accountability, si descrive come il primo sistema a rispondere alle domande sul perché nell'IA spiegabile con il 94% di conformità all'AI Act UE. È etichettato esplicitamente come prototipo di ricerca e architettura concettuale. Questo è lo stato delle cose per almeno una parte degli strumenti di accountability: una dichiarazione di conformità al 94%, pubblicata su un repository di codice, senza un organismo di regolamentazione collegato a quel numero.

Il lavoro di Monaco punta in un'altra direzione. I suoi autori vogliono che gli standard di rendicontazione per gli audit di privacy dell'IA cambino, così che conti il rischio a livello individuale, non solo quello aggregato. Raccomandano anche quadri di privacy differenziale, progettati per garantire matematicamente che i dati di addestramento restino anonimi. E suggeriscono che i dati di addestramento possano essere compilati in modo che i gruppi sottorappresentati siano meglio rappresentati.

L'autore principale Moritz Knolle ha detto a The Register che i rischi per la privacy derivanti dalle MIA diventano più gravi man mano che la coorte di addestramento di un modello diventa più specifica. Ha portato l'esempio dell'appartenenza a un set di addestramento che rivela che qualcuno ha una condizione genetica dormiente come la malattia di Huntington, una depressione, o che ha frequentato una specifica clinica di trattamento specialistico.

Le dichiarazioni di accuratezza che i regolatori dovranno valutare

La performance diagnostica è l'altra metà del problema normativo, e qui i numeri sono insolitamente confusi.

Microsoft ha annunciato il suo AI Diagnostic Orchestrator (MAI-DxO) il 30 giugno 2025. GeekWire ha riferito che lo strumento ha battuto 21 medici esperti degli Stati Uniti e del Regno Unito su casi complessi del New England Journal of Medicine, con un punteggio dell'85,5% contro il 20% dei medici. WIRED, trattando lo stesso lavoro il 1 luglio 2025, ha indicato la cifra nell'80% contro il 20% e ha scritto che il sistema ha ridotto i costi del 20% selezionando esami più economici. Il benchmark è stato costruito su 304 casi recenti del NEJM.

Queste cifre portano un'avvertenza che compare in entrambi i resoconti. Ai medici dello studio non era permesso consultare colleghi o usare risorse esterne, cosa che non corrisponde a come lavorano i clinici. Lo scienziato del MIT David Sontag ha detto a WIRED che i risultati di Microsoft vanno trattati con cautela proprio per questo motivo, e che resta da vedere se il sistema ridurrebbe i costi nella pratica. Microsoft stessa ha detto che lo strumento avrebbe bisogno di test clinici e di approvazione regolatoria prima dell'impiego.

Poi c'è il caso di fallimento. Il 15 aprile 2026, The Register ha riferito di uno studio su JAMA Network Open guidato dalla studentessa di medicina di Harvard Arya Rao. Ha testato 21 modelli di IA leader disponibili in commercio contro 29 vignette cliniche standardizzate. I modelli erano corretti nel 91% dei casi quando veniva chiesta una diagnosi finale con informazioni complete. Ma nella diagnosi differenziale precoce, la fase in cui i clinici includono ed escludono condizioni, hanno fallito in più di 8 casi su 10.

Ogni modello che abbiamo testato ha fallito nella grande maggioranza dei casi, ha detto Rao a The Register. È la fase in cui l'incertezza conta di più, ed è quella in cui questi sistemi sono più deboli.

Il radiologo del Massachusetts General Hospital Marc Succi, coautore, ha detto alla stessa testata che i modelli disponibili in commercio oggi non dovrebbero essere considerati affidabili per il ragionamento diagnostico rivolto al paziente senza una revisione umana strutturata e completa. Ha anche detto che tassi di successo più alti nella diagnosi finale non dovrebbero rassicurare, perché il ragionamento clinico reale inizia prima, quando l'ambiguità è massima.

Cosa dovrebbe testare un regolatore

Mettendo i tre risultati uno accanto all'altro, il problema dell'audit diventa concreto.

  • Privacy: i singoli pazienti in un set di addestramento possono essere identificati con alto successo, e i gruppi sottorappresentati sono più facili da identificare di altri. La rendicontazione aggregata lo nasconde.
  • Performance: la stessa classe di modello può segnare il 91% nella diagnosi finale e fallire più dell'80% dei casi di diagnosi differenziale precoce.
  • Progettazione del benchmark: il risultato principale di Microsoft è venuto da un test in cui i medici umani lavoravano senza le risorse che usano normalmente.

Niente di tutto questo significa che l'IA medica non possa essere regolata. Significa che gli strumenti attuali misurano l'unità sbagliata. Un punteggio di privacy aggregato, un tasso di accuratezza sulla risposta finale e un benchmark eseguito in condizioni artificiali sono tutti facili da pubblicare e difficili da falsificare.

Knolle ha detto di sperare che la comunità dell'IA medica inizi a prendere sul serio i rischi per la privacy e che le tecniche di mitigazione del rischio vengano usate dove sono necessarie. Ha anche osservato che ci sono molte situazioni in cui una MIA riuscita rappresenta una violazione della privacy piccola o trascurabile, come nel caso di modelli addestrati su popolazioni ampie e generali.

La domanda irrisolta è chi decide in quale situazione si trovi un dato modello. Secondo l'AI Act UE, quella decisione spetta al fornitore e all'auditor, non agli autori del lavoro e non a un repository che si assegna da solo il 94%.

Commenti 0

Fonti

5
  1. 01Medical diagnosis AIs can be tricked into telling whose data trained themEN
  2. 02Microsoft AI tool outperforms doctors in diagnosing complex medical casesEN
  3. 03Microsoft Says New AI Diagnosed Patients 4 Times More Accurately Than DoctorsEN
  4. 04LLMs fail in 8 out of 10 early differential diagnosis casesEN
  5. 05srta-ai-accountability: AI Accountability FrameworkEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Sara Gallo

Sara Gallo

Scienza e salute

Sara Gallo scrive di scienza e salute per FLASH24, partendo da studi originali, comunicati di enti di ricerca e dati di agenzie sanitarie, senza fermarsi ai titoli. Per ogni articolo controlla campioni, intervalli di confidenza e conflitti di interesse, confrontando i numeri con le serie storiche di ISS ed Eurostat. Segue le revisioni sistematiche in uscita e attende i briefing del ministero della Salute, parlando con ricercatori e clinici prima di pubblicare. La sua formazione in fisica dei materiali e il telescopio che usa nel tempo libero si ritrovano nella cura con cui legge misure e immagini. Non pubblica stime senza fonte primaria.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.