Log in

Ops! Per usare il Centro di Lettura devi prima effettuare il log in!

Password dimenticata?

Non hai un account? Registrati

Registrazione

Sei un essere umano?

Hai già un account? Log in

Cerca nel sito…

Reset

L’attuale regolazione dell’intelligenza artificiale (IA) in Europa e in Italia si fonda su finalità pienamente condivisibili di tutela dei diritti fondamentali, sicurezza e responsabilità nell’uso di sistemi ad alto impatto. Tuttavia, nel dibattito pubblico e talora anche nell’interpretazione applicativa delle norme, concetti quali spiegabilità, trasparenza algoritmica e human-in-the-loop tendono a essere caricati di aspettative eccessive, semanticamente ambigue e tecnicamente non sempre sostenibili. L’AI Act dell’Unione europea, entrato in vigore il 1° agosto 2024, e la legge italiana 23 settembre 2025, n. 132, delineano in realtà un quadro più articolato, fondato su obblighi di documentazione, robustezza, accuratezza, supervisione umana, qualità dei dati e sorveglianza dei sistemi. In ambito sanitario, dove l’errore algoritmico incide su diagnosi, prognosi e scelte terapeutiche, il criterio decisivo non è però la piena accessibilità interna del modello, bensì la sua affidabilità operativa nel contesto clinico reale. Il presente contributo propone pertanto uno spostamento di paradigma: dalla spiegabilità come ideale simbolico alla affidabilità come proprietà empiricamente dimostrabile; dalla trasparenza del codice alla auditabilità dei processi; dalla mera presenza umana alla capacità strutturale di intervento informato. In questa prospettiva, la regolazione dell’IA clinica dovrebbe convergere verso standard ispirati alla evidence-based medicine, alla scienza dei sistemi complessi e al ciclo di vita dei dispositivi medici, privilegiando validazione esterna, monitoraggio post-market, fattori umani, tracciabilità e governance della responsabilità.

Introduzione

Negli ultimi anni la regolazione dell’intelligenza artificiale ha assunto, nel lessico pubblico e in parte anche in quello istituzionale, una configurazione quasi assiomatica: quanto più un sistema di IA è “spiegabile”, tanto più esso sarebbe anche legittimo, controllabile e degno di fiducia. Questa intuizione ha esercitato una forte attrazione politica e culturale, soprattutto nei settori ad alto impatto, come la sanità, dove l’uso di sistemi algoritmici può incidere direttamente su diagnosi, prognosi, priorità di accesso, trattamenti e allocazione delle risorse. Tuttavia, proprio nel momento in cui il diritto europeo e nazionale stanno consolidando i propri impianti normativi, emerge con crescente evidenza la necessità di distinguere tra il valore politico della spiegazione e la sua effettiva funzione tecnico-regolatoria. L’entrata in vigore del Regolamento europeo 2024/1689, noto come AI Act, il 1° agosto 2024, e l’adozione in Italia della legge 23 settembre 2025, n. 132, rendono oggi non più rinviabile una riflessione critica sui presupposti concettuali che stanno guidando la regolazione dell’IA e, in particolare, sulla loro adeguatezza rispetto ai sistemi contemporanei impiegati in medicina.

Dalla spiegabilità come ideale normativo ai suoi limiti epistemologici

Occorre chiarire subito che una simile riflessione non si colloca affatto in una prospettiva deregolatoria. Al contrario, essa muove dal riconoscimento pieno della necessità di regole forti, soprattutto quando l’AI opera in contesti in cui sono in gioco la salute, la sicurezza, la dignità della persona e i diritti fondamentali. L’AI Act si presenta infatti come il primo quadro giuridico organico al mondo specificamente dedicato all’intelligenza artificiale e adotta un approccio risk-based che differenzia gli obblighi in funzione del livello di rischio dei sistemi. Per i sistemi ad alto rischio, il diritto europeo non si limita a evocare la trasparenza, ma richiede sistemi di gestione del rischio, qualità dei dati, logging (o record-keeping si riferisce all’obbligo imposto ai fornitori e agli utilizzatori di sistemi di IA di registrare automaticamente, tracciare e conservare la documentazione relativa al funzionamento, alle decisioni e agli eventi significativi del sistema lungo tutto il suo ciclo di vita, ndr), documentazione tecnica, informazioni al deployer (chi distribuisce e rende operativo un software, ndr), misure di supervisione umana, robustezza, accuratezza e cybersecurity. Analogamente, la legge italiana del 2025 afferma di voler promuovere un uso corretto, trasparente e responsabile dell’IA in una dimensione antropocentrica, interpretando espressamente le proprie disposizioni in conformità con il regolamento europeo. Il problema, dunque, non è l’esistenza della regolazione, ma il fatto che una parte rilevante del dibattito continua a leggere e applicare tali norme attraverso categorie semantiche spesso imprecise, sovrapponendo nozioni molto diverse tra loro, quali explainability (spiegabilità), interpretabilità, trasparenza, intelligibilità, tracciabilità e auditabilità.

Questo equivoco è particolarmente visibile nel successo del termine “explainability”, divenuto negli ultimi anni una sorta di parola chiave normativa e morale. Eppure, dal punto di vista epistemologico e tecnico, la spiegabilità non costituisce una proprietà univoca. In alcuni casi essa indica l’interpretabilità intrinseca del modello; in altri, si riferisce a spiegazioni post hoc generate su modelli opachi; in altri ancora, coincide semplicemente con l’obbligo di fornire all’utente informazioni comprensibili sul contesto d’uso, sulle finalità del sistema, sui suoi limiti e sui suoi rischi. Queste distinzioni sono tutt’altro che terminologiche: esse determinano la qualità stessa della regolazione.

Cynthia Rudin, informatica e statistica nota per il suo lavoro sull’apprendimento automatico interpretabile, ha mostrato con forza come – nei contesti ad alto impatto – il tentativo di “spiegare” modelli black box attraverso tecniche post hoc possa produrre un’illusione di comprensione più che una vera garanzia epistemica. Un esempio paradigmatico è quello dei sistemi di risk scoring utilizzati in ambito giudiziario, come Compas: anche quando si forniscono spiegazioni locali o semplificazioni ex post dei fattori che avrebbero inciso sulla classificazione di un soggetto, resta opaco il reale funzionamento del modello, la fedeltà della spiegazione rispetto alla decisione effettivamente generata e la possibilità di individuare errori materiali, correlazioni spurie o criteri non giustificabili. In questi casi, la spiegazione non equivale a controllo: può rendere la decisione più narrabile, ma non necessariamente più verificabile Queste distinzioni sono tutt’altro che terminologiche, perché rinviano a un mutamento più profondo del paradigma epistemologico. Una parte rilevante della cultura occidentale continua infatti a presupporre un modello di cognizione implicitamente ispirato alla razionalità simbolico-discorsiva classica, nel quale comprendere equivale a ricostruire una sequenza relativamente esplicita di nessi tra cause, ragioni e conseguenze. In tale orizzonte, la conoscenza è ritenuta pienamente affidabile solo quando può essere resa intellegibile mediante regole, passaggi logici e catene di inferenze verbalizzabili. I sistemi contemporanei di machine learning, e in particolare le reti neurali profonde, mettono però in crisi questo presupposto: essi non organizzano la conoscenza principalmente come un insieme di regole locali espresse in forma simbolica, ma come una struttura distribuita di pesi, vincoli e relazioni in spazi ad alta dimensionalità, nella quale l’informazione è codificata in modo geometrico-matematico attraverso miliardi di parametri. Ne deriva che la performance del sistema può dipendere da regolarità reali, stabili e operativamente efficaci, pur senza essere traducibile in una spiegazione semplice, lineare e umanamente perspicua. L’errore teorico consiste allora nel confondere l’esplicitabilità di una decisione con la sua affidabilità: ma spiegabilità e affidabilità non coincidono. Un sistema può essere facilmente narrabile e tuttavia fragile, impreciso o clinicamente fuorviante; specularmente, un sistema può essere solo parzialmente intellegibile sul piano interno e tuttavia risultare altamente robusto, calibrato, validato e sicuro nel contesto d’uso. Il mutamento epistemologico descritto può essere sintetizzato visivamente nella figura 1.

Figura 1 – Modelli epistemologici a confronto.
A sinistra, il modello cognitivo simbolico-discorsivo basato su catene causa-effetto esplicite e verbalizzabili; a destra, la conoscenza distribuita tipica delle reti neurali, codificata in forma geometrico-matematica in spazi ad alta dimensionalità. La figura illustra il passaggio da una conoscenza esplicitabile a una conoscenza operativamente efficace ma non direttamente interpretabile in termini lineari.

Evidenze empiriche e snodi regolatori

Per questo la questione regolatoria decisiva non è se ogni inferenza algoritmica possa essere ricondotta a una catena causa-effetto umanamente leggibile, bensì se il sistema possa essere verificato, governato, monitorato e contestualizzato in modo sufficientemente rigoroso per l’impiego cui è destinato. In ambito sanitario, Ghassemi e colleghi hanno parlato esplicitamente della “false hope” associata agli attuali approcci di explainable AI nel supporto decisionale riferito al singolo paziente. Il punto della loro critica non è che ogni forma di spiegazione sia inutile, ma che molte tecniche oggi disponibili producono soltanto rappresentazioni approssimative, locali e post hoc del comportamento del modello, senza garantire che tali rappresentazioni siano realmente fedeli al processo inferenziale che ha generato l’output. Ne deriva una conseguenza cruciale: la spiegazione può risultare persuasiva o intuitivamente rassicurante per il clinico, senza per questo offrire un controllo epistemico robusto sulla correttezza, sulla generalizzabilità o sulla sicurezza della decisione. Per tale ragione, assumere la spiegabilità come criterio regolatorio centrale rischia di scambiare per governabilità effettiva ciò che è, in realtà, solo una ricostruzione semplificata e talvolta fuorviante del funzionamento del sistema. In contesti clinici ad alto impatto, il fuoco normativo dovrebbe quindi spostarsi dalla mera narrabilità della decisione verso requisiti più solidi di validazione, robustezza, monitoraggio e verifica empirica delle prestazioni. Questo spostamento dalla spiegabilità all’affidabilità può essere chiarito attraverso un esempio concreto. A titolo esemplificativo, si consideri un sistema di intelligenza artificiale utilizzato per il supporto alla diagnosi radiologica, ad esempio per l’identificazione precoce di noduli polmonari in immagini TC. In un simile contesto, la decisione del modello può non essere riconducibile a una catena esplicita di regole clinicamente interpretabili; tuttavia, la sua affidabilità può essere valutata ex post attraverso una pluralità di criteri empirici rigorosi. Tra questi rientrano: la validazione su dataset indipendenti e multicentrici, la misurazione delle performance discriminative (ad esempio AUROC, sensibilità e specificità), l’analisi della calibrazione probabilistica, il monitoraggio della stabilità delle prestazioni nel tempo (data drift e concept drift), la valutazione dell’impatto clinico in studi prospettici e l’analisi degli errori in relazione a sottogruppi di popolazione.

Inoltre, l’affidabilità del sistema non viene valutata isolatamente, ma in relazione al contesto d’uso e all’interazione con il team umano: si analizza, ad esempio, se l’integrazione del sistema migliori le decisioni cliniche rispetto alla pratica standard, se riduca la variabilità inter-operatore o se introduca nuovi rischi sistematici. In questo quadro, il controllo epistemico non deriva dalla piena esplicitabilità interna del modello, ma dalla convergenza di evidenze empiriche, validazioni indipendenti e meccanismi di monitoraggio continuo.

Questo esempio mostra come sia possibile ottenere un elevato grado di affidabilità operativa anche in presenza di modelli solo parzialmente intellegibili, e chiarisce perché una regolazione centrata esclusivamente sulla spiegabilità rischi di trascurare dimensioni più rilevanti per la sicurezza e l’efficacia clinica.  La differenza tra spiegabilità e affidabilità può essere sistematizzata nei termini riassunti nella figura 2.

Figura 2 – Spiegabilità versus affidabilità nei sistemi di AI.
La spiegabilità si fonda sulla traducibilità del modello in regole causali umane e su catene inferenziali esplicite, ma può produrre rappresentazioni surrogate e talvolta fuorvianti. L’affidabilità, invece, si fonda su criteri empirici quali coerenza nel tempo, robustezza, validazione e monitoraggio continuo. La figura evidenzia che le due dimensioni non coincidono: un sistema può essere spiegabile ma non affidabile, oppure affidabile pur restando solo parzialmente interpretabile.

L’aspetto interessante è che lo stesso impianto europeo, se letto attentamente, non coincide affatto con una mitologia ingenua della trasparenza totale. La Commissione europea riconosce espressamente che, in molti casi, non è possibile comprendere perché un sistema di AI abbia prodotto una determinata decisione o previsione. Proprio per questo l’AI Act non si affida a un unico criterio, ma a un insieme di obblighi distribuiti lungo l’intero ciclo di vita del sistema. Inoltre, la fase attuativa ha già mostrato una difficoltà strutturale; pertanto, la Commissione europea ha dovuto accompagnare l’implementazione con FAQ, piattaforme di supporto, codici di pratica e future linee guida. Ha anche riconosciuto il ritardo nello sviluppo degli standard armonizzati da parte di Cen (European committee for standardization che riunisce gli organismi nazionali di normazione di 34 Paesi europei) e Cenelec (European committee for electrotechnical standardization che riunisce i corrispondenti comitati nazionali per il settore elettrotecnico). Entrambi i committee sono ufficialmente riconosciuti dall’Unione europea come European standardization organizations, Nel novembre 2025, la Commissione ha inoltre proposto un “Digital omnibus on AI”, ossia un intervento omnibus di semplificazione normativa volto a introdurre modifiche mirate all’AI Act per facilitarne un’applicazione tempestiva, proporzionata e sostenibile, anche in ragione del ritardo degli standard tecnici e della necessità di strumenti attuativi complementari. Questo dato è teoricamente rilevante: esso mostra che il problema non è solo giuridico, ma epistemico-operativo. Quando la norma incontra sistemi tecnici complessi, il diritto è costretto a spostarsi da formule astratte di principio verso dispositivi più concreti di standardizzazione, documentazione, verifica e adattamento progressivo.

In sanità tale tensione emerge con particolare intensità. L’idea secondo cui sarebbe sufficiente mantenere “l’uomo nel loop” (human in the loop) per neutralizzare i rischi dell’AI è, da sola, teoricamente debole e praticamente insufficiente. La presenza formale del medico a valle del processo decisionale non garantisce infatti né comprensione critica né reale capacità di controllo. La letteratura sui sistemi di supporto decisionale ha documentato da tempo il fenomeno dell’automation bias, cioè la tendenza degli operatori a sovra-affidarsi all’automazione, riducendo la vigilanza, la verifica autonoma e la qualità dell’analisi critica. Questo problema non scompare semplicemente perché il decisore finale è umano; al contrario, può persino aggravarsi quando il sistema è percepito come tecnicamente sofisticato, statisticamente superiore o istituzionalmente validato. Le stesse FAQ europee sul requisito di human oversight (supervisione umana) insistono, significativamente, non sulla sola presenza dell’essere umano, ma sulla necessità che il sistema sia progettato in modo da poter essere monitorato efficacemente, che vi siano misure proporzionate al rischio e che il deployer assegni la supervisione a persone con competenza, autorità e supporto adeguati. In altri termini, il problema non è la presenza umana in sé, ma la qualità strutturale dell’intervento umano possibile.

Da questo punto di vista, la legge italiana contiene elementi che meritano di essere valorizzati più di quanto non sia stato fatto finora. L’articolo 7 afferma che l’uso dell’IA in ambito sanitario deve contribuire al miglioramento del sistema sanitario e che i sistemi di IA costituiscono un supporto nei processi di prevenzione, diagnosi, cura e scelta terapeutica, lasciando impregiudicata la decisione, sempre rimessa agli esercenti la professione medica. Ma lo stesso articolo aggiunge un punto ancora più importante: i sistemi di IA utilizzati in sanità e i dati impiegati devono essere affidabili, periodicamente verificati e aggiornati al fine di minimizzare il rischio di errori e migliorare la sicurezza dei pazienti. Qui affiora, in forma normativa, il cuore della tesi sostenuta in questo lavoro: il criterio decisivo non è l’accesso integrale all’interiorità del modello, bensì la sua affidabilità operativa. Analogamente, l’articolo 8 apre in modo rilevante alla ricerca e sperimentazione scientifica in sanità, qualificando certi trattamenti di dati come di rilevante interesse pubblico, consentendo usi secondari di dati privi di identificativi diretti e trattamenti finalizzati ad anonimizzazione, pseudonimizzazione e sintetizzazione, con possibilità per Agenas di definire linee guida anche sulla creazione di dati sintetici, previo parere del Garante. Questa parte della legge italiana mostra come una regolazione intelligente non debba limitarsi a porre barriere, ma debba creare condizioni controllate di sviluppo, validazione e monitoraggio.

Verso una regolazione evidence-based dell’IA in sanità

Da qui la proposta teorica di questo articolo: spostare il baricentro concettuale della regolazione dall’ideale della spiegabilità alla scienza dell’affidabilità. Per affidabilità non si intende una fiducia generica o retorica, ma una proprietà empiricamente valutabile del sistema, definibile in termini di validità prestazionale, robustezza, calibrazione, tracciabilità, auditabilità, controllabilità organizzativa e monitoraggio lungo il ciclo di vita. In questa prospettiva, la domanda regolatoria decisiva non è “il modello è pienamente spiegabile?”, bensì “il sistema è sufficientemente verificabile, governabile e sicuro per l’uso clinico cui è destinato?”. Tale spostamento non è arbitrario: esso è perfettamente coerente con la logica della evidence-based medicine, con il paradigma dei dispositivi medici e con i principali riferimenti metodologici internazionali. L’AI risk management framework del National institute of standards and technology mostra con particolare chiarezza che l’affidabilità e credibilità dell’IA non può essere ridotta alla sola spiegabilità. Essa emerge, piuttosto, dall’equilibrio contestuale tra una pluralità di proprietà: validità e affidabilità, safety, sicurezza informatica e resilienza, accountability e trasparenza, spiegabilità e interpretabilità, tutela della privacy enhancement e fairness con gestione dei bias dannosi. La spiegabilità, dunque, non fonda da sola la fiducia nel sistema, ma rappresenta soltanto una delle dimensioni da ponderare all’interno di un più ampio giudizio di affidabilità socio-tecnica. Spirit-AI disciplina il reporting dei protocolli di trial, Decide-AI la valutazione clinica precoce dei sistemi di supporto decisionale basati su IA, e Tripod+AI il reporting dei modelli predittivi clinici sviluppati o validati con regressione o machine learning. In tutti e tre i casi, l’accento metodologico cade sulla trasparenza del disegno, del contesto d’uso, della validazione e delle performance, più che sulla pretesa di una spiegazione esaustiva del funzionamento interno del modello.

Sul versante regolatorio dei dispositivi medici, i principi di good machine learning practice promossi nell’ambito dell’International medical device regulators forume i principi congiunti di Fda, Health Canada e Medicines & healthcare products regulatory agency del Regno Unito sulla trasparenza dei dispositivi medicali abilitati da machine learning mostrano con particolare evidenza che la governabilità dell’IA clinica non dipende primariamente dalla piena intelligibilità interna del modello. Essa viene piuttosto ancorata a una logica di total product lifecycle per la gestione dell’intero ciclo di vita di un prodotto, dalla sua concezione iniziale fino alla sua dismissione e smaltimento, alla valutazione delle prestazioni del sistema nel contesto del team umano-IA e alla comunicazione agli utenti di informazioni selezionate, chiare e concretamente rilevanti per l’uso sicuro ed efficace del dispositivo. Ne deriva una conseguenza importante anche per la teoria della responsabilità. In un ecosistema clinico governato da modelli statistici complessi, la responsabilità non può essere pensata come il semplice residuo di una decisione finale umana, né come l’effetto automatico della leggibilità del codice. Essa deve essere redistribuita lungo la filiera tecnica e organizzativa: progettazione, validazione, integrazione, deploy (processo per rendere un sistema basato su IA accessibile, funzionale e pronto all’uso in un contesto pratico, ndr), sorveglianza, aggiornamento, gestione degli incidenti, formazione degli utenti, audit dei processi. In questa prospettiva, l’auditabilità dei sistemi e dei workflow assume una rilevanza superiore alla sola trasparenza del modello, perché consente una ricostruzione ex post delle condizioni di funzionamento, delle fonti informative, delle versioni, dei controlli e delle deviazioni. La vera alternativa, dunque, non è tra opacità e spiegabilità, ma tra opacità incontrollata e opacità compensata da evidenze, standard, documentazione, verifiche indipendenti e capacità di intervento informato. È precisamente in questo passaggio che la regolazione dell’IA può maturare da etica declaratoria a scienza istituzionale dell’affidabilità.

Il presente contributo si colloca esattamente su questo crinale. Esso non intende contrapporre innovazione e tutela, né sostenere che i sistemi di IA debbano essere accettati nonostante la loro opacità. Intende, più rigorosamente, mostrare che la tutela dei pazienti, dei professionisti e dei diritti fondamentali può essere rafforzata soltanto quando il lessico regolatorio abbandona il feticismo di una spiegazione interna spesso impossibile o epistemicamente fragile e si orienta invece verso criteri più solidi: validazione, sorveglianza, audit, fattori umani, qualità dei dati, controllo delle modifiche, reporting trasparente delle performance e reale capacità di intervento clinico. In ambito medico, dove nessuna tecnologia è adottata per il solo fatto di essere intuitivamente comprensibile, ma per il fatto di essere sufficientemente sicura, efficace e governabile, una regolazione evidence-based dell’intelligenza artificiale appare non solo auspicabile, ma necessaria.

Fabio Di Bello
Wiley Global Technology

Customer Education & AI Implementation Manager
LinkedIn | YouTube | Facebook

Note essenziali per il manoscritto

  1. Regolamento (UE) 2024/1689 del Parlamento europeo e del Consiglio del 13 giugno 2024, pubblicato nella Gazzetta ufficiale dell’Unione europea il 12 luglio 2024, entrato in vigore il 1° agosto 2024.
  2. Commissione europea, AI Act, pagina ufficiale di sintesi e timeline di applicazione: approccio risk-based, obblighi per sistemi ad alto rischio, entrata in applicazione progressiva, proposta di semplificazione del 19 novembre 2025.
  3. Legge 23 settembre 2025, n. 132, “Disposizioni e deleghe al Governo in materia di intelligenza artificiale”, in Gazzetta Ufficiale n. 223 del 25 settembre 2025, in vigore dal 10 ottobre 2025.
  4. Legge n. 132/2025, art. 7: l’AI in sanità come supporto, decisione sempre rimessa al medico; obbligo di affidabilità, verifica periodica e aggiornamento dei sistemi e dei dati impiegati.
  5. Legge n. 132/2025, art. 8: ricerca scientifica in ambito sanitario, uso secondario di dati privi di identificativi diretti, anonimizzazione, pseudonimizzazione, sintetizzazione, ruolo di AGENAS e del Garante.
  6. Rudin C. Stop explaining black box machine learning models for high stakes decisions and use interpretable models instead. Nature Machine Intelligence. 2019;1:206–215.
  7. Ghassemi M, Oakden-Rayner L, Beam AL. The false hope of current approaches to explainable artificial intelligence in health care. The Lancet Digital Health. 2021;3:e745–e750.
  8. NIST. Artificial Intelligence Risk Management Framework (AI RMF 1.0). 2023.
  9. Cruz Rivera S, Liu X, Chan A-W, et al. SPIRIT-AI extension. Nature Medicine. 2020. Vasey B, Nagendran M, Campbell B, et al. DECIDE-AI. Nature Medicine. 2022. Collins GS, Moons KGM, Dhiman P, et al. TRIPOD+AI. BMJ. 2024.
  10. IMDRF. Good machine learning practice for medical device development: Guiding principles. 2025; FDA, Health Canada, MHRA. Transparency for Machine Learning-Enabled Medical Devices: Guiding Principles. 2024.
  11. Goddard K, Roudsari A, Wyatt JC. Automation bias: a systematic review of frequency, effect mediators, and mitigators. Journal of the American Medical Informatics Association. 2012; e relativo impatto nei sistemi di supporto decisionale clinico.
  12. Commissione europea, FAQ ufficiali su high-risk AI systems, human oversight e standardizzazione: la supervisione umana deve essere effettiva, proporzionata al rischio, affidata a soggetti competenti; gli standard armonizzati risultano ancora in corso e il loro ritardo ha motivato la proposta di Digital Omnibus.

Bibliografia selettiva

Condividi

Condividi questo articolo:

Ultimi articoli

Neutralità o complicità?

Religione, medicina e le ragioni del potere: Ferdinando Laghi e Roberto Romizi

I commenti sono chiusi.