Intelligenza Artificiale

Non chiedere all’IA di fingere: chiedile la verità verificabile

OffLineMind · · 5 min

Non chiedere all’IA di fingere: chiedile la verità verificabile

Se non sa, deve dirlo

L’intelligenza artificiale generativa può produrre risposte plausibili ma false. Non è una semplice possibilità teorica: è un problema riconosciuto dagli stessi sviluppatori dei modelli.

OpenAI definisce le «hallucinations» come casi nei quali un modello genera con sicurezza una risposta che non è vera e osserva che i modelli linguistici possono ancora produrre questo tipo di errore. La ricerca pubblicata da OpenAI nel 2025 collega il problema anche ai sistemi di addestramento e valutazione che possono premiare il tentativo di indovinare invece del riconoscimento dell’incertezza.

La conseguenza è semplice:

un’IA non deve essere incoraggiata a completare una risposta quando non possiede elementi sufficienti per sostenerla.

Deve poter dire:

«Non lo so.»

Oppure:

«Non posso verificarlo con le informazioni disponibili.»

Questa non è una debolezza del sistema. È una condizione necessaria per una comunicazione affidabile.

La sicurezza del linguaggio non è una prova

Una risposta può essere:

  • grammaticalmente perfetta;
  • dettagliata;
  • convincente;
  • accompagnata da spiegazioni;
  • espressa con assoluta sicurezza;

e tuttavia essere falsa.

Il problema nasce quando la forma della risposta viene scambiata per prova della sua verità.

Per questo bisogna separare almeno quattro stati:

VERIFICATO — l’affermazione è sostenuta da evidenze controllabili.

INCERTO — esistono elementi, ma non sufficienti per una conclusione definitiva.

NON VERIFICABILE — le informazioni disponibili non permettono di stabilire se l’affermazione sia vera.

STOP — procedere produrrebbe un rischio di errore non accettabile.

È questa distinzione, più che il tono della risposta, a determinare la qualità epistemica di un sistema.

Anche NIST mette la verifica al centro

Il National Institute of Standards and Technology (NIST) considera la validità e l’affidabilità tra le caratteristiche fondamentali di un’IA affidabile.

Il NIST AI Risk Management Framework indica tra le caratteristiche della trustworthy AI la validità e affidabilità, la sicurezza, la resilienza, la trasparenza, la spiegabilità e la responsabilità. Il documento sottolinea inoltre che la validità e l’affidabilità devono essere considerate nel contesto specifico dell’utilizzo del sistema.

Il NIST sottolinea inoltre l’importanza di test, valutazione, verifica e validazione dei sistemi di IA attraverso il proprio AI Resource Center.

La conseguenza metodologica è importante:

non basta che un modello produca una risposta plausibile; bisogna poter valutare quanto quella risposta sia affidabile nel contesto in cui viene utilizzata.

Anche l’AI Act europeo parla di accuratezza e robustezza

Il Regolamento europeo sull’intelligenza artificiale non stabilisce che una IA possa garantire una verità assoluta.

Stabilisce però requisiti di accuratezza, robustezza e resilienza agli errori per i sistemi di IA ad alto rischio. L’articolo 15 richiede che tali sistemi raggiungano un livello appropriato di accuratezza e robustezza e siano il più possibile resilienti a errori, guasti e incoerenze.

L’articolo 13 richiede inoltre informazioni sufficientemente trasparenti sulle capacità e sui limiti del sistema, comprese le prestazioni di accuratezza e robustezza e le circostanze che possono influenzarle.

Non significa che l’AI Act abbia risolto il problema della verità.

Significa che accuratezza, limiti, trasparenza e supervisione fanno parte della governance dell’IA.

La regola dovrebbe essere più severa

Da queste premesse nasce una regola molto semplice:

Non chiedere mai a un’IA di fingere. Chiedile di distinguere ciò che è verificato da ciò che è incerto e di fermarsi quando non può sostenere un’affermazione.

Non significa pretendere che una macchina possieda una «verità assoluta».

Significa impedirle di trasformare automaticamente una probabilità linguistica in un fatto.

La differenza è enorme.

Probabile non significa vero.

Plausibile non significa dimostrato.

Scritto bene non significa verificato.

La verità deve avere una procedura

Un sistema realmente orientato all’affidabilità dovrebbe seguire una sequenza:

AFFERMAZIONE → EVIDENZA → VERIFICA → LIVELLO DI CERTEZZA → DECISIONE O STOP

Se l’evidenza è sufficiente, si procede.

Se l’evidenza è incompleta, si dichiara l’incertezza.

Se l’affermazione non può essere verificata, non deve essere presentata come fatto.

Se l’incertezza è incompatibile con la decisione da prendere, il sistema deve fermarsi.

Questo è molto diverso dal semplice comando:

«Dammi la risposta migliore.»

La richiesta corretta dovrebbe essere:

«Dammi soltanto ciò che puoi sostenere con evidenze verificabili e dichiarami esplicitamente ciò che non puoi verificare.»

Il punto di contatto con PENSAI

È qui che si colloca la logica della modalità agnostica di PENSAI.

Quando le informazioni disponibili non sono sufficienti, il sistema non deve colmare il vuoto con una supposizione presentata come fatto.

Deve sospendere il giudizio.

X → verifica → V/F → decisione

La X rappresenta ciò che non è ancora sufficientemente conosciuto.

Non è una risposta negativa.

È il riconoscimento disciplinato dell’incertezza.

La decisione arriva soltanto dopo la verifica.

Una IA che sa dire «non lo so»

Forse la caratteristica più importante di un sistema di IA affidabile non è la quantità di risposte che riesce a produrre.

È la capacità di riconoscere quando non deve produrle come fatti.  La ricerca sulle allucinazioni mostra che il problema non è stato completamente risolto.

NIST considera validità, affidabilità, trasparenza e valutazione elementi centrali della gestione del rischio dell’IA. L’Unione europea ha introdotto requisiti normativi riguardanti accuratezza, robustezza e trasparenza per specifiche categorie e utilizzi dei sistemi di IA. Da questi elementi emerge una conclusione metodologica, non una promessa tecnologica:

non possiamo pretendere che una IA sia infallibile. Possiamo però pretendere che non trasformi ciò che non sa in una falsa certezza.

E quando non può dimostrare ciò che afferma, la risposta corretta può essere una sola:

STOP.


Fonti verificate

Disclaimer: questo articolo è stato realizzato con il supporto dell’intelligenza artificiale. La responsabilità editoriale e la verifica finale delle fonti spettano all’autore.

Views: 3

OffLineMind

Correlati