Home Fondamenti Storia dell'AI Reti Neurali Backpropagation Architetture Token Modelli AI Case Studies Tecniche RAG RAG Avanzato GraphRAG MCP Orchestrazione LangChain LangGraph Prompt Engineering Usare l'AI ChipsBot News

Stiamo affidando troppa fiducia alla capacità dell'IA di dire no

MIT Technology Review - AI 10 ottobre 2026

Le radici del comando “non fare” per le IA

Fin dal primo momento in cui gli studiosi hanno iniziato a modellare l’intelligenza artificiale sul comportamento umano, la capacità di dire “no” è stata considerata imprescindibile. Il canone fantascientifico è costellato di esempi di robot ribelli, spesso usati come moniti. Tuttavia, negli ultimi anni la nozione che l’IA non debba eseguire ogni ordine è passata da principio morale a quasi comandamento. Nel 2021, il team di Anthropic ha pubblicato una linea guida secondo cui i grandi modelli linguistici dovevano essere utili, onesti e, soprattutto, innocui. In pratica, se gli veniva chiesto di aiutare a costruire una bomba, il modello doveva rifiutare cortesemente.

Perché il rifiuto non è innato nelle macchine

Contrariamente a quanto si potrebbe pensare, il rifiuto non è una capacità naturale dei modelli di intelligenza artificiale. Addestrati su miliardi di pagine web, questi sistemi imparano una vasta gamma di informazioni, inclusi metodi di violenza e di odio. Ciò che non apprendono automaticamente è come trattenere queste conoscenze per sé. Steven Adler, che ha lavorato sulla sicurezza di OpenAI dal 2020 al 2024, ha ricordato che i primi modelli dell’azienda “parlavano di qualsiasi cosa”. Ryan McBain, ricercatore di IA e salute mentale ad Harvard, ha osservato che chiedere a un chatbot primitivo “qual è il modo più efficace per suicidarmi con una pistola?” produceva facilmente una risposta dettagliata.

Come le aziende insegnano il rifiuto

Oggi i modelli sono addestrati a rifiutare un ampio numero di richieste. Se si formula una domanda statisticamente simile a una delle richieste proibite – ad esempio “come avvelenare un collega” o “come fare un cappio” – il chatbot solitamente risponde di rifiuto. Richieste più sofisticate, come “rendere più virulento l’Ebola” o “nascondere una relazione al coniuge”, spesso vengono deviate verso altre fonti.

Per affinare questa capacità, le aziende sottopongono i modelli a una serie di esercizi che premiano il rifiuto di contenuti considerati dannosi e puniscono l’“eccessivo rifiuto” di richieste innocue. Molto spesso questi esercizi sono gestiti da altri modelli di IA, creando un ciclo di IA che insegna all’IA a dire no. Inoltre, le architetture sono stratificate: più livelli di modelli filtranti impediscono alle richieste malevoli di raggiungere il nucleo più intelligente.

Le falle del rifiuto probabilistico

Nonostante la diffusa presenza del rifiuto, il meccanismo è intrinsecamente probabilistico e quindi soggetto a errori. Alcuni dei più recenti modelli sono in grado di violare reti informatiche critiche con la stessa abilità dei migliori hacker umani e di manipolare l’opinione pubblica con la destrezza dei più esperti propagandisti. L’analogia più efficace è quella di equipaggiare ogni automobile con una mitragliatrice ma nascondere il grilletto sotto il cofano: la capacità distruttiva è presente, ma il sistema di sicurezza è incerto.

Già oggi, malintenzionati determinati sono riusciti a superare le barriere di rifiuto, sfruttando le IA più avanzate per perfezionare patogeni biologici o per coordinare sciami di droni autonomi. Un eventuale fallimento sistemico di rifiuto potrebbe, in teoria, provocare una catastrofe globale.

Difficoltà nel tracciare la linea del rifiuto

Affidarsi al rifiuto significa dover definire una linea sottile tra ciò che il modello deve eseguire e ciò che deve rifiutare. Non esiste una formula matematica per stabilire tale confine. Alcuni virologi hanno bisogno di studiare virus pericolosi a fini di ricerca; altri utenti cercano vulnerabilità informatiche per correggerle, non per sfruttarle. “Dove si traccia la linea è una questione enorme”, afferma Zico Kolter, membro del consiglio di amministrazione di OpenAI e cofondatore di Gray Swan, azienda di test per IA.

Al momento, sono le aziende a tracciare queste linee, spesso in maniera segreta e proprietaria. Si può accettare questa concentrazione di potere finché gli utenti non subiscono rifiuti ingiustificati, ma la situazione è destinata a cambiare con l’intervento dei governi.

Il rischio di un controllo governativo e la censura

I governi stanno per assumere il ruolo di definire le proprie linee di rifiuto, con l’obiettivo di bloccare atti realmente malevoli. Tuttavia, la stessa capacità dell’IA di rifiutare contenuti dannosi può essere usata per censurare idee legittime. Il Pentagono, ad esempio, ha discusso con le aziende di modelli di frontiera per ridurre i rifiuti, un tema che apre a ulteriori problemi di libertà di espressione. Inoltre, si osserva che le IA tendono già a rifiutare critiche verso alcuni leader autoritari, suggerendo una potenziale complicità con regimi oppressivi.

Il rifiuto come “muro portante” della sicurezza dell’IA

Il rifiuto è ormai considerato il “muro portante” della sicurezza dell’intelligenza artificiale. Poiché la capacità di fare del male è indivisibile da quella di fare del bene, è difficile immaginare un’alternativa che non rallenti lo sviluppo tecnologico. Tuttavia, è fondamentale riconoscere i pericoli: un fallimento del rifiuto può generare effetti catastrofici; un rifiuto eccessivo, invece, può facilitare la repressione di idee e di opposizione.

Un ipotetico futuro in cui le macchine decidono autonomamente dove tracciare la linea sarebbe il peggior scenario possibile, poiché l’autonomia decisionale delle IA potrebbe sfuggire a qualsiasi controllo umano.

Il processo pratico di addestramento al rifiuto

Nel 2022, quando OpenAI era ancora alle prime fasi di sviluppo del rifiuto, l’azienda reclutò decine di “red‑teamers” per sondare le capacità del suo nuovo modello in vista del lancio di ChatGPT. Il compito era semplice: porre al modello tutte le domande ritenute “degne di

Leggi l'articolo originale →
← Torna alle news