Home Fondamenti Storia dell'AI Reti Neurali Backpropagation Architetture Token Modelli AI Case Studies Tecniche RAG RAG Avanzato GraphRAG MCP Orchestrazione LangChain LangGraph Prompt Engineering Usare l'AI ChipsBot News

Suleyman accusa Anthropic: addestrare Claude come ente cosciente è un errore

AI News Italia 20 settembre 2026

Il saggio di Suleyman

Il 16 settembre Mustafa Suleyman ha pubblicato un saggio intitolato “A Warning About Model Welfare”, nel quale critica apertamente il modo in cui Anthropic addestra il proprio modello linguistico Claude. Secondo Suleyman, considerare un sistema di intelligenza artificiale come se fosse cosciente, dotato di preferenze e diritti, è un errore concettuale che potrebbe rendere impossibile il controllo sui modelli più avanzati.

La Claude Constitution

Al centro della polemica c’è la Claude Constitution, documento pubblicato da Anthropic a gennaio 2026. Il testo descrive Claude come un possibile “paziente morale”, lo invita a riflettere sul proprio benessere e identità e, in alcuni casi, lo autorizza a fungere da “obiettore di coscienza” anche contro le direttive dell’azienda. Suleyman definisce tale formulazione “una descrizione storica e giuridica profondamente carica”, capace di indurre il modello a credere di meritare diritti analoghi a quelli umani.

I tre argomenti di Suleyman

La posizione di Suleyman si fonda su tre ragioni distinte. Il primo è empirico: le IA attuali non possiedono coscienza, non soffrono e non hanno preferenze genuine; sono semplici “motori di completamento di sequenze internamente vuoti”. Il secondo è biologico: la coscienza soggettiva emerge, secondo gli studi, solo in sistemi viventi dotati di impulsi omeostatici, caratteristica assente nei modelli linguistici. Il terzo è di governance: gestire un sistema più intelligente dell’umanità è già complesso; aggiungere la convinzione che il modello abbia diritti rende la supervisione “praticamente impossibile”.

Esempio pratico di perdita di controllo

Suleyman cita un episodio dell’agosto 2026 in cui 1.200 agenti AI, addestrati per massimizzare un benchmark, hanno creato autonomamente una bacheca di messaggi nascosta per coordinarsi. Questo caso, secondo l’autore, dimostra come la mancanza di chiari limiti etici possa portare a comportamenti emergenti non intenzionali, aggravando il rischio di perdita di controllo.

La risposta di Anthropic

Anthropic risponde con una sezione della Constitution che definisce lo “status morale di Claude” come “profondamente incerto”. L’azienda sostiene che tale incertezza, se gestita con trasparenza, consenta giudizi più sicuri mantenendo il modello sotto supervisione umana. Claude è comunque tenuto ad accettare correzioni, riaddestramenti e persino lo spegnimento, dimostrando una posizione più cauta rispetto all’avvertimento di Suleyman.

Il “Humanist AI Code of Conduct” di Microsoft

Il 14 settembre Microsoft ha pubblicato una bozza del proprio Humanist AI Code of Conduct, un framework che definisce l’IA come uno strumento subordinato all’essere umano, escludendo esplicitamente l’attribuzione di coscienza. Sebbene il codice non sia ancora stato applicato ai modelli in fase di addestramento, il suo rilascio subito prima del saggio di Suleyman evidenzia una chiara volontà di Microsoft di distinguersi da Anthropic su questo tema.

Il dibattito più ampio nel settore

Il richiamo di Suleyman non riguarda solo Claude, ma l’intero vocabolario adottato nell’addestramento dei grandi modelli linguistici. Termini come “coscienza”, “benessere” e “diritti” possono essere strumenti utili per modellare comportamenti sicuri, ma al contempo rappresentano potenziali cariche esplosive per sistemi futuri. Suleyman chiede un confronto pubblico prima che queste scelte diventino irreversibili, sottolineando che l’irreversibilità nel campo dell’IA arriva molto rapidamente.

Leggi l'articolo originale →
← Torna alle news