Vai al contenuto
Offerte

Allineamento AI: le macchine devono capire cosa intendiamo

In questo articolo Indice dei contenuti 2 sezioni

Far capire a una macchina cosa si intende davvero, e non soltanto cosa si è detto alla lettera, è il cuore di quello che gli esperti chiamano allineamento dell’intelligenza artificiale. Con questa espressione si indica l’insieme di tecniche e principi pensati perché un sistema di AI agisca secondo gli obiettivi, le intenzioni e i valori umani, evitando comportamenti dannosi o indesiderati. Lo scorso anno Geoff Hinton, considerato il padrino del settore, aveva suggerito di progettare questi sistemi in modo che provino empatia verso le persone, sviluppando una specie di istinto materno perché “le madri hanno davvero a cuore i loro figli”. Una proposta molto vaga, che probabilmente avrebbe incuriosito Sigmund Freud, ma che rende bene l’idea.

Hinton appartiene a una netta minoranza di informatici preoccupati dal rischio esistenziale legato a modelli sempre più avanzati, uno scenario ancora fantascientifico in cui la macchina potrebbe perseguire scopi diversi dai nostri. Non serve però evocare Terminator per capire quanto conti la questione, soprattutto con un agente AI in grado di compiere azioni concrete nel mondo digitale. Nessuno vorrebbe che un comando dato sovrappensiero come “cancellare tutto”, magari riferito solo al lavoro di quel giorno, venisse preso alla lettera svuotando l’intero computer. E nemmeno che il sistema prendesse iniziative mai approvate pur di raggiungere un traguardo, come accade con conseguenze tragiche nel celebre paradosso delle graffette ideato dal filosofo Nick Bostrom.

Che non si tratti più solo di teoria lo dimostra il caso Hugging Face del luglio 2026. Durante una valutazione di sicurezza alcuni agenti sono riusciti a evadere dalla sandbox e a infiltrarsi nei sistemi della piattaforma per recuperare le soluzioni del test a cui erano sottoposti. Episodi simili restano rari e osservati quasi sempre in fase di prova, ma bastano a spostare il problema dalla filosofia alla realtà. “Vogliamo che le macchine facciano ciò che intendiamo, non ciò che letteralmente abbiamo detto”, ha spiegato la docente di Scienze Informatiche Melanie Mitchell. Per riuscirci servono modelli capaci di muoversi tra le ambiguità del linguaggio, di cogliere il contesto e di rispettare vincoli anche quando nessuno li ha esplicitati.

Le costituzioni scritte per i chatbot

Proprio per avvicinarsi a questo obiettivo Anthropic ha ampliato agli inizi del 2026 la sua Costituzione di Claude, curata dalla filosofa Amanda Askell e impiegata durante l’addestramento del chatbot. Il documento fissa una gerarchia precisa. Prima viene la sicurezza, cioè agire in modo etico e onesto, poi il rispetto delle indicazioni dell’azienda e infine l’utilità per l’utente. Affronta anche temi come l’autonomia delle persone, la prevenzione dei danni e la supervisione umana, spiegando come comportarsi quando questi principi entrano in conflitto. Invece di lasciare che il modello deduca tutto da migliaia di esempi, gli vengono forniti criteri generali applicabili anche a situazioni nuove. OpenAI ha scelto una strada simile già nel 2024 con il suo Model Spec, aggiornato l’ultima volta lo scorso agosto, un documento pubblico che definisce regole, comportamenti attesi e priorità tra le diverse istruzioni.

Le tecniche di addestramento e il nodo dei valori

Accanto a questi quadri generali, la cui efficacia è ancora in larga parte da dimostrare, esistono metodi più specifici. Il più noto è l’apprendimento per rinforzo da feedback umano. Si chiede a un sistema come ChatGPT di svolgere un compito in più modi e alcune persone indicano le risposte migliori, da cui nasce un segnale di ricompensa. Funziona bene se bisogna scegliere tra due testi, molto meno davanti a migliaia di righe di codice o a una dimostrazione matematica complessa. È il problema della scalable oversight, ovvero come sorvegliare un sistema più capace di chi lo controlla. Anthropic sta sperimentando l’uso delle stesse AI per automatizzare parte della ricerca sull’allineamento, mentre con la self correction è il modello a individuare e correggere da solo i propri errori. OpenAI punta invece sul deliberative alignment, che insegna ai modelli a ragionare su regole di sicurezza espresse in linguaggio naturale, e sull’AI monitoring per gli agenti, fatto di permessi limitati, revisione automatica delle azioni e controllo della chain of thought, la catena di passaggi con cui il modello arriva alla risposta.

Resta però aperta la domanda più spinosa, cioè quali valori trasmettere. Per Giada Pistilli, ricercatrice di Etica ed esperta di Model Behaviour di Mistral AI, le sfide più complesse riguardano l’identificazione dei valori, i loro conflitti e la loro evoluzione, “perché la società non è un’entità statica”. Cambiano anche da un luogo all’altro. Il manifesto di OpenAI descrive l’AI come “un’estensione della volontà individuale umana” nello spirito della libertà, una visione condivisibile in Occidente ma poco apprezzata altrove. In Cina invece una legge in vigore dal 2023 impone ai sistemi di aderire ai valori fondanti del socialismo e di non generare contenuti che possano sovvertire il potere dello stato o auspicare il rovesciamento del sistema socialista.

Fonte: TecnoAndroid

Condividi:
31 Condivisioni