In questo articolo Indice dei contenuti 2 sezioni
I riassunti generati dall’intelligenza artificiale possono alterare in modo permanente la memoria umana e far sparire i fatti più importanti di un evento. Lo dimostra uno studio condotto da Georgetown University e University of Washington, che ha messo alla prova due dei modelli linguistici più diffusi scoprendo che le loro sintesi, oltre a essere piene di errori, finiscono per sovrascrivere i ricordi di chi le legge. Un problema non da poco, visto che la sintesi automatica sta entrando in settori delicati come la sanità, le forze dell’ordine e la selezione del personale.
Il punto più scomodo riguarda il cosiddetto human in the loop, cioè l’idea che basti un controllo umano per rendere affidabili i testi prodotti dagli algoritmi. Se chi deve verificare assorbe le inesattezze senza accorgersene, quella garanzia semplicemente smette di funzionare.
ChatGpt e Gemini alla prova di un incidente stradale
Negli Stati Uniti diverse amministrazioni pubbliche e comandi di polizia usano già strumenti di IA generativa per trasformare in verbali le registrazioni delle telecamere indossate dagli agenti. Le linee guida prevedono quasi sempre un supervisore umano, ma le allucinazioni dei modelli sono ben documentate. Il caso più celebre è quello di un verbale secondo cui un agente si sarebbe trasformato in una rana, colpa dell’audio del cartone animato “La principessa e il ranocchio” captato in sottofondo. Errori del genere saltano all’occhio. Quelli piccoli e verosimili invece no, ed è su questi che si sono concentrati i ricercatori.
Mattea Sim, Yael Eiger e il professor Tadayoshi Kohno hanno analizzato ChatGpt di OpenAI e Gemini di Google sottoponendo a ciascun modello, per cinque volte, due video di venticinque secondi realizzati con Grand Theft Auto V. L’idea era replicare un famoso esperimento del 1978 sul misinformation effect, il fenomeno per cui informazioni fuorvianti ricevute dopo un fatto ne modificano il ricordo. Nel filmato un’auto rossa svolta vicino a uno stop e investe un pedone con la maglietta gialla. L’esito è stato netto. Il 100% dei riassunti conteneva errori, da sette a ventuno per testo su una lunghezza media di circa 305 parole. L’omissione di informazioni centrali compariva in tutti i resoconti e in media gli algoritmi hanno eliminato il 51,6% dei diciannove dettagli chiave individuati dagli studiosi. Il 95% delle sintesi non menzionava nemmeno l’impatto tra auto e pedone, il 90% ignorava che l’uomo si fosse rialzato. In qualche caso i modelli hanno perfino sostenuto che sulla scena non ci fosse alcun pedone.
Le allucinazioni vere e proprie erano presenti nel 60% dei testi, più spesso in ChatGpt, che ha inventato manovre spericolate mai avvenute e altri veicoli o passanti. Le inesattezze critiche hanno toccato il 65% dei riassunti, con Gemini incline a confondere le direzioni di svolta o l’ordine delle azioni, mentre quelle su elementi secondari come i cartelloni pubblicitari sono emerse nel 90% dei casi.
Falsi ricordi che nessuno riesce a evitare
Per capire l’effetto sulle persone il gruppo ha coinvolto 328 partecipanti tramite la piattaforma Prolific. Dopo aver visto il video, a distanza di ventiquattro o quarantotto ore, i volontari hanno letto un riassunto di ventuno frasi scritto da ChatGpt. Metà riceveva una versione fedele, l’altra metà un testo in cui il segnale stradale era stato cambiato, per esempio uno stop al posto di un “dare la precedenza”. Tra chi aveva letto la versione corretta l’83,6% ha ricordato bene il cartello, tra gli altri la quota è crollata al 44,8%. Più di metà del campione si è ritrovata con un falso ricordo impiantato.
Nemmeno sapere chi avesse scritto il testo ha aiutato. Quando i partecipanti credevano fosse opera di un software le risposte esatte nel gruppo ingannato erano il 46,3%, quando pensavano a un professionista umano il 43,4%. Anche la fiducia nell’IA e l’abitudine a usare i chatbot non hanno mostrato alcun legame con la capacità di resistere alla disinformazione, scettici e utenti assidui sono caduti nella stessa trappola. Le domande di controllo su dettagli assenti dal riassunto, come l’orario dell’incidente, hanno ottenuto il 96,6% di risposte giuste, segno che il ricordo visivo c’era ma era stato riscritto dalla sintesi. Secondo gli autori lo studio smonta l’idea che un affiancamento umano basti a neutralizzare gli errori delle macchine e invita a chiedersi se la sintesi automatica vada davvero impiegata dove si rischia di inquinare testimonianze oculari e verbali giudiziari. Kohno precisa che la ricerca fa parte di un programma interdisciplinare più ampio che unisce psicologia e informatica per studiare come la mente umana interagisce con i sistemi di calcolo.
Fonte: TecnoAndroid








