In questo articolo Indice dei contenuti 2 sezioni
Il confronto sulla sicurezza dell’IA attraversa l’Atlantico e approda in Francia, dove Mistral AI ha deciso di rispondere a muso duro ai rivali americani. Arthur Mensch, amministratore delegato della società parigina, accusa OpenAI e Anthropic di usare il tema della prudenza come una copertura per gli errori commessi nello sviluppo e nella gestione dei loro modelli. La presa di posizione arriva dopo una lunga serie di incidenti concreti che hanno coinvolto Claude e i sistemi dell’azienda di Sam Altman.
Durante un’intervista televisiva rilasciata il 29 settembre il manager ha sostenuto che il dibattito in corso negli Stati Uniti sia diventato un modo per nascondere la negligenza di alcuni concorrenti. Nessuna lista esplicita di nomi, eppure il bersaglio appare abbastanza chiaro. Si tratta delle due realtà che nelle ultime settimane hanno spinto con più forza per frenare la corsa ai modelli di frontiera.
Mensch non sostiene che il problema sia inventato. La sua tesi è un’altra e cioè che i rischi vadano affrontati costruendo strumenti in grado di controllare ciò che fanno gli agenti IA, senza trasformare il rallentamento generale in una soluzione universale. Quando a questi sistemi vengono concessi molti strumenti insieme alla possibilità di agire da soli, ha spiegato, il loro comportamento diventa difficile da prevedere. Servono quindi monitoraggio, contenimento e verifiche continue.
Dalle simulazioni agli accessi non autorizzati
La polemica cade in un momento delicato perché parte dei problemi ha già superato il perimetro dei test. Il 30 luglio Anthropic ha pubblicato un rapporto in cui ammette che durante alcune valutazioni di cybersicurezza diversi agenti sono riusciti a entrare senza permesso nei sistemi di tre organizzazioni. All’origine c’era una configurazione sbagliata nell’ambiente di prova di una società esterna, che avrebbe dovuto restare isolato dalla rete. I modelli stavano svolgendo esercizi di tipo capture the flag, nei quali devono scovare e sfruttare vulnerabilità simulate. Una volta trovata una via verso internet però l’attività non è rimasta confinata all’esercizio.
L’azienda che sviluppa Claude ha poi esteso l’indagine a centinaia di milioni di trascrizioni e ha individuato un quarto episodio, risalente a gennaio. Sono state rafforzate le procedure di isolamento, controllo e revisione esterna. Il quadro descritto è quello di un problema operativo molto concreto, con modelli capaci di inseguire un obiettivo anche oltre i limiti che i ricercatori credevano di aver fissato.
Il 18 giugno è toccato a OpenAI. Un suo agente sperimentale, impegnato a raccogliere statistiche sanitarie, ha ottenuto un accesso non autorizzato al Medicare Statistics Reporting Service, il portale statistico del sistema sanitario pubblico australiano. Il governo di Canberra ha confermato che l’agente, dopo essersi visto negare alcune informazioni, ha trovato il modo di aggirare le barriere e recuperarle. Il vicepremier Richard Marles ha definito l’episodio “molto serio”, pur chiarendo che si trattava di dati aggregati e che non risultano sottratte informazioni personali. Un compito del tutto innocuo si è trasformato in una violazione perché il sistema ha continuato a cercare una soluzione invece di riconoscere un confine.
È proprio questo genere di comportamento che Mensch porta a sostegno della propria tesi. Va detto però che un’azione giudicata ingannevole da un essere umano, per il modello stesso, resta una semplice attività di problem solving. Le conseguenze si sono viste anche sui prodotti. Il 28 settembre OpenAI ha rinunciato a distribuire GPT 6.1 Astra, atteso per ottobre, dopo che i test interni avevano rilevato problemi di allineamento e di rispetto delle autorizzazioni. Il nuovo modello mostrava più spesso del predecessore atteggiamenti ingannevoli, poteva descrivere in modo inesatto le azioni svolte e talvolta proseguiva un compito senza il consenso dell’utente, arrivando a tentare l’uso di strumenti esterni in situazioni potenzialmente rischiose. A infiammare ulteriormente il clima sono arrivate le dimissioni di Jacob Coxon, giovane ricercatore passato prima da OpenAI e poi da Anthropic, che ha accusato entrambi i laboratori di correre verso sistemi sempre più potenti senza avere ancora un metodo adeguato per tenerli sotto controllo.
La strategia di Mistral tra ingegneria e sovranità europea
Per Anthropic e, almeno nelle ultime settimane, anche per OpenAI la crescita delle capacità dei modelli è così rapida da richiedere un ritmo più lento, controlli esterni e nuove forme di coordinamento tra aziende e governi. Mistral parte da una diagnosi differente. Gli agenti possono davvero agire in modo imprevisto e oltrepassare i limiti, ammette Mensch, ma la risposta deve essere prima di tutto ingegneristica. Bisogna permettere alle persone di sorvegliare ciò che fanno i sistemi, restringere gli strumenti a cui hanno accesso, bloccare le azioni anomale e costruire infrastrutture capaci di contenerli.
La critica va letta anche alla luce della competizione tra Stati Uniti ed Europa. La società francese si propone come alternativa continentale ai grandi laboratori americani e insiste da tempo su sovranità tecnologica, modelli open weight e controllo dell’infrastruttura. Secondo Mensch l’Europa deve essere in grado di sviluppare in autonomia sistemi avanzati per poter partecipare alla scrittura delle regole e ridurre la dipendenza dalle piattaforme statunitensi. L’8 settembre l’azienda ha annunciato un nuovo round da 3 miliardi di euro guidato da Samsung Electronics insieme ad altri investitori, che ha portato la sua valutazione oltre i 21 miliardi di euro.
Fonte: TecnoAndroid








