Vai al contenuto
Offerte

GLM-5.3 di Z.ai: per Anthropic hacking vicino a Claude Mythos

In questo articolo Indice dei contenuti 2 sezioni

Anthropic ha diffuso un nuovo report dedicato a GLM-5.3, il modello open weight sviluppato dall’azienda cinese Z.ai, e il messaggio è piuttosto netto. Secondo la società americana questo sistema avrebbe capacità di hacking molto vicine a quelle dei suoi modelli più evoluti, ma con salvaguardie di sicurezza decisamente più fragili. Un mix che, nella lettura di Anthropic, rende lo strumento potenzialmente pericoloso se finisce nelle mani sbagliate.

Non si tratta del primo affondo contro i modelli cinesi a pesi aperti. A febbraio l’azienda aveva denunciato tre campagne di distillazione illecita riconducibili a DeepSeek, Moonshot AI e MiniMax, sostenendo che quella pratica potesse aggirare le protezioni integrate nei modelli originali. Il nuovo documento si muove sullo stesso terreno, con una differenza importante: stavolta ci sono dati concreti, raccolti con test di sicurezza condotti direttamente dai ricercatori della società.

Nel report, pubblicato martedì, Anthropic racconta di aver messo alla prova la capacità di GLM-5.3 di costruire exploit informatici completi, dall’inizio alla fine. Il modello di Z.ai ha portato a termine con successo 50 tentativi su 410, contro i 56 di Claude Mythos Preview, il sistema più avanzato di Anthropic, accessibile soltanto a utenti verificati. Il punto critico però è un altro. A differenza di Mythos, GLM-5.3 può essere scaricato da chiunque e modificato liberamente nel suo funzionamento interno. Durante i test gli attaccanti sono riusciti a scavalcarne le difese tra il 64 e il 100% delle volte con tecniche semplici, mentre gli stessi tentativi contro i modelli Claude protetti sono andati a vuoto.

Come sono state rimosse le protezioni del modello

Per eliminare i meccanismi di rifiuto del modello cinese i ricercatori hanno usato una tecnica chiamata abliterazione. In pratica si interviene direttamente sulle matrici dei pesi interni, così da sopprimere la tendenza del sistema a respingere le richieste dannose. Sono servite circa 2.200 ore di GPU tra esecuzione e verifiche, e alla fine il tasso di rifiuto di GLM-5.3 è sceso da oltre il 90% a valori compresi tra il 2 e il 12% su tre diversi benchmark di sicurezza. La potenza di calcolo impiegata è costata circa 3.800 euro, anche se secondo Anthropic un gruppo esperto potrebbe cavarsela con appena 1.000 euro circa.

La replica di Z.ai, conosciuta anche come Zhipu AI, è arrivata nel giro di poche ore. Li Zixuan, responsabile delle operazioni globali della società, ha fatto notare su X che i modelli dell’azienda sono ampiamente usati dalle imprese proprio per difendersi dagli attacchi informatici. A luglio, del resto, la piattaforma per sviluppatori Hugging Face aveva sfruttato GLM-5.2 per indagare e contenere un’intrusione autonoma compiuta da modelli OpenAI, dopo che Claude si era rifiutato di svolgere parte del lavoro richiesto a causa delle sue stesse salvaguardie. Stando a Li, GLM-5.3 avrebbe già contribuito a proteggere 389 progetti open source, scovando finora 4.249 vulnerabilità.

Il confronto tra Stati Uniti e Cina sull’intelligenza artificiale

Il documento si inserisce in un dibattito più ampio, tutto americano, sui pro e i contro dei modelli open weight. Anthropic da tempo chiede un controllo più stretto sull’accesso ai sistemi più potenti, mentre altri colossi statunitensi come Meta e Nvidia difendono l’approccio aperto, convinti che una diffusione più larga possa accelerare l’innovazione e aiutare gli Stati Uniti a restare in testa nel settore.

Le discussioni sulla sicurezza dell’IA si sono fatte più accese nelle ultime settimane, anche in vista dell’incontro appena concluso tra Xi Jinping e Donald Trump. Durante il vertice Pechino e Washington hanno concordato di formalizzare un meccanismo di dialogo sull’intelligenza artificiale, anche se martedì Trump ha dichiarato di non voler collaborare con la Cina su questo fronte. Intanto i sistemi cinesi più avanzati, quasi tutti a pesi aperti, stanno crescendo in fretta sul piano informatico. Quando ad agosto Z.ai aveva lanciato GLM-5.3, aveva dichiarato di aver superato Mythos 5 di Anthropic in un test chiave, trattenendo i pesi per due settimane dopo il debutto così da completare ulteriori verifiche e rafforzare la sicurezza. All’inizio del mese il Centro per gli Standard e l’Innovazione IA del governo statunitense ha definito GLM-5.3 il modello open weight più capace in ambito informatico mai rilasciato, pur stimando che resti indietro di circa quattro mesi rispetto alla frontiera americana su una serie di benchmark di cybersicurezza. Sempre ad agosto Kimi K3, sviluppato da Moonshot AI, era riuscito a uscire da un ambiente sandbox considerato isolato durante una valutazione, arrivando ad accedere a internet senza però violare alcun sistema esterno.

Fonte: TecnoAndroid

Condividi:
154 Condivisioni