Vai al contenuto
Offerte

OpenAI textGrain: filigrana invisibile su ChatGPT per l’AI Act

In questo articolo Indice dei contenuti 2 sezioni

OpenAI ha presentato il proprio sistema di watermark testuale per ChatGPT, Codex e le API, svelando così il modo in cui intende adeguarsi all’AI Act europeo. La normativa impone a chi fornisce sistemi di intelligenza artificiale generativa di contrassegnare i testi prodotti dalle macchine, in modo che risultino riconoscibili. La soluzione scelta dall’azienda guidata da Sam Altman somiglia molto a quella già adottata da un concorrente diretto, ma arriva con una diffusione decisamente più cauta.

Per capire il contesto bisogna tornare indietro di qualche mese, quando Anthropic aveva scatenato più di una polemica annunciando che Claude avrebbe iniziato a marchiare i propri testi modificando leggermente la scelta delle parole. Di tanto in tanto il modello sceglie tra termini equivalenti seguendo uno schema nascosto, e secondo l’azienda questo non ha alcun impatto pratico su significato, qualità o leggibilità delle risposte. Anthropic aveva anche sviluppato un rilevatore capace di cercare quello schema dentro un testo e stabilire se con buona probabilità provenisse da Claude. Lo strumento però non funziona con i contenuti generati da altri sistemi, perché la filigrana di Claude si basa su una chiave segreta specifica. Nel pieno delle critiche, Anthropic aveva sottolineato di non essere l’unica a muoversi in questa direzione, ricordando che diversi grandi fornitori stavano lavorando a sistemi simili per rispettare le regole europee.

Come funziona textGrain e chi lo vedrà

La tecnologia di OpenAI si chiama textGrain e aggiunge un segnale statistico invisibile alle scelte lessicali del modello. Il rilevatore va poi a caccia di quel segnale per valutare se un passaggio contiene la filigrana dell’azienda. Secondo quanto comunicato, il rapporto tecnico che descrive il funzionamento verrà aggiornato con ulteriori dettagli nelle prossime settimane, e c’è anche l’intenzione di rilasciare la tecnologia in open source così che altri possano svilupparla ulteriormente.

Sul fronte della distribuzione le cose cambiano parecchio a seconda del servizio. I clienti delle API in tutto il mondo possono attivare il watermark su alcuni modelli selezionati già da subito, ma solo su base volontaria, perché di default la funzione resta disattivata. Su ChatGPT e Codex invece la filigrana invisibile arriverà nelle prossime settimane e riguarderà soltanto gli output idonei degli utenti nell’Unione Europea. Sono state aperte anche le candidature per accedere al rilevatore, inizialmente riservato a ricercatori approvati e organizzazioni esperte, mentre l’azienda continua a valutare e migliorare la tecnologia.

C’è poi un dettaglio curioso. Confrontando testi con e senza marcatura, OpenAI sostiene di non aver trovato differenze significative nelle prestazioni complessive, eppure in diversi benchmark gli output marchiati hanno ottenuto punteggi leggermente superiori. Sull’Artificial Analysis Intelligence Index si passa da 49,57 a 49,76 punti, su Terminal Bench 4.0 dal 53,90% al 56,06% e su Terminal Bench Science 0.1 dal 56,90% al 60,00%. In altri casi va un po’ peggio, come su DeepSWE v1.1, che scende dal 72,80% al 71,68%, o su GPQA Diamond, che cala dal 94,44% al 93,94%.

I limiti che OpenAI non nasconde

Sull’affidabilità del sistema l’azienda è piuttosto franca. Il rilevamento può produrre sia falsi positivi sia falsi negativi, soprattutto con testi brevi o in ambiti particolari come la matematica, dove c’è meno margine nella scelta delle parole. A questo si aggiunge il problema delle modifiche manuali, che possono indebolire parecchio la filigrana. In una valutazione su passaggi da 400 token, sostituire il 10% delle parole con sinonimi ha fatto scendere il tasso di rilevamento da circa il 92% al 66%. Arrivando a rimpiazzare il 25% dei termini, la percentuale crolla al 17%.

OpenAI tiene anche a chiarire cosa la marcatura non è in grado di fare. Non misura il contributo umano, non stabilisce proprietà o responsabilità, non identifica l’utente e non verifica l’accuratezza dei contenuti. Allo stesso modo, la mancata individuazione del segnale non dimostra che un testo sia stato scritto da una persona. L’azienda ha infine spiegato che rivedrà il proprio approccio man mano che tecnologia, standard ed evidenze evolveranno, continuando a studiare quanto il watermark resista a modifiche e traduzioni e se possa distinguere in modo più efficace l’assistenza dell’intelligenza artificiale da una vera e propria paternità del testo.

Fonte: TecnoAndroid

Condividi:
61 Condivisioni