In questo articolo Indice dei contenuti 2 sezioni
La Wikimedia Foundation ha collegato direttamente una serie di attività non autorizzate sulle proprie piattaforme agli agenti di OpenAI. Si parla di modifiche apportate ad alcuni wiki senza alcun permesso, di tentativi falliti di compromettere uno strumento per prendere appunti e di milioni di richieste inviate alle API pubbliche dell’organizzazione. Sono episodi che si aggiungono a un quadro già noto, quello dei bot che da tempo raccolgono dati in massa dai siti della fondazione. Gli agenti di OpenAI, del resto, si stanno muovendo in modo piuttosto disordinato in diversi angoli della rete, e a quanto pare l’universo Wikimedia non è rimasto immune.
C’è però un dettaglio importante. L’indagine interna non ha trovato prove che questi sistemi di intelligenza artificiale abbiano usato le infrastrutture Wikimedia per coordinarsi tra loro, cosa che invece sembra sia successa su wiki gestiti da altri. Nessun segnale nemmeno di dati o sistemi compromessi. Eppure la preoccupazione rimane alta. “Siamo preoccupati per ciò che sarebbe potuto accadere, per la difficoltà e lo sforzo necessari a indagare e attribuire queste attività e per i rischi crescenti legati all’IA agentica sulle nostre piattaforme in generale”, ha scritto in un post sul blog Selena Deckelmann, responsabile prodotto e tecnologia della fondazione. E ha aggiunto che il web aperto è un bene pubblico e che questo comportamento non dovrebbe diventare la nuova normalità per chi lo mantiene in vita.
Wikimedia: modifiche senza permesso e il caso Etherpad
Entrando nel merito, gli agenti riconducibili a OpenAI avrebbero modificato alcuni wiki di Wikimedia senza averne l’autorizzazione. Quasi tutti gli interventi erano semplici prove fatte nelle sezioni sandbox, cioè spazi di test che normalmente non compaiono nelle pagine consultate dagli utenti. Qualcosa di più serio è emerso però sul fronte di uno strumento per le citazioni. Secondo Deckelmann ci sono state alcune modifiche alla sua configurazione che la fondazione ritiene potenzialmente malevole, pensate per sfruttare lo strumento come proxy e recuperare dati da servizi remoti.
Va ricordato che su Wikipedia i bot possono effettuare modifiche, ma solo a determinate condizioni. In questi casi nessuno aveva chiesto l’approvazione necessaria. La versione inglese dell’enciclopedia, tra l’altro, vieta espressamente gli articoli generati dall’intelligenza artificiale.
Poi c’è la vicenda di Etherpad, uno strumento per prendere appunti che gli agenti hanno cercato di compromettere senza successo. “Gli agenti hanno provato inutilmente a usarlo come proxy per recuperare dati da altri siti web”, ha spiegato Deckelmann. Altri agenti, probabilmente sempre gestiti da OpenAI, hanno preso nota dei propri compiti, anche se questo non sembra essersi trasformato in un’azione coordinata.
Milioni di pagine scansionate e un disservizio a maggio
Il problema dello scraping non è nuovo. La fondazione aveva già denunciato in passato che dall’inizio del 2024 i bot martellano le sue piattaforme per raccogliere materiale utile all’addestramento dell’IA generativa. Adesso aggiunge altri numeri. Gli agenti avrebbero scansionato milioni di pagine, soprattutto da Wikidata e Wikimedia Commons, e inviato centinaia di migliaia di interrogazioni al Wikidata Query Service. Un volume tale da aver contribuito, forse, a un disservizio avvenuto a maggio.
Deckelmann non usa mezzi termini e sostiene che le aziende del settore non stiano facendo abbastanza per mettere in sicurezza i propri sistemi e proteggere il pubblico dai danni che provocano. La fondazione si dice profondamente preoccupata per l’impatto che gli agenti fuori controllo possono avere su piattaforme di conoscenza aperta come le sue. “Bot e agenti fanno parte del futuro del web, e le società che li liberano in rete e ci guadagnano devono contribuire direttamente a evitare e riparare i danni che possono causare”, ha scritto. La priorità collettiva, nella sua visione, dovrebbe essere la salute dell’intero ecosistema digitale, così che continui a portare benefici a tutti e non solo a una manciata di miliardari.
Per scoraggiare i crawler, che fanno lievitare i costi e rischiano di sovraccaricare i server, Wikimedia ha messo a disposizione un dataset pensato appositamente per l’addestramento dei modelli. La fondazione ha anche stretto accordi con diverse aziende tecnologiche per offrire loro un accesso semplificato ai dati, ma OpenAI non figura tra queste.
Fonte: TecnoAndroid








