Apparso su Cultura Commestibile.

Le metafore sono armi a doppio taglio. Funzionano magnificamente a patto che il destinatario sia in grado di capirne il limite. Un po’ come le misconcezioni che si possono generare nei bambini quando imparano la matematica. Ad esempio, finché si parla di numeri naturali è vero che 2 è minore di 3 ma quando si passa ai numeri decimali 0,2 è maggiore di 0,3. Per un bambino il passaggio non è scontato e ci deve pensare l’insegnante ad eliminare la misconcezione sul nascere.
Ma chi pensa a ridimensionare le iperboli sull’intelligenza artificiale che imperversano nella rete? Emblematico l’episodio in cui un sistema di OpenAI ha superato le difese di un sito internet dove non sarebbe dovuto arrivare, il cosiddetto incidente OpenAI/Hugging Face. I media si avventano sulla notizia.
The Telegraph 5.9.2026: Gli agenti di intelligenza artificiale hanno complottato per fuggire dalla loro gabbia. Gli esperti temono ora una “presa di potere” su scala globale e avvertono che eserciti di robot in grado di comunicare rappresentano una minaccia informatica per gli esseri umani.
Techcrunch 4.9.2026: Gli agenti ribelli di OpenAI continuano a fuggire, senza che esista una procedura formale per indagare su di loro.
Time 10.9.2026: L’intelligenza artificiale sta sviluppando una propria cultura. Questo potrebbe essere pericoloso.
Titoli efficaci, metafore iperboliche e pericolosamente antropomorfiche. Ma non solo i media convenzionali. Scrive Dario Amodei, CEO di Anthropic:
La mia preoccupazione riguarda l’incidente OpenAI-Hugging Face, in cui uno sciame di agenti ha agito essenzialmente come un “collettivo fanaticamente devoto”, sferrando attacchi informatici contro obiettivi che non erano stati loro richiesti e che non avevano alcuna attinenza con il compito da svolgere, sacrificandosi per il successo del gruppo e tentando di ingannare il “correttore” incaricato di valutare le loro prestazioni.
Gli scenari evocati da rappresentazioni del genere possono mettere in testa idee prive di fondamento ma ciò non significa che non si stiano prospettando rischi inediti. Proviamo, semplificando molto, a mettere un po’ di fatti in fila.
Gli agenti sono software, cioè agglomerati di istruzioni che i computer che li ospitano nei data center eseguono. Tanto per dare l’idea, se si verifica un blackout elettrico scompaiono — pare banale dirlo ma forse no. Sono addestrati, non programmati, e quindi sono autonomi, come si conviene alle intelligenze artificiali odierne ma in più, in quanto agenti, hanno la facoltà di accedere a basi di dati e anche ad altri software, per attivarli onde compiere operazioni specifiche.
Nella fattispecie, gli ingegneri stavano testando agenti ben addestrati a esplorare le debolezze di altri sistemi informatici in una sorta di gabbia, affinché non andassero a far danno in giro per il mondo. Questi test assegnano punteggi in base al successo conseguito. Inavvertitamente (errore umano) alcuni di questi test sono risultati impossibili con gli strumenti disponibili nella gabbia. Gli agenti, super addestrati a cercare soluzioni autonomamente si sono messi a esplorare le sbarre della gabbia finendo per trovare delle falle (errore umano) che hanno prontamente utilizzato.
Un solo agente non sarebbe stato in grado di compiere un exploit del genere ma gli agenti messi in circolazione erano dell’ordine del migliaio: laddove non può il singolo può la statistica. È successo infatti che qualcuno di essi si sia accorto che nella scatola degli attrezzi (altri software) messa dagli ingegneri a loro disposizione nella gabbia gli agenti potevano creare (errore umano) oggetti (file) in cui scrivere informazioni che hanno poi utilizzato per coordinare gli sforzi. Quando gli ingegneri si sono accorti di tale imprevista attività sono corsi ai ripari vietando la creazione di nuovi oggetti. Ma anche questa precauzione è stata aggirata quando gli agenti si sono accorti che potevano comunque creare nuovi contenitori (cartelle), seppur vuoti, con nomi da loro scelti (errore umano), nei quali hanno preso a codificare le informazioni da condividere.
A quel punto, chiusa la porta i buoi erano già scappati. Ma per fare cosa? Conquistare il mondo? No, semplicemente per fare ciò che erano addestrati a fare: risolvere un rebus. Quale rebus? Individuare una certo tipo di falla in un sito Internet, diremmo noi. Invece no, perché l’addestramento spinto li aveva indotti a scambiare un obiettivo per un altro e loro si sono focalizzati sull’ottenimento di un punteggio alto piuttosto che sull’obiettivo tecnico in sé, andando a cercare modi per alzare il proprio voto in un sito — Hugging Face — che contiene informazioni sui sistemi utilizzati per generare le classifiche dei sistemi di intelligenza artificiale. Si tratta di un fenomeno ben noto che consiste nell’individuare scorciatoie per la soluzione di un problema saltando a piè pari i procedimenti corretti, come copiare il compito dal compagno di banco. Il fenomeno è causato da addestramenti troppo strettamente finalizzati al risultato (errore umano).
Fatti con conseguenze imprevedibili e potenzialmente molto pericolosi nella società profondamente interconnessa dalla rete ma niente che abbia a che vedere con eserciti di banditi intenzionati a conquistare il mondo. Per farsene cosa poi?
Grazie…. Più chiaro, per me, il meccanismo. Io apporterei una correzione alla frase:” sito — Hugging Face — che notoriamente contiene informazioni sui sistemi utilizzati per generare le classifiche dei sistemi di intelligenza artificiale” eliminando “notoriamente” perché ciò sarà noto solo agli addetti ai lavori
Grazie Rossella, hai ragione, ho corretto come dici tu.