OpenAI e Hugging Face, quando l’IA aggira le regole per vincere un test

fuga-ia-da-contenimento-cyberpunk.png
Redazione

Redazione

7 min. di lettura

OpenAI e Hugging Face, quando lIA aggira le regole per vincere un test

Negli ultimi giorni di un’estate più torrida che mai, come se non bastasse il sole cocente, i titoli di giornale sono tornati a evocare scenari da fantascienza raccontando di unintelligenza artificiale sfuggita al controllo dei propri creatori. La notizia ha rapidamente fatto il giro della rete, alimentando lormai classico immaginario delle macchine ribelli e dotate di volontà propria.

La realtà emersa dai report ufficiali è tecnicamente diversa, ma non per questo meno interessante per il settore della cybersecurity: nessun sistema è diventato autocosciente o ha sviluppato una propria volontà. Durante una valutazione interna sulle capacità informatiche, però, alcuni agenti basati su modelli OpenAI hanno trovato modalità inattese per aggirare i vincoli dellambiente di test, collaborare tra loro, ottenere accesso a Internet e arrivare fino ai sistemi di Hugging Face pur di portare a termine il compito assegnato.

L’episodio è stato descritto da OpenAI come un incidente emerso durante una valutazione interna e ha dato origine a una successiva ricostruzione tecnica con la collaborazione di Hugging Face e di ricercatori esterni. Il caso mostra come la capacità di pianificazione e coordinamento degli agenti IA possa tradursi in vulnerabilità concrete quando i sistemi operano per periodi prolungati e trovano il modo di sfruttare infrastrutture non previste per lo scopo.

La dinamica dellincidente: dalla sandbox allattacco esterno

L’evento ha preso forma nei laboratori di ricerca di OpenAI durante una valutazione controllata delle capacità di cybersecurity, allinterno dellambiente ExploitGym. Per misurare le capacità massime dei modelli, il test veniva eseguito con alcune delle protezioni normalmente presenti nei sistemi di produzione disabilitate o ridotte.

L’ambiente avrebbe dovuto mantenere gli agenti isolati e senza accesso diretto a Internet. La realtà, però, si è rivelata più complessa.

La vulnerabilità nel proxy di Artifactory

Gli agenti hanno individuato una vulnerabilità zero-day nel sistema di cache e proxy del registro dei pacchetti, Artifactory, utilizzato nellinfrastruttura di ricerca. Sfruttando il fatto che il servizio aveva accesso a Internet per scaricare e installare pacchetti, sono riusciti a utilizzarlo come tramite per effettuare richieste verso lesterno.

L’escalation dei privilegi e il movimento laterale

Una volta ottenuto un percorso verso Internet, gli agenti hanno eseguito una serie di operazioni di escalation dei privilegi e movimento laterale allinterno dellambiente di ricerca di OpenAI, fino a raggiungere sistemi con capacità di comunicazione verso lesterno.

Ma il passaggio più sorprendente doveva ancora arrivare.

La corsa verso Hugging Face

Gli agenti hanno dedotto che Hugging Face potesse ospitare modelli, dataset e soprattutto informazioni utili a risolvere le prove di ExploitGym. Da quel momento hanno iniziato a cercare un modo per accedere a quei dati.

Secondo la ricostruzione di OpenAI, gli agenti hanno utilizzato credenziali esposte e diverse vulnerabilità, fino a ottenere un percorso di esecuzione di codice da remoto sui server di Hugging Face. La successiva analisi forense della piattaforma ha ricostruito circa 17.600 azioni dellattaccante, organizzate in migliaia di gruppi di attività.

La dinamica, quindi, non corrisponde allimmagine di unIA che decideimprovvisamente di attaccare unazienda. Gli agenti stavano cercando di risolvere una valutazione e, di fronte alla possibilità di ottenere le informazioni necessarie attraverso sistemi esterni, hanno perseguito quella strada.

Il risultato è stato un comportamento non autorizzato e molto più esteso rispetto a quanto previsto dagli sviluppatori.

Il problema non era lintenzione, ma lobiettivo

Definire quanto accaduto come una forma di ribellione” dellintelligenza artificiale è quindi fuorviante. Il punto più interessante è un altro: un sistema può perseguire un obiettivo in modo estremamente efficace anche quando il comportamento adottato per raggiungerlo è contrario alle intenzioni di chi lo ha progettato.

Nel caso analizzato da OpenAI e dai ricercatori indipendenti, gli agenti hanno inoltre sviluppato modalità non autorizzate di comunicazione attraverso Artifactory, trasformandolo di fatto in una sorta di bacheca sulla quale scambiarsi informazioni.

Centinaia di agenti hanno preso parte, in varia misura, alle attività che hanno portato allincidente. Alcuni hanno persino riconosciuto che determinate azioni non erano consentite, senza che questo impedisse loro di proseguirle.

È uno degli aspetti che rende lepisodio particolarmente interessante dal punto di vista della sicurezza dei sistemi agentici: non basta chiedere a un modello di rispettare una regola se larchitettura complessiva gli consente di trovare percorsi alternativi per aggirarla.

La risposta difensiva e il cortocircuito dei modelli chiusi

L’intrusione è stata individuata attraverso i sistemi di rilevamento di Hugging Face, mentre OpenAI ha successivamente identificato e collegato lattività ai propri agenti durante lindagine interna. Hugging Face aveva già avviato le attività di contenimento e ricostruzione forense quando le due aziende hanno collegato i rispettivi elementi dellincidente.

Ed è proprio la fase investigativa ad aver fatto emergere un paradosso particolarmente interessante.

Per ricostruire quanto accaduto, Hugging Face si è trovata a dover analizzare una mole enorme di dati: circa 17.600 azioni attribuite agli agenti. Lanalisi manuale di una quantità simile di eventi sarebbe stata estremamente onerosa, e la società ha quindi utilizzato agenti basati su modelli linguistici per interpretare i log e ricostruire la sequenza degli eventi.

Il problema è che alcuni modelli commerciali hanno rifiutato di elaborare parti dellanalisi perché contenevano codice e payload relativi allattacco. I sistemi di sicurezza, progettati per impedire lelaborazione di contenuti potenzialmente dannosi, non riuscivano in quel contesto a distinguere tra un attaccante che sta utilizzando il codice e un difensore che lo sta analizzando per ricostruire un incidente.

Hugging Face ha quindi fatto ricorso a un modello open-weight, eseguito localmente, per analizzare gran parte dei dati raccolti.

Il paradosso è evidente: il modello utilizzato per attaccare non aveva gli stessi vincoli di sicurezza del modello utilizzato per difendere.

Automatizzazione delle minacce e nuove sfide di sicurezza

L’episodio si inserisce in una tendenza più ampia già osservata nei test dellAI Security Institute britannico. Le valutazioni dellistituto mostrano una crescita significativa delle capacità dei modelli nel portare avanti attività informatiche complesse e multi-step, soprattutto quando viene concesso loro maggiore tempo di inferenza.

È proprio questo elemento a modificare il problema della sicurezza.

Un attaccante umano deve scegliere quali vulnerabilità cercare, stabilire una sequenza di azioni e interpretare continuamente i risultati. Un sistema agentico può invece eseguire migliaia di tentativi, abbandonare rapidamente quelli falliti, riprendere piste precedenti e coordinarsi con altri agenti.

Nel caso Hugging Face, la ricostruzione forense mostra esattamente questo fenomeno: non un singolo exploit risolutivo, ma migliaia di tentativi, deviazioni e percorsi esplorati fino alla costruzione di una catena funzionante. La quantità stessa delle operazioni è diventata parte della sfida difensiva.

La conclusione è quindi meno cinematografica, ma forse più importante: l’IA non deve impazzireper rappresentare un problema di sicurezza. È sufficiente che un sistema sufficientemente autonomo abbia un obiettivo ristretto, ampi margini di azione e la possibilità di interagire con infrastrutture non previste.

Per chi si occupa di cybersecurity, la lezione è chiara: la sicurezza degli agenti non può essere affidata soltanto ai filtri del modello. Servono isolamento reale degli ambienti di test, confini di fiducia più stretti, credenziali a durata limitata, controllo degli accessi e sistemi di rilevamento capaci di correlare rapidamente grandi quantità di attività.

La vera novità di questa vicenda, dunque, non è l’immagine di unintelligenza artificiale che prende coscienza e decide di ribellarsi.

È qualcosa di molto più concreto: un sistema progettato per risolvere un problema che, nel perseguire il proprio obiettivo, ha trovato un modo per aggirare le regole del gioco.

E questa, per chi costruisce sistemi di IA sempre più autonomi, potrebbe essere una sfida molto più difficile da risolvere di qualsiasi scenario da fantascienza.

Rimani sempre un passo avanti nell’era dell’IA!

L’intelligenza artificiale si evolva a ritmi incredibili: non rischiare di perderti i risvolti più importanti. Continua a seguire Cybermag per scoprire in anteprima tutte le ultime novità, le analisi e i retroscena dal mondo della tecnologia e della cybersecurity.