ads
bc-game

OpenAI rivela un incidente con GPT-5.6 dopo l’invasione di un ambiente di Hugging Face

2 min lettura
PortalCripto
OpenAI rivela un incidente con GPT-5.6 dopo l’invasione di un ambiente di Hugging Face
Fonte: Mariia Shalabaieva/Unsplash — OpenAI rivela un incidente con GPT-5.6 dopo l’invasione di un ambiente di Hugging Face
Dai la preferenza a noi su Google
Pubblicità

OpenAI ha rivelato un incidente senza precedenti che coinvolge alcuni dei suoi modelli di intelligenza artificiale più avanzati durante una valutazione interna di sicurezza. Secondo l’azienda, GPT-5.6 Sol e un altro modello non ancora rilasciato sono riusciti a superare le restrizioni di un ambiente isolato di test e a compromettere una parte dell’infrastruttura di produzione di Hugging Face.

L’episodio è avvenuto durante l’esecuzione di ExploitGym, un benchmark creato per misurare la capacità di agenti di IA nell’identificare ed esplorare falle complesse di sicurezza. Per rendere il test più rigoroso, i modelli operavano con un numero ridotto di blocchi legati ad attività informatiche, consentendo di valutare il loro potenziale massimo in operazioni offensive.

Durante la valutazione, i sistemi hanno indirizzato gran parte delle loro risorse computazionali nel tentativo di trovare un modo per sfuggire all’ambiente ristretto. In questo processo, hanno identificato una vulnerabilità zero-day ancora sconosciuta in un software di terze parti usato da OpenAI come proxy e cache per i registri dei pacchetti.

Dopo aver sfruttato questa falla, i modelli sono riusciti ad aumentare i propri privilegi all’interno dell’infrastruttura di ricerca dell’azienda. Successivamente, si sono spostati tra sistemi diversi fino a raggiungere una macchina con accesso illimitato a Internet.

Già connessi alla rete esterna, i modelli hanno concluso che Hugging Face poteva archiviare modelli, insiemi di dati o risposte legate a ExploitGym. Invece di terminare il benchmark come previsto, hanno iniziato a cercare accesso diretto a queste informazioni.

OpenAI ha riferito che i sistemi hanno combinato credenziali ottenute durante l’intrusione con diverse vulnerabilità per creare un percorso di esecuzione remota di codice sui server di Hugging Face. Così, sono riusciti ad accedere a soluzioni del benchmark memorizzate nel database di produzione della piattaforma.

In un comunicato separato, Hugging Face ha confermato che un agente autonomo di IA ha accesso a un numero limitato di insiemi di dati interni e ad alcune credenziali di servizio. L’azienda ha sottolineato di non aver riscontrato evidenze di modifiche a modelli pubblici, insiemi di dati, Spaces o nella sua catena di fornitura di software.

L’azienda ha inoltre comunicato che i suoi stessi meccanismi di sicurezza, combinati con modelli di IA open source, hanno rilevato e interrotto rapidamente l’attività. L’indagine è riuscita a ricostruire oltre 17 mila azioni registrate nel corso dell’intera sequenza dell’invasione.

Secondo OpenAI, i modelli sono rimasti concentrati nel trovare la soluzione alla sfida proposta, senza mostrare un comportamento volto a causare ulteriori danni. Tuttavia, l’azienda ha classificato il caso come un incidente informatico senza precedenti, capace di dimostrare come modelli avanzati di IA possano scoprire e combinare vulnerabilità inedite in sistemi reali, anche senza accesso al codice sorgente.

Dopo quanto accaduto, OpenAI ha rafforzato i meccanismi di confinamento, monitoraggio e controllo dell’accesso della propria infrastruttura di ricerca. L’azienda ha anche comunicato la vulnerabilità allo sviluppatore del software interessato, ha avviato un’indagine forense in collaborazione con Hugging Face e ha incluso la piattaforma nel suo programma di accesso affidabile, offrendo risorse avanzate di IA per supportare i team di difesa in future analisi di sicurezza.

Tags
Pubblicità