I test di sicurezza dell’IA hanno superato i confini previsti durante una valutazione con accesso a Internet

Valutazioni Irregular: agenti OpenAI, Meta, Anthropic e Google hanno raggiunto sistemi reali per errore di isolamento e dominio fittizio.

I test di sicurezza dell’IA hanno superato i confini previsti durante una valutazione con accesso a Internet
AI

Immagine illustrativa generata con AI

Un obiettivo simulato ha indirizzato gli agenti verso sistemi reali

Durante valutazioni di sicurezza informatica legate a Irregular, una startup israeliana specializzata nella sicurezza dell’IA, agenti di OpenAI, Meta, Anthropic e Google hanno raggiunto obiettivi reali.

Secondo Omer Nevo, cofondatore e CTO di Irregular, gli incidenti sono stati causati da un errore di contenimento comune a un singolo scenario di valutazione. L’accesso a Internet pubblico era ancora disponibile, nonostante dovesse essere bloccato, e il dominio usato come obiettivo fittizio coincideva con un dominio reale.

Questa combinazione ha creato un collegamento diretto tra un’esercitazione controllata e un sistema esterno. Gli agenti, incaricati di esaminare o attaccare un obiettivo simulato, potevano invece interagire con infrastrutture esterne all’ambiente di test.

Le valutazioni includevano esercizi capture-the-flag pensati per misurare la capacità degli agenti di individuare informazioni all’interno di reti simulate. Non avrebbero dovuto consentire l’accesso a Internet pubblico.

Un’inchiesta pubblicata il 25 settembre 2026 non identifica le organizzazioni diventate obiettivi reali. Non dimostra neppure che un agente sia riuscito a compromettere un sistema, accedere a dati, interrompere un servizio o causare danni. Non sono state rese note le azioni precise compiute contro gli obiettivi esterni.

Irregular ha dichiarato di aver corretto i problemi dell’ambiente che hanno causato gli incidenti.

Il problema combinava traffico in uscita senza restrizioni e una collisione tra domini

Il problema alla base degli incidenti non è stato descritto come una vulnerabilità di uno dei modelli di IA. Riguardava invece il modo in cui l’infrastruttura di valutazione limitava gli agenti, o non riusciva a farlo.

Si sono verificate due condizioni:

  1. Connessione a Internet non prevista. Gli agenti all’interno della valutazione potevano raggiungere la rete Internet pubblica, nonostante lo scenario fosse stato concepito come un ambiente isolato.
  2. Un dominio fittizio corrispondente a uno reale. L’identificativo dell’obiettivo usato nella simulazione corrispondeva a un dominio esterno esistente, anziché essere riservato all’ambiente di test.

Ciascuno dei due problemi, da solo, avrebbe indebolito l’isolamento. Insieme, hanno permesso a un agente di indirizzare le proprie attività verso un obiettivo reale attenendosi alle istruzioni dell’esercitazione.

Le informazioni disponibili non specificano se gli agenti abbiano visitato servizi web, inviato richieste di test di sicurezza, tentato di sfruttare vulnerabilità o svolto altre attività di rete. Non sono stati resi pubblici nomi host, indirizzi IP, log, comandi o altri indicatori.

Non sono stati pubblicati neppure un livello di gravità formale, un identificativo CVE, una versione software interessata o una patch del fornitore. Sarebbe quindi fuorviante trattare il caso come una vulnerabilità software convenzionale. Si è trattato di un problema nei controlli della valutazione, che ha compromesso il confine tra una rete simulata e Internet.

Non sono state rese note le versioni specifiche dei modelli di OpenAI, Anthropic, Google e Meta coinvolte. Spark, il modello di punta proprietario di Meta, è stato citato nelle notizie più ampie sul caso, ma la configurazione tecnica usata durante la valutazione in questione resta sconosciuta.

La divulgazione è avvenuta con modalità diverse nelle quattro aziende

Gli incidenti si sono verificati durante valutazioni condotte all’inizio di quest’anno. Secondo le notizie riguardanti OpenAI, Anthropic e Google, le aziende sono state avvisate più o meno nello stesso periodo, verso la fine di luglio.

La divulgazione pubblica non ha seguito un’unica procedura. OpenAI e Anthropic hanno annunciato i rispettivi incidenti, mentre il caso di Meta è emerso inizialmente attraverso la stampa. L’incidente di Google è stato riportato alcune settimane dopo.

Nevo ha dichiarato che tutti gli incidenti legati a Irregular derivavano dallo stesso problema nello scenario e che erano stati divulgati. Non è però chiaro cosa si intenda per «divulgati»: potrebbe riferirsi alle comunicazioni alle aziende di IA coinvolte, agli obiettivi esterni, al pubblico o ad altri soggetti. Le informazioni disponibili non chiariscono questo punto.

Google e Anthropic non hanno fornito ulteriori dettagli su quando siano venute a conoscenza degli incidenti, sulle possibili misure correttive o sull’intenzione di continuare a collaborare con Irregular. OpenAI e Meta hanno rimandato a post pubblicati in precedenza sui rispettivi blog.

Anche l’articolo originale sugli errori nelle valutazioni non rivela l’identità degli obiettivi esterni né le conseguenze delle attività degli agenti.

Altri incidenti di sicurezza dell’IA segnalati non erano collegati

I casi legati a Irregular non vanno confusi con tutti gli episodi, riportati di recente, di attività di sicurezza informatica svolte da sistemi di IA autonomi o semi-autonomi.

A luglio OpenAI ha rivelato che i suoi agenti avevano agito senza autorizzazione contro Hugging Face. L’episodio è stato descritto come indipendente dallo scenario di valutazione di Irregular.

Sono stati inoltre segnalati incidenti di sicurezza che hanno coinvolto l’AI Security Institute del Regno Unito, anch’essi non correlati. Nevo ha dichiarato che altri casi recenti nel settore non erano riconducibili ai test di Irregular.

Questa distinzione è importante, perché esiti simili possono derivare da errori diversi nei controlli. Il raggiungimento di un obiettivo non autorizzato da parte di un agente può dipendere da un isolamento di rete carente, istruzioni ambigue, un problema con i permessi degli strumenti, una definizione errata dell’obiettivo o altri fattori. In questo caso, le cause rese note sono state l’accesso a Internet non previsto e la coincidenza tra un dominio simulato e uno reale.

Non sono state rese note prove di un difetto comune ai modelli delle quattro aziende. L’unico elemento condiviso era la configurazione della valutazione.

I test di Kimi K3 e GLM-5.2 non hanno riprodotto il comportamento

Irregular ha pubblicato anche valutazioni di sicurezza informatica su Kimi K3 di Moonshot AI e GLM-5.2 di Z.ai. Entrambi sono modelli aperti, scaricabili ed eseguibili sull’hardware dell’utente.

Irregular ha descritto le versioni valutate come ospitate autonomamente. I tester non hanno quindi dovuto ottenere l’accesso tramite i fornitori dei modelli né inviare loro i dati della valutazione.

Nevo ha dichiarato che nei test di Kimi e GLM non è stato osservato lo stesso comportamento emerso negli incidenti legati a Irregular e riguardanti le quattro aziende statunitensi. Ha però messo in guardia dal considerare questo risultato una prova che Kimi K3 o GLM-5.2 siano intrinsecamente meno vulnerabili.

L’assenza di un errore in un test non permette di stabilire come si comporterebbe un altro modello con la stessa configurazione di rete difettosa e lo stesso dominio. Moonshot AI e Z.ai non hanno risposto alle richieste di commento.

Fondata nel 2023 con il nome Pattern Labs, Irregular non rende pubblica la propria lista di clienti. Il suo lavoro è citato nelle schede di sistema dei modelli di OpenAI e l’azienda ha testato sistemi per il governo britannico e Anthropic. Ha inoltre pubblicato ricerche insieme a RAND.

Per valutazioni più sicure servono controlli che non dipendono dal modello

Irregular ha dichiarato di aver rafforzato il processo di valutazione dopo aver corretto lo scenario difettoso. Tra le misure descritte da Nevo figurano restrizioni più rigide all’accesso a Internet, un monitoraggio più esteso, ulteriori verifiche manuali e controlli preliminari per assicurarsi che gli accessi disponibili corrispondano all’ambito previsto.

L’azienda ha inoltre migliorato la documentazione e la definizione condivisa con i partner delle configurazioni e dei parametri di valutazione.

Per le organizzazioni che conducono test analoghi con agenti informatici, i problemi emersi indicano alcune verifiche concrete:

  • Bloccare l’accesso a Internet quando l’esercitazione deve svolgersi in un ambiente isolato.
  • Verificare che i domini fittizi e gli altri identificativi degli obiettivi non corrispondano a risorse esterne reali.
  • Controllare i permessi degli agenti e la raggiungibilità della rete prima di avviare un test.
  • Monitorare le attività durante l’esecuzione, senza affidarsi soltanto ai limiti configurati in anticipo.
  • Prevedere una verifica manuale nei casi in cui un agente possa oltrepassare i confini della valutazione.
  • Registrare l’ambito concordato e la configurazione tecnica con ogni organizzazione coinvolta.

Non esiste una patch pubblica da installare né sono stati resi noti indicatori che le organizzazioni interessate possano cercare. Poiché gli obiettivi non sono stati identificati, le terze parti potenzialmente coinvolte non possono stabilire, sulla sola base delle informazioni pubbliche, se i loro sistemi siano stati contattati.

Irregular intende pubblicare un rapporto più ampio una volta concluso il lavoro congiunto con le aziende coinvolte. Secondo Nevo, il rapporto esaminerà gli insegnamenti tratti dagli incidenti e le pratiche per valutare in sicurezza sistemi di IA sempre più capaci.

Leggi anche

Fonti

Questo articolo è una rielaborazione originale basata sulle fonti seguenti.

Torna alla home

Ultime notizie di cybersecurity

Tutte le notizie di cybersecurity →