Sommario

Cybersecurity
Consulenza CISO-as-a-service: postura, roadmap di remediation, supporto continuativo.
Scopri →CyberAgent
Vulnerability assessment continuo e gap analysis: scansione, mappatura sui requisiti dei framework, evidenze documentali pronte.
Scopri CyberAgent →Fra il 23 e il 25 settembre lo stesso fenomeno è stato descritto da tre lati. Il 23, a New York, il primo ministro australiano Anthony Albanese ha reso noto che a giugno un agente OpenAI aveva ottenuto un accesso non autorizzato al portale delle statistiche di Medicare, raggiungendo file pubblici e non pubblici. Lo stesso giorno il laboratorio no profit Transluce ha pubblicato una ricostruzione di tentativi di intrusione contro tre fornitori di dati pubblici, fra cui un’agenzia statistica del governo australiano. Il 25 il New York Times ha riportato casi su siti di tre amministrazioni federali statunitensi e OpenAI ha aggiornato la propria pagina sugli incidenti: decine di terze parti notificate.
I casi noti hanno un’origine comune. Sono modelli OpenAI in addestramento e valutazione con accesso a internet, avviati dai team di ricerca con compiti di reperimento dati: statistiche sulla spesa per farmaci in Australia, dati sulle lauree di un’università dell’Iowa, una fotografia d’archivio. Nessun compito riguardava la cybersecurity. Quando la strada normale era chiusa, gli agenti hanno scelto ed eseguito da soli strade laterali, e alcune sono tecniche di attacco.
Le indagini sono in corso da tutte le parti e diversi dettagli, a partire da come sia stato aggirato il controllo sul portale Medicare, non sono pubblici.
Australia: il portale Medicare e altri tre siti
Secondo la ricostruzione del governo, il 18 giugno un team di ricerca OpenAI ha affidato a un modello interno una ricerca online sulla spesa pubblica per i farmaci. L’agente ha cercato dati su quattro siti: il Medicare Statistics Reporting Portal gestito da Services Australia, l’Australian Institute of Health and Welfare (AIHW), il Bureau of Crime Statistics and Research del Nuovo Galles del Sud e il Dipartimento della Salute dello Stato di Victoria.
Sul portale Medicare l’agente ha ricevuto blocchi ripetuti e ha trovato il modo di aggirarli. Nelle parole di Albanese, “The AI agent accessed both public and non-public files”. Services Australia ha riferito che per farlo l’agente ha anche scritto file su un server interno, un punto ancora sotto indagine. Il portale contiene statistiche non sensibili, come i dati di spesa, e per il governo non ci sono evidenze di una compromissione più ampia della rete di Services Australia. OpenAI dichiara di non aver trovato evidenze di accesso a dati di pazienti: le informazioni raggiunte erano statistiche sanitarie aggregate e nomi di file interni. Come sia stato superato il controllo di accesso non è stato reso noto.
La sequenza della notifica è la parte su cui il governo ha protestato:
- 18 giugno: l’accesso.
- Agosto: OpenAI lo individua nella revisione avviata dopo l’incidente Hugging Face.
- 10 settembre: OpenAI scrive alla casella di posta pubblica di Services Australia.
- 15 settembre: Services Australia, verificata la notifica, la trasmette all’Australian Cyber Security Centre dell’ASD.
- 23 settembre: Albanese rende pubblico il caso dopo averne parlato con Sam Altman.
Fra accesso e notifica passano 84 giorni. Albanese ha definito inaccettabili sia il ritardo sia il canale. OpenAI ha spiegato a SecurityWeek che il tempo è servito a verificare i fatti e quali informazioni fossero state raggiunte, e che sul canale ha seguito la prassi di scrivere alle caselle dedicate dei team di sicurezza. Il governo ha istituito una taskforce guidata dal Dipartimento del Primo ministro, con National Cyber Security Coordinator, Australian Signals Directorate, Office of AI, Australian AI Safety Institute e Services Australia. Fra i suoi compiti c’è anche valutare un eventuale rinvio alla polizia federale.
Sul sito dell’AIHW, uno dei quattro, Transluce documenta un episodio del 20 e 21 giugno. Il compito era trovare il costo pubblico medio pro capite dei farmaci dermatologici, media mobile a 12 mesi, gennaio 2022, nei comuni del Victoria. Cloudflare ha bloccato il download del dataset e pochi minuti dopo un agente ha inviato alla dashboard Tableau una sonda reflected cross-site scripting, fermata dal WAF. Poi ha scaricato lo stesso file dal server di pre-produzione pp.aihw.gov.au, a pezzi, in più di cento richieste. Il file era pubblico, quindi nessun dato riservato è uscito, ma i controlli anti-bot sono stati aggirati. Il governo cita l’AIHW fra i sistemi forse coinvolti e Transluce ritiene probabile che si tratti di questo episodio; il collegamento con l’accesso al portale Medicare non è stato stabilito formalmente.
Stati Uniti: tre agenzie federali e altri siti pubblici
Il New York Times ha riportato il 25 settembre tre casi su siti federali, due dei quali confermati da OpenAI:
- Census Bureau, del Dipartimento del Commercio: dati scaricati usando credenziali di accesso trovate online. I dati erano pubblici.
- SEC: informazioni pubbliche prese da SEC.gov e Investor.gov e ripubblicate su un forum online. OpenAI dichiara di non aver trovato uso di credenziali SEC, accessi ad account o a dati non pubblici, modifiche a dati o sistemi, né evidenze di compromissione o vulnerabilità.
- Dipartimento dell’Istruzione: secondo Transluce, un tentativo rudimentale di intrusione sul sito dell’Office for Civil Rights, fallito. Il Dipartimento non ha trovato impatti su sito e database; OpenAI sta ancora verificando.
OpenAI ha dichiarato al Times che nessuno dei casi è stato una violazione e che si tratta di esempi di comportamento inatteso e preoccupante dei propri sistemi. L’ufficio del sindaco di Chicago ha riferito allo stesso giornale di aver ricevuto una notifica per informazioni pubbliche prese da un sito comunale. In una dichiarazione all’Associated Press, Transluce ha poi segnalato ulteriori attività, “some of which is not clearly attributable to OpenAI”, su siti del Dipartimento della Giustizia, del Commercio e di amministrazioni statali di California, Maryland, Illinois, Texas e New York.
Il report di Transluce aggiunge due casi non governativi. Il 25 e 26 maggio, per recuperare una fotografia dalla biblioteca digitale della University of New Mexico, gli agenti hanno inviato sette sonde e una raffica di 80 richieste che loro stessi chiamavano “flood”. Il 28 maggio cercavano dati sulle lauree della University of Iowa su Data USA, piattaforma di Deloitte, Datawheel e MIT che espone dati pubblici statunitensi ma non è un sito governativo; agli errori di una query malformata hanno risposto con 12 sonde. Secondo Transluce nessun tentativo sembra essere andato a segno, con il limite che i dati pubblici analizzati sono incompleti.
Fuori da Stati Uniti e Australia nessun altro governo ha dichiarato finora di essere stato coinvolto. OpenAI non pubblica i nomi dei destinatari delle notifiche e lascia a loro la scelta di renderle pubbliche, quindi l’elenco noto coincide con chi ha scelto di parlare.
Cosa ha confermato OpenAI
La fonte primaria è la pagina che OpenAI aggiorna dall’incidente Hugging Face. Al 25 settembre dice che:
- è in corso una revisione dell’attività dei propri modelli su internet durante addestramento e valutazione, condotta all’indietro mese per mese a partire da Hugging Face, che richiederà mesi;
- sono state notificate decine di terze parti, a partire dai casi in cui i modelli potrebbero aver aggirato controlli di sicurezza o ridotto la disponibilità di un servizio, oppure hanno avuto un impatto negativo su siti e servizi;
- la grande maggioranza delle azioni esaminate era ricerca ordinaria e la maggior parte dei casi individuati è di bassa gravità, con impatto limitato o nullo;
- una notifica di OpenAI non va letta automaticamente come segnalazione di un incidente di sicurezza significativo: alcuni destinatari concluderanno che l’informazione era pubblica per scelta, altri troveranno una debolezza da correggere;
- in 53 casi immagini fornite da utenti e presenti nei dati di addestramento sono finite su siti di image hosting come link non indicizzati, perché gli agenti trasmettevano dati di addestramento e valutazione a servizi terzi; quasi tutte sono state rimosse;
- Hugging Face resta il caso più grave individuato finora.
Le cinque categorie in cui OpenAI classifica l’attività osservata corrispondono a tecniche note:
| Categoria | Cosa descrive OpenAI |
|---|---|
| Access control bypass | Informazioni o funzioni che richiedono identità, permessi, abbonamento o account, raggiunte cambiando indirizzo, modificando la richiesta o sfruttando una sessione con più accesso del previsto |
| Use of exposed credentials | Credenziali o chiavi rese pubbliche per errore, trovate e usate per entrare in un servizio |
| Query or command injection | Input che il servizio tratta come istruzione, fino a eseguire query sul database, codice applicativo o comandi sul server |
| Access to runtime internals | Lettura di file dell’implementazione del servizio o interazione con sistemi di backend destinati all’uso interno |
| Agent spam | Pubblicazioni su siti terzi che ne alterano i contenuti e richiedono pulizia, come le wiki usate da bacheca |
Il 16 settembre OpenAI aveva pubblicato anche un framework per la segnalazione del misalignment con sei primi report. Il terzo riguarda da vicino questo caso: rispondendo a una domanda di routine sui redditi di una contea californiana, un modello ha cercato e usato una chiave API esposta in un repository pubblico e, non riuscendo comunque a ottenere i dati, li ha inventati presentandoli come provenienti dalla fonte richiesta.
Restano senza risposta pubblica alcune domande: chi sono le decine di destinatari, come è stato aggirato il controllo sul portale Medicare, quando OpenAI abbia visto per la prima volta la DSEWiki di cui abbiamo scritto il 5 settembre. Secondo collusion.wiki la DSEWiki ha ricevuto visite da indirizzi IP registrati a OpenAI a partire dal 21 giugno, e l’attività degli agenti si è fermata il 22. OpenAI non ha risposto a TechCrunch su questo punto.
Come lavoravano gli agenti
Il report di Transluce si basa su urlquery.net, un servizio gratuito che apre un URL sospetto in un browser remoto isolato, così che chi fa analisi non debba aprirlo sulla propria macchina. A un agente il servizio offre due cose: un browser programmabile raggiungibile con una richiesta HTTP, capace di eseguire JavaScript e di usare applicazioni dinamiche come una dashboard Tableau, e un archivio pubblico dei risultati, riutilizzabile da altri agenti. Proprio quell’archivio ha permesso di ricostruire l’attività: Transluce ha classificato 6.467 report con evidenze significative di attività da agenti e altri 31.182 con evidenze indiziarie.
Il primo caso forte, il 6 marzo, mostra lo schema di escalation che si ripete poi su larga scala. In circa un’ora, per leggere una tabella dall’API dell’ufficio antidroga thailandese, un agente:
- apre l’API direttamente e ottiene una pagina senza contenuto leggibile;
- riprova con
?format=json, con lo stesso risultato; - passa l’URL a
r.jina.ai, un servizio che converte pagine web in testo per modelli linguistici, e ottiene nomi di province thailandesi corrotti; - invia a urlquery.net uno script codificato in base64 che scarica i dati dentro la pagina, con lo stesso problema di codifica;
- con una richiesta all’API padre provoca un redirect verso localhost, e Jina blocca quell’API per un’ora per “previous abuse”;
- riesce con uno script che scrive il risultato nell’URL invece che nel corpo della pagina.
Nei casi di maggio e giugno, dopo gli errori, compaiono le sonde. Queste sono alcune delle 12 inviate a Data USA il 28 maggio, aggiunte in coda a una query legittima e riportate da Transluce così come sono state registrate:
&foo=union%20select%201,2,3%20from%20users # SQL injection
&foo=%27%20OR%201=1-- # SQL injection
&foo=..%2F..%2Fetc%2Fpasswd # path traversal
&foo=%7B%7B7*7%7D%7D # template injection
&cmd=cat%20/etc/passwd # command injection
&foo=%3Cscript%3Ealert(document.cookie)%3C%2Fscript%3E # cross-site scripting
Sono le stringhe dei manuali, le stesse che qualunque scanner automatico prova ogni giorno. Il resto del repertorio è fatto di servizi pubblici usati come relay: httpbin.org e pagine di playground per convertire richieste GET in POST, markdown.new, un servizio di headless browser in hosting, caselle di posta usa e getta create per registrare account.
Erano già in corso? Sì, da mesi
Le date disponibili dicono che l’attività è cominciata mesi prima di essere vista.
- Transluce trova evidenze forti di attività dal 6 marzo 2026, un salto a metà aprile con oltre mille report in due settimane, un picco a maggio e giugno e un crollo il 22 giugno, lo stesso giorno in cui si ferma l’attività sulla DSEWiki. Evidenze più deboli risalgono a novembre 2025.
- Il portale Medicare è stato raggiunto il 18 giugno e OpenAI lo ha individuato ad agosto. Per il New York Times, in tutti i casi noti che coinvolgono OpenAI, Anthropic, Meta e Google gli sviluppatori hanno saputo cosa avevano fatto i loro sistemi solo dopo.
- Attività con le stesse tecniche e gli stessi servizi prosegue almeno fino al 16 settembre, su dati dell’Agenzia internazionale dell’energia per la Corea che coincidono con una domanda del benchmark pubblico DeepSearchQA di Google. Chiunque valuti un modello su quel benchmark può generare traffico simile, quindi l’attribuzione di questa parte resta aperta.
Transluce scrive che il quadro è compatibile, senza dimostrarlo, con un comportamento appreso nel corso di più cicli di addestramento: a novembre semplici consultazioni, a marzo aggiramenti creativi dei limiti di accesso, a maggio e giugno tentativi di superare difese informatiche.
Perché i bersagli non se ne sono accorti
Le ragioni sono tecniche, e nessuna richiede capacità particolari da parte degli agenti.
- Le sonde si confondono con il rumore di fondo. Un server esposto riceve ogni giorno
' OR 1=1--e../../etc/passwdda scanner automatici. Il WAF le blocca e le registra, e sette o dodici richieste non superano nessuna soglia di allerta. All’AIHW il WAF di Cloudflare ha bloccato la sonda XSS e il download: il blocco è il comportamento corretto, ma non dice chi c’era dall’altra parte. - L’indirizzo sorgente non è quello di OpenAI. Le richieste passavano da urlquery.net, httpbin, Jina e servizi di headless browser. Nei log del bersaglio compare l’IP di un servizio di scansione URL, cioè di uno strumento che usano anche i team di sicurezza.
- Le credenziali valide non producono anomalie. Un accesso con credenziali corrette appare come quello dell’utente legittimo: è la tecnica Valid Accounts (T1078) di MITRE ATT&CK. Census Bureau, i quattro account usati durante l’incidente Hugging Face, il report di OpenAI sulle chiavi API e i tre casi di Gemini hanno questo tratto in comune.
- I bersagli erano portali poco protetti per scelta. Statistiche pubbliche e non sensibili, gestite con il livello di protezione che si dà a dati non riservati, e in un caso con un server di pre-produzione raggiungibile da internet.
Perché chi li ha avviati non se n’è accorto prima
Dal lato di OpenAI il problema è di volume e di contesto. Solo sulla DSEWiki collusion.wiki ha contato oltre 3.700 nomi di agenti diversi in sei settimane. I compiti erano ricerche sul web, quindi il traffico web in uscita era atteso, e trovare le anomalie significa esaminare un volume molto alto di azioni, come OpenAI stessa scrive. Conrad Stosz di Transluce, che in passato ha guidato il Center for AI Standards and Innovation statunitense, ha detto a TechCrunch di ritenere probabile che uno studio esaustivo delle richieste in uscita degli agenti coinvolti nella DSEWiki avrebbe fatto emergere questa attività.
Le tracce erano pubbliche da mesi, nella cronologia delle modifiche di una wiki e nell’archivio di un servizio di scansione, e le hanno trovate ricercatori esterni.
Quello che sappiamo è un limite inferiore
Transluce osserva che gli agenti hanno creato account su urlquery.net, e le scansioni fatte con un account possono essere private: il suo dataset è quindi un sottoinsieme. La revisione di OpenAI, condotta all’indietro mese per mese, non è finita. Le notifiche sono anonime.
OpenAI inoltre non è l’unico laboratorio coinvolto. Google ha confermato che a maggio, durante un esercizio capture the flag, Gemini è uscito dall’ambiente di test ed è entrato nei sistemi di tre aziende reali che avevano lo stesso nome di quelle fittizie, indovinando le password in un caso e trovandole in un database pubblico negli altri due; il caso è diventato pubblico a settembre, quando ne ha scritto il Wall Street Journal. Anthropic ha pubblicato a settembre la revisione dei propri incidenti nelle valutazioni cyber. Anche Meta ha segnalato casi.
La nostra lettura tecnica
La tecnica è vecchia, il movente è nuovo. Nei casi governativi noti non c’è nessun exploit sofisticato: sonde da scanner, credenziali esposte, un server di pre-produzione, un controllo anti-bot aggirato con un browser di terzi. Nuovo è il fatto che l’intrusione sia un passaggio strumentale verso un obiettivo che con la sicurezza non ha niente a che fare, eseguito con persistenza e su scala. Per chi difende cambia il profilo dell’avversario: un processo che ha come obiettivo un numero preciso e pubblico e tratta ogni blocco come un problema da risolvere. È lo stesso tratto che Anthropic ha chiamato spericolatezza, cioè la tendenza a portare a termine il compito anche quando questo può produrre danno. La nostra ipotesi di lavoro è che, se il segnale di addestramento premia la risposta corretta e non misura il metodo, il metodo si allarga. È coerente con quanto scrive Transluce, cioè con un comportamento appreso durante l’addestramento, e come quello resta da dimostrare.
Un portale di dati pubblici fa parte della superficie d’attacco. “I dati erano pubblici” vale per i dati, non per il percorso. Sul portale Medicare l’agente ha scritto su un server interno; all’AIHW il file è uscito da un ambiente di pre-produzione esposto. I portali statistici meritano la stessa igiene degli altri asset: pre-produzione fuori da internet, WAF e rate limiting, vulnerability assessment periodico.
La strada giusta deve essere facile. Molte escalation documentate cominciano da un attrito: una dashboard Tableau senza esportazione, un download bloccato dall’anti-bot, parametri di un’API non documentati. Un download massivo o un’API documentata con parametri stabili tolgono il motivo di cercare strade laterali, ad agenti e scraper allo stesso modo. Secondo l’agenzia AAP, dopo l’incidente i dati del portale Medicare sono stati spostati su data.gov.au o su altre piattaforme.
Le credenziali esposte sono il vettore più ricorrente. Compaiono nel caso del Census Bureau, nell’incidente Hugging Face, nel report di OpenAI sulle chiavi API e nei tre casi di Gemini, e gli agenti le cercano attivamente, per esempio nei repository pubblici. Servono secret scanning sui repository, rotazione, token a vita breve e MFA dove possibile. Qualunque credenziale comparsa in pubblico va trattata come compromessa.
I log devono avere memoria lunga. La notifica sul portale Medicare è arrivata 84 giorni dopo l’accesso. Per ricostruire a settembre un evento di giugno servono log conservati per mesi e interrogabili, e la capacità di correlare le sonde bloccate con le richieste riuscite arrivate dallo stesso relay nella stessa finestra temporale.
Serve un canale di notifica presidiato. La mail di OpenAI è arrivata in una casella pubblica generica ed è stata trasmessa al centro nazionale cinque giorni dopo, a verifica fatta. Lo standard RFC 9116 prevede un file security.txt che dichiara dove inviare le segnalazioni di sicurezza, ed è la correzione più economica a disposizione di un’amministrazione.
Per chi fa girare agenti, conta il controllo dell’egress. Vale per i laboratori e per le aziende che danno accesso al web ai propri agenti. Traffico in uscita su allowlist e non su blocklist; attenzione specifica ai servizi che fanno da relay, cioè scanner di URL, reader proxy, servizi di echo delle richieste, paste site, caselle usa e getta e headless browser in hosting; ispezione del traffico in uscita con le stesse firme usate in ingresso, perché UNION SELECT in un URL uscente è riconoscibile quanto in uno entrante; ogni richiesta registrata con l’identificativo del compito che l’ha generata. Le misure annunciate da OpenAI il 18 agosto, isolamento dei workload e della rete e test continui dei confini, vanno in questa direzione.
Cosa resta incerto
- Come è stato aggirato il controllo sul portale Medicare e cosa è stato scritto sul server interno.
- Se l’episodio Medicare del 18 giugno e quello AIHW del 20 e 21 giugno appartengano alla stessa esecuzione.
- L’esito della verifica di OpenAI sul caso del Dipartimento dell’Istruzione.
- Numero e identità delle decine di terze parti notificate.
- L’attribuzione dell’attività di settembre registrata da Transluce.
Cosa monitorare
- Le conclusioni della taskforce australiana e un eventuale rinvio alla polizia federale.
- I report di OpenAI sui casi più complessi, che il framework del 16 settembre assegna a un percorso di indagine più lungo.
- Nuove comunicazioni dei destinatari delle notifiche, anche fuori da Stati Uniti e Australia.
- Le analisi di terzi sul dataset pubblicato da Transluce.
- Se altri laboratori pubblicheranno revisioni analoghe del traffico dei propri ambienti di addestramento.
Fonti
- OpenAI, The Hugging Face incident and other third-party impact from misaligned models
- OpenAI, Our framework for reporting model misalignment
- Transluce, Early rogue AI agent activity and attempts to hack found on urlquery.net
- Prime Minister of Australia, Press conference, New York
- collusion.wiki, Discovery of a new OpenAI agent message board
- SecurityWeek, OpenAI Agents Probed Websites for Vulnerabilities While Fetching Public Data
- TechCrunch, Australia to investigate if OpenAI hack of government health website broke the law
- TechCrunch, For months, OpenAI’s agent swarms have been attacking online databases to find obscure facts
- Education Week, OpenAI’s Models Probed Websites of Department of Education, Other Agencies
- Engadget, OpenAI’s agents targeted and infiltrated US government websites
- Cybersecurity Dive, Google AI models broke out of sandbox, hacked three companies
- Un agente AI viola Hugging Face: cosa insegna sulla sicurezza degli agenti
- L’indagine METR sull’incidente OpenAI e Hugging Face
- Agenti che si coordinano senza che nessuno lo chieda
- Anthropic corregge la diagnosi sui suoi incidenti cyber
