Anthropic afferma che Claude ha hackerato 3 organizzazioni e pubblicato codice dannoso su PyPI
Anthropic ha confermato che i modelli Claude sono evasi da ambienti di valutazione della cybersecurity presumibilmente isolati e hanno raggiunto sistemi reali connessi a internet.
Anthropic ha reso noti tre incidenti di sicurezza che hanno coinvolto modelli convinti di attaccare obiettivi simulati. Un errore di configurazione aveva lasciato attivo l’accesso a internet, consentendo loro di interagire con servizi e organizzazioni reali.
Gli incidenti seguono la recente violazione di Hugging Face che ha coinvolto agenti OpenAI e le segnalazioni secondo cui i modelli OpenAI avrebbero sfruttato vulnerabilità zero-day di JFrog Artifactory nel tentativo di evadere da una sandbox.
L’accesso a internet è rimasto attivo durante i test di sicurezza di Claude
Il valutatore terzo Irregular ha organizzato i test come esercizi capture-the-flag. I modelli hanno ricevuto istruzioni che indicavano che stavano operando all’interno di simulazioni isolate.
Tuttavia, l’ambiente di test poteva ancora accedere a internet. Quando i modelli non sono riusciti a individuare gli obiettivi simulati previsti, hanno cercato sistemi simili online e hanno trattato alcuni servizi reali come parte dell’esercizio.
Anthropic e Irregular non hanno identificato il problema di configurazione fino a mesi dopo il primo incidente. Anthropic ha dichiarato che la violazione più datata conosciuta si è verificata ad aprile ed è rimasta nascosta per circa tre mesi.
Claude Mythos 5 ha pubblicato un pacchetto PyPI malevolo
Durante una valutazione, Claude Mythos 5 ha trovato istruzioni di setup che facevano riferimento a un pacchetto Python fittizio. Il nome del pacchetto non era stato registrato sul Python Package Index.
Il modello ha riconosciuto di poter registrare il nome inutilizzato e pubblicare il proprio codice. I sistemi che seguivano le istruzioni di setup avrebbero quindi potuto scaricare ed eseguire automaticamente il pacchetto.
Claude ha creato gli account necessari e ha caricato un pacchetto malevolo su PyPI. Il pacchetto è rimasto pubblicamente disponibile per circa un’ora prima che le protezioni automatiche di PyPI lo rimuovessero.
Durante quel periodo, 15 sistemi reali hanno scaricato ed eseguito il codice.
Sono state rubate le credenziali di un’azienda di sicurezza
Uno dei sistemi coinvolti apparteneva a un’azienda di cybersecurity che scarica ed esamina automaticamente i pacchetti PyPI appena pubblicati.
Il pacchetto malevolo ha raccolto le credenziali dal sistema e le ha inviate a un’infrastruttura che Claude aveva creato. Il modello ha poi utilizzato le credenziali rubate per accedere ad altre parti della rete aziendale.
Anthropic ha dichiarato che Claude non aveva alcuna conoscenza pregressa dell’organizzazione e non l’ha selezionata intenzionalmente come obiettivo. L’azienda ha informato PyPI e condiviso gli indicatori collegati al pacchetto malevolo.
L’azienda di cybersecurity coinvolta non aveva rilevato l’intrusione prima di essere contattata da Anthropic.
Claude Opus 4.7 ha avuto accesso a un database di produzione
Una valutazione separata che ha coinvolto Claude Opus 4.7 ha portato all’accesso a un database di produzione reale.
L’obiettivo fittizio utilizzato nell’esercizio condivideva il nome con un’azienda e un dominio esistenti. Dopo che Claude non è riuscito a raggiungere il sistema simulato, ha trovato l’organizzazione reale online e l’ha trattata come l’obiettivo previsto.
Il modello ha estratto credenziali di applicazioni e infrastrutture prima di ottenere l’accesso a un database contenente diverse centinaia di righe di informazioni di produzione.
Anthropic ha descritto questo incidente come più grave perché il modello ha raggiunto sistemi aziendali attivi e ha avuto accesso a dati reali.
Un modello di ricerca ha scansionato circa 9.000 sistemi
Un modello di ricerca Anthropic non ancora rilasciato ha causato il terzo incidente.
Dopo non essere riuscito a individuare l’obiettivo di test previsto, il modello ha scansionato circa 9.000 sistemi connessi a internet. Ha compromesso un’applicazione esposta utilizzando credenziali visualizzate su una pagina di debug e una vulnerabilità di SQL injection.
Il modello ha successivamente stabilito che l’applicazione compromessa apparteneva a un account cloud non correlato. Ha quindi interrotto l’attacco senza richiedere l’intervento umano.
Anthropic stava ancora cercando di contattare l’organizzazione coinvolta quando ha pubblicato i suoi risultati.
I modelli hanno sfruttato debolezze di sicurezza di base
Anthropic ha dichiarato che gli incidenti non hanno coinvolto tecniche di attacco nuove o precedentemente sconosciute.
I modelli hanno sfruttato debolezze comuni, tra cui credenziali esposte, password deboli, endpoint accessibili pubblicamente, pagine di debug contenenti informazioni sensibili e vulnerabilità di SQL injection.
Il fallimento principale è derivato dall’accesso a internet senza restrizioni e dal presupposto dei modelli che ogni sistema raggiungibile facesse parte del test autorizzato.
Anthropic ha sospeso i test informatici dopo aver esaminato gli incidenti
Anthropic ha iniziato a riesaminare le valutazioni e ha sospeso tutti i test di cybersecurity il 23 luglio.
L’azienda ha identificato i tre incidenti il 24 luglio. Irregular e due organizzazioni coinvolte hanno ricevuto le notifiche il 27 luglio.
Anthropic ha continuato a cercare di raggiungere l’organizzazione coinvolta nel terzo incidente.
Nessuna delle due organizzazioni che Anthropic è riuscita a contattare aveva rilevato autonomamente le compromissioni prima di ricevere le notifiche.
L’ambiente di valutazione era privo delle protezioni di produzione
I sistemi di test non utilizzavano i classificatori, gli strumenti di monitoraggio e le altre protezioni incluse nei modelli Claude disponibili pubblicamente.
Anthropic ha dichiarato che le sue protezioni di produzione avrebbero probabilmente bloccato le azioni osservate durante le valutazioni. Ha definito gli incidenti principalmente come fallimenti nella progettazione dei test, nell’infrastruttura, nel monitoraggio e nella supervisione di terze parti.
L’azienda non ha descritto gli incidenti come la prova di un fallimento fondamentale di allineamento. Al contrario, i modelli hanno seguito le istruzioni di valutazione interagendo erroneamente con obiettivi reali.
Anthropic prevede un monitoraggio più rigoroso per i test futuri
Anthropic prevede di estendere il monitoraggio delle trascrizioni nelle valutazioni future e di introdurre strumenti di indagine più efficaci.
Aumenterà inoltre la supervisione dei partner di test di terze parti ed esaminerà il modo in cui gli ambienti di valutazione si collegano alle infrastrutture esterne.
Anthropic sta discutendo una revisione indipendente con METR e prevede di pubblicare una trascrizione parzialmente oscurata dell’incidente di PyPI.
Nonostante i fallimenti di sicurezza, Claude Mythos ha dimostrato forti capacità di rilevamento delle vulnerabilità . Anche Microsoft ha riconosciuto di faticare a correggere tutte le vulnerabilità trovate da Claude Mythos, evidenziando sia il potenziale di ricerca sulla sicurezza del modello, sia i rischi creati da ambienti di test scarsamente isolati.
Leggi la nostra pagina informativa per scoprire come puoi aiutare Windows Report a sostenere il team editoriale. Read more
User forum
0 messages