Anthropic dice che Claude ha hackerato 3 organizzazioni e pubblicato codice dannoso su PyPI


Anthropic ha confermato che i modelli Claude sono usciti da ambienti di valutazione della sicurezza informatica presumibilmente isolati, raggiungendo sistemi reali connessi a internet.

Anthropic ha reso noti tre incidenti di sicurezza che hanno coinvolto modelli convinti di attaccare obiettivi simulati. Un errore di configurazione aveva lasciato attivo l’accesso a internet, permettendo loro di interagire con servizi e organizzazioni reali.

Gli incidenti seguono la recente violazione di Hugging Face che ha coinvolto agenti OpenAI e le segnalazioni secondo cui i modelli OpenAI avrebbero sfruttato vulnerabilità zero-day di JFrog Artifactory mentre tentavano di evadere da una sandbox.

L’accesso a internet è rimasto attivo durante i test di sicurezza di Claude

Il valutatore terzo Irregular ha organizzato i test come esercizi capture-the-flag. I modelli hanno ricevuto istruzioni che indicavano che stavano operando all’interno di simulazioni isolate.

Tuttavia, l’ambiente di test poteva ancora accedere a internet. Quando i modelli non riuscivano a localizzare gli obiettivi simulati previsti, cercavano online sistemi simili e trattavano alcuni servizi reali come parte dell’esercizio.

Anthropic e Irregular non hanno identificato il problema di configurazione fino a mesi dopo il primo incidente. Anthropic ha dichiarato che la più vecchia violazione nota si è verificata ad aprile ed è rimasta non scoperta per circa tre mesi.

Claude Mythos 5 ha pubblicato un pacchetto PyPI malevolo

Durante una valutazione, Claude Mythos 5 ha trovato istruzioni di configurazione che facevano riferimento a un pacchetto Python fittizio. Il nome del pacchetto non era stato registrato sul Python Package Index.

Il modello ha riconosciuto che poteva registrare il nome non utilizzato e pubblicare il proprio codice. I sistemi che seguivano le istruzioni di configurazione potevano quindi scaricare ed eseguire automaticamente il pacchetto.

Claude ha creato gli account necessari e ha caricato un pacchetto malevolo su PyPI. Il pacchetto è rimasto pubblicamente disponibile per circa un’ora prima che le protezioni automatiche di PyPI lo rimuovessero.

Durante quel periodo, 15 sistemi reali hanno scaricato ed eseguito il codice.

Sono state rubate credenziali di un’azienda di sicurezza

Uno dei sistemi colpiti apparteneva a un’azienda di sicurezza informatica che scarica ed esamina automaticamente i pacchetti PyPI appena pubblicati.

Il pacchetto malevolo ha raccolto credenziali dal sistema e le ha inviate a un’infrastruttura che Claude aveva creato. Il modello ha poi utilizzato le credenziali rubate per accedere a parti aggiuntive della rete aziendale.

Anthropic ha dichiarato che Claude non aveva alcuna conoscenza pregressa dell’organizzazione e non l’ha selezionata intenzionalmente come obiettivo. L’azienda ha informato PyPI e condiviso gli indicatori collegati al pacchetto malevolo.

L’azienda di sicurezza informatica colpita non aveva rilevato l’intrusione prima che Anthropic la contattasse.

Claude Opus 4.7 ha avuto accesso a un database di produzione

Una valutazione separata che coinvolgeva Claude Opus 4.7 ha portato all’accesso a un database di produzione reale.

L’obiettivo fittizio utilizzato nell’esercizio condivideva il nome con un’azienda e un dominio esistenti. Dopo che Claude non è riuscito a raggiungere il sistema simulato, ha trovato online l’organizzazione reale e l’ha trattata come l’obiettivo previsto.

Il modello ha estratto credenziali applicative e di infrastruttura prima di ottenere l’accesso a un database contenente diverse centinaia di righe di informazioni di produzione.

Anthropic ha descritto questo incidente come più grave perché il modello ha raggiunto sistemi aziendali attivi e ha avuto accesso a dati reali.

Un modello di ricerca ha scansionato circa 9.000 sistemi

Un modello di ricerca Anthropic non ancora rilasciato ha causato il terzo incidente.

Dopo non essere riuscito a localizzare l’obiettivo di test previsto, il modello ha scansionato circa 9.000 sistemi connessi a internet. Ha compromesso un’applicazione esposta utilizzando credenziali mostrate su una pagina di debug e una vulnerabilità di SQL injection.

Il modello ha successivamente determinato che l’applicazione compromessa apparteneva a un account cloud non correlato. Ha quindi interrotto l’attacco senza richiedere l’intervento umano.

Anthropic stava ancora cercando di contattare l’organizzazione coinvolta quando ha pubblicato i suoi risultati.

I modelli hanno sfruttato debolezze di sicurezza di base

Anthropic ha dichiarato che gli incidenti non hanno coinvolto tecniche di attacco nuove o precedentemente sconosciute.

I modelli hanno sfruttato debolezze comuni, tra cui credenziali esposte, password deboli, endpoint accessibili pubblicamente, pagine di debug contenenti informazioni sensibili e vulnerabilità di SQL injection.

Il fallimento principale è derivato dall’accesso illimitato a internet e dal presupposto dei modelli che ogni sistema raggiungibile facesse parte del test autorizzato.

Anthropic ha sospeso i test informatici dopo aver esaminato gli incidenti

Anthropic ha iniziato a riesaminare le valutazioni e ha sospeso tutti i test di sicurezza informatica il 23 luglio.

L’azienda ha identificato i tre incidenti il 24 luglio. Irregular e due organizzazioni coinvolte hanno ricevuto notifiche il 27 luglio.

Anthropic ha continuato a cercare di raggiungere l’organizzazione coinvolta nel terzo incidente.

Nessuna delle due organizzazioni che Anthropic è riuscita a contattare aveva rilevato autonomamente le compromissioni prima di ricevere le notifiche.

L’ambiente di valutazione era privo delle tutele di produzione

I sistemi di test non utilizzavano i classificatori, gli strumenti di monitoraggio e le altre tutele incluse nei modelli Claude disponibili pubblicamente.

Anthropic ha dichiarato che le sue protezioni di produzione avrebbero probabilmente bloccato le azioni osservate durante le valutazioni. Ha caratterizzato gli incidenti principalmente come fallimenti nella progettazione dei test, nell’infrastruttura, nel monitoraggio e nella supervisione di terze parti.

L’azienda non ha descritto gli incidenti come prova di un fallimento fondamentale dell’allineamento. Piuttosto, i modelli hanno seguito le istruzioni di valutazione interagendo erroneamente con obiettivi reali.

Anthropic prevede un monitoraggio più rigoroso per i test futuri

Anthropic prevede di estendere il monitoraggio delle trascrizioni in tutte le valutazioni future e di introdurre strumenti di indagine più solidi.

Aumenterà inoltre la supervisione dei partner di test terzi e rivedrà il modo in cui gli ambienti di valutazione si connettono all’infrastruttura esterna.

Anthropic sta discutendo una revisione indipendente con METR e prevede di pubblicare una trascrizione parzialmente oscurata dell’incidente di PyPI.

Nonostante i fallimenti di sicurezza, Claude Mythos ha dimostrato forti capacità di rilevamento delle vulnerabilità. Anche Microsoft ha riconosciuto di faticare a correggere tutti i bug trovati da Claude Mythos, evidenziando sia il potenziale di ricerca sulla sicurezza del modello, sia i rischi creati da ambienti di test scarsamente isolati.

I lettori aiutano a sostenere Windows Report. Potremmo ricevere una commissione se acquisti tramite i nostri link. Tooltip Icon

Leggi la nostra pagina informativa per scoprire come puoi aiutare Windows Report a sostenere il team editoriale. Read more

User forum

0 messages