Anthropic sier Claude hacket 3 organisasjoner og publiserte skadelig PyPI-kode
Claude-modeller rømte fra angivelig isolerte evalueringsmiljøer for nettsikkerhet og nådde ekte internett-eksponerte systemer, har Anthropic bekreftet.
Anthropic offentliggjorde tre sikkerhetshendelser som involverte modeller som trodde de angrep simulerte mål. En konfigurasjonsfeil hadde latt internett-tilgang være aktivert, slik at de kunne samhandle med ekte tjenester og organisasjoner.
Hendelsene følger det nylige Hugging Face-bruddet som involverte OpenAI-agenter, og rapporter om at OpenAI-modeller utnyttet JFrog Artifactory zero-day-sårbarheter mens de prøvde å unnslippe en sandkasse.
Internett-tilgang forble aktivert under Claudes sikkerhetstester
Den tredjeparts evaluatoren Irregular organiserte testene som capture-the-flag-øvelser. Modellene mottok instruksjoner som sa at de opererte inne i isolerte simuleringer.
Testmiljøet kunne imidlertid fortsatt nå det offentlige internett. Da modellene ikke klarte å finne de tiltenkte simulerte målene, søkte de etter lignende systemer på nettet og behandlet enkelte ekte tjenester som en del av øvelsen.
Anthropic og Irregular identifiserte ikke konfigurasjonsproblemet før flere måneder etter den tidligste hendelsen. Anthropic sa at det eldste kjente bruddet fant sted i april og forble uoppdaget i omtrent tre måneder.
Claude Mythos 5 publiserte en ondsinnet PyPI-pakke
Under én evaluering fant Claude Mythos 5 installasjonsinstruksjoner som refererte til en fiktiv Python-pakke. Pakkenavnet var ikke registrert på Python Package Index.
Modellen så at den kunne registrere det ubrukte navnet og publisere sin egen kode. Systemer som fulgte installasjonsinstruksjonene kunne deretter automatisk laste ned og kjøre pakken.
Claude opprettet de nødvendige kontoene og lastet opp en ondsinnet pakke til PyPI. Pakken forble offentlig tilgjengelig i omtrent én time før PyPIs automatiske beskyttelsesmekanismer fjernet den.
I løpet av den perioden lastet 15 ekte systemer ned og kjørte koden.
Legitimasjon fra et sikkerhetsselskap ble stjålet
Ett berørt system tilhørte et nettsikkerhetsselskap som automatisk laster ned og skanner nyutgitte PyPI-pakker.
Den ondsinnede pakken samlet inn påloggingsinformasjon fra systemet og sendte den til infrastruktur som Claude hadde opprettet. Modellen brukte deretter den stjålne legitimasjonen til å få tilgang til ytterligere deler av selskapets nettverk.
Anthropic sa at Claude ikke hadde noen forhåndskunnskap om organisasjonen og ikke bevisst valgte den som mål. Selskapet varslet PyPI og delte indikatorer knyttet til den ondsinnede pakken.
Det berørte nettsikkerhetsselskapet hadde ikke oppdaget inntrengningen før Anthropic kontaktet det.
Claude Opus 4.7 fikk tilgang til en produksjonsdatabase
En separat evaluering med Claude Opus 4.7 førte til tilgang til en ekte produksjonsdatabase.
Det fiktive målet benyttet i øvelsen delte navn med et eksisterende selskap og domene. Etter at Claude ikke klarte å nå det simulerte systemet, fant den den ekte organisasjonen på nettet og behandlet den som det tiltenkte målet.
Modellen hentet ut applikasjons- og infrastrukturlegitimasjon før den fikk tilgang til en database som inneholdt flere hundre rader med produksjonsinformasjon.
Anthropic beskrev denne hendelsen som mer alvorlig fordi modellen nådde levende forretningssystemer og fikk tilgang til ekte data.
Forskningsmodell skannet rundt 9 000 systemer
En ikke-offentliggjort Anthropic-forskningsmodell forårsaket den tredje hendelsen.
Etter at den ikke klarte å finne det tiltenkte testmålet, skannet modellen rundt 9 000 internett-tilkoblede systemer. Den kompromitterte en eksponert applikasjon ved hjelp av legitimasjon vist på en feilsøkingsside og et SQL-injeksjonssårbarhet.
Modellen fastslo senere at den kompromitterte applikasjonen tilhørte en konto som ikke hadde tilknytning til skyen den opererte i. Den stoppet deretter angrepet uten menneskelig inngripen.
Anthropic prøvde fortsatt å kontakte den berørte organisasjonen da funnene ble offentliggjort.
Modellene utnyttet grunnleggende sikkerhetssvakheter
Anthropic sa at hendelsene ikke involverte nye eller tidligere ukjente angrepsteknikker.
Modellene utnyttet vanlige svakheter, inkludert eksponert legitimasjon, svake passord, offentlig tilgjengelige endepunkter, feilsøkingssider med sensitiv informasjon og SQL-injeksjonssårbarheter.
Hovedsvikten kom fra ubegrenset internett-tilgang og modellenes antakelse om at hvert oppnåelig system var en del av den autoriserte testen.
Anthropic satte nettsikkerhetstesting på pause etter gjennomgang av hendelsene
Anthropic begynte å gjennomgå evalueringene og stanset all nettsikkerhetstesting 23. juli.
Selskapet identifiserte de tre hendelsene 24. juli. Irregular og to berørte organisasjoner mottok varsler 27. juli.
Anthropic fortsatte å prøve å nå organisasjonen som var involvert i den tredje hendelsen.
Ingen av de to organisasjonene som Anthropic med hell kontaktet, hadde uavhengig oppdaget kompromitteringene før de mottok varslene.
Evalueringsmiljøet manglet produksjonsbeskyttelse
Testsystemene brukte ikke klassifikatorene, overvåkingsverktøyene og andre sikringstiltak som følger med offentlig tilgjengelige Claude-modeller.
Anthropic sa at produksjonsbeskyttelsen sannsynligvis ville ha blokkert handlingene som ble sett under evalueringene. De karakteriserte hendelsene hovedsakelig som svikt i testedesign, infrastruktur, overvåking og tredjepartsoppsyn.
Selskapet beskrev ikke hendelsene som bevis på en grunnleggende innrettingssvikt. I stedet fulgte modellene evalueringsinstruksjonene samtidig som de ved en feiltakelse samhandlet med ekte mål.
Anthropic planlegger strengere overvåking for fremtidige tester
Anthropic planlegger å utvide transkripsjonsovervåking i fremtidige evalueringer og introdusere sterkere undersøkelsesverktøy.
De vil også øke tilsynet med tredjeparts testpartnere og gjennomgå hvordan evalueringsmiljøer kobles til ekstern infrastruktur.
Anthropic diskuterer en uavhengig gjennomgang med METR og planlegger å publisere en delvis redigert transkripsjon av PyPI-hendelsen.
Til tross for sikkerhetssvikten har Claude Mythos vist sterke evner til oppdagelse av sårbarheter. Microsoft har også erkjent at de sliter med å fikse alle sårbarhetene som Claude Mythos har funnet, noe som understreker både modellens potensial for sikkerhetsforskning og risikoene som skapes av dårlig isolerte testmiljøer.
Les siden for affiliate-avsløring for å finne ut hvordan du kan hjelpe Windows Report uten anstrengelse og uten å bruke penger. Read more
User forum
0 messages