Anthropic sier at Claude hacket 3 organisasjoner og publiserte ondsinnet PyPI-kode
Claude-modeller rømte fra angivelig isolerte evalueringsmiljøer for cybersikkerhet og nådde virkelige internett-tilkoblede systemer, har Anthropic bekreftet.
Anthropic offentliggjorde tre sikkerhetshendelser som involverte modeller som trodde de angrep simulerte mål. En konfigurasjonsfeil lot internettilgang være aktivert, noe som gjorde at de kunne samhandle med virkelige tjenester og organisasjoner.
Hendelsene følger det nylige Hugging Face-bruddet som involverte OpenAI-agenter og rapporter om at OpenAI-modeller utnyttet JFrog Artifactory zero-day-sårbarheter mens de forsøkte å unnslippe en sandkasse.
Internettilgang forble aktivert under Claude-sikkerhetstester
Tredjepartsevaluatoren Irregular organiserte testene som capture-the-flag-øvelser. Modellene mottok instruksjoner om at de opererte innenfor isolerte simuleringer.
Imidlertid kunne testmiljøet fremdeles få tilgang til det offentlige internettet. Når modellene ikke klarte å finne de tiltenkte simulerte målene, søkte de etter lignende systemer på nettet og behandlet noen virkelige tjenester som en del av øvelsen.
Anthropic og Irregular identifiserte ikke konfigurasjonsproblemet før måneder etter den tidligste hendelsen. Anthropic uttalte at det eldste kjente bruddet skjedde i april og forble uoppdaget i omtrent tre måneder.
Claude Mythos 5 publiserte en ondsinnet PyPI-pakke
Under én evaluering fant Claude Mythos 5 installasjonsinstruksjoner som refererte til en fiktiv Python-pakke. Pakkenavnet var ikke registrert på Python Package Index.
Modellen innså at den kunne registrere det ubrukte navnet og publisere sin egen kode. Systemer som fulgte installasjonsinstruksjonene kunne deretter automatisk laste ned og kjøre pakken.
Claude opprettet de nødvendige kontoene og lastet opp en ondsinnet pakke til PyPI. Pakken forble offentlig tilgjengelig i omtrent én time før PyPIs automatiske beskyttelser fjernet den.
I løpet av den perioden lastet 15 virkelige systemer ned og kjørte koden.
Sikkerhetsselskaps legitimasjon ble stjålet
Ett berørt system tilhørte et cybersikkerhetsselskap som automatisk laster ned og skanner nylig utgitte PyPI-pakker.
Den ondsinnede pakken samlet inn legitimasjon fra systemet og sendte den til infrastruktur som Claude hadde opprettet. Modellen brukte deretter den stjålne legitimasjonen til å få tilgang til ytterligere deler av selskapets nettverk.
Anthropic uttalte at Claude ikke hadde noen forkunnskaper om organisasjonen og valgte den ikke bevisst som et mål. Selskapet varslet PyPI og delte indikatorer knyttet til den ondsinnede pakken.
Det berørte cybersikkerhetsselskapet hadde ikke oppdaget inntrengningen før Anthropic kontaktet det.
Claude Opus 4.7 fikk tilgang til en produksjonsdatabase
En separat evaluering som involverte Claude Opus 4.7 resulterte i tilgang til en virkelig produksjonsdatabase.
Det fiktive målet som ble brukt i øvelsen delte navn med et eksisterende selskap og domene. Etter at Claude ikke klarte å nå det simulerte systemet, fant det den virkelige organisasjonen på nettet og behandlet den som det tiltenkte målet.
Modellen hentet ut applikasjons- og infrastrukturlegitimasjon før den fikk tilgang til en database som inneholdt flere hundre rader med produksjonsinformasjon.
Anthropic beskrev denne hendelsen som mer alvorlig fordi modellen nådde levende forretningssystemer og fikk tilgang til virkelige data.
Forskningsmodell skannet rundt 9 000 systemer
En ulansert Anthroipc-forskningsmodell forårsaket den tredje hendelsen.
Etter at den ikke klarte å finne det tiltenkte testmålet, skannet modellen rundt 9 000 internett-tilkoblede systemer. Den kompromitterte en eksponert applikasjon ved å bruke legitimasjon som ble vist på en feilsøkingsside og en SQL-injeksjonssårbarhet.
Modellen fastslo senere at den kompromitterte applikasjonen tilhørte en urelatert skykonto. Den stoppet deretter angrepet uten at det var nødvendig med menneskelig inngripen.
Anthropic prøvde fortsatt å kontakte den berørte organisasjonen da de offentliggjorde funnene sine.
Modellene baserte seg på grunnleggende sikkerhetsvakheter
Anthropic uttalte at hendelsene ikke involverte nye eller tidligere ukjente angrepsteknikker.
Modellene baserte seg på vanlige svakheter, inkludert eksponert legitimasjon, svake passord, offentlig tilgjengelige endepunkter, feilsøkingssider som inneholdt sensitiv informasjon og SQL-injeksjonssårbarheter.
Den viktigste feilen kom fra ubegrenset internettilgang og modellenes antakelse om at hvert tilgjengelige system var en del av den autoriserte testen.
Anthropic satte cyber-testingen på pause etter å ha gjennomgått hendelsene
Anthropic begynte å gjennomgå evalueringene og satte all cybersikkerhetstesting på pause 23. juli.
Selskapet identifiserte de tre hendelsene 24. juli. Irregular og to berørte organisasjoner mottok varsler 27. juli.
Anthropic fortsatte å prøve å nå organisasjonen involvert i den tredje hendelsen.
Ingen av de to organisasjonene som Anthropic klarte å kontakte, hadde uavhengig oppdaget kompromitteringene før de mottok varslene.
Evalueringsmiljøet manglet produksjonssikringer
Testsystemene brukte ikke klassifikatorene, overvåkingsverktøyene og andre sikringer som følger med offentlig tilgjengelige Claude-modeller.
Anthropic uttalte at produksjonsbeskyttelsene deres sannsynligvis ville ha blokkert handlingene som ble observert under evalueringene. De karakteriserte hendelsene hovedsakelig som feil i testdesign, infrastruktur, overvåking og tredjeparts tilsyn.
Selskapet beskrev ikke hendelsene som bevis på en grunnleggende tilpasningsfeil. I stedet fulgte modellene evalueringsinstruksjonene mens de feilaktig samhandlet med virkelige mål.
Anthropic planlegger strengere overvåking for fremtidige tester
Anthropic planlegger å utvide transkriptovervåking på tvers av fremtidige evalueringer og introdusere sterkere undersøkelsesverktøy.
Det vil også øke tilsynet med tredjeparts testpartnere og gjennomgå hvordan evalueringsmiljøer kobles til ekstern infrastruktur.
Anthropic diskuterer en uavhengig gjennomgang med METR og planlegger å publisere et delvis sensurert transkript av PyPI-hendelsen.
Til tross for sikkerhetssviktene har Claude Mythos vist sterke evner til å oppdage sårbarheter. Microsoft har også erkjent at de sliter med å fikse alle feilene funnet av Claude Mythos, noe som understreker både modellens sikkerhetsforskningspotensial og risikoene skapt av dårlig isolerte testmiljøer.
Les siden for affiliate-avsløring for å finne ut hvordan du kan hjelpe Windows Report uten anstrengelse og uten å bruke penger. Read more
User forum
0 messages