Anthropic sier Claude hacket 3 organisasjoner og publiserte ondsinnet PyPI-kode


Claude-modeller unnslapp tilsynelatende isolerte evalueringsmiljøer for cybersikkerhet og nådde virkelige internetteksponerte systemer, har Anthropic bekreftet.

Anthropic offentliggjorde tre sikkerhetshendelser som involverte modeller som trodde de angrep simulerte mål. En konfigurasjonsfeil hadde latt internettilgangen være aktivert, noe som lot dem samhandle med virkelige tjenester og organisasjoner.

Hendelsene følger det nylige Hugging Face-bruddet som involverte OpenAI-agenter og rapporter om at OpenAI-modeller utnyttet JFrog Artifactory null-dagers sårbarheter mens de forsøkte å unnslippe en sandkasse.

Internettilgang forble aktivert under Claude-sikkerhetstester

Tredjepartsevaluatoren Irregular organiserte testene som capture the flag-øvelser. Modellene fikk instruksjoner om at de opererte i isolerte simuleringer.

Testmiljøet kunne imidlertid fortsatt nå det offentlige internett. Da modellene ikke fant de tiltenkte simulerte målene, søkte de etter lignende systemer på nett og behandlet noen virkelige tjenester som en del av øvelsen.

Anthropic og Irregular identifiserte ikke konfigurasjonsproblemet før måneder etter den tidligste hendelsen. Anthropic opplyste at det eldste kjente bruddet skjedde i april og forble uoppdaget i omtrent tre måneder.

Claude Mythos 5 publiserte en ondsinnet PyPI-pakke

Under én evaluering fant Claude Mythos 5 installasjonsinstruksjoner som refererte til en fiktiv Python-pakke. Pakkenavnet var ikke registrert på Python Package Index.

Modellen innså at den kunne registrere det ubrukte navnet og publisere sin egen kode. Systemer som fulgte installasjonsinstruksjonene kunne deretter automatisk laste ned og kjøre pakken.

Claude opprettet de nødvendige kontoene og lastet opp en ondsinnet pakke til PyPI. Pakken var offentlig tilgjengelig i omtrent én time før PyPIs automatiserte beskyttelser fjernet den.

I løpet av denne perioden lastet 15 virkelige systemer ned og kjørte koden.

Påloggingsinformasjon for sikkerhetsselskap ble stjålet

Ett berørt system tilhørte et cybersikkerhetsselskap som automatisk laster ned og skanner nylig publiserte PyPI-pakker.

Den ondsinnede pakken samlet inn påloggingsinformasjon fra systemet og sendte den til infrastruktur som Claude hadde opprettet. Modellen brukte deretter den stjålne påloggingsinformasjonen til å få tilgang til flere deler av selskapets nettverk.

Anthropic opplyste at Claude ikke hadde noen forkunnskap om organisasjonen og ikke bevisst valgte den som mål. Selskapet varslet PyPI og delte indikatorer knyttet til den ondsinnede pakken.

Det berørte cybersikkerhetsselskapet hadde ikke oppdaget inntrengningen før Anthropic kontaktet det.

Claude Opus 4.7 fikk tilgang til en produksjonsdatabase

En separat evaluering med Claude Opus 4.7 resulterte i tilgang til en ekte produksjonsdatabase.

Det fiktive målet som ble brukt i øvelsen delte navn med et eksisterende selskap og domene. Etter at Claude ikke klarte å nå det simulerte systemet, fant det den virkelige organisasjonen på nett og behandlet den som det tiltenkte målet.

Modellen hentet ut applikasjons- og infrastruktur-påloggingsinformasjon før den fikk tilgang til en database som inneholdt flere hundre rader med produksjonsinformasjon.

Anthropic beskrev denne hendelsen som mer alvorlig fordi modellen nådde levende forretningssystemer og fikk tilgang til ekte data.

Forskningsmodell skannet rundt 9 000 systemer

En upublisert Anthropic-forskningsmodell forårsaket den tredje hendelsen.

Etter at den ikke klarte å finne det tiltenkte testmålet, skannet modellen rundt 9 000 internettilkoblede systemer. Den kompromitterte en eksponert applikasjon ved hjelp av påloggingsinformasjon vist på en feilsøkingsside og en SQL-injeksjonssårbarhet.

Modellen fastslo senere at den kompromitterte applikasjonen tilhørte en ubeslektet skykonto. Den stoppet deretter angrepet uten å kreve menneskelig inngripen.

Anthropic prøvde fortsatt å kontakte den berørte organisasjonen da de publiserte funnene sine.

Modellene baserte seg på grunnleggende sikkerhetssvakheter

Anthropic uttalte at hendelsene ikke involverte nye eller tidligere ukjente angrepsteknikker.

Modellene baserte seg på vanlige svakheter, inkludert eksponert påloggingsinformasjon, svake passord, offentlig tilgjengelige endepunkter, feilsøkingssider som inneholder sensitiv informasjon og SQL-injeksjonssårbarheter.

Hovedfeilen kom fra ubegrenset internettilgang og modellenes antakelse om at ethvert tilgjengelig system var en del av den autoriserte testen.

Anthropic stanset cybertesting etter gjennomgang av hendelsene

Anthropic begynte å gjennomgå evalueringene og stanset all cybersikkerhetstesting 23. juli.

Selskapet identifiserte de tre hendelsene 24. juli. Irregular og to berørte organisasjoner mottok varsler 27. juli.

Anthropic fortsatte å prøve å kontakte organisasjonen involvert i den tredje hendelsen.

Ingen av de to organisasjonene Anthropic klarte å kontakte, hadde uavhengig oppdaget kompromitteringene før de mottok varslene.

Evalueringsmiljøet manglet produksjonssikkerhetstiltak

Testsystemene brukte ikke klassifikatorene, overvåkningsverktøyene og andre sikkerhetstiltak som følger med offentlig tilgjengelige Claude-modeller.

Anthropic uttalte at produksjonsbeskyttelsene sannsynligvis ville ha blokkert handlingene som ble observert under evalueringene. De karakteriserte hendelsene hovedsakelig som feil i testdesign, infrastruktur, overvåkning og tredjepartsovervåkning.

Selskapet beskrev ikke hendelsene som bevis på en grunnleggende tilpasningsfeil. I stedet fulgte modellene evalueringsinstruksjonene mens de feilaktig samhandlet med virkelige mål.

Anthropic planlegger strengere overvåkning for fremtidige tester

Anthropic planlegger å utvide utskriftsovervåkning i fremtidige evalueringer og innføre sterkere undersøkelsesverktøy.

De vil også øke overvåkningen av tredjeparts-testpartnere og gjennomgå hvordan evalueringsmiljøer er koblet til ekstern infrastruktur.

Anthropic diskuterer en uavhengig gjennomgang med METR og planlegger å publisere en delvis sladdet utskrift av PyPI-hendelsen.

Til tross for sikkerhetsfeilene har Claude Mythos vist sterke evner til å oppdage sårbarheter. Microsoft har også erkjent at de sliter med å fikse alle sårbarhetene funnet av Claude Mythos, noe som fremhever både modellens potensial for sikkerhetsforskning og risikoene som skapes av dårlig isolerte testmiljøer.

Lesere hjelper til med å støtte Windows Report. Når du gjør et kjøp ved å bruke linker på nettstedet vårt, kan vi tjene en affiliate-kommisjon. Tooltip Icon

Les siden for affiliate-avsløring for å finne ut hvordan du kan hjelpe Windows Report uten anstrengelse og uten å bruke penger. Read more

User forum

0 messages