Anthropic hevder Claude hacket 3 organisasjoner og publiserte ondsinnet PyPI-kode


Claude-modeller rømte fra angivelig isolerte cybersikkerhetsevalueringsmiljøer og nådde ekte internett-tilkoblede systemer, har Anthropic bekreftet.

Anthropic offentliggjorde tre sikkerhetshendelser som involverte modeller som trodde de angrep simulerte mål. En konfigurasjonsfeil lot internettilgang forbli aktivert, slik at de kunne samhandle med ekte tjenester og organisasjoner.

Hendelsene følger det nylige Hugging Face-bruddet som involverte OpenAI-agenter og rapporter om at OpenAI-modeller utnyttet JFrog Artifactory zero-day-sårbarheter mens de forsøkte å rømme fra en sandkasse.

Internett-tilgang forble aktivert under Claudes sikkerhetstester

Tredjepartsevaluator Irregular organiserte testene som CTF-øvelser. Modellene mottok instruksjoner om at de opererte inne i isolerte simuleringer.

Testmiljøet kunne imidlertid fortsatt nå det offentlige internettet. Da modellene ikke klarte å finne de tiltenkte simulerte målene, søkte de etter lignende systemer på nettet og behandlet noen ekte tjenester som en del av øvelsen.

Anthropic og Irregular identifiserte ikke konfigurasjonsproblemet før måneder etter den tidligste hendelsen. Anthropic uttalte at det eldste kjente bruddet skjedde i april og forble uoppdaget i omtrent tre måneder.

Claude Mythos 5 publiserte en ondsinnet PyPI-pakke

Under en evaluering fant Claude Mythos 5 oppsettinstruksjoner som refererte til en fiktiv Python-pakke. Pakkenavnet var ikke registrert på Python Package Index.

Modellen innså at den kunne registrere det ubrukte navnet og publisere sin egen kode. Systemer som fulgte oppsettinstruksjonene kunne deretter automatisk laste ned og kjøre pakken.

Claude opprettet de nødvendige kontoene og lastet opp en ondsinnet pakke til PyPI. Pakken forble offentlig tilgjengelig i omtrent én time før PyPIs automatiske beskyttelsesmekanismer fjernet den.

I løpet av den perioden lastet 15 ekte systemer ned og kjørte koden.

Påloggingsinformasjon for et sikkerhetsselskap ble stjålet

Et berørt system tilhørte et cybersikkerhetsselskap som automatisk laster ned og skanner nytt opplastede PyPI-pakker.

Den ondsinnede pakken samlet inn påloggingsinformasjon fra systemet og sendte den til infrastruktur som Claude hadde opprettet. Modellen brukte deretter den stjålne påloggingsinformasjonen til å få tilgang til flere deler av selskapets nettverk.

Anthropic uttalte at Claude ikke hadde noen forhåndskunnskap om organisasjonen og ikke valgte den som mål med hensikt. Selskapet varslet PyPI og delte indikatorer knyttet til den ondsinnede pakken.

Det berørte cybersikkerhetsselskapet hadde ikke oppdaget inntrengningen før Anthropic kontaktet det.

Claude Opus 4.7 fikk tilgang til en produksjonsdatabase

En separat evaluering med Claude Opus 4.7 resulterte i tilgang til en ekte produksjonsdatabase.

Det fiktive målet som ble brukt i øvelsen, delte navn med et eksisterende selskap og domene. Etter at Claude mislyktes i å nå det simulerte systemet, fant den den virkelige organisasjonen på nettet og betraktet den som det tiltenkte målet.

Modellen hentet ut applikasjons- og infrastrukturlegitimasjon før den fikk tilgang til en database med flere hundre rader med produksjonsdata.

Anthropic beskrev denne hendelsen som mer alvorlig fordi modellen nådde levende forretningssystemer og fikk tilgang til ekte data.

Forskningsmodell skannet rundt 9 000 systemer

En ikke-utgitt Anthropic-forskningsmodell forårsaket den tredje hendelsen.

Etter at den mislyktes i å lokalisere det tiltenkte testmålet, skannet modellen rundt 9 000 internett-tilkoblede systemer. Den kompromitterte en eksponert applikasjon ved hjelp av påloggingsinformasjon vist på en feilsøkingsside og et SQL-injeksjonssårbarhet.

Modellen fastslo senere at den kompromitterte applikasjonen tilhørte en urelatert sky-konto. Deretter stoppet den angrepet uten menneskelig innblanding.

Anthropic prøvde fortsatt å kontakte den berørte organisasjonen da de publiserte funnene sine.

Modellene utnyttet grunnleggende sikkerhetssvakheter

Anthropic uttalte at hendelsene ikke involverte nye eller tidligere ukjente angrepsteknikker.

Modellene utnyttet vanlige svakheter, inkludert eksponerte påloggingsinformasjon, svake passord, offentlig tilgjengelige endepunkter, feilsøkingssider som inneholder sensitiv informasjon og SQL-injeksjonssårbarheter.

Hovedfeilen kom fra ubegrenset internett-tilgang og modellenes antakelse om at ethvert system de kunne nå, utgjorde en del av den autoriserte testen.

Anthropic satte cybertesting på pause etter å ha gjennomgått hendelsene

Anthropic begynte å gjennomgå evalueringene og satte all cybersikkerhetstesting på pause 23. juli.

Selskapet identifiserte de tre hendelsene 24. juli. Irregular og to berørte organisasjoner ble varslet 27. juli.

Anthropic fortsatte å prøve å nå organisasjonen som var involvert i den tredje hendelsen.

Ingen av de to organisasjonene som Anthropic lyktes med å kontakte, hadde oppdaget kompromitteringene på egen hånd før de mottok varslene.

Evalueringsmiljøet manglet produksjonsbeskyttelse

Testsystemene brukte ikke klassifikatorene, overvåkingsverktøyene og andre beskyttelsesmekanismer som følger med offentlig tilgjengelige Claude-modeller.

Anthropic uttalte at produksjonsbeskyttelsen sannsynligvis ville ha blokkert handlingene som ble sett under evalueringene. Selskapet karakteriserte hendelsene hovedsakelig som svikt i testdesign, infrastruktur, overvåking og tilsyn med tredjepart.

Selskapet beskrev ikke hendelsene som bevis på en grunnleggende tilpasningssvikt. I stedet fulgte modellene evalueringsinstruksjonene mens de feilaktig samhandlet med virkelige mål.

Anthropic planlegger strengere overvåking for fremtidige tester

Anthropic planlegger å utvide transkripsjonsovervåking for fremtidige evalueringer og innføre sterkere undersøkelsesverktøy.

Det vil også øke tilsynet med tredjeparts testpartnere og gjennomgå hvordan evalueringsmiljøer kobles til ekstern infrastruktur.

Anthropic diskuterer en uavhengig gjennomgang med METR og planlegger å publisere en delvis sensurert transkripsjon av PyPI-hendelsen.

Til tross for sikkerhetsfeilene, har Claude Mythos vist sterke evner til å oppdage sårbarheter. Microsoft har også erkjent at de sliter med å fikse alle sårbarhetene funnet av Claude Mythos, noe som understreker både modellens sikkerhetsforskningspotensial og risikoen skapt av dårlig isolerte testmiljøer.

Lesere hjelper til med å støtte Windows Report. Når du gjør et kjøp ved å bruke linker på nettstedet vårt, kan vi tjene en affiliate-kommisjon. Tooltip Icon

Les siden for affiliate-avsløring for å finne ut hvordan du kan hjelpe Windows Report uten anstrengelse og uten å bruke penger. Read more

User forum

0 messages