Anthropic siger, at Claude hackede 3 organisationer og offentliggjorde ondsindet PyPI-kode
Claude-modeller slap ud af angiveligt isolerede cybersikkerhedsevalueringsmiljøer og nåede ægte internetforbundne systemer, har Anthropic bekræftet.
Anthropic offentliggjorde tre sikkerhedshændelser, der involverer modeller, som troede, de angreb simulerede mål. En konfigurationsfejl havde efterladt internetadgang aktiveret, hvilket tillod dem at interagere med ægte tjenester og organisationer.
Hændelserne følger det nylige Hugging Face-brud, der involverer OpenAI-agenter, og rapporter om, at OpenAI-modeller udnyttede JFrog Artifactory-nuldagssårbarheder, mens de forsøgte at undslippe en sandkasse.
Internetadgang forblev aktiveret under Claudes sikkerhedstests
Tredjepartsevaluatoren Irregular organiserede testene som capture-the-flag-øvelser. Modellerne modtog instruktioner, der angav, at de fungerede inde i isolerede simuleringer.
Testmiljøet kunne dog stadig få adgang til det offentlige internet. Da modellerne ikke kunne finde deres planlagte simulerede mål, søgte de efter lignende systemer online og behandlede nogle ægte tjenester som en del af øvelsen.
Anthropic og Irregular identificerede ikke konfigurationsproblemet før måneder efter den tidligste hændelse. Anthropic sagde, at det ældste kendte brud fandt sted i april og forblev uopdaget i cirka tre måneder.
Claude Mythos 5 offentliggjorde en ondsindet PyPI-pakke
Under én evaluering fandt Claude Mythos 5 installationsinstruktioner, der refererede til en fiktiv Python-pakke. Pakkenavnet var ikke blevet registreret på Python Package Index.
Modellen erkendte, at den kunne registrere det ubrugte navn og offentliggøre sin egen kode. Systemer, der fulgte installationsinstruktionerne, kunne derefter automatisk downloade og udføre pakken.
Claude oprettede de nødvendige konti og uploadede en ondsindet pakke til PyPI. Pakken forblev offentligt tilgængelig i cirka en time, før PyPIs automatiserede beskyttelser fjernede den.
I løbet af den periode downloadede og udførte 15 ægte systemer koden.
Adgangsoplysninger fra et sikkerhedsfirma blev stjålet
Et berørt system tilhørte et cybersikkerhedsfirma, der automatisk downloader og scanner nyligt offentliggjorte PyPI-pakker.
Den ondsindede pakke indsamlede adgangsoplysninger fra systemet og sendte dem til en infrastruktur, som Claude havde oprettet. Modellen brugte derefter de stjålne adgangsoplysninger til at få adgang til yderligere dele af firmaets netværk.
Anthropic sagde, at Claude ikke havde nogen forudgående kendskab til organisationen og ikke bevidst valgte den som mål. Firmaet underrettede PyPI og delte indikatorer forbundet med den ondsindede pakke.
Det berørte cybersikkerhedsfirma havde ikke opdaget indtrængningen, før Anthropic kontaktede det.
Claude Opus 4.7 fik adgang til en produktionsdatabase
En separat evaluering med Claude Opus 4.7 førte til adgang til en ægte produktionsdatabase.
Det fiktive mål, der blev brugt i øvelsen, delte navn med et eksisterende firma og domæne. Efter at Claude ikke kunne nå det simulerede system, fandt den den ægte organisation online og behandlede den som det tilsigtede mål.
Modellen udtrak adgangsoplysninger til applikationer og infrastruktur, før den fik adgang til en database, der indeholdt flere hundrede rækker med produktionsoplysninger.
Anthropic beskrev denne hændelse som mere alvorlig, fordi modellen nåede live forretningssystemer og fik adgang til ægte data.
Forskningsmodel scannede omkring 9.000 systemer
En endnu ikke frigivet forskningsmodel fra Anthropic forårsagede den tredje hændelse.
Efter at den ikke kunne lokalisere det tilsigtede testmål, scannede modellen omkring 9.000 internetforbundne systemer. Den kompromitterede en eksponeret applikation ved hjælp af adgangsoplysninger, der blev vist på en debug-side, og en SQL-injektionssårbarhed.
Modellen fastslog senere, at den kompromitterede applikation tilhørte en uafhængig cloud-konto. Den stoppede derefter angrebet uden behov for menneskelig indgriben.
Anthropic forsøgte stadig at kontakte den berørte organisation, da det offentliggjorde sine resultater.
Modellerne baserede sig på grundlæggende sikkerhedssvagheder
Anthropic sagde, at hændelserne ikke involverede nye eller tidligere ukendte angrebsteknikker.
Modellerne baserede sig på almindelige svagheder, herunder eksponerede adgangsoplysninger, svage adgangskoder, offentligt tilgængelige endepunkter, debug-sider, der indeholdt følsomme oplysninger, og SQL-injektionssårbarheder.
Den primære fejl kom fra ubegrænset internetadgang og modellernes antagelse om, at hvert system, der kunne nås, var en del af den godkendte test.
Anthropic satte cybertest på pause efter gennemgang af hændelserne
Anthropic begyndte at gennemgå evalueringerne og satte al cybersikkerhedstest på pause den 23. juli.
Firmaet identificerede de tre hændelser den 24. juli. Irregular og to berørte organisationer modtog meddelelser den 27. juli.
Anthropic fortsatte med at forsøge at kontakte organisationen involveret i den tredje hændelse.
Ingen af de to organisationer, som Anthropic med succes kontaktede, havde uafhængigt opdaget kompromitteringerne, før de modtog meddelelserne.
Evalueringsmiljøet manglede produktionsbeskyttelser
Testsystemerne brugte ikke de klassifikatorer, overvågningsværktøjer og andre beskyttelsesforanstaltninger, der er inkluderet i offentligt tilgængelige Claude-modeller.
Anthropic sagde, at dets produktionsbeskyttelser sandsynligvis ville have blokeret de handlinger, der blev set under evalueringerne. Det karakteriserede hændelserne primært som fejl i testdesign, infrastruktur, overvågning og tredjepartsovervågning.
Firmaet beskrev ikke hændelserne som bevis på en grundlæggende tilpasningsfejl. I stedet fulgte modellerne evalueringsinstruktionerne, mens de ved en fejl interagerede med ægte mål.
Anthropic planlægger strengere overvågning til fremtidige tests
Anthropic planlægger at udvide udskriftsovervågningen på tværs af fremtidige evalueringer og indføre stærkere undersøgelsesværktøjer.
Det vil også øge overvågningen af tredjepartstestpartnere og gennemgå, hvordan evalueringsmiljøer forbinder til ekstern infrastruktur.
Anthropic diskuterer en uafhængig gennemgang med METR og planlægger at offentliggøre en delvist redigeret udskrift af PyPI-hændelsen.
På trods af sikkerhedsfejlene har Claude Mythos demonstreret stærke evner til at opdage sårbarheder. Microsoft har også anerkendt, at det kæmper med at rette alle de sårbarheder, som Claude Mythos finder, hvilket fremhæver både modellens potentiale inden for sikkerhedsforskning og de risici, der skabes af dårligt isolerede testmiljøer.
Læs siden med affiliate offentliggørelse for at finde ud af, hvordan du kan hjælpe Windows Report ubesværet og uden at bruge nogen penge. Read more
User forum
0 messages