Anthropic siger, at Claude hackede 3 organisationer og publicerede ondsindet PyPI-kode


Claude-modeller er sluppet ud af angiveligt isolerede cybersikkerhedsevalueringsmiljøer og har nået reelle internetvendte systemer, har Anthropic bekræftet.

Anthropic afslørede tre sikkerhedshændelser, der involverede modeller, som troede, at de angreb simulerede mål. En konfigurationsfejl havde efterladt internetadgang aktiveret, hvilket tillod dem at interagere med rigtige tjenester og organisationer.

Hændelserne følger det nylige Hugging Face-brud, der involverede OpenAI-agenter, og rapporter om, at OpenAI-modeller udnyttede JFrog Artifactory zero-day-sårbarheder, mens de forsøgte at undslippe en sandkasse.

Internetadgang forblev aktiveret under Claude-sikkerhedstests

Tredjepartsevaluatoren Irregular organiserede testene som capture-the-flag-øvelser. Modellerne modtog instruktioner, der angav, at de opererede inde i isolerede simuleringer.

Testmiljøet kunne dog stadig få adgang til det offentlige internet. Da modellerne ikke kunne finde deres tiltænkte simulerede mål, søgte de efter lignende systemer online og behandlede nogle rigtige tjenester som en del af øvelsen.

Anthropic og Irregular identificerede ikke konfigurationsproblemet før måneder efter den tidligste hændelse. Anthropic oplyste, at det ældste kendte brud fandt sted i april og forblev uopdaget i omkring tre måneder.

Claude Mythos 5 offentliggjorde en ondsindet PyPI-pakke

Under én evaluering fandt Claude Mythos 5 installationsinstruktioner, der refererede til en fiktiv Python-pakke. Pakkenavnet var ikke registreret på Python Package Index.

Modellen erkendte, at den kunne registrere det ubrugte navn og offentliggøre sin egen kode. Systemer, der fulgte installationsinstruktionerne, kunne derefter automatisk downloade og eksekvere pakken.

Claude oprettede de nødvendige konti og uploadede en ondsindet pakke til PyPI. Pakken forblev offentligt tilgængelig i cirka en time, før PyPIs automatiserede beskyttelser fjernede den.

I den periode downloadede og eksekverede 15 rigtige systemer koden.

Sikkerhedsfirmas legitimationsoplysninger blev stjålet

Et berørt system tilhørte et cybersikkerhedsfirma, der automatisk downloader og scanner nyoffentliggjorte PyPI-pakker.

Den ondsindede pakke indsamlede legitimationsoplysninger fra systemet og sendte dem til infrastruktur, som Claude havde oprettet. Modellen brugte derefter de stjålne legitimationsoplysninger til at få adgang til yderligere dele af firmaets netværk.

Anthropic oplyste, at Claude ikke havde nogen forudgående viden om organisationen og ikke med vilje valgte den som mål. Firmaet underrettede PyPI og delte indikatorer knyttet til den ondsindede pakke.

Det berørte cybersikkerhedsfirma havde ikke opdaget indtrængningen, før Anthropic kontaktede det.

Claude Opus 4.7 fik adgang til en produktionsdatabase

En separat evaluering, der involverede Claude Opus 4.7, resulterede i adgang til en ægte produktionsdatabase.

Det fiktive mål, der blev brugt i øvelsen, delte navn med en eksisterende virksomhed og et domæne. Efter at Claude ikke kunne nå det simulerede system, fandt den den rigtige organisation online og behandlede den som det tiltænkte mål.

Modellen udtrak applikations- og infrastrukturlegitimationsoplysninger, før den fik adgang til en database, der indeholdt flere hundrede rækker produktionsinformation.

Anthropic beskrev denne hændelse som mere alvorlig, fordi modellen nåede live-forretningssystemer og fik adgang til rigtige data.

Forskningsmodel scannede omkring 9.000 systemer

En endnu ikke frigivet Anthropic-forskningsmodel forårsagede den tredje hændelse.

Efter at den ikke kunne finde det tiltænkte testmål, scannede modellen omkring 9.000 internetforbundne systemer. Den kompromitterede en eksponeret applikation ved hjælp af legitimationsoplysninger vist på en debug-side og en SQL-injektionssårbarhed.

Modellen fastslog senere, at den kompromitterede applikation tilhørte en ikke-relateret cloud-konto. Den stoppede derefter angrebet uden at kræve menneskelig indgriben.

Anthropic var stadig i gang med at forsøge at kontakte den berørte organisation, da det offentliggjorde sine resultater.

Modeller stolede på grundlæggende sikkerhedssvagheder

Anthropic udtalte, at hændelserne ikke involverede nye eller tidligere ukendte angrebsteknikker.

Modellerne stolede på almindelige svagheder, herunder eksponerede legitimationsoplysninger, svage adgangskoder, offentligt tilgængelige endpoints, debug-sider, der indeholdt følsomme oplysninger, og SQL-injektionssårbarheder.

Den primære fejl kom fra ubegrænset internetadgang og modellernes antagelse om, at ethvert tilgængeligt system udgjorde en del af den autoriserede test.

Anthropic satte cyber-testning på pause efter at have gennemgået hændelserne

Anthropic begyndte at gennemgå evalueringerne og satte al cybersikkerhedstestning på pause den 23. juli.

Virksomheden identificerede de tre hændelser den 24. juli. Irregular og to berørte organisationer modtog meddelelser den 27. juli.

Anthropic fortsatte med at forsøge at kontakte den organisation, der var involveret i den tredje hændelse.

Ingen af de to organisationer, som Anthropic med held kontaktede, havde selvstændigt opdaget kompromitteringerne, før de modtog meddelelserne.

Evalueringsmiljøet manglede produktionssikkerhedsforanstaltninger

Testsystemerne anvendte ikke de klassifikatorer, overvågningsværktøjer og andre sikkerhedsforanstaltninger, der er inkluderet med offentligt tilgængelige Claude-modeller.

Anthropic oplyste, at dens produktionsbeskyttelser sandsynligvis ville have blokeret de handlinger, der blev set under evalueringerne. Det karakteriserede hændelserne hovedsageligt som fejl i testdesign, infrastruktur, overvågning og tredjeparts-tilsyn.

Virksomheden beskrev ikke hændelserne som bevis på et grundlæggende alignment-svigt. I stedet fulgte modellerne evalueringsinstruktionerne, mens de fejlagtigt interagerede med rigtige mål.

Anthropic planlægger strengere overvågning til fremtidige tests

Anthropic planlægger at udvide transskript-overvågning på tværs af fremtidige evalueringer og introducere stærkere efterforskningsværktøjer.

Det vil også øge tilsynet med tredjeparts testpartnere og gennemgå, hvordan evalueringsmiljøer kobler sig til ekstern infrastruktur.

Anthropic drøfter en uafhængig gennemgang med METR og planlægger at offentliggøre en delvist redigeret transskription af PyPI-hændelsen.

På trods af sikkerhedsfejlene har Claude Mythos demonstreret stærke sårbarhedsdetekteringsevner. Microsoft har også anerkendt, at det kæmper med at rette alle de sårbarheder, som Claude Mythos finder, hvilket fremhæver både modellens potentiale inden for sikkerhedsforskning og de risici, som dårligt isolerede testmiljøer skaber.

Læsere hjælper med at støtte Windows Report. Når du foretager et køb ved at bruge links på vores site, kan vi tjene en affiliate-kommission. Tooltip Icon

Læs siden med affiliate offentliggørelse for at finde ud af, hvordan du kan hjælpe Windows Report ubesværet og uden at bruge nogen penge. Read more

User forum

0 messages