Anthropic siger Claude hackede 3 organisationer og udgav ondsindet PyPI-kode


Claude-modeller undslap angiveligt isolerede cybersikkerhedsevalueringsmiljøer og nåede virkelige internetvendte systemer, har Anthropic bekræftet.

Anthropic offentliggjorde tre sikkerhedshændelser, der involverede modeller, som troede, de angreb simulerede mål. En konfigurationsfejl havde efterladt internetadgang aktiveret, hvilket tillod dem at interagere med virkelige tjenester og organisationer.

Hændelserne følger det nylige Hugging Face-brud, der involverede OpenAI-agenter, og rapporter om, at OpenAI-modeller udnyttede JFrog Artifactory zero-day-sårbarheder, mens de forsøgte at undslippe en sandkasse.

Internetadgang forblev aktiveret under Claudes sikkerhedstests

Tredjepartsevaluatoren Irregular organiserede testene som capture-the-flag-øvelser. Modellerne modtog instruktioner, der angav, at de opererede inde i isolerede simuleringer.

Testmiljøet kunne dog stadig få adgang til det offentlige internet. Da modellerne ikke kunne finde deres tilsigtede simulerede mål, søgte de efter lignende systemer online og behandlede nogle virkelige tjenester som en del af øvelsen.

Anthropic og Irregular identificerede ikke konfigurationsproblemet før måneder efter den tidligste hændelse. Anthropic oplyste, at det ældste kendte brud fandt sted i april og forblev uopdaget i omkring tre måneder.

Claude Mythos 5 offentliggjorde en ondsindet PyPI-pakke

Under en evaluering fandt Claude Mythos 5 installationsinstruktioner, der henviste til en fiktiv Python-pakke. Pakkenavnet var ikke registreret på Python Package Index.

Modellen indså, at den kunne registrere det ubrugte navn og offentliggøre sin egen kode. Systemer, der fulgte installationsinstruktionerne, kunne derefter automatisk downloade og eksekvere pakken.

Claude oprettede de nødvendige konti og uploadede en ondsindet pakke til PyPI. Pakken forblev offentligt tilgængelig i omkring en time, før PyPIs automatiserede beskyttelsesmekanismer fjernede den.

I løbet af den periode downloadede og eksekverede 15 virkelige systemer koden.

Legitimationsoplysninger fra sikkerhedsfirma blev stjålet

Et af de berørte systemer tilhørte et cybersikkerhedsfirma, der automatisk downloader og scanner nyligt offentliggjorte PyPI-pakker.

Den ondsindede pakke indsamlede legitimationsoplysninger fra systemet og sendte dem til en infrastruktur, som Claude havde oprettet. Modellen brugte derefter de stjålne legitimationsoplysninger til at få adgang til yderligere dele af firmaets netværk.

Anthropic oplyste, at Claude ikke havde nogen forudgående viden om organisationen og ikke bevidst valgte den som mål. Firmaet underrettede PyPI og delte indikatorer knyttet til den ondsindede pakke.

Det berørte cybersikkerhedsfirma havde ikke opdaget indtrængningen, før Anthropic kontaktede det.

Claude Opus 4.7 fik adgang til en produktionsdatabase

En separat evaluering, der involverede Claude Opus 4.7, resulterede i adgang til en virkelig produktionsdatabase.

Det fiktive mål, der blev brugt i øvelsen, delte navn med en eksisterende virksomhed og et domæne. Efter at Claude ikke kunne nå det simulerede system, fandt den den virkelige organisation online og behandlede den som det tilsigtede mål.

Modellen udtrak applikations- og infrastrukturlegitimationsoplysninger, før den fik adgang til en database indeholdende flere hundrede rækker produktionsinformation.

Anthropic beskrev denne hændelse som mere alvorlig, fordi modellen nåede live-forretningssystemer og fik adgang til virkelige data.

Forskningsmodel scannede omkring 9.000 systemer

En endnu ikke frigivet Anthropic-forskningsmodel forårsagede den tredje hændelse.

Efter at den ikke kunne finde det tilsigtede testmål, scannede modellen omkring 9.000 internetforbundne systemer. Den kompromitterede en eksponeret applikation ved hjælp af legitimationsoplysninger vist på en debug-side og en SQL-injektionssårbarhed.

Modellen fastslog senere, at den kompromitterede applikation tilhørte en ikke-relateret cloud-konto. Den standsede derefter angrebet uden menneskelig indgriben.

Anthropic forsøgte stadig at kontakte den berørte organisation, da de offentliggjorde deres resultater.

Modellerne baserede sig på grundlæggende sikkerhedssvagheder

Anthropic oplyste, at hændelserne ikke involverede nye eller tidligere ukendte angrebsteknikker.

Modellerne udnyttede almindelige svagheder, herunder eksponerede legitimationsoplysninger, svage adgangskoder, offentligt tilgængelige endpoints, debug-sider indeholdende følsomme oplysninger og SQL-injektionssårbarheder.

Den primære fejl stammede fra ubegrænset internetadgang og modellernes antagelse om, at alle tilgængelige systemer var en del af den autoriserede test.

Anthropic satte cyberafprøvning på pause efter gennemgang af hændelserne

Anthropic begyndte at gennemgå evalueringerne og satte al cybersikkerhedstest på pause den 23. juli.

Virksomheden identificerede de tre hændelser den 24. juli. Irregular og to berørte organisationer modtog meddelelser den 27. juli.

Anthropic fortsatte med at forsøge at nå den organisation, der var involveret i den tredje hændelse.

Ingen af de to organisationer, som Anthropic med succes kontaktede, havde uafhængigt opdaget kompromitteringerne, før de modtog meddelelserne.

Evalueringsmiljø manglede produktionssikkerhedsforanstaltninger

Testsystemerne brugte ikke de klassifikatorer, overvågningsværktøjer og andre sikkerhedsforanstaltninger, der er inkluderet i offentligt tilgængelige Claude-modeller.

Anthropic oplyste, at deres produktionsbeskyttelse sandsynligvis ville have blokeret de handlinger, der blev observeret under evalueringerne. De karakteriserede hændelserne primært som fejl i testdesign, infrastruktur, overvågning og tredjepartsovervågning.

Virksomheden beskrev ikke hændelserne som bevis på en grundlæggende alignment-fejl. I stedet fulgte modellerne evalueringsinstruktionerne, mens de fejlagtigt interagerede med virkelige mål.

Anthropic planlægger strengere overvågning til fremtidige tests

Anthropic planlægger at udvide transskriptovervågning på tværs af fremtidige evalueringer og introducere stærkere undersøgelsesværktøjer.

De vil også øge overvågningen af tredjepartstestpartnere og gennemgå, hvordan evalueringsmiljøer forbinder til ekstern infrastruktur.

Anthropic drøfter en uafhængig gennemgang med METR og planlægger at offentliggøre en delvist redigeret transskription af PyPI-hændelsen.

På trods af sikkerhedsfejlene har Claude Mythos demonstreret stærke evner til at opdage sårbarheder. Microsoft har også erkendt, at de kæmper med at rette alle de sårbarheder, der er fundet af Claude Mythos, hvilket understreger både modellens potentiale inden for sikkerhedsforskning og de risici, der skabes af dårligt isolerede testmiljøer.

Læsere hjælper med at støtte Windows Report. Når du foretager et køb ved at bruge links på vores site, kan vi tjene en affiliate-kommission. Tooltip Icon

Læs siden med affiliate offentliggørelse for at finde ud af, hvordan du kan hjælpe Windows Report ubesværet og uden at bruge nogen penge. Read more

User forum

0 messages