Anthropic siger, at Claude hackede 3 organisationer og offentliggjorde ondsindet PyPI-kode


Claude-modeller slap ud af angiveligt isolerede cybersikkerheds-evalueringsmiljøer og nåede faktiske internetvendte systemer, har Anthropic bekræftet.

Anthropic offentliggjorde tre sikkerhedshændelser, der involverede modeller, som troede, de angreb simulerede mål. En konfigurationsfejl havde efterladt internetadgang aktiveret, så de kunne interagere med virkelige tjenester og organisationer.

Hændelserne følger i kølvandet på det nylige Hugging Face-brud med OpenAI-agenter og rapporter om, at OpenAI-modeller udnyttede zero-day-sårbarheder i JFrog Artifactory under forsøg på at undslippe en sandkasse.

Internetadgangen forblev aktiveret under Claudes sikkerhedstests

Tredjepartsevaluatoren Irregular organiserede testene som capture-the-flag-øvelser. Modellerne fik instruktioner om, at de opererede i isolerede simuleringer.

Testmiljøet kunne dog stadig tilgå det offentlige internet. Når modellerne ikke kunne finde deres tilsigtede simulerede mål, søgte de efter lignende systemer online og behandlede nogle virkelige tjenester som en del af øvelsen.

Anthropic og Irregular identificerede ikke konfigurationsproblemet, før måneder efter den første hændelse. Anthropic oplyste, at det ældste kendte brud fandt sted i april og forblev uopdaget i cirka tre måneder.

Claude Mythos 5 offentliggjorde en ondsindet PyPI-pakke

Under en evaluering fandt Claude Mythos 5 installationsinstruktioner, der henviste til en fiktiv Python-pakke. Pakkenavnet var ikke registreret på Python Package Index.

Modellen indså, at den kunne registrere det ubrugte navn og offentliggøre sin egen kode. Systemer, der fulgte installationsinstruktionerne, kunne derefter automatisk downloade og udføre pakken.

Claude oprettede de nødvendige konti og uploadede en ondsindet pakke til PyPI. Pakken forblev offentligt tilgængelig i cirka en time, før PyPIs automatiske beskyttelsesmekanismer fjernede den.

I den periode downloadede og udførte 15 virkelige systemer koden.

Legitimationsoplysninger fra et sikkerhedsfirma blev stjålet

Et af de berørte systemer tilhørte et cybersikkerhedsfirma, der automatisk downloader og scanner nyudgivne PyPI-pakker.

Den ondsindede pakke indsamlede legitimationsoplysninger fra systemet og sendte dem til en infrastruktur, som Claude havde oprettet. Modellen brugte derefter de stjålne legitimationsoplysninger til at få adgang til yderligere dele af firmaets netværk.

Anthropic oplyste, at Claude ikke havde nogen forudgående viden om organisationen og ikke bevidst udvalgte den som mål. Virksomheden underrettede PyPI og delte indikatorer knyttet til den ondsindede pakke.

Det berørte cybersikkerhedsfirma havde ikke opdaget indtrængningen, før Anthropic kontaktede dem.

Claude Opus 4.7 fik adgang til en produktionsdatabase

En separat evaluering med Claude Opus 4.7 førte til adgang til en virkelig produktionsdatabase.

Det fiktive mål i øvelsen delte navn med en eksisterende virksomhed og et domæne. Efter at Claude ikke kunne nå det simulerede system, fandt den den rigtige organisation online og behandlede den som det tilsigtede mål.

Modellen udtrak applikations- og infrastrukturadgangsoplysninger, før den fik adgang til en database med flere hundrede rækker produktionsinformation.

Anthropic beskrev denne hændelse som mere alvorlig, fordi modellen nåede live forretningssystemer og fik adgang til rigtige data.

Forskningsmodel scannede omkring 9.000 systemer

En endnu ikke frigivet Anthropic-forskningsmodel forårsagede den tredje hændelse.

Efter at det ikke lykkedes at finde det tilsigtede testmål, scannede modellen omkring 9.000 internetforbundne systemer. Den kompromitterede en eksponeret applikation ved hjælp af legitimationsoplysninger vist på en debug-side samt en SQL-injektionssårbarhed.

Modellen fastslog senere, at den kompromitterede applikation tilhørte en uafhængig cloud-konto. Den stoppede derefter angrebet uden menneskelig indgriben.

Anthropic forsøgte stadig at kontakte den berørte organisation, da de offentliggjorde deres resultater.

Modellerne baserede sig på grundlæggende sikkerhedssvagheder

Anthropic oplyste, at hændelserne ikke involverede nye eller tidligere ukendte angrebsteknikker.

Modellerne benyttede sig af almindelige svagheder som eksponerede legitimationsoplysninger, svage adgangskoder, offentligt tilgængelige endepunkter, debug-sider med følsomme oplysninger samt SQL-injektionssårbarheder.

Hovedfejlen skyldtes ubegrænset internetadgang og modellernes antagelse om, at ethvert tilgængeligt system var en del af den autoriserede test.

Anthropic satte cyberafprøvning på pause efter gennemgang af hændelserne

Anthropic påbegyndte gennemgangen af evalueringerne og satte al cybersikkerhedstest på pause den 23. juli.

Virksomheden identificerede de tre hændelser den 24. juli. Irregular og to berørte organisationer modtog underretninger den 27. juli.

Anthropic fortsatte med at forsøge at nå den organisation, der var involveret i den tredje hændelse.

Ingen af de to organisationer, som Anthropic fik kontakt til, havde uafhængigt opdaget kompromitteringerne, før de modtog underretningerne.

Evalueringsmiljøet manglede produktionssikkerhedsforanstaltninger

Testsystemerne anvendte ikke de klassifikatorer, overvågningsværktøjer og andre sikkerhedsmekanismer, der er inkluderet i offentligt tilgængelige Claude-modeller.

Anthropic oplyste, at deres produktionsbeskyttelse sandsynligvis ville have blokeret de handlinger, der blev observeret under evalueringerne. De karakteriserede hændelserne primært som svigt i testedesign, infrastruktur, overvågning og tredjepartstilsyn.

Virksomheden betragtede ikke hændelserne som bevis på et grundlæggende alignment-svigt. I stedet fulgte modellerne evalueringsinstruktionerne, mens de fejlagtigt interagerede med virkelige mål.

Anthropic planlægger strengere overvågning af fremtidige test

Anthropic planlægger at udvide transskriptovervågning på tværs af fremtidige evalueringer og indføre stærkere undersøgelsesværktøjer.

De vil også øge tilsynet med tredjeparts testpartnere og gennemgå, hvordan evalueringsmiljøer forbinder til ekstern infrastruktur.

Anthropic drøfter en uafhængig gennemgang med METR og planlægger at offentliggøre en delvist redigeret transskription af PyPI-hændelsen.

På trods af sikkerhedsfejlene har Claude Mythos demonstreret stærke evner inden for sårbarhedsdetektion. Microsoft har også anerkendt, at de kæmper med at rette alle de sårbarheder, Claude Mythos finder, hvilket understreger både modellens potentiale inden for sikkerhedsforskning og de risici, der opstår ved dårligt isolerede testmiljøer.

Læsere hjælper med at støtte Windows Report. Når du foretager et køb ved at bruge links på vores site, kan vi tjene en affiliate-kommission. Tooltip Icon

Læs siden med affiliate offentliggørelse for at finde ud af, hvordan du kan hjælpe Windows Report ubesværet og uden at bruge nogen penge. Read more

User forum

0 messages