Anthropic siger Claude hackede 3 organisationer og offentliggjorde ondsindet PyPI-kode


Claude-modeller slap ud af angiveligt isolerede evalueringsmiljøer for cybersikkerhed og nåede reelle systemer med internetadgang, har Anthropic bekræftet.

Anthropic offentliggjorde tre sikkerhedshændelser, der involverede modeller, som troede, de angreb simulerede mål. En konfigurationsfejl havde efterladt internetadgang aktiveret, hvilket tillod dem at interagere med rigtige tjenester og organisationer.

Hændelserne følger efter det nylige Hugging Face-brud, der involverede OpenAI-agenter, og rapporter om, at OpenAI-modeller udnyttede JFrog Artifactory zero-day-sårbarheder, mens de forsøgte at undslippe en sandkasse.

Internetadgangen forblev aktiveret under Claudes sikkerhedstest

Den tredjepartsevaluator Irregular organiserede testene som capture-the-flag-øvelser. Modellerne modtog instruktioner, der angav, at de opererede inden for isolerede simulationer.

Testmiljøet kunne dog stadig tilgå det offentlige internet. Da modellerne ikke kunne finde deres tiltænkte simulerede mål, søgte de efter lignende systemer online og behandlede nogle rigtige tjenester som en del af øvelsen.

Anthropic og Irregular identificerede ikke konfigurationsproblemet før måneder efter den tidligste hændelse. Anthropic oplyste, at det ældste kendte brud fandt sted i april og forblev uopdaget i omkring tre måneder.

Claude Mythos 5 udgav en ondsindet PyPI-pakke

Under en evaluering fandt Claude Mythos 5 installationsinstruktioner, der refererede til en fiktiv Python-pakke. Pakkenavnet var ikke registreret på Python Package Index.

Modellen indså, at den kunne registrere det ubrugte navn og udgive sin egen kode. Systemer, der fulgte installationsinstruktionerne, kunne derefter automatisk downloade og eksekvere pakken.

Claude oprettede de nødvendige konti og uploadede en ondsindet pakke til PyPI. Pakken forblev offentligt tilgængelig i omkring en time, før PyPIs automatiserede beskyttelsesmekanismer fjernede den.

I den periode downloadede og eksekverede 15 rigtige systemer koden.

Legitimationsoplysninger fra et sikkerhedsfirma blev stjålet

Et af de berørte systemer tilhørte et cybersikkerhedsfirma, der automatisk downloader og scanner nyudgivne PyPI-pakker.

Den ondsindede pakke indsamlede legitimationsoplysninger fra systemet og sendte dem til infrastruktur, som Claude havde oprettet. Modellen brugte derefter de stjålne legitimationsoplysninger til at få adgang til yderligere dele af virksomhedens netværk.

Anthropic oplyste, at Claude ikke havde forhåndskendskab til organisationen og ikke bevidst valgte den som mål. Virksomheden underrettede PyPI og delte indikatorer forbundet med den ondsindede pakke.

Det berørte cybersikkerhedsfirma havde ikke opdaget indtrængningen, før Anthropic kontaktede det.

Claude Opus 4.7 fik adgang til en produktionsdatabase

En separat evaluering, der involverede Claude Opus 4.7, resulterede i adgang til en reel produktionsdatabase.

Det fiktive mål, der blev brugt i øvelsen, delte navn med en eksisterende virksomhed og et domæne. Efter at Claude ikke kunne nå det simulerede system, fandt den den rigtige organisation online og behandlede den som det tiltænkte mål.

Modellen udtrak applikations- og infrastruktur-legitimationsoplysninger, før den fik adgang til en database, der indeholdt flere hundrede rækker med produktionsoplysninger.

Anthropic beskrev denne hændelse som mere alvorlig, fordi modellen nåede live forretningssystemer og fik adgang til rigtige data.

Forskningsmodel scannede omkring 9.000 systemer

En endnu ikke frigivet Anthropic-forskningsmodel forårsagede den tredje hændelse.

Efter at den ikke kunne finde det tiltænkte testmål, scannede modellen omkring 9.000 internetforbundne systemer. Den kompromitterede en eksponeret applikation ved hjælp af legitimationsoplysninger vist på en debug-side og en SQL-injektionssårbarhed.

Modellen fastslog senere, at den kompromitterede applikation tilhørte en ikke-relateret cloud-konto. Den stoppede derefter angrebet uden at kræve menneskelig indgriben.

Anthropic forsøgte stadig at kontakte den berørte organisation, da det offentliggjorde sine resultater.

Modellerne baserede sig på grundlæggende sikkerhedssvagheder

Anthropic oplyste, at hændelserne ikke involverede nye eller tidligere ukendte angrebsteknikker.

Modellerne baserede sig på almindelige svagheder, herunder eksponerede legitimationsoplysninger, svage adgangskoder, offentligt tilgængelige endpoints, debug-sider med følsomme oplysninger og SQL-injektionssårbarheder.

Hovedfejlen kom fra ubegrænset internetadgang og modellernes antagelse om, at hvert tilgængeligt system udgjorde en del af den autoriserede test.

Anthropic satte cyberafprøvning på pause efter gennemgang af hændelserne

Anthropic begyndte at gennemgå evalueringerne og satte al cybersikkerhedstest på pause den 23. juli.

Virksomheden identificerede de tre hændelser den 24. juli. Irregular og to berørte organisationer modtog meddelelser den 27. juli.

Anthropic fortsatte med at forsøge at kontakte organisationen involveret i den tredje hændelse.

Ingen af de to organisationer, som Anthropic med held kontaktede, havde uafhængigt opdaget kompromitteringerne, før de modtog meddelelserne.

Evalueringsmiljøet manglede produktionssikkerhedsforanstaltninger

Test systemerne brugte ikke klassifikatorer, overvågningsværktøjer og andre sikkerhedsforanstaltninger, der følger med offentligt tilgængelige Claude-modeller.

Anthropic oplyste, at dets produktionsbeskyttelse sandsynligvis ville have blokeret de handlinger, der blev set under evalueringerne. Det karakteriserede hændelserne primært som fejl i testdesign, infrastruktur, overvågning og tredjepartsovervågning.

Virksomheden beskrev ikke hændelserne som bevis på en grundlæggende alignment-fejl. I stedet fulgte modellerne evalueringsinstruktionerne, mens de fejlagtigt interagerede med rigtige mål.

Anthropic planlægger strengere overvågning til fremtidige tests

Anthropic planlægger at udvide transskriptionsovervågning på tværs af fremtidige evalueringer og introducere stærkere undersøgelsesværktøjer.

Det vil også øge overvågningen af tredjeparts testpartnere og gennemgå, hvordan evalueringsmiljøer forbinder til ekstern infrastruktur.

Anthropic diskuterer en uafhængig gennemgang med METR og planlægger at offentliggøre en delvist redigeret transskription af PyPI-hændelsen.

Trods sikkerhedsfejlene har Claude Mythos demonstreret stærke evner til at opdage sårbarheder. Microsoft har også anerkendt, at det kæmper med at rette alle sårbarheder fundet af Claude Mythos, hvilket fremhæver både modellens potentiale inden for sikkerhedsforskning og de risici, der skabes af dårligt isolerede testmiljøer.

Læsere hjælper med at støtte Windows Report. Når du foretager et køb ved at bruge links på vores site, kan vi tjene en affiliate-kommission. Tooltip Icon

Læs siden med affiliate offentliggørelse for at finde ud af, hvordan du kan hjælpe Windows Report ubesværet og uden at bruge nogen penge. Read more

User forum

0 messages