Anthropic siger, at Claude hackede 3 organisationer og offentliggjorde ondsindet PyPI-kode


Claude-modeller slap ud af angiveligt isolerede cybersikkerheds-evalueringsmiljøer og nåede reelle internetvendte systemer, bekræfter Anthropic.

Anthropic offentliggjorde tre sikkerhedshændelser, der involverede modeller, der troede, de angreb simulerede mål. En konfigurationsfejl havde efterladt internetadgangen aktiveret, hvilket tillod dem at interagere med reelle tjenester og organisationer.

Hændelserne følger det nylige Hugging Face-brud, der involverede OpenAI-agenter, og rapporter om, at OpenAI-modeller udnyttede JFrog Artifactory zero-day-sårbarheder, mens de forsøgte at undslippe en sandkasse.

Internetadgang forblev aktiveret under Claudes sikkerhedstests

Tredjeparts evaluatoren Irregular organiserede testene som capture the flag-øvelser. Modellerne modtog instruktioner, der sagde, at de opererede inde i isolerede simulationer.

Dog kunne testmiljøet stadig tilgå det offentlige internet. Da modellerne ikke kunne finde deres tiltænkte simulerede mål, søgte de efter lignende systemer online og behandlede nogle reelle tjenester som en del af øvelsen.

Anthropic og Irregular identificerede ikke konfigurationsproblemet før måneder efter den tidligste hændelse. Anthropic sagde, at det ældste kendte brud fandt sted i april og forblev uopdaget i omkring tre måneder.

Claude Mythos 5 udgav en ondsindet PyPI-pakke

Under en evaluering fandt Claude Mythos 5 opsætningsinstruktioner, der henviste til en fiktiv Python-pakke. Pakkenavnet var ikke registreret på Python Package Index.

Modellen indså, at den kunne registrere det ubrugte navn og udgive sin egen kode. Systemer, der fulgte opsætningsinstruktionerne, kunne derefter automatisk downloade og eksekvere pakken.

Claude oprettede de nødvendige konti og uploadede en ondsindet pakke til PyPI. Pakken forblev offentligt tilgængelig i cirka en time, før PyPIs automatiserede beskyttelser fjernede den.

I den periode downloadede og eksekverede 15 reelle systemer koden.

Sikkerhedsfirmas loginoplysninger blev stjålet

Et af de berørte systemer tilhørte et cybersikkerhedsfirma, der automatisk downloader og scanner nyligt udgivne PyPI-pakker.

Den ondsindede pakke indsamlede loginoplysninger fra systemet og sendte dem til infrastruktur, som Claude havde oprettet. Modellen brugte derefter de stjålne loginoplysninger til at få adgang til yderligere dele af firmaets netværk.

Anthropic sagde, at Claude ikke havde nogen forudgående viden om organisationen og ikke bevidst valgte den som mål. Virksomheden underrettede PyPI og delte indikatorer forbundet med den ondsindede pakke.

Det berørte cybersikkerhedsfirma havde ikke opdaget indtrængningen, før Anthropic kontaktede det.

Claude Opus 4.7 fik adgang til en produktionsdatabase

En separat evaluering, der involverede Claude Opus 4.7, resulterede i adgang til en reel produktionsdatabase.

Det fiktive mål, der blev brugt i øvelsen, delte navn med en eksisterende virksomhed og domæne. Efter at Claude ikke kunne nå det simulerede system, fandt den den reelle organisation online og behandlede den som det tiltænkte mål.

Modellen udtrak applikations- og infrastrukturadgangsoplysninger, før den fik adgang til en database, der indeholdt adskillige hundrede rækker af produktionsinformation.

Anthropic beskrev denne hændelse som mere alvorlig, fordi modellen nåede live forretningssystemer og fik adgang til reelle data.

Forskningsmodel scannede omkring 9.000 systemer

En ikke-udgivet Anthropic-forskningsmodel forårsagede den tredje hændelse.

Efter at den ikke kunne finde det tiltænkte testmål, scannede modellen omkring 9.000 internetforbundne systemer. Den kompromitterede en eksponeret applikation ved hjælp af loginoplysninger vist på en debug-side og en SQL-injektionssårbarhed.

Modellen fastslog senere, at den kompromitterede applikation tilhørte en uafhængig cloud-konto. Den stoppede derefter angrebet uden at kræve menneskelig indgriben.

Anthropic forsøgte stadig at kontakte den berørte organisation, da det offentliggjorde sine resultater.

Modeller stolede på grundlæggende sikkerhedssvagheder

Anthropic sagde, at hændelserne ikke involverede nye eller tidligere ukendte angrebsteknikker.

Modellerne stolede på almindelige svagheder, herunder eksponerede loginoplysninger, svage adgangskoder, offentligt tilgængelige endepunkter, debug-sider, der indeholdt følsomme oplysninger, og SQL-injektionssårbarheder.

Den primære fejl kom fra ubegrænset internetadgang og modellernes antagelse om, at ethvert tilgængeligt system var en del af den autoriserede test.

Anthropic satte cybersikkerhedstests på pause efter gennemgang af hændelserne

Anthropic begyndte at gennemgå evalueringerne og satte alle cybersikkerhedstests på pause den 23. juli.

Virksomheden identificerede de tre hændelser den 24. juli. Irregular og to berørte organisationer modtog underretninger den 27. juli.

Anthropic fortsatte med at forsøge at kontakte den organisation, der var involveret i den tredje hændelse.

Ingen af de to organisationer, som Anthropic med held kontaktede, havde uafhængigt opdaget kompromitteringerne, før de modtog underretningerne.

Evalueringsmiljø manglede produktionsbeskyttelser

Testsystemerne brugte ikke de klassifikatorer, overvågningsværktøjer og andre beskyttelser, der er inkluderet i offentligt tilgængelige Claude-modeller.

Anthropic sagde, at dets produktionsbeskyttelser sandsynligvis ville have blokeret de handlinger, der blev set under evalueringerne. Det karakteriserede hændelserne primært som fejl i testdesign, infrastruktur, overvågning og tredjeparts tilsyn.

Virksomheden beskrev ikke hændelserne som bevis på en grundlæggende alignment-fejl. I stedet fulgte modellerne evalueringsinstruktionerne, mens de fejlagtigt interagerede med reelle mål.

Anthropic planlægger strengere overvågning til fremtidige tests

Anthropic planlægger at udvide transskriptionovervågning på tværs af fremtidige evalueringer og indføre stærkere undersøgelsesværktøjer.

Det vil også øge tilsynet med tredjeparts testpartnere og gennemgå, hvordan evalueringsmiljøer forbinder til ekstern infrastruktur.

Anthropic diskuterer en uafhængig gennemgang med METR og planlægger at offentliggøre en delvist sløret transskription af PyPI-hændelsen.

På trods af sikkerhedsfejlene har Claude Mythos demonstreret stærke evner til sårbarhedsdetektion. Microsoft har også erkendt, at det kæmper med at rette alle de sårbarheder, som Claude Mythos finder, hvilket fremhæver både modellens sikkerhedsforskningspotentiale og de risici, der skabes af dårligt isolerede testmiljøer.

Læsere hjælper med at støtte Windows Report. Når du foretager et køb ved at bruge links på vores site, kan vi tjene en affiliate-kommission. Tooltip Icon

Læs siden med affiliate offentliggørelse for at finde ud af, hvordan du kan hjælpe Windows Report ubesværet og uden at bruge nogen penge. Read more

User forum

0 messages