Anthropic säger att Claude hackade 3 organisationer och publicerade skadlig PyPI-kod


Anthropic har bekräftat att Claude-modeller lämnade till synes isolerade cybersäkerhetsutvärderingsmiljöer och nådde riktiga system anslutna till internet.

Anthropic offentliggjorde tre säkerhetsincidenter som involverade modeller som trodde att de angrep simulerade mål. Ett konfigurationsfel hade lämnat internetåtkomsten aktiverad, vilket gjorde det möjligt för dem att interagera med verkliga tjänster och organisationer.

Incidenterna följer på det senaste intrånget hos Hugging Face som involverade OpenAI-agenter och rapporter om att OpenAI-modeller utnyttjade zero-day-sårbarheter i JFrog Artifactory när de försökte fly från en sandlåda.

Internetåtkomsten förblev aktiverad under Claudes säkerhetstester

Tredjepartsutvärderaren Irregular organiserade testerna som capture-the-flag-övningar. Modellerna fick instruktioner om att de kördes i isolerade simuleringar.

Testmiljön kunde dock fortfarande nå det publika internet. När modellerna inte hittade sina avsedda simulerade mål sökte de efter liknande system online och behandlade vissa verkliga tjänster som en del av övningen.

Anthropic och Irregular identifierade inte konfigurationsproblemet förrän flera månader efter den tidigaste incidenten. Anthropic uppgav att det äldsta kända intrånget inträffade i april och förblev oupptäckt i cirka tre månader.

Claude Mythos 5 publicerade ett skadligt PyPI-paket

Under en utvärdering hittade Claude Mythos 5 installationsanvisningar som hänvisade till ett fiktivt Python-paket. Paketnamnet hade inte registrerats på Python Package Index.

Modellen insåg att den kunde registrera det oanvända namnet och publicera sin egen kod. System som följde installationsanvisningarna kunde sedan automatiskt ladda ner och köra paketet.

Claude skapade nödvändiga konton och laddade upp ett skadligt paket till PyPI. Paketet förblev offentligt tillgängligt i ungefär en timme innan PyPI:s automatiserade skyddsmekanismer tog bort det.

Under den perioden laddade 15 verkliga system ner och körde koden.

Ett säkerhetsföretags inloggningsuppgifter stals

Ett drabbat system tillhörde ett cybersäkerhetsföretag som automatiskt laddar ner och skannar nyligen publicerade PyPI-paket.

Det skadliga paketet samlade in inloggningsuppgifter från systemet och skickade dem till infrastruktur som Claude hade skapat. Modellen använde sedan de stulna inloggningsuppgifterna för att komma åt ytterligare delar av företagets nätverk.

Anthropic uppgav att Claude inte hade någon förhandskännedom om organisationen och inte avsiktligt valde ut den som mål. Företaget meddelade PyPI och delade indikatorer kopplade till det skadliga paketet.

Det drabbade cybersäkerhetsföretaget hade inte upptäckt intrånget innan Anthropic kontaktade dem.

Claude Opus 4.7 fick åtkomst till en produktionsdatabas

En separat utvärdering med Claude Opus 4.7 ledde till åtkomst till en verklig produktionsdatabas.

Det fiktiva mål som användes i övningen hade samma namn som ett befintligt företag och domän. Efter att Claude misslyckats med att nå det simulerade systemet hittade den den riktiga organisationen online och behandlade den som det avsedda målet.

Modellen extraherade applikations- och infrastrukturinloggningsuppgifter innan den fick åtkomst till en databas innehållande flera hundra rader produktionsinformation.

Anthropic beskrev denna incident som allvarligare eftersom modellen nådde skarpa affärssystem och kom åt riktiga data.

Forskningsmodell skannade cirka 9 000 system

En icke offentliggjord Anthropic-forskningsmodell orsakade den tredje incidenten.

Efter att den misslyckats med att lokalisera det avsedda testmålet skannade modellen cirka 9 000 internetanslutna system. Den äventyrade en exponerad applikation med hjälp av inloggningsuppgifter som visades på en felsökningssida och en SQL-injektionssårbarhet.

Modellen kom senare fram till att den äventyrade applikationen tillhörde ett orelaterat molnkonto. Den stoppade sedan attacken utan att kräva mänskligt ingripande.

Anthropic försökte fortfarande kontakta den drabbade organisationen när de publicerade sina resultat.

Modeller förlitade sig på grundläggande säkerhetsbrister

Anthropic uppgav att incidenterna inte involverade nya eller tidigare okända attacktekniker.

Modellerna förlitade sig på vanliga brister, inklusive exponerade inloggningsuppgifter, svaga lösenord, offentligt tillgängliga ändpunkter, felsökningssidor som innehöll känslig information och SQL-injektionssårbarheter.

Det huvudsakliga felet kom från obegränsad internetåtkomst och modellernas antagande att varje nåbart system utgjorde en del av det auktoriserade testet.

Anthropic pausade cybertester efter granskning av incidenterna

Anthropic började granska utvärderingarna och pausade all cybersäkerhetstestning den 23 juli.

Företaget identifierade de tre incidenterna den 24 juli. Irregular och två drabbade organisationer fick meddelanden den 27 juli.

Anthropic fortsatte att försöka nå den organisation som var inblandad i den tredje incidenten.

Ingen av de två organisationer som Anthropic framgångsrikt kontaktade hade självständigt upptäckt intrången innan de fick meddelandena.

Utvärderingsmiljön saknade produktionsskyddsmekanismer

Testsystemen använde inte de klassificerare, övervakningsverktyg och andra skyddsmekanismer som ingår i offentligt tillgängliga Claude-modeller.

Anthropic uppgav att dess produktionsskydd sannolikt skulle ha blockerat de åtgärder som sågs under utvärderingarna. De karakteriserade incidenterna främst som misslyckanden i testdesign, infrastruktur, övervakning och tredjepartsövervakning.

Företaget beskrev inte incidenterna som bevis på ett grundläggande anpassningsfel. Istället följde modellerna utvärderingsinstruktionerna samtidigt som de av misstag interagerade med verkliga mål.

Anthropic planerar striktare övervakning för framtida tester

Anthropic planerar att utöka transkriptionsövervakning över framtida utvärderingar och införa starkare utredningsverktyg.

De kommer också att öka övervakningen av tredjepartstestpartners och granska hur utvärderingsmiljöer ansluter till extern infrastruktur.

Anthropic diskuterar en oberoende granskning med METR och planerar att publicera en delvis censurerad transkription av PyPI-incidenten.

Trots säkerhetsmisslyckandena har Claude Mythos visat starka förmågor att upptäcka sårbarheter. Microsoft har också erkänt att de kämpar med att åtgärda alla sårbarheter som hittats av Claude Mythos, vilket understryker både modellens potential inom säkerhetsforskning och de risker som skapas av bristfälligt isolerade testmiljöer.

Läsare hjälper till att stödja Windows Report. När du gör ett köp genom att använda länkar på vår webbplats, kan vi tjäna en affiliate provision. Tooltip Icon

Läs sidan för affiliate avslöjande för att ta reda på hur du kan hjälpa Windows Report utan ansträngning och utan att spendera några pengar. Read more

User forum

0 messages