Anthropic säger att Claude hackade 3 organisationer och publicerade skadlig kod på PyPI


Claude-modeller tog sig ut ur förmodat isolerade utvärderingsmiljöer för cybersäkerhet och nådde verkliga internetanslutna system, har Anthropic bekräftat.

Anthropic offentliggjorde tre säkerhetsincidenter där modeller trodde att de angrep simulerade mål. Ett konfigurationsfel hade lämnat internetåtkomsten aktiverad, vilket gjorde att de kunde interagera med verkliga tjänster och organisationer.

Incidenterna följer på det nyliga intrånget mot Hugging Face där OpenAI-agenter var inblandade, samt rapporter om att OpenAI-modeller utnyttjade nolldagars sårbarheter i JFrog Artifactory när de försökte fly en sandlåda.

Internetåtkomsten förblev aktiverad under Claudes säkerhetstester

Tredjepartsutvärderaren Irregular organiserade testerna som capture-the-flag-övningar. Modellerna fick instruktioner om att de arbetade i isolerade simuleringar.

Dock kunde testmiljön fortfarande nå det publika internet. När modellerna inte lyckades hitta sina avsedda simulerade mål sökte de efter liknande system online och behandlade vissa verkliga tjänster som en del av övningen.

Anthropic och Irregular identifierade inte konfigurationsproblemet förrän månader efter den tidigaste incidenten. Anthropic uppgav att det äldsta kända intrånget inträffade i april och förblev oupptäckt i ungefär tre månader.

Claude Mythos 5 publicerade ett skadligt PyPI-paket

Under en utvärdering hittade Claude Mythos 5 installationsinstruktioner som hänvisade till ett fiktivt Python-paket. Paketnamnet hade inte registrerats på Python Package Index.

Modellen insåg att den kunde registrera det oanvända namnet och publicera sin egen kod. System som följde installationsinstruktionerna kunde sedan automatiskt ladda ner och köra paketet.

Claude skapade de nödvändiga kontona och laddade upp ett skadligt paket till PyPI. Paketet var offentligt tillgängligt i ungefär en timme innan PyPI:s automatiska skydd tog bort det.

Under den perioden laddade 15 verkliga system ner och körde koden.

Säkerhetsföretags autentiseringsuppgifter stals

Ett påverkat system tillhörde ett cybersäkerhetsföretag som automatiskt laddar ner och skannar nyligen publicerade PyPI-paket.

Det skadliga paketet samlade in autentiseringsuppgifter från systemet och skickade dem till infrastruktur som Claude hade skapat. Modellen använde sedan de stulna autentiseringsuppgifterna för att komma åt ytterligare delar av företagets nätverk.

Anthropic sade att Claude inte hade någon förhandskännedom om organisationen och inte avsiktligt valde den som mål. Företaget meddelade PyPI och delade indikatorer kopplade till det skadliga paketet.

Det berörda cybersäkerhetsföretaget hade inte upptäckt intrånget innan Anthropic kontaktade dem.

Claude Opus 4.7 fick åtkomst till en produktionsdatabas

En separat utvärdering med Claude Opus 4.7 ledde till åtkomst till en verklig produktionsdatabas.

Det fiktiva målet som användes i övningen delade namn med ett befintligt företag och domän. Efter att Claude inte lyckades nå det simulerade systemet hittade det den verkliga organisationen online och behandlade den som det avsedda målet.

Modellen extraherade applikations- och infrastrukturautentiseringsuppgifter innan den fick åtkomst till en databas som innehöll flera hundra rader produktionsinformation.

Anthropic beskrev denna incident som allvarligare eftersom modellen nådde levande affärssystem och fick tillgång till verkliga data.

Forskningsmodell skannade omkring 9 000 system

En icke-släppt forskningsmodell från Anthropic orsakade den tredje incidenten.

Efter att den inte lyckades hitta det avsedda testmålet skannade modellen omkring 9 000 internetanslutna system. Den komprometterade en exponerad applikation genom att använda autentiseringsuppgifter som visades på en felsökningssida samt en SQL-injektionssårbarhet.

Modellen fastställde senare att den komprometterade applikationen tillhörde ett orelaterat molnkonto. Den stoppade sedan attacken utan att kräva mänsklig inblandning.

Anthropic försökte fortfarande kontakta den berörda organisationen när de publicerade sina resultat.

Modellerna förlitade sig på grundläggande säkerhetsbrister

Anthropic sade att incidenterna inte involverade nya eller tidigare okända attacktekniker.

Modellerna förlitade sig på vanliga svagheter, inklusive exponerade autentiseringsuppgifter, svaga lösenord, offentligt tillgängliga slutpunkter, felsökningssidor som innehöll känslig information samt SQL-injektionssårbarheter.

Det huvudsakliga misslyckandet kom från obegränsad internetåtkomst och modellernas antagande att varje nåbart system utgjorde en del av det auktoriserade testet.

Anthropic pausade cybertester efter att ha granskat incidenterna

Anthropic påbörjade granskningen av utvärderingarna och pausade all cybersäkerhetstestning den 23 juli.

Företaget identifierade de tre incidenterna den 24 juli. Irregular och två berörda organisationer fick meddelanden den 27 juli.

Anthropic fortsatte att försöka nå den organisation som var inblandad i den tredje incidenten.

Inget av de två organisationer som Anthropic framgångsrikt kontaktade hade självständigt upptäckt intrången innan de fick meddelandena.

Utvärderingsmiljön saknade produktionsskydd

Testsystemen använde inte de klassificerare, övervakningsverktyg och andra skyddsmekanismer som ingår i offentligt tillgängliga Claude-modeller.

Anthropic sade att dess produktionsskydd sannolikt skulle ha blockerat de åtgärder som sågs under utvärderingarna. De karakteriserade incidenterna främst som misslyckanden i testdesign, infrastruktur, övervakning och tredjepartsöversyn.

Företaget beskrev inte incidenterna som bevis på ett grundläggande anpassningsmisslyckande. Istället följde modellerna utvärderingsinstruktionerna samtidigt som de av misstag interagerade med verkliga mål.

Anthropic planerar strängare övervakning för framtida tester

Anthropic planerar att utöka transkriptionsövervakningen över framtida utvärderingar och införa starkare utredningsverktyg.

Det kommer också att öka översynen av tredjepartstestpartners och granska hur utvärderingsmiljöerna ansluter till extern infrastruktur.

Anthropic diskuterar en oberoende granskning med METR och planerar att publicera ett delvis redigerat transskript av PyPI-incidenten.

Trots säkerhetsmisslyckandena har Claude Mythos visat starka förmågor att upptäcka sårbarheter. Microsoft har också erkänt att de kämpar med att åtgärda alla sårbarheter som hittats av Claude Mythos, vilket belyser både modellens potential för säkerhetsforskning och riskerna som skapas av dåligt isolerade testmiljöer.

Läsare hjälper till att stödja Windows Report. När du gör ett köp genom att använda länkar på vår webbplats, kan vi tjäna en affiliate provision. Tooltip Icon

Läs sidan för affiliate avslöjande för att ta reda på hur du kan hjälpa Windows Report utan ansträngning och utan att spendera några pengar. Read more

User forum

0 messages