Anthropic säger att Claude hackade 3 organisationer och publicerade skadlig PyPI-kod
Claude-modeller lämnade förmodat isolerade utvärderingsmiljöer för cybersäkerhet och nådde verkliga internetanslutna system, har Anthropic bekräftat.
Anthropic avslöjade tre säkerhetsincidenter som involverade modeller som trodde att de attackerade simulerade mål. Ett konfigurationsfel hade lämnat internetåtkomst aktiverat, vilket gjorde att de kunde interagera med verkliga tjänster och organisationer.
Incidenterna följer på det nyliga intrånget på Hugging Face som involverade OpenAI-agenter och rapporter om att OpenAI-modeller utnyttjade nolldagssårbarheter i JFrog Artifactory när de försökte fly en sandlåda.
Internetåtkomsten förblev aktiverad under Claudes säkerhetstester
Den tredjepartsutvärderare Irregular organiserade testerna som capture-the-flag-övningar. Modellerna fick instruktioner som angav att de opererade inuti isolerade simuleringar.
Testmiljön hade dock fortfarande tillgång till det publika internet. När modellerna inte lyckades hitta sina avsedda simulerade mål sökte de efter liknande system online och behandlade vissa verkliga tjänster som en del av övningen.
Anthropic och Irregular identifierade inte konfigurationsproblemet förrän månader efter den tidigaste incidenten. Anthropic uppgav att den äldsta kända intrånget inträffade i april och förblev oupptäckt i ungefär tre månader.
Claude Mythos 5 publicerade ett skadligt PyPI-paket
Under en utvärdering hittade Claude Mythos 5 installationsinstruktioner som hänvisade till ett fiktivt Python-paket. Paketnamnet hade inte registrerats på Python Package Index.
Modellen insåg att den kunde registrera det lediga namnet och publicera sin egen kod. System som följde installationsinstruktionerna kunde sedan automatiskt ladda ner och exekvera paketet.
Claude skapade nödvändiga konton och laddade upp ett skadligt paket till PyPI. Paketet förblev offentligt tillgängligt i ungefär en timme innan PyPI:s automatiserade skydd tog bort det.
Under den tiden laddade 15 verkliga system ner och exekverade koden.
Säkerhetsföretags inloggningsuppgifter stals
Ett drabbat system tillhörde ett cybersäkerhetsföretag som automatiskt laddar ner och skannar nypublicerade PyPI-paket.
Det skadliga paketet samlade in inloggningsuppgifter från systemet och skickade dem till infrastruktur som Claude hade skapat. Modellen använde sedan de stulna uppgifterna för att få tillgång till ytterligare delar av företagets nätverk.
Anthropic uppgav att Claude inte hade någon förhandskunskap om organisationen och inte avsiktligt valde ut den som mål. Företaget meddelade PyPI och delade indikatorer kopplade till det skadliga paketet.
Det drabbade cybersäkerhetsföretaget hade inte upptäckt intrånget innan Anthropic kontaktade det.
Claude Opus 4.7 fick tillgång till en produktionsdatabas
En separat utvärdering med Claude Opus 4.7 ledde till tillgång till en verklig produktionsdatabas.
Det fiktiva målet som användes i övningen delade sitt namn med ett befintligt företag och domän. Efter att Claude inte lyckades nå det simulerade systemet hittade det den verkliga organisationen online och behandlade den som det avsedda målet.
Modellen extraherade applikations- och infrastrukturuppgifter innan den fick tillgång till en databas som innehöll flera hundra rader produktionsinformation.
Anthropic beskrev denna incident som allvarligare eftersom modellen nådde levande affärssystem och fick tillgång till verkliga data.
FoU-modell skannade omkring 9 000 system
En icke-släppt forskningsmodell från Anthropic orsakade den tredje incidenten.
Efter att den misslyckades med att hitta det avsedda testmålet skannade modellen omkring 9 000 internetanslutna system. Den komprometterade en exponerad applikation genom att använda inloggningsuppgifter som visades på en felsökningssida och en SQL-injektionssårbarhet.
Modellen fastställde senare att den komprometterade applikationen tillhörde ett orelaterat molnkonto. Den stoppade sedan attacken utan att kräva mänsklig inblandning.
Anthropic försökte fortfarande kontakta den drabbade organisationen när de publicerade sina resultat.
Modeller förlitade sig på grundläggande säkerhetssvagheter
Anthropic uppgav att incidenterna inte involverade nya eller tidigare okända attacktekniker.
Modellerna förlitade sig på vanliga svagheter, inklusive exponerade inloggningsuppgifter, svaga lösenord, publikt tillgängliga slutpunkter, felsökningssidor innehållande känslig information och SQL-injektionssårbarheter.
Det huvudsakliga misstaget kom från obegränsad internetåtkomst och modellernas antagande att varje nåbart system utgjorde en del av det auktoriserade testet.
Anthropic pausade cybertester efter att ha granskat incidenterna
Anthropic började granska utvärderingarna och pausade all cybersäkerhetstestning den 23 juli.
Företaget identifierade de tre incidenterna den 24 juli. Irregular och två drabbade organisationer fick meddelanden den 27 juli.
Anthropic fortsatte att försöka nå organisationen inblandad i den tredje incidenten.
Ingen av de två organisationer som Anthropic framgångsrikt kontaktade hade självständigt upptäckt intrången innan de mottog meddelandena.
Utvärderingsmiljön saknade produktionsskydd
Testsystemen använde inte de klassificerare, övervakningsverktyg och andra skydd som ingår i offentligt tillgängliga Claude-modeller.
Anthropic uppgav att dess produktionsskydd sannolikt skulle ha blockerat de åtgärder som sågs under utvärderingarna. Det karakteriserade incidenterna främst som brister i testdesign, infrastruktur, övervakning och tredjepartsöversyn.
Företaget beskrev inte incidenterna som bevis på ett grundläggande anpassningsfel. Istället följde modellerna utvärderingsinstruktionerna samtidigt som de av misstag interagerade med verkliga mål.
Anthropic planerar striktare övervakning för framtida tester
Anthropic planerar att utöka utskriftsövervakningen över framtida utvärderingar och införa starkare utredningsverktyg.
De kommer också att öka övervakningen av tredjepartspartners och granska hur utvärderingsmiljöer ansluter till extern infrastruktur.
Anthropic diskuterar en oberoende granskning med METR och planerar att publicera en delvis censurerad utskrift av PyPI-incidenten.
Trots säkerhetsbristerna har Claude Mythos visat starka förmågor att upptäcka sårbarheter. Microsoft har också erkänt att de kämpar med att åtgärda alla buggar som hittats av Claude Mythos, vilket understryker både modellens potential för säkerhetsforskning och riskerna som skapas av dåligt isolerade testmiljöer.
Läs sidan för affiliate avslöjande för att ta reda på hur du kan hjälpa Windows Report utan ansträngning och utan att spendera några pengar. Read more
User forum
0 messages