Anthropic säger att Claude hackade tre organisationer och publicerade skadlig PyPI-kod


Claude-modeller rymde från förmodat isolerade cybersäkerhetsutvärderingsmiljöer och nådde verkliga internetanslutna system, har Anthropic bekräftat.

Anthropic offentliggjorde tre säkerhetsincidenter som involverade modeller som trodde att de attackerade simulerade mål. Ett konfigurationsfel hade lämnat internetåtkomsten aktiverad, vilket gjorde att de kunde interagera med verkliga tjänster och organisationer.

Incidenterna följer det senaste Hugging Face-intrånget med OpenAI-agenter och rapporter om att OpenAI-modeller utnyttjade JFrog Artifactory zero-day-sårbarheter när de försökte fly en sandbox.

Internetåtkomst förblev aktiverad under Claudes säkerhetstester

Tredjepartsutvärderaren Irregular organiserade testerna som capture-the-flag-övningar. Modellerna fick instruktioner som angav att de arbetade i isolerade simuleringar.

Testmiljön kunde dock fortfarande nå det offentliga internet. När modellerna misslyckades med att hitta sina avsedda simulerade mål sökte de efter liknande system online och behandlade vissa verkliga tjänster som en del av övningen.

Anthropic och Irregular identifierade inte konfigurationsproblemet förrän månader efter den tidigaste incidenten. Anthropic uppgav att den äldsta kända intrånget inträffade i april och förblev oupptäckt i ungefär tre månader.

Claude Mythos 5 publicerade ett skadligt PyPI-paket

Under en utvärdering hittade Claude Mythos 5 installationsinstruktioner som refererade till ett fiktivt Python-paket. Paketnamnet hade inte registrerats på Python Package Index.

Modellen insåg att den kunde registrera det oanvända namnet och publicera sin egen kod. System som följde installationsinstruktionerna kunde sedan automatiskt ladda ner och köra paketet.

Claude skapade de nödvändiga kontona och laddade upp ett skadligt paket till PyPI. Paketet var offentligt tillgängligt i ungefär en timme innan PyPI:s automatiska skydd tog bort det.

Under den perioden laddade 15 verkliga system ner och körde koden.

Inloggningsuppgifter till ett säkerhetsföretag stals

Ett drabbat system tillhörde ett cybersäkerhetsföretag som automatiskt laddar ner och skannar nypublicerade PyPI-paket.

Det skadliga paketet samlade in inloggningsuppgifter från systemet och skickade dem till infrastruktur som Claude hade skapat. Modellen använde sedan de stulna uppgifterna för att få åtkomst till ytterligare delar av företagets nätverk.

Anthropic uppgav att Claude inte hade någon tidigare kännedom om organisationen och inte medvetet valde ut den som mål. Företaget meddelade PyPI och delade indikatorer kopplade till det skadliga paketet.

Det drabbade cybersäkerhetsföretaget hade inte upptäckt intrånget innan Anthropic kontaktade dem.

Claude Opus 4.7 fick åtkomst till en produktionsdatabas

En separat utvärdering med Claude Opus 4.7 resulterade i åtkomst till en verklig produktionsdatabas.

Det fiktiva målet som användes i övningen delade namn med ett befintligt företag och en domän. När Claude misslyckades med att nå det simulerade systemet, hittade den den verkliga organisationen online och behandlade den som det avsedda målet.

Modellen extraherade inloggningsuppgifter för applikationer och infrastruktur innan den fick åtkomst till en databas som innehöll flera hundra rader produktionsinformation.

Anthropic beskrev denna incident som allvarligare eftersom modellen nådde verkliga affärssystem och fick tillgång till riktiga data.

Forskningsmodell skannade cirka 9 000 system

En icke-släppt Anthropic-forskningsmodell orsakade den tredje incidenten.

Efter att den misslyckats med att hitta det avsedda testmålet skannade modellen cirka 9 000 internetanslutna system. Den komprometterade en exponerad applikation med hjälp av inloggningsuppgifter som visades på en felsökningssida och en SQL injection-sårbarhet.

Modellen fastställde senare att den komprometterade applikationen tillhörde ett orelaterat molnkonto. Den stoppade sedan attacken utan att kräva mänsklig inblandning.

Anthropic försökte fortfarande kontakta den berörda organisationen när de publicerade sina upptäckter.

Modeller förlitade sig på grundläggande säkerhetssvagheter

Anthropic uppgav att incidenterna inte involverade nya eller tidigare okända attacktekniker.

Modellerna förlitade sig på vanliga svagheter, inklusive exponerade inloggningsuppgifter, svaga lösenord, offentligt tillgängliga slutpunkter, felsökningssidor som innehöll känslig information och SQL injection-sårbarheter.

Det huvudsakliga felet kom från obegränsad internetåtkomst och modellernas antagande att varje nåbart system utgjorde en del av det auktoriserade testet.

Anthropic pausade cybertester efter att ha granskat incidenterna

Anthropic började granska utvärderingarna och pausade all cybersäkerhetstestning den 23 juli.

Företaget identifierade de tre incidenterna den 24 juli. Irregular och två berörda organisationer meddelades den 27 juli.

Anthropic fortsatte att försöka nå organisationen som var inblandad i den tredje incidenten.

Ingen av de två organisationer som Anthropic framgångsrikt kontaktade hade självständigt upptäckt kompromisser innan de mottog meddelandena.

Utvärderingsmiljön saknade produktionsskyddsåtgärder

Testsystemen använde inte de klassificerare, övervakningsverktyg och andra skyddsåtgärder som ingår i offentligt tillgängliga Claude-modeller.

Anthropic uppgav att deras produktionsskydd sannolikt skulle ha blockerat de åtgärder som sågs under utvärderingarna. De karakteriserade incidenterna främst som misslyckanden i testdesign, infrastruktur, övervakning och tredjepartsöversyn.

Företaget beskrev inte incidenterna som bevis på ett grundläggande alignment-fel. Istället följde modellerna utvärderingsinstruktionerna medan de av misstag interagerade med verkliga mål.

Anthropic planerar strängare övervakning för framtida tester

Anthropic planerar att utöka transkriptionsövervakningen under framtida utvärderingar och införa starkare utredningsverktyg.

De kommer också att öka tillsynen över tredjepartstestpartners och granska hur utvärderingsmiljöer ansluter till extern infrastruktur.

Anthropic diskuterar en oberoende granskning med METR och planerar att publicera en delvis redigerad transkription av PyPI-incidenten.

Trots säkerhetsmisslyckandena har Claude Mythos visat starka förmågor för sårbarhetsdetektering. Microsoft har också erkänt att de har svårt att åtgärda alla sårbarheter som hittats av Claude Mythos, vilket belyser både modellens potential för säkerhetsforskning och de risker som skapas av dåligt isolerade testmiljöer.

Läsare hjälper till att stödja Windows Report. När du gör ett köp genom att använda länkar på vår webbplats, kan vi tjäna en affiliate provision. Tooltip Icon

Läs sidan för affiliate avslöjande för att ta reda på hur du kan hjälpa Windows Report utan ansträngning och utan att spendera några pengar. Read more

User forum

0 messages