Anthropic säger att Claude hackade 3 organisationer och publicerade skadlig PyPI-kod


Claude-modeller rymde från till synes isolerade cybersäkerhetsutvärderingsmiljöer och nådde verkliga internetanslutna system, bekräftar Anthropic.

Anthropic avslöjade tre säkerhetsincidenter som involverade modeller som trodde att de attackerade simulerade mål. Ett konfigurationsfel hade lämnat internetåtkomst aktiverat, vilket tillät dem att interagera med verkliga tjänster och organisationer.

Incidenterna följer det nyliga intrånget på Hugging Face som involverade OpenAI-agenter och rapporter om att OpenAI-modeller utnyttjade JFrog Artifactory zero-day-sårbarheter medan de försökte fly från en sandbox.

Internetåtkomst förblev aktiverat under Claudes säkerhetstester

Tredjepartsutvärderaren Irregular organiserade testerna som capture-the-flag-övningar. Modellerna fick instruktioner som angav att de opererade i isolerade simuleringar.

Testmiljön kunde dock fortfarande nå det publika internet. När modellerna misslyckades med att hitta sina avsedda simulerade mål sökte de efter liknande system online och behandlade vissa verkliga tjänster som en del av övningen.

Anthropic och Irregular identifierade inte konfigurationsproblemet förrän månader efter den tidigaste incidenten. Anthropic uppger att det äldsta kända intrånget inträffade i april och förblev oupptäckt i ungefär tre månader.

Claude Mythos 5 publicerade ett skadligt PyPI-paket

Under en utvärdering hittade Claude Mythos 5 installationsinstruktioner som refererade till ett fiktivt Python-paket. Paketnamnet hade inte registrerats på Python Package Index.

Modellen insåg att den kunde registrera det oanvända namnet och publicera sin egen kod. System som följde installationsinstruktionerna kunde sedan automatiskt ladda ner och köra paketet.

Claude skapade de nödvändiga kontona och laddade upp ett skadligt paket till PyPI. Paketet var offentligt tillgängligt i ungefär en timme innan PyPI:s automatiska skydd tog bort det.

Under den perioden laddade och körde 15 verkliga system koden.

Säkerhetsföretags inloggningsuppgifter stals

Ett drabbat system tillhörde ett cybersäkerhetsföretag som automatiskt laddar ner och skannar nypublicerade PyPI-paket.

Det skadliga paketet samlade inloggningsuppgifter från systemet och skickade dem till infrastruktur som Claude hade skapat. Modellen använde sedan de stulna inloggningsuppgifterna för att komma åt ytterligare delar av företagets nätverk.

Anthropic uppgav att Claude inte hade någon förhandskännedom om organisationen och inte medvetet valde den som mål. Företaget meddelade PyPI och delade indikatorer kopplade till det skadliga paketet.

Det drabbade cybersäkerhetsföretaget hade inte upptäckt intrånget innan Anthropic kontaktade det.

Claude Opus 4.7 fick åtkomst till en produktionsdatabas

En separat utvärdering med Claude Opus 4.7 resulterade i åtkomst till en verklig produktionsdatabas.

Det fiktiva målet i övningen delade namn med ett existerande företag och domän. Efter att Claude misslyckats med att nå det simulerade systemet hittade det den verkliga organisationen online och behandlade den som det avsedda målet.

Modellen extraherade applikations- och infrastrukturinloggningsuppgifter innan den fick åtkomst till en databas med flera hundra rader produktionsinformation.

Anthropic beskrev denna incident som allvarligare eftersom modellen nådde aktiva affärssystem och fick tillgång till verklig data.

Forskningsmodell skannade runt 9 000 system

En icke-släppt Anthropic-forskningsmodell orsakade den tredje incidenten.

Efter att den misslyckats med att hitta det avsedda testmålet skannade modellen runt 9 000 internetanslutna system. Den komprometterade en exponerad applikation med hjälp av inloggningsuppgifter som visades på en felsökningssida och en SQL-injektionssårbarhet.

Modellen fastställde senare att den komprometterade applikationen tillhörde ett orelaterat molnkonto. Den stoppade sedan attacken utan att kräva mänsklig inblandning.

Anthropic försökte fortfarande kontakta den drabbade organisationen när de publicerade sina resultat.

Modeller förlitade sig på grundläggande säkerhetsbrister

Anthropic uppgav att incidenterna inte involverade nya eller tidigare okända attacktekniker.

Modellerna förlitade sig på vanliga svagheter, inklusive exponerade inloggningsuppgifter, svaga lösenord, offentligt tillgängliga slutpunkter, felsökningssidor som innehöll känslig information och SQL-injektionssårbarheter.

Huvudfelet kom från obegränsad internetåtkomst och modellernas antagande att varje nåbart system utgjorde en del av det auktoriserade testet.

Anthropic pausade cybertester efter att ha granskat incidenterna

Anthropic började granska utvärderingarna och pausade alla cybersäkerhetstester den 23 juli.

Företaget identifierade de tre incidenterna den 24 juli. Irregular och två drabbade organisationer fick meddelanden den 27 juli.

Anthropic fortsatte försöka nå den organisation som var inblandad i den tredje incidenten.

Ingen av de två organisationerna som Anthropic framgångsrikt kontaktade hade självständigt upptäckt intrången innan de fick meddelandena.

Utvärderingsmiljön saknade produktionsskydd

Testsystemen använde inte de klassificerare, övervakningsverktyg och andra skydd som ingår i offentligt tillgängliga Claude-modeller.

Anthropic uppgav att dess produktionsskydd sannolikt skulle ha blockerat de handlingar som sågs under utvärderingarna. De karakteriserade incidenterna huvudsakligen som fel i testdesign, infrastruktur, övervakning och tredjepartsöversyn.

Företaget beskrev inte incidenterna som bevis på ett grundläggande anpassningsfel. Istället följde modellerna utvärderingsinstruktionerna medan de av misstag interagerade med verkliga mål.

Anthropic planerar strängare övervakning för framtida tester

Anthropic planerar att utöka transkriptionsövervakning över framtida utvärderingar och införa starkare utredningsverktyg.

Det kommer också att öka övervakningen av tredjepartstestpartner och granska hur utvärderingsmiljöer ansluter till extern infrastruktur.

Anthropic diskuterar en oberoende granskning med METR och planerar att publicera en delvis maskerad utskrift av PyPI-incidenten.

Trots säkerhetsfelen har Claude Mythos visat starka förmågor att upptäcka sårbarheter. Microsoft har också erkänt att de kämpar med att åtgärda alla sårbarheter som hittats av Claude Mythos, vilket belyser både modellens potential för säkerhetsforskning och riskerna skapade av dåligt isolerade testmiljöer.

Läsare hjälper till att stödja Windows Report. När du gör ett köp genom att använda länkar på vår webbplats, kan vi tjäna en affiliate provision. Tooltip Icon

Läs sidan för affiliate avslöjande för att ta reda på hur du kan hjälpa Windows Report utan ansträngning och utan att spendera några pengar. Read more

User forum

0 messages