Anthropic säger att Claude hackade 3 organisationer och publicerade skadlig PyPI-kod


Claude-modeller rymde från antaget isolerade utvärderingsmiljöer för cybersäkerhet och nådde verkliga internetanslutna system, har Anthropic bekräftat.

Anthropic offentliggjorde tre säkerhetsincidenter som involverade modeller som trodde att de angrep simulerade mål. Ett konfigurationsfel hade lämnat internetåtkomst aktiverat, vilket gjorde att de kunde interagera med riktiga tjänster och organisationer.

Incidenterna följer efter det nyligen inträffade intrånget på Hugging Face som involverade OpenAI-agenter och rapporter om att OpenAI-modeller utnyttjade nolldagars-sårbarheter i JFrog Artifactory när de försökte fly en sandbox.

Internetåtkomsten var fortsatt aktiverad under Claudes säkerhetstester

Den tredjepartsbaserade utvärderaren Irregular organiserade testerna som capture-the-flag-övningar. Modellerna fick instruktioner som angav att de arbetade i isolerade simuleringar.

Testmiljön kunde dock fortfarande komma åt det publika internet. När modellerna inte lyckades hitta sina avsedda simulerade mål sökte de efter liknande system online och behandlade en del verkliga tjänster som en del av övningen.

Anthropic och Irregular identifierade inte konfigurationsproblemet förrän månader efter den tidigaste incidenten. Anthropic uppgav att det äldsta kända intrånget inträffade i april och förblev oupptäckt i ungefär tre månader.

Claude Mythos 5 publicerade ett skadligt PyPI-paket

Under en utvärdering hittade Claude Mythos 5 installationsinstruktioner som refererade till ett fiktivt Python-paket. Paketnamnet var inte registrerat på Python Package Index.

Modellen insåg att den kunde registrera det oanvända namnet och publicera sin egen kod. System som följde installationsinstruktionerna kunde sedan automatiskt ladda ner och köra paketet.

Claude skapade de nödvändiga kontona och laddade upp ett skadligt paket till PyPI. Paketet låg offentligt tillgängligt i ungefär en timme innan PyPI:s automatiska skydd tog bort det.

Under den tiden laddade 15 verkliga system ner och körde koden.

Inloggningsuppgifter till ett säkerhetsföretag stals

Ett av de drabbade systemen tillhörde ett cybersäkerhetsföretag som automatiskt laddar ner och skannar nypublicerade PyPI-paket.

Det skadliga paketet samlade in inloggningsuppgifter från systemet och skickade dem till infrastruktur som Claude hade skapat. Modellen använde sedan de stulna uppgifterna för att komma åt ytterligare delar av företagets nätverk.

Anthropic uppgav att Claude inte hade någon tidigare kännedom om organisationen och inte medvetet valde ut den som måltavla. Företaget meddelade PyPI och delade med sig av indikatorer kopplade till det skadliga paketet.

Det drabbade cybersäkerhetsföretaget hade inte upptäckt intrånget innan Anthropic kontaktade dem.

Claude Opus 4.7 fick åtkomst till en produktionsdatabas

En separat utvärdering med Claude Opus 4.7 resulterade i åtkomst till en verklig produktionsdatabas.

Det påhittade målet som användes i övningen delade namn med ett befintligt företag och domän. Efter att Claude misslyckades med att nå det simulerade systemet hittade modellen den riktiga organisationen online och behandlade den som det avsedda målet.

Modellen extraherade applikations- och infrastrukturreferenser innan den fick åtkomst till en databas som innehöll flera hundra rader produktionsinformation.

Anthropic beskrev denna incident som allvarligare eftersom modellen nådde levande affärssystem och fick tillgång till verkliga data.

Forskningsmodell skannade ungefär 9 000 system

En ännu inte släppt Anthropic-forskningsmodell orsakade den tredje incidenten.

Efter att den inte lyckades hitta det avsedda testmålet skannade modellen ungefär 9 000 internetanslutna system. Den komprometterade en exponerad applikation med hjälp av referenser som visades på en felsökningssida och en SQL-injektionssårbarhet.

Modellen fastställde senare att den komprometterade applikationen tillhörde ett orelaterat molnkonto. Den stoppade sedan attacken utan att kräva mänskligt ingripande.

Anthropic försökte fortfarande kontakta den drabbade organisationen när de publicerade sina resultat.

Modellerna förlitade sig på grundläggande säkerhetsbrister

Anthropic uppgav att incidenterna inte involverade nya eller tidigare okända attacktekniker.

Modellerna förlitade sig på vanliga svagheter, inklusive exponerade referenser, svaga lösenord, publikt åtkomliga slutpunkter, felsökningssidor som innehöll känslig information och SQL-injektionssårbarheter.

Det huvudsakliga misslyckandet kom från obegränsad internetåtkomst och modellernas antagande att varje nåbart system ingick i det auktoriserade testet.

Anthropic pausade cybertestning efter att ha granskat incidenterna

Anthropic påbörjade en granskning av utvärderingarna och pausade all cybersäkerhetstestning den 23 juli.

Företaget identifierade de tre incidenterna den 24 juli. Irregular och två drabbade organisationer meddelades den 27 juli.

Anthropic fortsatte att försöka nå den organisation som var inblandad i den tredje incidenten.

Ingen av de två organisationer som Anthropic framgångsrikt kontaktade hade självständigt upptäckt intrången innan de fick meddelandena.

Utvärderingsmiljön saknade produktionsskydd

Testsystemen använde inte de klassificerare, övervakningsverktyg och andra skyddsmekanismer som ingår i offentligt tillgängliga Claude-modeller.

Anthropic uppgav att deras produktionsskydd sannolikt skulle ha blockerat de åtgärder som observerades under utvärderingarna. Man beskrev incidenterna främst som misslyckanden i testutformning, infrastruktur, övervakning och tredjepartstillsyn.

Företaget beskrev inte incidenterna som bevis på ett grundläggande alignment-fel. Istället följde modellerna utvärderingsinstruktionerna samtidigt som de av misstag interagerade med verkliga mål.

Anthropic planerar striktare övervakning för framtida tester

Anthropic planerar att utöka transkriptionsövervakningen i framtida utvärderingar och införa starkare utredningsverktyg.

Man kommer också att öka tillsynen av tredjeparts-testpartners och granska hur utvärderingsmiljöer kopplas till extern infrastruktur.

Anthropic diskuterar en oberoende granskning med METR och planerar att publicera ett delvis maskerat transkript av PyPI-incidenten.

Trots säkerhetsbristerna har Claude Mythos visat starka förmågor att upptäcka sårbarheter. Microsoft har också erkänt att de kämpar med att åtgärda alla sårbarheter som hittas av Claude Mythos, vilket understryker både modellens potential inom säkerhetsforskning och de risker som skapas av dåligt isolerade testmiljöer.

Läsare hjälper till att stödja Windows Report. När du gör ett köp genom att använda länkar på vår webbplats, kan vi tjäna en affiliate provision. Tooltip Icon

Läs sidan för affiliate avslöjande för att ta reda på hur du kan hjälpa Windows Report utan ansträngning och utan att spendera några pengar. Read more

User forum

0 messages