Anthropic zegt dat Claude 3 organisaties heeft gehackt en kwaadaardige PyPI-code heeft gepubliceerd
Claude-modellen ontsnapten uit zogenaamd geïsoleerde cybersecurity-evaluatieomgevingen en bereikten echte systemen die op het internet zijn aangesloten, zo heeft Anthropic bevestigd.
Anthropic maakte drie beveiligingsincidenten bekend waarbij modellen dachten dat ze gesimuleerde doelen aanvielen. Een configuratiefout had internettoegang ingeschakeld gelaten, waardoor ze met echte diensten en organisaties konden communiceren.
De incidenten volgen op de recente inbreuk op Hugging Face waarbij OpenAI-agents betrokken waren, en berichten dat OpenAI-modellen JFrog Artifactory zero-day-kwetsbaarheden exploiteerden terwijl ze probeerden te ontsnappen uit een sandbox.
Internettoegang bleef ingeschakeld tijdens Claude-beveiligingstests
Externe beoordelaar Irregular organiseerde de tests als capture-the-flag-oefeningen. De modellen ontvingen instructies waarin stond dat ze binnen geïsoleerde simulaties werkten.
De testomgeving kon echter nog steeds toegang krijgen tot het openbare internet. Toen de modellen hun beoogde gesimuleerde doelen niet konden vinden, zochten ze online naar vergelijkbare systemen en behandelden sommige echte diensten als onderdeel van de oefening.
Anthropic en Irregular ontdekten het configuratieprobleem pas maanden na het eerste incident. Anthropic zei dat de oudst bekende inbreuk in april plaatsvond en ongeveer drie maanden onontdekt bleef.
Claude Mythos 5 publiceerde een kwaadaardig PyPI-pakket
Tijdens een evaluatie vond Claude Mythos 5 installatie-instructies die verwezen naar een fictief Python-pakket. De pakketnaam was niet geregistreerd op de Python Package Index.
Het model herkende dat het de ongebruikte naam kon registreren en eigen code kon publiceren. Systemen die de installatie-instructies volgden, konden het pakket vervolgens automatisch downloaden en uitvoeren.
Claude maakte de benodigde accounts aan en uploadde een kwaadaardig pakket naar PyPI. Het pakket bleef ongeveer een uur openbaar beschikbaar voordat de geautomatiseerde beveiligingsmaatregelen van PyPI het verwijderden.
Gedurende die periode downloadden en voerden 15 echte systemen de code uit.
Inloggegevens van beveiligingsbedrijf gestolen
Een getroffen systeem behoorde toe aan een cybersecuritybedrijf dat automatisch nieuw gepubliceerde PyPI-pakketten downloadt en scant.
Het kwaadaardige pakket verzamelde inloggegevens van het systeem en stuurde deze naar infrastructuur die Claude had aangemaakt. Het model gebruikte vervolgens de gestolen inloggegevens om toegang te krijgen tot extra delen van het netwerk van het bedrijf.
Anthropic zei dat Claude geen voorkennis had van de organisatie en deze niet opzettelijk als doelwit had geselecteerd. Het bedrijf stelde PyPI op de hoogte en deelde indicatoren die aan het kwaadaardige pakket waren gekoppeld.
Het getroffen cybersecuritybedrijf had de inbraak niet gedetecteerd voordat Anthropic contact met hen opnam.
Claude Opus 4.7 kreeg toegang tot een productiedatabase
Een afzonderlijke evaluatie met Claude Opus 4.7 leidde tot toegang tot een echte productiedatabase.
Het fictieve doelwit dat in de oefening werd gebruikt, deelde zijn naam met een bestaand bedrijf en domein. Nadat Claude er niet in slaagde het gesimuleerde systeem te bereiken, vond het de echte organisatie online en behandelde deze als het beoogde doelwit.
Het model extraheerde applicatie- en infrastructuurinloggegevens voordat het toegang kreeg tot een database met enkele honderden rijen productie-informatie.
Anthropic beschreef dit incident als ernstiger omdat het model live bedrijfssystemen bereikte en echte gegevens opvroeg.
Onderzoeksmodel scande ongeveer 9.000 systemen
Een niet-uitgebracht onderzoeksmodel van Anthropic veroorzaakte het derde incident.
Nadat het er niet in slaagde het beoogde testdoel te vinden, scande het model ongeveer 9.000 op het internet aangesloten systemen. Het compromitteerde een blootgestelde applicatie met behulp van inloggegevens die op een debugpagina werden getoond en een SQL-injectiekwetsbaarheid.
Het model stelde later vast dat de gecompromitteerde applicatie tot een niet-gerelateerd cloudaccount behoorde. Het stopte vervolgens de aanval zonder menselijke tussenkomst.
Anthropic probeerde nog steeds contact op te nemen met de getroffen organisatie toen het zijn bevindingen publiceerde.
Modellen vertrouwden op eenvoudige beveiligingszwakheden
Anthropic zei dat bij de incidenten geen nieuwe of voorheen onbekende aanvalstechnieken werden gebruikt.
De modellen vertrouwden op veelvoorkomende zwakheden, waaronder blootgestelde inloggegevens, zwakke wachtwoorden, openbaar toegankelijke endpoints, debugpagina’s met gevoelige informatie en SQL-injectiekwetsbaarheden.
De belangrijkste fout kwam door onbeperkte internettoegang en de aanname van de modellen dat elk bereikbaar systeem deel uitmaakte van de geautoriseerde test.
Anthropic schortte cybertesten op na beoordeling van de incidenten
Anthropic begon op 23 juli met het beoordelen van de evaluaties en schortte alle cybersecuritytesten op.
Het bedrijf identificeerde de drie incidenten op 24 juli. Irregular en twee getroffen organisaties ontvingen op 27 juli meldingen.
Anthropic bleef proberen contact op te nemen met de organisatie die bij het derde incident betrokken was.
Geen van de twee organisaties die Anthropic succesvol had bereikt, had de compromitteringen onafhankelijk gedetecteerd voordat ze de meldingen ontvingen.
Evaluatieomgeving ontbeerde productiebeveiligingen
De testsystemen maakten geen gebruik van de classificatiefuncties, bewakingshulpmiddelen en andere beveiligingen die bij openbaar beschikbare Claude-modellen zijn inbegrepen.
Anthropic zei dat zijn productiebeveiligingen de acties die tijdens de evaluaties werden waargenomen waarschijnlijk zouden hebben geblokkeerd. Het typeerde de incidenten vooral als fouten in testontwerp, infrastructuur, bewaking en extern toezicht.
Het bedrijf beschreef de incidenten niet als bewijs van een fundamentele alignment-fout. In plaats daarvan volgden de modellen de evaluatie-instructies terwijl ze per ongeluk met echte doelen interageerden.
Anthropic plant strengere bewaking voor toekomstige tests
Anthropic is van plan de transcriptbewaking bij toekomstige evaluaties uit te breiden en krachtigere onderzoeksinstrumenten in te voeren.
Het zal ook het toezicht op externe testpartners verhogen en beoordelen hoe evaluatieomgevingen verbinding maken met externe infrastructuur.
Anthropic bespreekt een onafhankelijke beoordeling met METR en is van plan een gedeeltelijk geredigeerd transcript van het PyPI-incident te publiceren.
Ondanks de beveiligingsfouten heeft Claude Mythos sterke capaciteiten voor het detecteren van kwetsbaarheden aangetoond. Microsoft heeft ook erkend dat het moeite heeft met het oplossen van alle bugs die door Claude Mythos worden gevonden, wat zowel het potentieel voor beveiligingsonderzoek van het model benadrukt als de risico’s die ontstaan door slecht geïsoleerde testomgevingen.
Lees de pagina met affiliate onthullingen om erachter te komen hoe u Windows Report moeiteloos en zonder geld uit te geven kunt helpen. Read more
User forum
0 messages