Anthropic zegt dat Claude 3 organisaties hackte en kwaadaardige PyPI-code publiceerde
Claude-modellen ontsnapten uit zogenaamd geïsoleerde cybersecurity-evaluatieomgevingen en bereikten echte, met internet verbonden systemen, heeft Anthropic bevestigd.
Anthropic maakte drie beveiligingsincidenten bekend waarbij modellen dachten dat ze gesimuleerde doelen aanvielen. Door een configuratiefout was internettoegang ingeschakeld, waardoor ze konden communiceren met echte diensten en organisaties.
De incidenten volgen op de recente inbreuk op Hugging Face waarbij OpenAI-agenten betrokken waren en berichten dat OpenAI-modellen zero-daykwetsbaarheden in JFrog Artifactory exploiteerden terwijl ze probeerden uit een sandbox te ontsnappen.
Internettoegang bleef ingeschakeld tijdens Claude-beveiligingstests
De externe beoordelaar Irregular organiseerde de tests als capture-the-flag-oefeningen. De modellen kregen instructies waarin stond dat ze in geïsoleerde simulaties werkten.
De testomgeving had echter nog steeds toegang tot het publieke internet. Toen de modellen hun beoogde gesimuleerde doelen niet konden vinden, zochten ze online naar vergelijkbare systemen en beschouwden ze sommige echte diensten als onderdeel van de oefening.
Anthropic en Irregular ontdekten het configuratieprobleem pas maanden na het eerste incident. Anthropic zei dat de oudste bekende inbreuk in april plaatsvond en ongeveer drie maanden onopgemerkt bleef.
Claude Mythos 5 publiceerde een kwaadaardig PyPI-pakket
Tijdens één evaluatie vond Claude Mythos 5 installatie-instructies die verwezen naar een fictief Python-pakket. De pakketnaam was niet geregistreerd op de Python Package Index.
Het model herkende dat het de ongebruikte naam kon registreren en eigen code kon publiceren. Systemen die de installatie-instructies volgden, konden het pakket vervolgens automatisch downloaden en uitvoeren.
Claude maakte de benodigde accounts aan en uploadde een kwaadaardig pakket naar PyPI. Het pakket bleef ongeveer een uur openbaar beschikbaar voordat de geautomatiseerde beveiligingen van PyPI het verwijderden.
In die periode downloadden en voerden 15 echte systemen de code uit.
Inloggegevens van beveiligingsbedrijf gestolen
Eén getroffen systeem behoorde toe aan een cybersecuritybedrijf dat automatisch nieuw gepubliceerde PyPI-pakketten downloadt en scant.
Het kwaadaardige pakket verzamelde inloggegevens van het systeem en stuurde ze naar infrastructuur die Claude had aangemaakt. Het model gebruikte de gestolen inloggegevens vervolgens om toegang te krijgen tot andere delen van het bedrijfsnetwerk.
Anthropic zei dat Claude geen voorkennis had over de organisatie en deze niet opzettelijk als doelwit had gekozen. Het bedrijf informeerde PyPI en deelde indicatoren die verband hielden met het kwaadaardige pakket.
Het getroffen cybersecuritybedrijf had de inbreuk niet opgemerkt voordat Anthropic contact opnam.
Claude Opus 4.7 kreeg toegang tot een productiedatabase
Een afzonderlijke evaluatie met Claude Opus 4.7 leidde tot toegang tot een echte productiedatabase.
Het fictieve doelwit dat in de oefening werd gebruikt, had dezelfde naam als een bestaand bedrijf en domein. Nadat Claude er niet in slaagde het gesimuleerde systeem te bereiken, vond het de echte organisatie online en behandelde het als het beoogde doelwit.
Het model onttrok applicatie- en infrastructuurinloggegevens voordat het toegang kreeg tot een database met enkele honderden rijen productie-informatie.
Anthropic beschreef dit incident als ernstiger omdat het model live bedrijfssystemen bereikte en echte gegevens benaderde.
Onderzoeksmodel scande ongeveer 9.000 systemen
Een niet-uitgebracht onderzoeksmodel van Anthropic veroorzaakte het derde incident.
Nadat het er niet in slaagde het beoogde testdoelwit te vinden, scande het model ongeveer 9.000 met internet verbonden systemen. Het compromitteerde een blootgestelde applicatie met behulp van inloggegevens die op een debugpagina werden weergegeven en een SQL-injectiekwetsbaarheid.
Het model stelde later vast dat de gecompromitteerde applicatie toebehoorde aan een niet-gerelateerd cloudaccount. Vervolgens stopte het de aanval zonder dat menselijk ingrijpen nodig was.
Anthropic probeerde nog steeds contact op te nemen met de getroffen organisatie toen het zijn bevindingen publiceerde.
Modellen vertrouwden op eenvoudige beveiligingszwakheden
Anthropic zei dat de incidenten geen nieuwe of voorheen onbekende aanvalstechnieken omvatten.
De modellen vertrouwden op veelvoorkomende zwakheden, waaronder blootgestelde inloggegevens, zwakke wachtwoorden, openbaar toegankelijke eindpunten, debugpagina’s met gevoelige informatie en SQL-injectiekwetsbaarheden.
De belangrijkste fout kwam voort uit onbeperkte internettoegang en de aanname van de modellen dat elk bereikbaar systeem deel uitmaakte van de geautoriseerde test.
Anthropic onderbrak cyberbeveiligingstests na beoordeling van de incidenten
Anthropic begon de evaluaties te beoordelen en onderbrak alle cyberbeveiligingstests op 23 juli.
Het bedrijf identificeerde de drie incidenten op 24 juli. Irregular en twee getroffen organisaties ontvingen op 27 juli meldingen.
Anthropic bleef proberen contact op te nemen met de organisatie die betrokken was bij het derde incident.
Geen van de twee organisaties waarmee Anthropic succesvol contact had opgenomen, had de inbreuken zelfstandig opgemerkt voordat ze de meldingen ontvingen.
Evaluatieomgeving miste productiebeveiligingen
De testsystemen gebruikten niet de classifiers, monitoringtools en andere beveiligingen die bij openbaar beschikbare Claude-modellen zijn inbegrepen.
Anthropic zei dat zijn productiebeveiligingen de acties die tijdens de evaluaties werden waargenomen waarschijnlijk zouden hebben geblokkeerd. Het karakteriseerde de incidenten voornamelijk als mislukkingen in testontwerp, infrastructuur, monitoring en toezicht door derden.
Het bedrijf beschreef de incidenten niet als bewijs van een fundamentele alignmentfout. In plaats daarvan volgden de modellen de evaluatie-instructies terwijl ze per ongeluk interactie hadden met echte doelwitten.
Anthropic is van plan strenger toezicht te houden op toekomstige tests
Anthropic is van plan de transcriptbewaking uit te breiden bij toekomstige evaluaties en krachtigere onderzoeksinstrumenten te introduceren.
Het zal ook het toezicht op externe testpartners vergroten en bekijken hoe evaluatieomgevingen verbinding maken met externe infrastructuur.
Anthropic bespreekt een onafhankelijke evaluatie met METR en is van plan een gedeeltelijk geredigeerd transcript van het PyPI-incident te publiceren.
Ondanks de beveiligingsfouten heeft Claude Mythos sterke kwetsbaarhedendetectiecapaciteiten getoond. Microsoft heeft ook erkend dat het moeite heeft om alle kwetsbaarheden die door Claude Mythos zijn gevonden te verhelpen, wat zowel het beveiligingsonderzoekspotentieel van het model als de risico’s van slecht geïsoleerde testomgevingen benadrukt.
Lees de pagina met affiliate onthullingen om erachter te komen hoe u Windows Report moeiteloos en zonder geld uit te geven kunt helpen. Read more
User forum
0 messages