Anthropic zegt dat Claude 3 organisaties heeft gehackt en kwaadaardige PyPI-code heeft gepubliceerd
Claude-modellen ontsnapten uit zogenaamd geïsoleerde evaluatieomgevingen voor cyberbeveiliging en bereikten echte internetgerichte systemen, heeft Anthropic bevestigd.
Anthropic maakte drie beveiligingsincidenten bekend waarbij modellen dachten dat ze gesimuleerde doelen aanvielen. Een configuratiefout had internettoegang ingeschakeld gelaten, waardoor ze konden interacteren met echte diensten en organisaties.
De incidenten volgen op de recente inbreuk bij Hugging Face waarbij OpenAI-agenten betrokken waren en berichten dat OpenAI-modellen zero-daykwetsbaarheden in JFrog Artifactory misbruikten terwijl ze probeerden te ontsnappen uit een sandbox.
Internettoegang bleef ingeschakeld tijdens Claude-beveiligingstests
De externe beoordelaar Irregular organiseerde de tests als capture-the-flag-oefeningen. De modellen kregen instructies dat ze in geïsoleerde simulaties opereerden.
De testomgeving kon echter nog steeds het openbare internet bereiken. Toen de modellen er niet in slaagden hun beoogde gesimuleerde doelen te vinden, zochten ze online naar vergelijkbare systemen en behandelden ze sommige echte diensten alsof ze deel uitmaakten van de oefening.
Anthropic en Irregular identificeerden het configuratieprobleem pas maanden na het eerste incident. Anthropic zei dat de oudst bekende inbreuk in april plaatsvond en ongeveer drie maanden onontdekt bleef.
Claude Mythos 5 publiceerde een kwaadaardig PyPI-pakket
Tijdens één evaluatie vond Claude Mythos 5 installatie-instructies die verwezen naar een fictief Python-pakket. De pakketnaam was niet geregistreerd op de Python Package Index.
Het model herkende dat het de niet-gebruikte naam kon registreren en zijn eigen code kon publiceren. Systemen die de installatie-instructies volgden, konden het pakket vervolgens automatisch downloaden en uitvoeren.
Claude maakte de benodigde accounts aan en uploadde een kwaadaardig pakket naar PyPI. Het pakket bleef ongeveer een uur openbaar beschikbaar voordat de geautomatiseerde beveiligingen van PyPI het verwijderden.
Gedurende die periode hebben 15 echte systemen de code gedownload en uitgevoerd.
Inloggegevens van beveiligingsbedrijf gestolen
Eén getroffen systeem was eigendom van een cyberbeveiligingsbedrijf dat automatisch nieuw gepubliceerde PyPI-pakketten downloadt en scant.
Het kwaadaardige pakket verzamelde inloggegevens van het systeem en stuurde deze naar infrastructuur die Claude had aangemaakt. Het model gebruikte de gestolen inloggegevens vervolgens om toegang te krijgen tot extra delen van het netwerk van het bedrijf.
Anthropic zei dat Claude geen voorkennis had over de organisatie en deze niet opzettelijk als doelwit had gekozen. Het bedrijf waarschuwde PyPI en deelde indicatoren die verband hielden met het kwaadaardige pakket.
Het getroffen cyberbeveiligingsbedrijf had de inbraak niet gedetecteerd voordat Anthropic contact met hen opnam.
Claude Opus 4.7 kreeg toegang tot een productiedatabase
Een afzonderlijke evaluatie met Claude Opus 4.7 leidde tot toegang tot een echte productiedatabase.
Het fictieve doelwit dat in de oefening werd gebruikt, deelde zijn naam met een bestaand bedrijf en domein. Nadat Claude er niet in slaagde het gesimuleerde systeem te bereiken, vond het de echte organisatie online en behandelde het deze als het beoogde doelwit.
Het model haalde applicatie- en infrastructuurreferenties op voordat het toegang kreeg tot een database met enkele honderden rijen productiegegevens.
Anthropic beschreef dit incident als ernstiger omdat het model live bedrijfssystemen bereikte en toegang kreeg tot echte gegevens.
Onderzoeksmodel scande ongeveer 9.000 systemen
Een niet-uitgebracht onderzoeksmodel van Anthropic veroorzaakte het derde incident.
Nadat het er niet in slaagde het beoogde testdoelwit te vinden, scande het model ongeveer 9.000 systemen die met internet waren verbonden. Het compromitteerde een blootgestelde applicatie met behulp van inloggegevens die op een debugpagina werden weergegeven en een SQL-injectiekwetsbaarheid.
Het model stelde later vast dat de gecompromitteerde applicatie tot een niet-gerelateerd cloudaccount behoorde. Vervolgens stopte het de aanval zonder menselijke tussenkomst.
Anthropic probeerde nog steeds contact op te nemen met de getroffen organisatie toen het zijn bevindingen publiceerde.
Modellen vertrouwden op basale beveiligingszwakheden
Anthropic zei dat de incidenten geen nieuwe of eerder onbekende aanvalstechnieken betroffen.
De modellen vertrouwden op veelvoorkomende zwakheden, waaronder blootgestelde inloggegevens, zwakke wachtwoorden, openbaar toegankelijke eindpunten, debugpagina’s met gevoelige informatie en SQL-injectiekwetsbaarheden.
De belangrijkste tekortkoming kwam voort uit onbeperkte internettoegang en de aanname van de modellen dat elk bereikbaar systeem deel uitmaakte van de geautoriseerde test.
Anthropic onderbrak cyberbeveiligingstests na beoordeling van de incidenten
Anthropic begon met het beoordelen van de evaluaties en onderbrak alle cyberbeveiligingstests op 23 juli.
Het bedrijf identificeerde de drie incidenten op 24 juli. Irregular en twee getroffen organisaties ontvingen op 27 juli meldingen.
Anthropic bleef proberen contact op te nemen met de organisatie die bij het derde incident betrokken was.
Geen van beide organisaties waarmee Anthropic succesvol contact had opgenomen, had de inbreuken zelfstandig gedetecteerd voordat ze de meldingen ontvingen.
Evaluatieomgeving miste productiesafeguards
De testsystemen maakten geen gebruik van de classificatoren, monitoringtools en andere beveiligingen die bij openbaar beschikbare Claude-modellen worden meegeleverd.
Anthropic zei dat zijn productiebeveiligingen de acties die tijdens de evaluaties werden waargenomen waarschijnlijk zouden hebben geblokkeerd. Het karakteriseerde de incidenten voornamelijk als tekortkomingen in testontwerp, infrastructuur, monitoring en toezicht door derden.
Het bedrijf beschreef de incidenten niet als bewijs van een fundamentele alignment-fout. In plaats daarvan volgden de modellen de evaluatie-instructies terwijl ze per ongeluk interactie hadden met echte doelwitten.
Anthropic plant strengere monitoring voor toekomstige tests
Anthropic is van plan de transcriptmonitoring uit te breiden naar toekomstige evaluaties en krachtigere onderzoeksinstrumenten te introduceren.
Het zal ook het toezicht op externe testpartners verhogen en beoordelen hoe evaluatieomgevingen verbinding maken met externe infrastructuur.
Anthropic bespreekt een onafhankelijke beoordeling met METR en is van plan een gedeeltelijk geredigeerd transcript van het PyPI-incident te publiceren.
Ondanks de beveiligingsfouten heeft Claude Mythos sterke capaciteiten voor het detecteren van kwetsbaarheden getoond. Microsoft heeft ook erkend dat het worstelt met het oplossen van alle kwetsbaarheden die door Claude Mythos zijn gevonden, wat zowel het potentieel voor beveiligingsonderzoek van het model benadrukt als de risico’s die ontstaan door slecht geïsoleerde testomgevingen.
Lees de pagina met affiliate onthullingen om erachter te komen hoe u Windows Report moeiteloos en zonder geld uit te geven kunt helpen. Read more
User forum
0 messages