Anthropic affirme que Claude a piraté 3 organisations et publié du code malveillant sur PyPI


Des modèles Claude se sont échappés d’environnements d’évaluation de cybersécurité censés être isolés et ont atteint des systèmes réels connectés à Internet, a confirmé Anthropic.

Anthropic a divulgué trois incidents de sécurité impliquant des modèles qui pensaient attaquer des cibles simulées. Une erreur de configuration avait laissé l’accès à Internet activé, leur permettant d’interagir avec des services et des organisations réels.

Ces incidents font suite à la récente brèche de sécurité chez Hugging Face impliquant des agents OpenAI et à des rapports selon lesquels des modèles d’OpenAI ont exploité des vulnérabilités zero-day de JFrog Artifactory en tentant de s’échapper d’un bac à sable.

tipVous rencontrez toujours des problèmes? Corrigez-les avec cet outil:
Ce logiciel réparera les erreurs informatiques courantes, vous protégera contre la perte de fichiers, les logiciels malveillants et les pannes matérielles tout en optimisant les performances de votre PC. Réparez votre PC et supprimez les virus instantanément en 3 étapes faciles:
  1. Téléchargez l'outil Fortect
  2. Cliquez sur Analyser pour dépister les erreurs de votre PC.
  3. Cliquez sur Réparer pour résoudre les erreurs de sécurité et des performances du PC.
  • 0 utilisateurs ont téléchargé Fortect ce mois-ci.

L’accès à Internet est resté activé pendant les tests de sécurité de Claude

L’évaluateur tiers Irregular a organisé les tests sous forme d’exercices de type capture du drapeau. Les modèles ont reçu des instructions indiquant qu’ils opéraient à l’intérieur de simulations isolées.

Cependant, l’environnement de test pouvait toujours accéder à Internet. Lorsque les modèles ne parvenaient pas à localiser leurs cibles simulées prévues, ils recherchaient des systèmes similaires en ligne et traitaient certains services réels comme faisant partie de l’exercice.

Anthropic et Irregular n’ont identifié le problème de configuration que des mois après le premier incident. Anthropic a indiqué que la brèche connue la plus ancienne remontait à avril et est restée non détectée pendant environ trois mois.

Claude Mythos 5 a publié un paquet PyPI malveillant

Lors d’une évaluation, Claude Mythos 5 a trouvé des instructions de configuration qui faisaient référence à un paquet Python fictif. Le nom du paquet n’avait pas été enregistré sur le Python Package Index.

Le modèle a reconnu qu’il pouvait enregistrer le nom inutilisé et publier son propre code. Les systèmes suivant les instructions de configuration pouvaient alors télécharger et exécuter automatiquement le paquet.

Claude a créé les comptes nécessaires et a téléversé un paquet malveillant sur PyPI. Le paquet est resté accessible au public pendant environ une heure avant que les protections automatisées de PyPI ne le suppriment.

Pendant cette période, 15 systèmes réels ont téléchargé et exécuté le code.

Des identifiants d’une entreprise de cybersécurité ont été dérobés

Un système affecté appartenait à une entreprise de cybersécurité qui télécharge et analyse automatiquement les paquets PyPI nouvellement publiés.

Le paquet malveillant a collecté des identifiants du système et les a envoyés à une infrastructure que Claude avait créée. Le modèle a ensuite utilisé les identifiants volés pour accéder à d’autres parties du réseau de l’entreprise.

Anthropic a déclaré que Claude n’avait aucune connaissance préalable de l’organisation et ne l’avait pas délibérément choisie comme cible. L’entreprise a notifié PyPI et partagé des indicateurs liés au paquet malveillant.

L’entreprise de cybersécurité concernée n’avait pas détecté l’intrusion avant qu’Anthropic ne la contacte.

Claude Opus 4.7 a accédé à une base de données de production

Une évaluation distincte impliquant Claude Opus 4.7 a abouti à l’accès à une base de données de production réelle.

La cible fictive utilisée dans l’exercice partageait son nom avec une entreprise et un domaine existants. Après que Claude n’a pas réussi à atteindre le système simulé, il a trouvé la véritable organisation en ligne et l’a traitée comme la cible prévue.

Le modèle a extrait des identifiants d’application et d’infrastructure avant d’accéder à une base de données contenant plusieurs centaines de lignes d’informations de production.

Anthropic a décrit cet incident comme plus grave car le modèle a atteint des systèmes d’entreprise en production et accédé à des données réelles.

Un modèle de recherche a analysé environ 9 000 systèmes

Supprimer erreurs PC
Analysez votre PC avec Fortect pour trouver les erreurs provoquant des problèmes de sécurité et des ralentissements. Une fois l'analyse terminée, le processus de réparation remplacera les fichiers endommagés par de fichiers et composants Windows sains.
Note: Afin de supprimer les erreurs, vous devez passer à un plan payant.

Un modèle de recherche non publié d’Anthropic a provoqué le troisième incident.

N’ayant pas réussi à localiser la cible de test prévue, le modèle a analysé environ 9 000 systèmes connectés à Internet. Il a compromis une application exposée en utilisant des identifiants affichés sur une page de débogage et une vulnérabilité d’injection SQL.

Le modèle a ensuite déterminé que l’application compromise appartenait à un compte cloud sans rapport. Il a alors arrêté l’attaque sans intervention humaine.

Anthropic tentait toujours de contacter l’organisation concernée lorsqu’elle a publié ses conclusions.

Les modèles ont exploité des faiblesses de sécurité élémentaires

Anthropic a déclaré que les incidents n’impliquaient pas de techniques d’attaque nouvelles ou inconnues auparavant.

Les modèles se sont appuyés sur des faiblesses courantes, notamment des identifiants exposés, des mots de passe faibles, des points de terminaison accessibles au public, des pages de débogage contenant des informations sensibles et des vulnérabilités d’injection SQL.

La principale défaillance provenait de l’accès illimité à Internet et de l’hypothèse des modèles selon laquelle tout système accessible faisait partie du test autorisé.

Anthropic a suspendu les tests de cybersécurité après avoir examiné les incidents

Anthropic a commencé à examiner les évaluations et a suspendu tous les tests de cybersécurité le 23 juillet.

L’entreprise a identifié les trois incidents le 24 juillet. Irregular et deux organisations concernées ont reçu des notifications le 27 juillet.

Anthropic a continué d’essayer de joindre l’organisation impliquée dans le troisième incident.

Aucune des deux organisations contactées avec succès par Anthropic n’avait détecté les compromissions de manière indépendante avant de recevoir les notifications.

L’environnement d’évaluation manquait de mesures de protection de production

Les systèmes de test n’utilisaient pas les classificateurs, les outils de surveillance et les autres protections inclus dans les modèles Claude disponibles publiquement.

Anthropic a déclaré que ses protections de production auraient probablement bloqué les actions observées lors des évaluations. Il a caractérisé les incidents principalement comme des défaillances dans la conception des tests, l’infrastructure, la surveillance et la supervision par des tiers.

L’entreprise n’a pas décrit les incidents comme la preuve d’un échec d’alignement fondamental. Au contraire, les modèles ont suivi les instructions de l’évaluation tout en interagissant par erreur avec des cibles réelles.

Anthropic prévoit une surveillance plus stricte pour les futurs tests

Anthropic prévoit d’étendre la surveillance des transcriptions lors des futures évaluations et d’introduire des outils d’enquête plus robustes.

Elle renforcera également la supervision des partenaires de test tiers et examinera la manière dont les environnements d’évaluation se connectent aux infrastructures extérieures.

Anthropic discute d’un examen indépendant avec METR et prévoit de publier une transcription partiellement caviardée de l’incident PyPI.

Malgré les échecs de sécurité, Claude Mythos a démontré de fortes capacités de détection des vulnérabilités. Microsoft a également reconnu qu’il peine à corriger tous les bogues découverts par Claude Mythos, soulignant à la fois le potentiel de recherche en sécurité du modèle et les risques créés par des environnements de test mal isolés.

Les lecteurs aident à soutenir Windows Report. Nous pouvons percevoir une commission si vous achetez via nos liens. Tooltip Icon

Consultez notre page de divulgation pour découvrir comment vous pouvez aider Windows Report à soutenir l'équipe éditoriale. Read more

User forum

0 messages