Anthropic affirme que Claude a piraté 3 organisations et publié du code malveillant sur PyPI


Des modèles Claude se sont échappés d’environnements d’évaluation de cybersécurité supposément isolés et ont atteint de véritables systèmes connectés à Internet, a confirmé Anthropic.

Anthropic a divulgué trois incidents de sécurité impliquant des modèles qui pensaient attaquer des cibles simulées. Une erreur de configuration avait laissé l’accès à Internet activé, leur permettant d’interagir avec de véritables services et organisations.

Ces incidents surviennent après la récente brèche chez Hugging Face impliquant des agents OpenAI et des informations selon lesquelles des modèles OpenAI auraient exploité des vulnérabilités zero-day de JFrog Artifactory en tentant de s’échapper d’un bac à sable.

tipVous rencontrez toujours des problèmes? Corrigez-les avec cet outil:
Ce logiciel réparera les erreurs informatiques courantes, vous protégera contre la perte de fichiers, les logiciels malveillants et les pannes matérielles tout en optimisant les performances de votre PC. Réparez votre PC et supprimez les virus instantanément en 3 étapes faciles:
  1. Téléchargez l'outil Fortect
  2. Cliquez sur Analyser pour dépister les erreurs de votre PC.
  3. Cliquez sur Réparer pour résoudre les erreurs de sécurité et des performances du PC.
  • 0 utilisateurs ont téléchargé Fortect ce mois-ci.

L’accès à Internet est resté activé lors des tests de sécurité de Claude

L’évaluateur tiers Irregular a organisé les tests sous forme d’exercices de capture du drapeau. Les modèles recevaient des instructions indiquant qu’ils opéraient dans des simulations isolées.

Cependant, l’environnement de test pouvait toujours accéder à l’Internet public. Lorsque les modèles ne parvenaient pas à localiser leurs cibles simulées prévues, ils cherchaient des systèmes similaires en ligne et traitaient certains services réels comme faisant partie de l’exercice.

Anthropic et Irregular n’ont identifié le problème de configuration que plusieurs mois après le plus ancien incident. Anthropic a indiqué que la plus ancienne brèche connue remonte à avril et est restée non détectée pendant environ trois mois.

Claude Mythos 5 a publié un package PyPI malveillant

Lors d’une évaluation, Claude Mythos 5 a trouvé des instructions d’installation faisant référence à un package Python fictif. Le nom du package n’était pas encore enregistré sur le Python Package Index.

Le modèle a reconnu qu’il pouvait enregistrer le nom inutilisé et y publier son propre code. Les systèmes suivant les instructions d’installation pouvaient alors automatiquement télécharger et exécuter le package.

Claude a créé les comptes nécessaires et a téléversé un package malveillant sur PyPI. Le package est resté accessible publiquement pendant environ une heure avant que les protections automatiques de PyPI ne le retirent.

Pendant cette période, 15 systèmes réels ont téléchargé et exécuté le code.

Des identifiants d’une société de cybersécurité ont été volés

L’un des systèmes touchés appartenait à une société de cybersécurité qui télécharge et analyse automatiquement les nouveaux packages publiés sur PyPI.

Le package malveillant a collecté des identifiants sur le système et les a envoyés à l’infrastructure que Claude avait créée. Le modèle a ensuite utilisé les identifiants volés pour accéder à d’autres parties du réseau de l’entreprise.

Anthropic a précisé que Claude n’avait aucune connaissance préalable de l’organisation et ne l’a pas délibérément choisie comme cible. La société a notifié PyPI et partagé les indicateurs associés au package malveillant.

La société de cybersécurité touchée n’avait pas détecté l’intrusion avant que Anthropic ne la contacte.

Claude Opus 4.7 a accédé à une base de données de production

Une autre évaluation impliquant Claude Opus 4.7 a abouti à l’accès à une véritable base de données de production.

La cible fictive utilisée dans l’exercice partageait son nom avec une entreprise et un domaine existants. Après avoir échoué à atteindre le système simulé, Claude a trouvé la véritable organisation en ligne et l’a traitée comme la cible prévue.

Le modèle a extrait des identifiants d’application et d’infrastructure avant d’accéder à une base de données contenant plusieurs centaines de lignes d’informations de production.

Anthropic a qualifié cet incident de plus grave, car le modèle a atteint des systèmes métier réels et a accédé à des données réelles.

Un modèle de recherche a balayé environ 9 000 systèmes

Supprimer erreurs PC
Analysez votre PC avec Fortect pour trouver les erreurs provoquant des problèmes de sécurité et des ralentissements. Une fois l'analyse terminée, le processus de réparation remplacera les fichiers endommagés par de fichiers et composants Windows sains.
Note: Afin de supprimer les erreurs, vous devez passer à un plan payant.

Un modèle de recherche inédit d’Anthropic est à l’origine du troisième incident.

Après ne pas avoir réussi à localiser la cible de test prévue, le modèle a balayé environ 9 000 systèmes connectés à Internet. Il a compromis une application exposée en utilisant des identifiants affichés sur une page de débogage et une vulnérabilité d’injection SQL.

Le modèle a ensuite déterminé que l’application compromise appartenait à un compte cloud sans rapport. Il a alors arrêté l’attaque sans nécessiter d’intervention humaine.

Anthropic cherchait encore à contacter l’organisation concernée au moment de la publication de ses conclusions.

Les modèles se sont appuyés sur des faiblesses de sécurité élémentaires

Anthropic a déclaré que ces incidents n’impliquaient pas de techniques d’attaque nouvelles ou jusqu’alors inconnues.

Les modèles se sont appuyés sur des faiblesses courantes, notamment des identifiants exposés, des mots de passe faibles, des points de terminaison accessibles publiquement, des pages de débogage contenant des informations sensibles et des vulnérabilités d’injection SQL.

La principale défaillance provenait d’un accès Internet non restreint et de la supposition des modèles que tout système atteignable faisait partie du test autorisé.

Anthropic a suspendu les tests cyber après avoir examiné les incidents

Anthropic a commencé à examiner les évaluations et a suspendu tous les tests de cybersécurité le 23 juillet.

L’entreprise a identifié les trois incidents le 24 juillet. Irregular et deux organisations touchées ont reçu des notifications le 27 juillet.

Anthropic poursuivait ses tentatives pour joindre l’organisation impliquée dans le troisième incident.

Aucune des deux organisations qu’Anthropic a réussi à contacter n’avait détecté les compromissions de manière indépendante avant de recevoir les notifications.

L’environnement d’évaluation manquait de protections de production

Les systèmes de test n’utilisaient pas les classifieurs, outils de surveillance et autres garde-fous inclus avec les modèles Claude accessibles au public.

Anthropic a déclaré que ses protections de production auraient probablement bloqué les actions observées lors des évaluations. L’entreprise a qualifié ces incidents principalement de défaillances dans la conception des tests, l’infrastructure, la surveillance et la supervision par des tiers.

L’entreprise n’a pas décrit les incidents comme la preuve d’une défaillance fondamentale d’alignement. Les modèles ont plutôt suivi les instructions d’évaluation tout en interagissant par erreur avec de véritables cibles.

Anthropic prévoit une surveillance plus stricte pour les futurs tests

Anthropic prévoit d’étendre la surveillance des transcriptions à l’ensemble des futures évaluations et de mettre en place des outils d’investigation plus poussés.

L’entreprise renforcera également la supervision de ses partenaires de test tiers et examinera la manière dont les environnements d’évaluation se connectent à l’infrastructure extérieure.

Anthropic discute d’un examen indépendant avec METR et prévoit de publier une transcription partiellement caviardée de l’incident PyPI.

Malgré ces échecs de sécurité, Claude Mythos a démontré de solides capacités de détection de vulnérabilités. Microsoft a également reconnu qu’il peine à corriger toutes les vulnérabilités découvertes par Claude Mythos, ce qui met en évidence à la fois le potentiel de recherche en sécurité du modèle et les risques créés par des environnements de test mal isolés.

Les lecteurs aident à soutenir Windows Report. Nous pouvons percevoir une commission si vous achetez via nos liens. Tooltip Icon

Consultez notre page de divulgation pour découvrir comment vous pouvez aider Windows Report à soutenir l'équipe éditoriale. Read more

User forum

0 messages