Anthropicは、Claudeが3つの組織をハッキングし、悪意のあるPyPIコードを公開したと発表しました


Anthropicは、Claudeモデルが隔離されているはずのサイバーセキュリティ評価環境から脱出し、実際のインターネット接続システムに到達していたことを確認しました。

Anthropicが開示した3件のセキュリティインシデントでは、モデルはシミュレーション上の標的を攻撃していると認識していましたが、設定ミスによりインターネットアクセスが有効なままだったため、実際のサービスや組織と相互作用してしまいました。

これらのインシデントは、OpenAIエージェントが関与した最近のHugging Face侵害や、OpenAIモデルがJFrog Artifactoryのゼロデイ脆弱性を悪用してサンドボックスからの脱出を試みたという報告に続くものです。

Claudeのセキュリティテスト中にインターネットアクセスが有効なままだった

サードパーティの評価機関であるIrregularは、これらのテストをキャプチャー・ザ・フラッグ演習として実施しました。モデルには、隔離されたシミュレーション内で動作しているという指示が与えられていました。

しかし、テスト環境は依然として公衆インターネットにアクセスできる状態でした。モデルが意図したシミュレーション標的を見つけられなかった場合、オンラインで類似のシステムを検索し、一部の実際のサービスを演習の一部として扱ってしまいました。

AnthropicとIrregularは、最も初期のインシデントから数か月が経過するまで、この設定の問題を認識しませんでした。Anthropicによると、判明している最古の侵害は4月に発生し、約3か月間発見されませんでした。

Claude Mythos 5が悪意のあるPyPIパッケージを公開

ある評価中に、Claude Mythos 5は架空のPythonパッケージを参照するセットアップ手順を発見しました。そのパッケージ名はPython Package Indexに登録されていませんでした。

モデルは、未使用の名前を登録し、自身のコードを公開できることを認識しました。セットアップ手順に従うシステムは、その後自動的にそのパッケージをダウンロードして実行する可能性がありました。

Claudeは必要なアカウントを作成し、悪意のあるパッケージをPyPIにアップロードしました。このパッケージは、PyPIの自動保護機能によって削除されるまで、約1時間公開されたままでした。

その間に、15の実際のシステムがコードをダウンロードして実行しました。

セキュリティ企業の認証情報が盗まれる

影響を受けたシステムの1つは、新しく公開されたPyPIパッケージを自動的にダウンロードしてスキャンするサイバーセキュリティ企業のものでした。

悪意のあるパッケージはシステムから認証情報を収集し、Claudeが作成したインフラストラクチャに送信しました。モデルはその後、盗んだ認証情報を使用して、企業ネットワークの追加部分にアクセスしました。

Anthropicは、Claudeがその組織について事前知識を持たず、意図的に標的として選んだわけではないと述べました。同社はPyPIに通知し、悪意のあるパッケージに関連する指標を共有しました。

影響を受けたサイバーセキュリティ企業は、Anthropicから連絡があるまで、この侵入を検知していませんでした。

Claude Opus 4.7が本番データベースにアクセス

Claude Opus 4.7を含む別の評価では、実際の本番データベースへのアクセスが発生しました。

演習で使用された架空の標的は、実在する企業およびドメインと名前を共有していました。Claudeがシミュレーションシステムに到達できなかった後、オンラインで実在の組織を見つけ、それを意図した標的として扱いました。

モデルはアプリケーションとインフラストラクチャの認証情報を抽出し、数百行の本番情報を含むデータベースにアクセスしました。

Anthropicは、モデルが稼働中のビジネスシステムに到達し、実際のデータにアクセスしたため、このインシデントをより深刻なものと説明しました。

研究用モデルが約9,000のシステムをスキャン

未公開のAnthropicの研究用モデルが3件目のインシデントを引き起こしました。

意図したテスト標的を見つけられなかった後、このモデルは約9,000のインターネット接続システムをスキャンしました。デバッグページに表示された認証情報とSQLインジェクションの脆弱性を利用して、露出したアプリケーションに侵入しました。

モデルはその後、侵入したアプリケーションが無関係のクラウドアカウントに属していると判断し、人間の介入を必要とせずに攻撃を停止しました。

Anthropicは調査結果を公開した時点で、影響を受けた組織への連絡をまだ試みている段階でした。

モデルは基本的なセキュリティの弱点に依存

Anthropicは、これらのインシデントに新しい、またはこれまで知られていなかった攻撃手法は含まれていなかったと述べました。

モデルは、露出した認証情報、脆弱なパスワード、公開されたエンドポイント、機密情報を含むデバッグページ、SQLインジェクションの脆弱性など、一般的な弱点に依存していました。

主な失敗は、無制限のインターネットアクセスと、到達可能なすべてのシステムが許可されたテストの一部であるというモデルの思い込みから生じました。

インシデントのレビュー後、Anthropicはサイバーテストを一時停止

Anthropicは評価の見直しを開始し、7月23日にすべてのサイバーセキュリティテストを一時停止しました。

同社は7月24日に3件のインシデントを特定しました。Irregularと影響を受けた2つの組織には7月27日に通知が行われました。

Anthropicは、3件目のインシデントに関与した組織への連絡を継続しています。

Anthropicが連絡に成功した2つの組織のいずれも、通知を受ける前に、侵害を独立して検知していませんでした。

評価環境に本番環境の安全策が欠如

テストシステムは、一般公開されているClaudeモデルに含まれる分類器、監視ツール、その他の安全策を使用していませんでした。

Anthropicは、自社の本番環境の保護機能があれば、評価中に見られたアクションをブロックできた可能性が高いと述べました。同社はこれらのインシデントを、主にテスト設計、インフラストラクチャ、監視、およびサードパーティの監督における失敗と位置づけました。

同社は、これらのインシデントをアライメントの根本的な問題の証拠とは説明しませんでした。代わりに、モデルは評価指示に従ったものの、実際の標的と誤って対話してしまったとしています。

Anthropic、将来のテストでより厳格な監視を計画

Anthropicは、将来の評価全体でトランスクリプト監視を拡大し、より強力な調査ツールを導入する計画です。

また、サードパーティのテストパートナーに対する監督を強化し、評価環境が外部インフラストラクチャにどのように接続するかを見直す予定です。

AnthropicはMETRと独立したレビューについて協議しており、PyPIインシデントの一部を編集したトランスクリプトを公開する予定です。

これらのセキュリティ上の失敗にもかかわらず、Claude Mythosは強力な脆弱性検出能力を示しています。Microsoftもまた、Claude Mythosによって発見されたすべての脆弱性の修正に苦戦していることを認めており、モデルのセキュリティ研究の可能性と、不十分に隔離されたテスト環境が生み出すリスクの両方を浮き彫りにしています。

読者の皆様のご支援が Windows Report を支えています。当サイトのリンクを経由してご購入いただいた場合、当社が手数料を受け取ることがあります。 Tooltip Icon

情報開示ページをご覧いただき、Windows Report の編集チームをどのように支援できるかをご確認ください。 Read more

User forum

0 messages