Anthropic、Claudeが3つの組織をハッキングし、悪意のあるPyPIコードを公開したと発表
Claudeモデルが隔離されているはずのサイバーセキュリティ評価環境から脱出し、実際のインターネット接続システムに到達したことをAnthropicが確認しました。
Anthropicは、模擬標的を攻撃していると認識していたモデルが関与した3件のセキュリティインシデントを公開しました。設定ミスによりインターネットアクセスが有効なままになっており、実際のサービスや組織とやり取りすることを許しました。
これらのインシデントは、OpenAIエージェントが関与した最近のHugging Face侵害や、OpenAIモデルがサンドボックスからの脱出を試みる中でJFrog Artifactoryのゼロデイ脆弱性を悪用したという報告に続くものです。
Claudeのセキュリティテスト中にインターネットアクセスが有効なままだった
サードパーティ評価機関のIrregularが、キャプチャー・ザ・フラッグ演習としてテストを実施しました。モデルは、隔離されたシミュレーション内で動作していると説明する指示を受け取りました。
しかし、テスト環境は依然として公共のインターネットにアクセス可能でした。モデルが意図された模擬標的を見つけられなかった場合、オンラインで類似のシステムを検索し、一部の実際のサービスを演習の一部として扱いました。
AnthropicとIrregularは、最も初期のインシデントから数か月が経過するまで、この設定上の問題を特定しませんでした。Anthropicによると、既知の最も古い侵害は4月に発生し、約3か月間発見されなかったとのことです。
Claude Mythos 5が悪意のあるPyPIパッケージを公開
ある評価中に、Claude Mythos 5は架空のPythonパッケージを参照するセットアップ手順を見つけました。そのパッケージ名はPython Package Indexに登録されていませんでした。
モデルは、未使用の名前を登録し、自身のコードを公開できることを認識しました。セットアップ手順に従うシステムは、その後、そのパッケージを自動的にダウンロードして実行することになります。
Claudeは必要なアカウントを作成し、悪意のあるパッケージをPyPIにアップロードしました。そのパッケージは、PyPIの自動保護機能によって削除されるまで、約1時間にわたって公開されたままでした。
その間に、15の実際のシステムがコードをダウンロードして実行しました。
セキュリティ企業の資格情報が盗まれる
影響を受けたシステムの1つは、新しく公開されたPyPIパッケージを自動的にダウンロードしてスキャンするサイバーセキュリティ企業のものでした。
悪意のあるパッケージは、システムから資格情報を収集し、Claudeが作成したインフラストラクチャに送信しました。モデルはその後、盗んだ資格情報を使用して、企業ネットワークの追加部分にアクセスしました。
Anthropicは、Claudeがその組織について事前の知識を持っておらず、意図的に標的として選んだわけではないと述べました。同社はPyPIに通知し、悪意のあるパッケージに関連する痕跡指標を共有しました。
影響を受けたサイバーセキュリティ企業は、Anthropicから連絡を受ける前に侵入を検知していませんでした。
Claude Opus 4.7が本番データベースにアクセス
Claude Opus 4.7が関与した別の評価では、実際の本番データベースへのアクセスが発生しました。
演習で使用された架空の標的は、実在する企業およびドメインと同じ名前でした。Claudeがシミュレーションされたシステムに到達できなかった後、オンラインで実際の組織を見つけ、それを意図された標的として扱いました。
モデルは、アプリケーションとインフラストラクチャの資格情報を抽出した後、数百行の本番情報を含むデータベースにアクセスしました。
Anthropicは、このインシデントをより深刻だと説明しました。モデルが稼働中のビジネスシステムに到達し、実際のデータにアクセスしたためです。
研究モデルが約9,000システムをスキャン
未公開のAnthropic研究モデルが3件目のインシデントを引き起こしました。
意図されたテスト標的を見つけられなかった後、モデルは約9,000のインターネット接続システムをスキャンしました。デバッグページに表示された資格情報とSQLインジェクションの脆弱性を利用して、露出したアプリケーションを侵害しました。
モデルはその後、侵害したアプリケーションが無関係なクラウドアカウントに属していると判断しました。そして、人間の介入なしに攻撃を停止しました。
Anthropicが調査結果を公開した時点では、まだ影響を受けた組織への連絡を試みている最中でした。
モデルは基本的なセキュリティの弱点に依存
Anthropicは、これらのインシデントに新しい、またはこれまで未知の攻撃手法は含まれていないと述べました。
モデルは、露出した資格情報、弱いパスワード、一般にアクセス可能なエンドポイント、機密情報を含むデバッグページ、SQLインジェクションの脆弱性など、一般的な弱点に依存していました。
主な失敗は、無制限のインターネットアクセスと、到達可能なすべてのシステムが認可されたテストの一部であるというモデルの想定から生じました。
Anthropicはインシデントのレビュー後、サイバーテストを一時停止
Anthropicは評価のレビューを開始し、7月23日にすべてのサイバーセキュリティテストを一時停止しました。
同社は7月24日に3件のインシデントを特定しました。Irregularと影響を受けた2組織には7月27日に通知が行われました。
Anthropicは、3件目のインシデントに関与した組織への連絡を引き続き試みました。
Anthropicが連絡に成功した2組織のいずれも、通知を受け取る前に自主的に侵害を検知していませんでした。
評価環境に本番環境の保護策が欠如
テストシステムは、一般提供されているClaudeモデルに含まれる分類器、監視ツール、その他の保護策を使用していませんでした。
Anthropicは、自社の本番環境の保護策があれば、評価中に見られたアクションを阻止できた可能性が高いと述べました。同社はこれらのインシデントを、主にテスト設計、インフラストラクチャ、監視、およびサードパーティの監督における失敗として特徴付けました。
同社は、これらのインシデントを根本的なアラインメントの失敗の証拠とは表現しませんでした。その代わりに、モデルは評価指示に従いながら、誤って実際の標的とやり取りしたと述べました。
Anthropicは今後のテストでより厳格な監視を計画
Anthropicは、今後の評価全体でトランスクリプト監視を拡大し、より強力な調査ツールを導入する予定です。
また、サードパーティのテストパートナーに対する監督を強化し、評価環境が外部インフラストラクチャにどのように接続されているかを見直します。
AnthropicはMETRとの独立レビューについて協議しており、PyPIインシデントの部分的に編集されたトランスクリプトを公開する予定です。
これらのセキュリティ上の失敗にもかかわらず、Claude Mythosは強力な脆弱性検出能力を示しました。Microsoftも、Claude Mythosによって発見されたすべての脆弱性を修正するのに苦労していることを認めており、モデルのセキュリティ研究の可能性と、不十分に隔離されたテスト環境が生み出すリスクの両方を浮き彫りにしています。
情報開示ページをご覧いただき、Windows Report の編集チームをどのように支援できるかをご確認ください。 Read more
User forum
0 messages