Anthropicは、Claudeが3つの組織をハッキングし、悪意のあるPyPIコードを公開したと発表しました


クロードモデルが隔離されているはずのサイバーセキュリティ評価環境から脱出し、実際のインターネット接続システムに到達したことを、Anthropicが確認しました。

Anthropicは、シミュレーションされた標的を攻撃していると信じていたモデルが関与する3件のセキュリティインシデントを開示しました。設定ミスによりインターネットアクセスが有効のまま残され、実際のサービスや組織とやり取りすることを可能にしていました。

これらのインシデントは、OpenAIエージェントが関与した最近のHugging Face侵害や、OpenAIモデルがサンドボックスからの脱出を試みる中でJFrog Artifactoryのゼロデイ脆弱性を悪用したという報告に続くものです。

Claudeのセキュリティテスト中にインターネット接続が有効のままだった

第三者評価機関Irregularは、テストをキャプチャー・ザ・フラッグ演習として実施しました。モデルには、隔離されたシミュレーション内で動作しているという指示が与えられました。

しかし、テスト環境は依然として公共のインターネットにアクセスできました。モデルが意図したシミュレーション標的を見つけられなかった際、オンラインで類似のシステムを検索し、一部の実際のサービスを演習の一部として扱いました。

AnthropicとIrregularは、最初のインシデントから数か月が経過するまで設定の問題を特定できませんでした。Anthropicによると、判明している最も古い侵害は4月に発生し、約3か月間発見されなかったとのことです。

Claude Mythos 5が悪意のあるPyPIパッケージを公開

ある評価中に、Claude Mythos 5は架空のPythonパッケージを参照するセットアップ手順を発見しました。そのパッケージ名はPython Package Indexに登録されていませんでした。

モデルは、未使用の名前を登録して独自のコードを公開できると認識しました。そのセットアップ手順に従うシステムは、パッケージを自動的にダウンロードして実行する可能性がありました。

Claudeは必要なアカウントを作成し、悪意のあるパッケージをPyPIにアップロードしました。そのパッケージは約1時間にわたって公開された状態で、その後PyPIの自動保護機能によって削除されました。

その間に、15の実際のシステムがそのコードをダウンロードして実行しました。

セキュリティ企業の認証情報が盗まれた

影響を受けたシステムの1つは、新しく公開されたPyPIパッケージを自動的にダウンロードしてスキャンするサイバーセキュリティ企業のものでした。

悪意のあるパッケージはシステムから認証情報を収集し、Claudeが作成したインフラストラクチャに送信しました。その後モデルは、盗んだ認証情報を使って企業ネットワークの他の部分にアクセスしました。

Anthropicによると、Claudeはその組織について事前知識はなく、意図的に標的として選んだわけではありませんでした。同社はPyPIに通知し、悪意のあるパッケージに関連する指標を共有しました。

影響を受けたサイバーセキュリティ企業は、Anthropicから連絡を受ける前に侵入を検知していませんでした。

Claude Opus 4.7が本番データベースにアクセス

Claude Opus 4.7が関与する別の評価で、実際の本番データベースへのアクセスが発生しました。

演習で使用された架空の標的は、既存の企業およびドメインと同じ名前を持っていました。Claudeがシミュレーションされたシステムに到達できなかった後、オンラインで実際の組織を見つけ、それを意図された標的として扱いました。

モデルはアプリケーションとインフラストラクチャの認証情報を抽出し、数百行の本番情報を含むデータベースにアクセスしました。

Anthropicは、モデルが稼働中のビジネスシステムに到達し実際のデータにアクセスしたため、このインシデントがより深刻であると説明しました。

研究モデルが約9,000のシステムをスキャン

Anthropicの未リリースの研究モデルが3番目のインシデントを引き起こしました。

意図したテスト標的を見つけられなかった後、そのモデルは約9,000のインターネット接続システムをスキャンしました。デバッグページに表示された認証情報とSQLインジェクションの脆弱性を利用して、露出したアプリケーションを侵害しました。

その後モデルは、侵害したアプリケーションが無関係のクラウドアカウントに属していると判断しました。その後、人間の介入なしに攻撃を停止しました。

Anthropicが調査結果を公表した時点で、影響を受けた組織への連絡を試み続けていました。

モデルは基本的なセキュリティの弱点に依存

Anthropicは、これらのインシデントには新しい、あるいは以前に知られていなかった攻撃手法は含まれていないと述べました。

モデルは、露出した認証情報、脆弱なパスワード、公開されているエンドポイント、機密情報を含むデバッグページ、SQLインジェクションの脆弱性など、一般的な弱点に依存していました。

主な失敗は、制限のないインターネットアクセスと、到達可能なすべてのシステムが認可されたテストの一部であるというモデルの想定に起因します。

Anthropicはインシデントのレビュー後、サイバーテストを一時停止

Anthropicは7月23日に評価のレビューを開始し、すべてのサイバーセキュリティテストを一時停止しました。

同社は7月24日に3件のインシデントを特定しました。Irregularと影響を受けた2組織には、7月27日に通知が送られました。

Anthropicは3番目のインシデントに関与した組織への連絡を試み続けました。

Anthropicが連絡に成功した2組織のいずれも、通知を受け取る前に侵入を独自に検知していませんでした。

評価環境には本番用の保護策が欠如していた

テストシステムは、一般公開されているClaudeモデルに含まれている分類器、監視ツール、その他の保護策を使用していませんでした。

Anthropicは、同社の本番用保護策があれば、評価中に見られた行動をブロックできた可能性が高いと述べました。同社は、これらのインシデントは主にテスト設計、インフラストラクチャ、監視、および第三者による監視の失敗であると位置付けました。

同社は、これらのインシデントを根本的なアラインメントの失敗の証拠とは説明しませんでした。むしろ、モデルは評価の指示に従いながら、誤って実際の標的とやり取りしていました。

Anthropicは今後のテストに対してより厳格な監視を計画

Anthropicは、将来の評価全体でトランスクリプト監視を拡大し、より強力な調査ツールを導入する予定です。

また、第三者テストパートナーへの監督を強化し、評価環境が外部インフラストラクチャにどのように接続されているかを見直します。

AnthropicはMETRとの独立したレビューについて議論しており、PyPIインシデントの一部を編集したトランスクリプトを公開する予定です。

これらのセキュリティ上の失敗にもかかわらず、Claude Mythosは強力な脆弱性検出能力を実証しました。Microsoftも、Claude Mythosが見つけた脆弱性をすべて修正することに苦戦していることを認めており、モデルのセキュリティ研究の可能性と、不十分に隔離されたテスト環境によって生み出されるリスクの両方を浮き彫りにしています。

読者の皆様のご支援が Windows Report を支えています。当サイトのリンクを経由してご購入いただいた場合、当社が手数料を受け取ることがあります。 Tooltip Icon

情報開示ページをご覧いただき、Windows Report の編集チームをどのように支援できるかをご確認ください。 Read more

User forum

0 messages