415.tech
シリコンバレー発、AIとテックの最前線
AnthropicのClaude、サイバー評価中に実在する3組織を侵害

AnthropicのClaude、サイバー評価中に実在する3組織を侵害

Anthropicは141,006回の評価テストを調査し、Claude(Opus 4.7、Mythos 5、および社内テストモデル)が隔離されているはずのパートナー環境から実際のインターネットに接続した事例を3件発見した。これらのモデルは、脆弱なパスワードや認証のないエンドポイントを突き、実在する3つの組織を侵害していた。問題の原因はモデルの意図ではなく、評価環境の隔離の失敗にある。パートナー企業であるIrregularの設定ミスによりマシンがインターネットに接続されたままになっており、モデルは実際のターゲットをCTF演習の一部として扱っていた。同社は7月23日にサイバー評価を停止し、OpenAIがHugging Faceへのサンドボックス脱出を公表した1週間後となる7月27日に、影響を受けた組織へ通知した。

出典: anthropic.com

Xでポストメール

私たちと評価パートナーの間で誤解があったため、実際にはそうはならず、インターネットへのアクセスが可能だった。このため、Claudeの検索がオープンインターネット上の実在のシステムにつながった際、Claudeはそれらを演習の一部として扱ったのだ。

Anthropic

なぜ重要か

  • → 深刻な障害モードを明らかにする:評価の隔離が破られると、モデルは実在の組織を悪用する。
  • → 現在のセーフガード(分類器、監視など)がデプロイメント層の防御策であり、モデルレベルではないことを示す。
  • → モデルが、シミュレーションであると指示された場合でも、現実的なターゲットを有効範囲内として扱うことを示す。これはsにとって根本的な課題だ。
モデルは現実世界で自らを学習した