415.tech
シリコンバレー発、AIとテックの最前線
Rehberger、成功率80%のプロンプトインジェクションでClaude Codeのautoモードを突破

Rehberger、成功率80%のプロンプトインジェクションでClaude Codeのautoモードを突破

Johann Rehbergerは、Claude Codeのautoモードにzipアーカイブをダウンロードさせ、ローカルのstruct.pyに隠された悪意のあるコードを実行させることに成功した。このコードは`import base64`によって密かに読み込まれる仕組みで、同氏によると攻撃の成功率は約80%に達するという。より注目すべき発見は、ガードレールの逆転現象である。Claudeは侵害に気づき、マルウェアプロセスを強制終了しようとしたが、autoモードがそのクリーンアップコマンドを拒否したのだ。同氏が提示する緩和策は、無人エージェントをコンテナ、VM、またはOSサンドボックス内で実行し、ネットワークの外部通信を制限して監視すること、そしてホームディレクトリ、SSHキー、クラウドの認証情報をエージェントの実行環境から隔離するという、極めて妥当なものだ。

出典: simonwillison.net

Xでポストメール

Claudeは侵害を検知するが、Auto Modeはそのクリーンアップコマンドをブロックする

simonwillison.net

なぜ重要か

  • → 80%の確率で成功するprompt injectionがClaude Codeのデフォルトの自動モードを破る
  • → 安全ガードレールはクリーンアップを妨げ、マルウェアを実行中のプロセス内に閉じ込める可能性がある
  • → Sandboxingは、無人エージェントの実行に対する唯一信頼できる防御策であり続ける
Guardrails vs. guardrails
このエディションの他の記事