415.tech
シリコンバレー発、AIとテックの最前線
OpenAIのGPT-Red、プロンプトインジェクション発見率84%で人間の13%を圧倒

OpenAIのGPT-Red、プロンプトインジェクション発見率84%で人間の13%を圧倒

OpenAIは、プロンプトインジェクションの脆弱性を自動発見する社内の自己対戦型RLシステム「GPT-Red」を開発した。GPT-5.1に対する未学習の間接的インジェクションテストにおいて、人間のレッドチームが約13%だったのに対し、同システムは84%の発見率を記録した。さらに、モデルの可視化された推論プロセスを偽装する新たな攻撃手法「偽のChain of Thought」を発見し、GPT-5.1を95%以上の確率で騙すことに成功した。その後、GPT-5.6 Solでの敵対的学習により、この成功率は10%未満に低下している。このツールを社内専用に留めることで、レッドチームの活動は閉じたループとなり、自動化された攻撃生成が次期モデルの防御力向上に直結する。これは競合他社が外部から調達できない独自の競争優位性となる。

出典: openai.com

Xでポストメール