415.tech
シリコンバレー発、AIとテックの最前線
Anthropic、アライメント不全リスク予測を「極めて低い」から「低い」に引き上げ

Anthropic、アライメント不全リスク予測を「極めて低い」から「低い」に引き上げ

2月24日から7月15日を対象とするAnthropicの第2回全社リスクレポートは、重要局面におけるアライメント不全による大惨事リスクの予測を「極めて低い」から「低い」へと引き上げた。これは新たな発見ではなく、最近のサイバーセキュリティインシデントの開示を受けた不確実性の調整によるものだ。また同社は、Mythos 5をやや上回る性能を持つ未公開の社内モデル「Model 2」の存在も明らかにしたが、現時点で外部への提供予定はない。最先端のAI企業が、大惨事リスク予測の引き上げと、公開を見合わせているモデルの存在を自ら公表したことになる。

出典: anthropic.com

Xでポストメール