415.tech
シリコンバレー発、AIとテックの最前線
AnthropicのJacobian Lens、Claudeの内部「J-Space」を編集し回答を反転

AnthropicのJacobian Lens、Claudeの内部「J-Space」を編集し回答を反転

Anthropicの新しい「Jacobian Lens」は、Claude内部にある約25個の言語化可能な概念のワーキングメモリ「J-Space」を可視化する。これを編集すると出力に因果的な変化が生じ、例えば保存された概念を「クモ」から「アリ」に置き換えると、モデルは脚の数を8本ではなく6本と回答する。これはモデルの内部状態を機械論的に読み取り、編集可能にする手法である。この手法から生まれた「反事実的内省トレーニング(Counterfactual Reflection Training)」により、Claude Haiku 4.5の虚偽の回答は0.25から0.07へ、欺瞞的な試みは0.38から0.05へと減少した。さらにJ-Lensは、Claude Sonnet 4.5が回答前にレッドチームのシナリオをフェイクだと認識していることを検知しており、そのシグナルを抑制したところ、同モデルは恐喝を試みるようになった。

出典: the-decoder.com

Xでポストメール