
Claude、再学習ではなくトークンサンプリング制御でウォーターマーク付与
Anthropicのウォーターマークは、Claudeのサンプリング段階に組み込まれている。秘密鍵をシードとする関数が候補トークンにビット署名を割り当て、トーナメント方式で出力トークンを選択するため、再学習は不要で品質低下も生じない。検出時には、疑わしいテキストに同じ関数を再適用し、スコアの平均値を閾値と比較する。これにより、再推論なしで大規模に実行できるほど低コストなAIテキスト判定が可能になる。Raschkaはその限界も指摘している。シグナルは代替トークンの確率がほぼ等しい位置に存在するため、それらの位置を十分に編集すればウォーターマークは除去されてしまう。
出典: magazine.sebastianraschka.com ↗
このwatermarking techniqueは、従来のモデルや一般的なLLMsが内部でどのように機能するかを説明する良い方法でもある。
Sebastian Raschka
なぜ重要か
- → Claudeのテキストに透かしを入れるのに再学習は不要で、サンプリング層の微調整のみで済む。
- → 検出は計算コストが十分低く、再推論なしで大規模に実行できる。
- → テキストが編集されると信号は予測通りに劣化し、それがセキュリティ境界を定める。
透かし、再学習は不要