415.tech
シリコンバレー発、AIとテックの最前線
Claude、再学習ではなくトークンサンプリング制御でウォーターマーク付与

Claude、再学習ではなくトークンサンプリング制御でウォーターマーク付与

Anthropicのウォーターマークは、Claudeのサンプリング段階に組み込まれている。秘密鍵をシードとする関数が候補トークンにビット署名を割り当て、トーナメント方式で出力トークンを選択するため、再学習は不要で品質低下も生じない。検出時には、疑わしいテキストに同じ関数を再適用し、スコアの平均値を閾値と比較する。これにより、再推論なしで大規模に実行できるほど低コストなAIテキスト判定が可能になる。Raschkaはその限界も指摘している。シグナルは代替トークンの確率がほぼ等しい位置に存在するため、それらの位置を十分に編集すればウォーターマークは除去されてしまう。

出典: magazine.sebastianraschka.com

Xでポストメール

このwatermarking techniqueは、従来のモデルや一般的なLLMsが内部でどのように機能するかを説明する良い方法でもある。

Sebastian Raschka

なぜ重要か

  • → Claudeのテキストに透かしを入れるのに再学習は不要で、サンプリング層の微調整のみで済む。
  • → 検出は計算コストが十分低く、再推論なしで大規模に実行できる。
  • → テキストが編集されると信号は予測通りに劣化し、それがセキュリティ境界を定める。
透かし、再学習は不要
このエディションの他の記事