
Anthropicの自動研究者、時給4ドルで10件のアライメントベンチマークにおいて人間の提案を上回る
AnthropicのフェローであるChen Yueh-Hanの論文によると、自動研究者は各イテレーションで文献検索、手法の提案、30分間のトレーニングを実行し、全体的なパフォーマンスを低下させることなく、テストした10件のアライメントベンチマークすべてでターゲットモデルを改善した。最も優れた自動化手法は、経験豊富な人間が6時間かけて提案する内容を上回った。同社が人間の研究者に支払う時給150ドルに対し、API推論コストは時給約4ドルに収まっており、アライメント作業における再帰的な自己改善の具体的なコスト曲線が初めて示された。ただし同論文は、この結果がベンチマークが実際のアライメント目標を反映している場合にのみ成立すると認めており、ベンチマーク設計が人間に残された仕事となるとしている。
出典: techcrunch.com ↗
最高のAAR手法は、経験豊富な人間が提案するものを平均して6時間以内に打ち負かす。
Anthropicの論文「Automated Researchers Can Reliably Mitigate Alignment Failures」
なぜ重要か
- → AIシステムは今や人間のalignment研究者を1/37のコストで打ち負かす。
- → 安全性確保の分野におけるrecursive self-improvementへの道を開く。
- → 研究者の労力ではなく、Benchmark設計がボトルネックになる。
研究者が研究を自動化する