
Artificial Analysis、Intelligence Index v4.2で非公開ホールドアウトデータを40%に倍増
Artificial Analysisは「Intelligence Index v4.2」をリリースした。非公開ホールドアウトテストセットの比重を40%に倍増させたほか、エージェント型ナレッジワーク向けの「AA-Briefcase」と、4,592ページのPDFからなるSurge AIの「GDP.pdf」を追加し、スコアが飽和していた「GPQA Diamond」を除外した。このゲーミング対策への移行こそが真の変化であり、リーダーボードの順位は開発企業が学習に利用できないデータに依存するようになった。全体では依然としてClaude Fable 5.1が首位を維持しているが、GPT-6 Astraが2位につけており、GDP.pdfではFable 5.1の26.2%に対し33.2%でトップを獲得している。
出典: artificialanalysis.ai ↗
我々のIndexの重み付けの40%が、いまや非公開の、保持されたテストセットだ。これはv4.1から倍増した数字だ。
Artificial Analysis
なぜ重要か
- → 公開ベンチマークを通じたモデルラボの不正操作を40%のプライベートなテストセットが阻止する。
- → エージェント的な知的労働が、現実的な数週間にわたるプロジェクトのパフォーマンスとして測定されるようになった。
- → 最先端のリーダーたち (Fable 5.1、GPT-6 Astra) は、長文コンテキスト文書の推論で大きく意見が分かれている。
不正操作防止ベンチマーク