
OpenAI、GPT-6 Astra公開後にベンチマーク修正、競合スコアを下方修正
Fortune誌は、GPT-6 Astraのブログ記事公開から数時間のうちに、OpenAIが公開済みのベンチマークを編集した経緯を追跡した。Astraのハルシネーション率は4.2%から2%に下がり再び4.2%に戻ったほか、同モデルのARC-AGI-3スコアは報道解禁前ドラフトの98.6%から99.99%に上昇した。一方で、AnthropicのFable 5.1のFrontierMath Tier 4スコアは87.8%から78%に低下した後、最終的に83%に落ち着いている。OpenAIはこの変動について、チェックポイント、スキャフォールド、実行における数パーセントの評価ノイズが原因だと説明している。しかしこの説明は、ベンダーが公開するベンチマーク表がフロンティアモデルを比較する上で安定した基準ではないことを自ら認めるものでもある。
出典: fortune.com ↗
ほとんどの評価は、報告に使われた正確なcheckpoint、scaffold、およびevaluation runによって、数パーセントポイントのノイズを含んでいる。
OpenAI広報担当者
なぜ重要か
- → ベンチマーク操作は、競争激化する業界での公正なモデル比較を脅かす。
- → OpenAIが公開後に行った編集は、ベンダー公表の性能主張の信頼性を損なう。
- → 評価条件の透明性不足により、報告された数値を信用することはできない。
批判されるベンチマーク