415.tech
シリコンバレー発、AIとテックの最前線
GPT-6 AstraがARC-AGI-3を人間の中央値未満の手数でクリア、CholletのAGI予測前倒し

GPT-6 AstraがARC-AGI-3を人間の中央値未満の手数でクリア、CholletのAGI予測前倒し

Epoch AIは50以上のベンチマークでGPT-6 Astraを169点で首位と評価した。一方でArtificial Analysisは同モデルを61点とし、GPT-5.6 Solと同等、66点のClaude Fable 5.1を下回ると評価しており、総合的な見解は完全に分かれている。議論の余地がないのはARC-AGI-3の結果だ。Astraは約26,000ドルのテストコストで62.7%に達し、Solの7.8%やClaude Opus 5の30.2%を上回った。さらに、クリアした人間の中央値よりも少ない手数で96%のレベルを解き終えた。Francois Cholletはこの進歩を予想の2倍の速さだと評価し、2030年としていたAGI実現の予測を前倒しした。これにより、最先端モデルの競争は単純なベンチマークスコアから、未知の環境を習得するまでに必要な経験の少なさを示すサンプル効率へと移行している。

出典: the-decoder.com

Xでポストメール

Astraは96パーセントのレベルを、それらを解いた人間の中央値よりも少ない手数でクリアした。平均すると、半分強の手数でだ。

ARC Prizeの測定結果

なぜ重要か

  • → Sample efficiencyは今や人間よりもAIに軍配が上がる。少ない試行回数でより速く学習するのだ。
  • → Cholletが予測するAGI達成時期は早まり、フロンティアは生スコアから環境適応へと移行した。
  • → モデルは、かつては外部の補助を必要とした推論を内部化し、その場で記号表記を発明する。
Sample efficiencyの逆転
このエディションの他の記事