
Mithil Vakdeの1.5時間学習Transformerが67セントでARC-AGI-1スコア44%達成
独立系研究者のMithil Vakdeは、1基のRTX 5090を使用して約1.5時間で小規模なTransformerをゼロからトレーニングし、すべてのタスクのトレーニングと推論を含む総計算コスト67セントで、ARC-AGI-1の公開評価セットで44%、ARC-AGI-2で7%のスコアを達成した。この結果はスケールではなくサンプル効率の高さを示す真のシグナルである。3D RoPE位置埋め込み、パズルごとの学習済み埋め込み、色と二面角のデータ拡張のみを使用してTRM/HRMクラスのスコアに匹敵しており、コードはgithub.com/mvakde/mdlARCで公開されている。最先端ベンチマークの推論研究が、合成データや研究機関の予算なしに、1基のコンシューマー向けGPUで実現可能になった。
出典: mvakde.github.io ↗
私は小さなtransformerを5090上で1.5時間でゼロから訓練した。多くのLLMを凌駕し、TRM/HRMと同等のスコアを出す
Mithil Vakde
なぜ重要か
- → Frontier AI推論 (44% ARC-AGI-1) が現在、消費者向けハードウェアで67セントで動作する。
- → スケールではなくサンプル効率がAGIに近いベンチマークを推進することを証明する。
- → 研究室の予算や特殊なインフラを持たない研究者にとって、フロンティア研究を可能にする。
スケールよりも効率性