
GPT-6 Astra 通关 ARC-AGI-3 关卡的步数少于人类中位数,促使 Chollet 提前 AGI 预测
Epoch AI 在 50 多个基准测试中将 GPT-6 Astra 排名第一(169 分),而 Artificial Analysis 给其打分为 61 分、与 GPT-5.6 Sol 持平,落后于 Claude Fable 5.1 的 66 分、因此综合评价确实存在分歧。毫无争议的结果出现在 ARC-AGI-3 上,Astra 在约 $26,000 的测试成本下达到了 62.7% 的成绩,而 Sol 为 7.8%,Claude Opus 5 为 30.2%,并且在 96% 的关卡中,其通关步数少于成功通关的人类中位数。Francois Chollet 称这一进展比预期快了一倍,并提前了其 2030 年的 AGI 预测,将前沿竞争从原始基准分数转向 sample efficiency、即模型在掌握陌生环境前所需的经验量有多小。
来源: the-decoder.com ↗