
OpenAI发布后修改GPT-6 Astra的benchmark数据,下调竞品得分
《财富》追踪发现,在GPT-6 Astra博客文章上线后的数小时内,OpenAI多次修改了已发布的benchmark数据:Astra的幻觉率从4.2%降至2%后又改回4.2%,其ARC-AGI-3得分从解禁前草案的98.6%升至99.99%,而Anthropic的Fable 5.1在FrontierMath Tier 4的得分从87.8%降至78%,最终定格在83%。OpenAI将这些数据波动归因于不同checkpoint、scaffold和run之间存在几个百分点的评估噪声、这一解释也变相承认,厂商发布的benchmark表格并非比较前沿模型的可靠依据。
来源: fortune.com ↗