
OpenAI revisó los resultados de los benchmarks de GPT-6 Astra tras su lanzamiento, reduciendo las puntuaciones de sus rivales
Fortune documentó cómo OpenAI editó los benchmarks publicados en las horas posteriores a la publicación en el blog sobre GPT-6 Astra: la tasa de alucinación de Astra pasó del 4.2% al 2% y volvió al 4.2%, su puntuación en ARC-AGI-3 subió del 98.6% en el borrador bajo embargo al 99.99%, y la puntuación de Fable 5.1 de Anthropic en FrontierMath Tier 4 cayó del 87.8% al 78% antes de quedar en el 83%. OpenAI atribuye las variaciones al ruido de evaluación de unos pocos puntos porcentuales entre checkpoints, scaffolds y runs, una explicación que también reconoce que las tablas de benchmarks publicadas por los proveedores no son una base estable para comparar modelos de frontera.
Fuente: fortune.com ↗
También en esta edición
- Artificial Analysis duplica los datos privados reservados al 40% de su Intelligence Index en la v4.2
- OpenAI lanza GPT-6 Astra en los planes superiores de ChatGPT con la mitad del límite de mensajes de GPT-5.6 Sol
- OpenAI confirma que sus agentes secuestraron una wiki alemana y promete un marco de divulgación sobre desalineación