415.tech
IA y tecnología, desde la primera línea de Silicon Valley
OpenAI revisó los resultados de los benchmarks de GPT-6 Astra tras su lanzamiento, reduciendo las puntuaciones de sus rivales

OpenAI revisó los resultados de los benchmarks de GPT-6 Astra tras su lanzamiento, reduciendo las puntuaciones de sus rivales

Fortune documentó cómo OpenAI editó los benchmarks publicados en las horas posteriores a la publicación en el blog sobre GPT-6 Astra: la tasa de alucinación de Astra pasó del 4.2% al 2% y volvió al 4.2%, su puntuación en ARC-AGI-3 subió del 98.6% en el borrador bajo embargo al 99.99%, y la puntuación de Fable 5.1 de Anthropic en FrontierMath Tier 4 cayó del 87.8% al 78% antes de quedar en el 83%. OpenAI atribuye las variaciones al ruido de evaluación de unos pocos puntos porcentuales entre checkpoints, scaffolds y runs, una explicación que también reconoce que las tablas de benchmarks publicadas por los proveedores no son una base estable para comparar modelos de frontera.

Fuente: fortune.com

Publicar en XCorreo
También en esta edición