
OpenAI、SWE-Bench Proのタスクの約3分の1に欠陥を発見
OpenAIがSWE-Bench Proを監査した結果、その信頼性に欠けることが判明した。5人のエンジニアが公開されている731件のタスクのうち249件(34%)に欠陥があると指摘しており、プロンプトでは先頭のスペースが1つであるにもかかわらず2つ要求されるなど、非公開テストの判定が厳しすぎる、あるいは見当違いであることが理由に挙げられている。これはコーディングエージェントのベンチマーク評価を行うすべての人に対する具体的な警告である。同社はこのベンチマークの採用推奨を撤回しており、最先端モデルの精度が8ヶ月で23.3%から80.3%へと急上昇したことは、真の進歩と同じくらいデータ汚染の可能性を示唆している。
出典: the-decoder.com ↗