
RoboflowベンチマークでGPT-5.6 Solが46.2 mAP、GPT-5.5の検出スコア3倍
RoboflowのVLMベンチマークにおいて、OpenAIのGPT-5.6 Solは物体検出で46.2 mAP@50(GPT-5.5は13.8)、カウントタスクで73.0%(同64.9%)を記録した。性能向上にはばらつきがあり、OCRとテキスト抽出はそれぞれ90.7%と82.5%に低下した。しかし、これまで同社の弱点であった物体検出は、ドキュメントのワークフローや画面理解エージェントで実用レベルの能力へと進化している。画像1枚あたりのコストはSolの2.5セントに対し、Gemini 3.5 Flashは0.8セントで依然として両タスクをリードしており、大量の画像処理タスクにおける経済性に変化はない。
出典: blog.roboflow.com ↗
Detectionは弱点から実用的な機能へと移行し、モデルファミリー全体でCounting機能が向上した。
Roboflow
なぜ重要か
- → Object detectionが3.3倍向上し、視覚的理解に依存するドキュメントワークフローやUIエージェントの制約を解消した。
- → SolはGemini 3.5 Flashより3倍高価なままであり、大量のビジョン作業での導入を制限している。
- → OpenAIはコンピュータビジョンにおける長年の弱点についに終止符を打ち、VLMの能力ランキングを再構築している。
OpenAIのビジョン戦略の転換