
Terminal-Bench-Science公開、70件の専門家タスクでClaude Opus 5が解決率30%で首位
スタンフォード大学の研究者とTerminal-Benchチームは、「Terminal-Bench-Science 0.1」をリリースした。これは、生命科学、物理科学、地球科学、数理科学、工学の各分野にわたる70件の専門家厳選の研究ワークフローからなるベンチマークであり、22カ国376人の貢献者による920件の提案から抽出された。Claude Opus 5が解決率30.0%でリーダーボードの首位に立ち、GPT-5.6 Sol(22.4%)とClaude Fable 5(21.4%)がそれに続いた。タスクは最先端のシステムを意図的に破綻させるよう調整されているため、すべてのモデルのスコアがTerminal-Bench 3.0の記録を10ポイント以上下回っている。この70%の失敗率は、研究助手としてのエージェントの現状を如実に示している。実際の科学的ワークフローは依然としてほとんど未解決であり、このベンチマークは継続的に更新されるため、リリースのたびにハードルは上がっていく。
出典: terminal-bench-science.ai ↗
AIにおける科学的能力の基準を設定するのは、モデル開発者やデータベンダーではなく、科学者なのだ。
Terminal-Bench-Science team
なぜ重要か
- → 科学的なベンチマークは今や、教科書の問題ではなく実際のワークフローを測定する。
- → 70%の失敗率は、AIエージェントが実用的な研究支援には程遠い状態であることを示している。
- → 継続的なベンチマークは、科学的ニーズと最先端AIとの間のフィードバックループを生み出す。
科学が基準を設定する