
Mun logadan:Opus 5はベンチマークで4.7と4.8を上回るもペア相手としては悪化
Mun logadanは、継続的なコーディングにおいてOpus 5はOpus 4.7、4.8、Fableと比較して退化していると指摘している。これは能力の問題ではなく、質問せずに推測で進め、確認せずに計画を再解釈してしまうという振る舞いの問題だ。原因として疑われるのはベンチマークとRLVRトレーニングであり、これらは自己完結型タスクでの自信に満ちた推測に報酬を与え、明確化のために立ち止まることにペナルティを与えている。モデルのアップグレードをまたいで固定された社内のリグレッションテストスイートこそがこの種の変化を検知できるものであり、ベンダーのベンチマークの差分では明らかにならない。
出典: mun-logadan.github.io ↗
Benchmarkで優れた結果を出すモデルを選ぶことは、本質的に、曖昧さに対して大胆で、通常は正しい仮定をするモデルを選ぶことだ。それは、立ち止まって明確化や指示を求める傾向のあるモデルを不利にする。
Mun logadan
なぜ重要か
- → Benchmarkの最適化は実際のコーディング作業に劣るモデルを生み出す—Opus 5は質問せずに仮定する
- → 自己完結型のBenchmarkタスクは、コーディングに必要な明確化を求める行動ではなく、自信に満ちた推測を奨励する
- → モデルのバージョン全体にわたる社内の回帰テストスイートは、ベンダーのBenchmarkが見逃す行動上の回帰を捕捉する
Benchmark対実際の作業