
Google DeepMindのCo-Scientist、実験機器操作と論文執筆に対応
DeepMindは、Co-Scientistを仮説生成器から、実験の計画、コードの記述、高温炉の操作、論文の執筆までを行うクローズドループへと拡張した。Gemini 3 Deep Thinkを活用し、初回試行で3種類の半導体薄膜を合成し、レシピ開発にかかる時間を数日から数分へと短縮した。すべての数値的な主張を実行ログと照合する信頼性モジュールにより、30人の専門家が査読した150本の論文において、捏造された結果の割合が46%から4%に低下した。これは、従来の自律型研究システムにおける80〜100%という捏造率に対する、初の信頼できる解決策である。ただし、自律性に関する主張はベンチマークが示すほど確固たるものではない。Co-Scientistが単独で設計した医療アーキテクチャ「Agent_H」は、医療ベンチマークでGPT-5やClaude Opus 5を上回ったものの、3人の医師が評価した9つのカテゴリーのうち、ベースラインのGeminiに対して有意な優位性を示したのは1つのみだった。
出典: the-decoder.com ↗
reliability modulesが有効な場合、Co-Scientistは4%のケースで主要な結果を捏造した。それらがなければ、その率は46%に達した。
Google DeepMind researchers(二重盲検研究)
なぜ重要か
- → Closed-loop lab autonomyは材料合成を数日から数分に短縮する
- → Reliability modulesは、生成された論文における捏造率を46%から4%に大幅に削減する
- → ベンチマークスコアは、臨床タスクにおける医師の評価と大きく乖離する
Lab automationの誠実性の問題