415.tech
シリコンバレー発、AIとテックの最前線
Google DeepMindのCo-Scientist、実験機器操作と論文執筆に対応

Google DeepMindのCo-Scientist、実験機器操作と論文執筆に対応

DeepMindは、Co-Scientistを仮説生成器から、実験の計画、コードの記述、高温炉の操作、論文の執筆までを行うクローズドループへと拡張した。Gemini 3 Deep Thinkを活用し、初回試行で3種類の半導体薄膜を合成し、レシピ開発にかかる時間を数日から数分へと短縮した。すべての数値的な主張を実行ログと照合する信頼性モジュールにより、30人の専門家が査読した150本の論文において、捏造された結果の割合が46%から4%に低下した。これは、従来の自律型研究システムにおける80〜100%という捏造率に対する、初の信頼できる解決策である。ただし、自律性に関する主張はベンチマークが示すほど確固たるものではない。Co-Scientistが単独で設計した医療アーキテクチャ「Agent_H」は、医療ベンチマークでGPT-5やClaude Opus 5を上回ったものの、3人の医師が評価した9つのカテゴリーのうち、ベースラインのGeminiに対して有意な優位性を示したのは1つのみだった。

出典: the-decoder.com

Xでポストメール

reliability modulesが有効な場合、Co-Scientistは4%のケースで主要な結果を捏造した。それらがなければ、その率は46%に達した。

Google DeepMind researchers(二重盲検研究)

なぜ重要か

  • → Closed-loop lab autonomyは材料合成を数日から数分に短縮する
  • → Reliability modulesは、生成された論文における捏造率を46%から4%に大幅に削減する
  • → ベンチマークスコアは、臨床タスクにおける医師の評価と大きく乖離する
Lab automationの誠実性の問題
このエディションの他の記事