
NVIDIAがNemotron 3.5 LightningとNeMo Switchyardルーターをリリース
NVIDIAは、OSSのルーティングライブラリ「NeMo Switchyard」をGitHubでリリースし、同時に大量のエージェントタスク向けに構築された30Bのmixture-of-expertsモデル「Nemotron 3.5 Lightning」を発表した。NeMo Switchyardは、アプリケーションを書き換えることなく、エージェントワークフローの各ステップをオープンモデル、プロプライエタリモデル、および同社のモデルの中から最適なものに振り分ける。社内ベンチマークではOpus 4.8単体と比較して約3分の1のタスク完了コストでフロンティアレベルの精度を維持し、LangChainの測定では145件のマルチターンDeep Agentsタスクにおいて、呼び出しの7%をフロンティアモデルにルーティングすることで、6%の精度低下と引き換えにコストを74%削減した。LangChain、LiteLLM、Kongを使用する開発者は直ちにステップごとのルーティングを追加できるが、公開されているコスト数値はすべてベンダーによる測定である点には留意が必要であり、すでにCognition、Ramp、Siemensなどが導入している。
出典: blogs.nvidia.com ↗
NeMo Switchyardは、frontierレベルの精度を維持しながら、タスク完了コストをOpus 4.8単独の場合のほぼ3分の1まで削減する。
NVIDIA社内ベンチマーク
なぜ重要か
- → エージェントは、コードを書き直すことなく、タスクをより安価なモデルにルーティングできるようになり、frontier-onlyモデルのみの場合と比較して58〜74%のコスト削減につながる。
- → Open 30Bモデルは、コードレビューやセキュリティ監視など、プライバシーが重要な専門タスク向けにローカルで動作する。
- → System-of-modelsアーキテクチャは、ベンダーロックインからオープンソースとプロプライエタリなモデル全体での開発者の選択肢へと制御を移す。
ルーティングがブルートフォース(総当たり)に取って代わる