
NVIDIAのNemotron 3.5 Lightning、Gemini 3.5 Flash-Liteの2倍となる670トークン/秒を達成
NVIDIAのNemotron 3.5 Lightningは、316億パラメータ(アクティブパラメータ36億)のハイブリッドMamba-Transformerモデルである。Artificial AnalysisのIntelligence Indexでは24を記録し、4分の1のパラメータ数でgpt-oss-120bと同等のレベルに達している。真の飛躍はスピードとエージェントタスクにある。Gemini 3.5 Flash-Liteの386トークン/秒に対して約670トークン/秒を記録したほか、GDPval-AA v2ではgpt-oss-120bの800に対し、824のEloレーティングを獲得している。純粋な知能スコアではQwen3.6 35B A3B(32)やMetaのMuse Glimmer(35)が依然として上回っている。そのため、制限の緩いOpenMDW-1.1ライセンスの同ウェイトは、フロンティアモデルとしてではなく、エージェントパイプライン向けの安価で高スループットなエンジンとして位置づけられる。
出典: the-decoder.com ↗
最終的なNVFP4ウェイトを使ったプレリリース試験では、このモデルは秒間約670 tokensを記録し、比較対象全モデルの中で最高の測定スループットであり、GoogleのGemini 3.5 Flash-Lite (386 tokens/s) のほぼ2倍の速さだ。
Artificial Analysis
なぜ重要か
- → 670 tokens/secはGemini Flash-Liteの2倍の速度を達成し、リアルタイムエージェントパイプラインを可能にする
- → 31.6B params、3.6B active — gpt-oss-120bと同等の知能を持ちながら、その4分の1のサイズ
- → Open weightsとpermissive licenseは、プロプライエタリモデルに対する無料で展開可能な代替手段となる
賢さよりも速さ