
DeepSeekのDSpark、投機的バッチデコーディングで推論レイテンシを85%削減
DSparkは、軽量なドラフトモデルで応答候補を生成し、大規模モデルでそれらをバッチ検証することで、ユーザーあたりの応答時間を最大85%削減する。さらに、信頼度ベースのスケジューラがGPU負荷に応じて検証の深さを調整する仕組みだ。この成果は本物である。同社は輸出規制下にあるハードウェア向けにこれを開発しており、中国のAI開発が、単純なチップ数ではなく推論効率の面で複利的な進化を遂げていることを示している。
出典: scmp.com ↗
応答が長くなるとtoken-by-tokenの出力が遅くなることが多く、graphics processing units (GPU) の利用率が低くなり、ユーザーが感じる待ち時間が長くなる。これが「AIを提供する上での主要なボトルネック」だった
DeepSeek
なぜ重要か
- → 応答遅延を85%削減し、実用AIアプリを遅らせる推論ボトルネックに直接対処
- → 米国のチップ輸出規制を回避する中国の効率性優先AI戦略の成功を示す
- → 推論最適化が今や生ハードウェアのスケーリングよりも重要であることを示す
ハードウェアよりも効率性