
Geminiのエージェント型動画理解機能、動画解析トークンを最大88%削減
Googleは、「Gemini 3.7 Flash」「3.6 Flash」「3.5 Flash-Lite」向けにエージェント型動画理解機能を提供開始した。モデルが固定の1fpsで動画を読み込むのではなく、どのセグメント、フレーム、音声、トランスクリプトを検査するかを自律的に選択することで、トークン数を最大88%、解析コストを最大66%削減しつつ、精度を最大7%向上させる。追加機能料金は不要で、標準のトークン価格のままAPIの単一設定で有効化できる。これにより、90分の講義や数時間に及ぶ録画におけるコストと詳細さのトレードオフを解消し、Flashクラスのモデルを動画解析における精度対コストの最前線に押し上げる。
出典: blog.google ↗
agenticな動画理解は、分析コストを最大66%、トークン消費量を最大88%削減し、同時に精度を最大7%向上させる
Google
なぜ重要か
- → 動画分析トークンを88%削減し、コストを66%削減しつつ精度も向上する
- → コストと詳細さの間で強制的なトレードオフを強いられることなく、長尺動画の処理を可能にする
- → フレーム、音声、トランスクリプトのAgenticな選択が、固定レート取り込みのオーバーヘッドを排除する
よりスマートな動画解析