
Google、物理法則に準拠した編集が可能なany-to-videoモデル「Gemini Omni Flash」を発表
Gemini Omni Flashは、テキスト、画像、音声、動画の任意の組み合わせを入力として受け取り、物理シミュレーション、シーンの記憶、キャラクターの一貫性を備えた動画を出力する。同モデルは本日より、GeminiアプリおよびGoogle Flowを通じてAI Plus、Pro、Ultraのサブスクリプション登録者に提供されるほか、YouTube Shortsでは無料で利用できる。この戦略的な動きは、Googleが単一のモデルで推論と生成のギャップを埋めるものであり、初期状態からSynthIDによる電子透かしが組み込まれている。開発者および企業向けAPIも今後提供される予定だ。
出典: blog.google ↗
Omni は、あらゆる入力からあらゆるものを作成できる新しいモデルだ。ビデオから始まる。
Google
なぜ重要か
- → 自然言語での会話を通じたビデオ編集により、フレームバイフレームのツール操作が不要になり、プロフェッショナル品質のアウトプットへのハードルが低くなる。
- → 物理シミュレーションとシーンメモリが編集全体で一貫性を維持し、コヒーレンスを失わずに複雑なマルチターンの創造的改良が可能になる。
- → 初期段階から組み込まれた SynthID ウォーターマーキングは、大規模な合成ビデオの来歴を確立し、広範な採用前に真正性の懸念に対処する。
推論が生成と出会う