
Alibaba「Wan3.0」、テキストや画像、文書から30秒の動画を生成
Alibabaの「Wan3.0」がベータ版として公開された。動画長の上限をWan2.5の2倍となる30秒に引き上げ、1回のプロンプトで最大10枚の画像、5本の動画、5つの音声クリップに加え、PDF、Webページ、PowerPointファイルを受け付ける。同社は、キャラクターや小道具、空間レイアウトの一貫性が強化されたと説明している。これは、生成動画を使い物にならなくする顔やインターフェースの崩れに対する具体的な修正となる。利用料金は1秒あたり0.05〜0.28ドルで、wan.video、Alibaba Cloud Model Studio、Qwen Cloud API経由で提供される。このリリースは、同社がAI投資による前年同期比75%の減益を報告し、香港上場企業として過去最大規模の株式売却を発表したのと同じ週に行われた。動画生成を、同社がシェア獲得を狙うボリュームビジネスと位置付けていることがうかがえる。
出典: the-decoder.com ↗
AI生成ビデオは、特に顔やユーザーインターフェースにおいて、しばしばvisual driftや歪みに悩まされる。Wan3.0は、キャラクター、小道具、空間レイアウトといった参照素材からの細部をより一貫性のあるものに保つことで、それを解決することを目指す。
Alibaba
なぜ重要か
- → ほとんどのAIビデオが制作に使えなくするvisual drift problemを解決する
- → 1つのプロンプトでMultimodal input(テキスト、画像、ビデオ、オーディオ、PDF)を可能にし、制作の手間を削減する
- → ビデオ生成が目新しさから本格的な事業へと移行していることを示し、Alibabaは75%の利益率にもかかわらず巨額を投じている
ビデオ生成が本格化する