
RunwayのSolaris、コードではなく動画でアプリUIを生成
RunwayのSolarisは、推論用の言語モデルと同社の動画モデル「Gen-4.5」をベースにした世界モデルを組み合わせ、ユーザーのクリック、ドラッグ、タイピングに合わせてアプリのインターフェースを720pでフレームごとにレンダリングする。自己回帰生成と蒸留された数ステップの拡散モデルにより、標準的な動画拡散モデルのわずかなコストでレイテンシを0.5秒未満に抑えている。これにより、生成されたインターフェースは、現在単一の固定レイアウトに過学習しがちなエージェントにとって、有望なトレーニング環境となる。アクセスはリクエストベースの早期アクセスとなっており、同社は安定して読み取れるテキスト、長時間のセッションにおける一貫性、スクリーンリーダーのサポートを未解決の課題として挙げている。これは製品版のランタイムではなく、研究的な試みである。
出典: runway.com ↗
今日構築されるあらゆるソフトウェアは、未だに変換を必要とする。つまり、視覚的なデザインは、何かを実行する前に、まず中間表現(例:コード)に変換されなければならない。
Runway
なぜ重要か
- → 中間コード層を排除し、インターフェースが直接レンダリング可能な視覚的成果物となる。
- → エージェントが固定されたインターフェースではなく、動的なレイアウトで学習するようになり、バリエーション全体での汎化性能が向上する。
- → 500ms未満の遅延でのリアルタイムフレーム生成が、これまで不可能だったインタラクティブな体験を可能にする。
ビデオがコードに取って代わる