Google、生成AI動画モデル「Gemini Omni 1.1 Flash」を提供開始 シーン延長や4K出力に対応

Google、生成AI動画モデル「Gemini Omni 1.1 Flash」を提供開始 シーン延長や4K出力に対応
出典:Gemini Omni 1.1 Flash lets you build with more control

Googleは8月27日、開発者向けの生成AI動画モデル「Gemini Omni 1.1 Flash」を発表しました。動画生成や編集における制御機能を強化したアップデートで、Gemini APIを通じてGoogle AI Studioで利用できます。Google DeepMindのプロダクトマネージャー、Anish Nangia氏とAlisa Fortin氏は、プロ向けの用途に対応する「production-ready」のモデルとして位置付けています。

新機能の一つは、既存の映像の続きを生成するシーン延長です。Omni 1.1 Flashは、直前の映像について最大10秒間の文脈を分析できます。従来のモデルでは最後の1秒間を参照していたとしており、Googleは映像上の一貫性と物語への追従性を改善したと説明しています。動画は10秒単位で延長でき、累積で最大40秒まで作成可能です。開発者はプロンプトを使い、カメラの移動や登場人物の会話などを指定して続きのシーンを生成できます。

開始フレームと終了フレームを指定し、その間を連続した映像として生成する機能も加わりました。複雑なカメラの周回やズームによる遷移、途切れのないループ映像などでの利用を想定しています。Googleは、こうした機能により、生成動画のワークフローやクリエイティブツール、メディア編集ソフトを開発する際に、映像表現をより細かく制御できるようにするとしています。

試作向けには、360p解像度の軽量なプレビュー生成を用意しました。Googleによると、標準の720pと比べて最大60%高速に生成でき、費用は3分の1です。この速度比較は、360pと720pのシステムスループットに基づくものです。ストーリーボードの反復やレンダリングの確認など、複数の案を短時間で比較する用途を想定します。最終出力では1080pまたは4Kへのアップスケーリングに対応し、プロダクション向けの高解像度映像を生成できます。

マルチモーダル入力では、最大3秒間の動画を参照素材として利用可能です。動画参照を基に視覚的な文脈やキャラクターの一貫性を維持しながら、場面を作成できるとしています。

Omni 1.1 FlashはGoogle AI Studioのほか、Gemini Enterprise Agent PlatformのAgent Platform APIで企業が利用できます。Google Flowでは、Google AI Plus、Pro、Ultraの世界中の加入者に同日から提供します。シーン延長機能はGeminiアプリでも、これら3プランの加入者が世界で利用できます。Googleは公式ドキュメント、cookbook、プロンプト作成ガイドも公開し、シーン延長、動画参照、アップスケーリングのアプリケーションへの組み込みを案内しています。


出典:Gemini Omni 1.1 Flash lets you build with more control

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!
目次