テキストから動画を生成
テキストプロンプトから動画出力を生成し、テキスト駆動の生成ワークフローに適したモデルとして位置づけられています。
Stable Video は、テキストから動画を生成できる Stability AI の生成動画モデルです。可変フレームレート、短尺出力、ライセンス制の自社運用に対応。
Stable Video Diffusion は Stable Diffusion を基盤にした Stability AI の生成動画モデルです。製品ページでは、編集やポストプロダクションツールではなく、テキストプロンプトから動画を生成するモデルとして紹介されています。
サイトでは、テキストから動画への生成、可変フレームレート、高速な処理時間という 3 つの中核機能が強調されています。また、このモデルは self-hosted license の下で自社インフラにデプロイできるとされており、自社の環境内で動画生成を実行したいチームにとって適しています。
テキストプロンプトから動画出力を生成し、テキスト駆動の生成ワークフローに適したモデルとして位置づけられています。
14 または 25 フレームを生成でき、1秒あたり 3〜30 フレームの範囲でフレームレートを制御できます。
サイトでは動画を 2 分以内で作成できるとされており、生成クリップの短い所要時間が示唆されています。
自社の環境でモデルを実行できる self-hosted デプロイ経路を提供しています。
サイト上の「Get license」CTA を通じて、ライセンス制のアクセスフローを提供しています。
早期のビジュアルコンセプトや、動きのある素早い下書きが必要なときに、プロンプトテキストから短い動画クリップを生成します。
チームが環境やデプロイ設定をローカルで管理する必要がある場合に、自社インフラ内でモデルを実行します。
タイミングやクリップ長が実験に重要な場合に、選択したフレームレートで短尺動画を生成します。
サイトで示されている 2 分以内の処理時間が関連する、短時間で反復する動画ワークフローの評価に役立ちます。
Stable Video Diffusion は、テキストプロンプトから動画出力を作成する生成動画モデルとして説明されています。提示されたページ本文では、より広い入力形式やワークフローの違いについては記載されていません。
ソースでは、14フレームと25フレームの生成に対応し、1秒あたり3〜30フレームの範囲でフレームレートを調整できるとされています。
ページには動画を2分以内で作成できるとありますが、ハードウェア要件、キューの挙動、すべてのワークロードでの保証については記載されていません。
サイトでは、Stable Video Diffusion を self-hosted license の下で自社インフラにデプロイできると案内しており、高度なカスタマイズに対応しています。
提供されたテキストではライセンス制の流れが示されていますが、収集された内容には明示的な商用条件や価格の金額は記載されていません。