Skip to main content
Gemini Omni Flashは、Google DeepMindの会話型ビデオ生成・編集モデルです。Google I/O 2026でGemini Omniファミリーの一部として初めて発表されました。Geminiのマルチモーダル推論とネイティブビデオ作成を組み合わせ、自然言語でやりたいことを記述し、参照画像やビデオを添付すると、同期されたオーディオ付きのクリップを生成します。現在のバージョンGemini Omni Flash 1.1は2026年8月27日に一般提供(GA)され、キーフレーム補間、360p/4K出力オプション、シーン拡張が追加されました。

Gemini Omni Flash 1.1 が得意なこと

  • 会話型ビデオ編集: 自然言語でビデオを編集・調整: キャラクターの交換、シーンの再照明、アングルの変更、オブジェクトの追加・削除を、オリジナルのオーディオとビデオトラックを維持したまま実行できます
  • マルチモーダル入力: テキスト、画像(最大14枚)、ビデオ(最大3本、各10秒)を組み合わせて生成をガイドします。すべての出力にネイティブのオーディオトラックが付きます
  • キーフレーム補間: image_to_video タスクでは、先頭フレームとオプションの末尾フレームを添付すると、その間の映像をモデルが生成します
  • 参照画像からビデオへ: <IMAGE_REF_0> のようなタグで参照画像を役割にバインドすると、画像内のキャラクター、製品、オブジェクトが新しいシーンに登場します。画像自体はフレームとして使用されません
  • シーン拡張: extend タスクはクリップに最大10秒の新しい映像を追加します。直近10秒のコンテキストを読み取ってキャラクターと動きの一貫性を保ち、累計で約40秒まで拡張できます
  • 解像度コントロール: 360pで下書きし(コストは720pの約3分の1)、その後720p、1080p、4Kで再レンダリングします。16:9と9:16のアスペクト比に対応しています
  • 世界知識とシミュレーション: 物理の理解と、Gemini の歴史・科学・文化的文脈に関する知識を組み合わせ、フォトリアリズムを超えた意味のあるストーリーテリングを可能にします
  • テキストとアクションの同期: 読みやすいテキストとグラフィックスをビデオに直接レンダリングし、動的タイポグラフィを画面上の動きに同期させます
APIノードを使用するには、正しくログインしていることと、許可されたネットワーク環境で使用していることを確認する必要があります。APIノードの使用に必要な具体的な要件については、ドキュメントの「APIノードの概要」セクションをご参照ください。
ComfyUI が最新版に更新されていることを確認してください。このガイドで紹介するワークフローは、ワークフローテンプレートから入手できます。 テンプレート内に該当のワークフローが見つからない場合、ComfyUI のバージョンが古くなっている可能性があります。ワークフローを読み込んだ際にノードが欠落している場合の考えられる原因:
  1. 最新の ComfyUI(Nightly 版)を使用していない
  2. 起動時に一部のノードのインポートに失敗している
Gemini Omni Flash 1.1 のワークフローには ComfyUI 0.34.2 以降が必要です。ノードのモデルドロップダウンで Omni Flash 1.1 を選択するとGAモデルを使用できます。Omni Flash オプションはプレビューモデルを実行します。このモデルは2026年9月30日に廃止される予定です。

利用可能なワークフロー

テキストから動画へ(Omni Flash 1.1)

Gemini Omni Flash 1.1を使用して、自然言語のプロンプトから映画的なビデオを生成します。プロンプトで希望の長さ(3〜10秒)を直接記述し、ノードでアスペクト比と出力解像度を選択します: 16:9または9:16、低コストの下書きには360p、最終レンダリングには最大4K。すべてのクリップに生成されたオーディオトラックが含まれます。 Gemini Omni Flash 1.1 テキストからビデオへのワークフロープレビュー

Comfy Cloudで実行

Comfy Cloudで開く

ワークフローをダウンロード

JSONをダウンロードするか、テンプレートライブラリで「Gemini Omni 1.1」を検索

画像から動画へ(Omni Flash 1.1)

Gemini Omni Flash 1.1で画像をアニメーション化します。image_to_video タスクでは、添付した1枚目の画像が先頭フレームになり、オプションの2枚目の画像が末尾フレームになります: モデルがその間の映像を生成するため、カメラのオービット、ズームトランジション、ループクリップが予測しやすくなります。 Gemini Omni Flash 1.1 画像からビデオへのワークフロープレビュー

Comfy Cloudで実行

Comfy Cloudで開く

ワークフローをダウンロード

JSONをダウンロードするか、テンプレートライブラリで「Gemini Omni 1.1」を検索

参照画像からビデオへ(Omni Flash 1.1)

最大14枚の参照画像から、特定の被写体を取り込んだビデオを生成します。参照モードでは、<IMAGE_REF_0> のようなタグで各画像を役割にバインドし、プロンプト内でそのタグを参照します: 画像内のキャラクター、製品、オブジェクトがシーンに登場し、画像自体はフレームとして使用されません。キャラクター参照とスタイル参照を組み合わせると、ブランド一貫性のあるコンテンツにできます。 Gemini Omni Flash 1.1 参照画像からビデオへのワークフロープレビュー

Comfy Cloudで実行

Comfy Cloudで開く

ワークフローをダウンロード

JSONをダウンロードするか、テンプレートライブラリで「Gemini Omni 1.1」を検索

ビデオ編集(Omni Flash 1.1)

Gemini Omni Flash 1.1を使用して、自然言語でビデオを編集します。edit タスクでは、ノードは入力ビデオを1本だけ受け取り(10秒以内)、指示に基づいて書き換えます: 背景の交換、シーンのスタイル変更、要素の追加・削除。editextend タスクは入力ビデオのアスペクト比を維持します。シンプルなプロンプトが最も効果的です。「他はそのままに」と添えると一貫性が最大になります。 Gemini Omni Flash 1.1 ビデオ編集ワークフロープレビュー

Comfy Cloudで実行

Comfy Cloudで開く

ワークフローをダウンロード

JSONをダウンロードするか、テンプレートライブラリで「Gemini Omni 1.1」を検索

ビデオ拡張(Omni Flash 1.1)

extend タスクで既存のビデオを1ステップあたり最大10秒拡張し、合計約40秒のストーリーを構築できます。モデルは直近10秒のコンテキストを分析し、シーンが中断した箇所から継続する際にキャラクター、動き、オーディオの一貫性を保ちます。参照画像を添付して、ストーリーの途中で新しいキャラクターを登場させることもできます。拡張はクリップの末尾にのみ新しいコンテンツを追加しますが、トランジションを自然にするためモデルが元の末尾フレームを修正する場合があります。 Gemini Omni Flash 1.1 ビデオ拡張ワークフロープレビュー

Comfy Cloudで実行

Comfy Cloudで開く

ワークフローをダウンロード

JSONをダウンロードするか、テンプレートライブラリで「Gemini Omni 1.1」を検索

はじめる

  1. ComfyUIを最新バージョンにアップデートする(Omni Flash 1.1 ワークフローには0.34.2以降が必要)
  2. キャンバスをダブルクリックし、「Gemini Omni Flash」ノードを検索する
  3. またはテンプレートライブラリから既製のワークフローを使用する
  4. 入力タイプ(テキスト、画像、ビデオ)に合ったワークフローを選択する
  5. プロンプトを入力して生成する
最良の結果を得るには、Gemini Omni FlashをNano Banana 2 Liteと組み合わせて使用してください。高速度で画像を生成し、その後Gemini Omni Flashでアニメーション化してビデオにします。