EN ← トップへ戻る
生成AI

Gemini Omni発表|動画を含む多様な入力からコンテンツ生成

Google I/O 2026で披露されたGemini Omni。動画を含むマルチモーダルな入力と生成・編集の方向性を整理。

記事ID:TC-0013 公開: 更新:2026-10-10

GoogleはI/O 2026で、新しいマルチモーダルモデル『Gemini Omni』を発表しました。動画を起点に、さまざまな形式の入力からコンテンツを作成・編集する方向性を示しています。

マルチモーダルAIは、文章だけでなく画像、音声、映像などの情報を組み合わせて扱います。制作現場では、素材の理解と編集指示を同じワークフローで扱える可能性があります。

【Gemini Omniの発表で重要な点】GoogleがI/O 2026で示したGemini Omniは、さまざまな形式の入力を受け取り、コンテンツを生成・編集することを目指すモデルです。ただし、発表時点の中心は動画出力です。将来的に『あらゆる入力からあらゆる出力へ』広げるという構想と、現在使える機能を区別する必要があります。

【動画生成とマルチモーダル理解の関係】文章で場面を指示するだけでなく、写真、動画、音声などを参考素材として渡せる点が特徴です。例えば写真の構図を参考に映像を作る、既存の動画に新しい要素を加えるといった制作が想定されます。複数の素材を統合するほど、どの素材の特徴を優先するかという編集意図を明確にすることが重要になります。

【物理表現への取り組み】Googleは、重力、運動エネルギー、流体の動きなどに対する理解の改善を説明しています。動画では、静止画像の見栄えがよくても、物体の移動や接触が不自然だと違和感が生まれます。物理的な一貫性の向上は、映像の説得力を高める方向ですが、あらゆる場面で物理法則が正確に再現されることを保証するものではありません。

【会話による編集という体験】Geminiアプリでは、背景の変更や映画的なズームなどを自然言語で指示する動画編集が紹介されています。従来の編集ソフトでは、複数の設定画面やタイムラインを操作する必要がありました。会話型の編集は、完成イメージを言葉で伝える入口を増やすものです。一方、細かなフレーム単位の調整がどこまで可能かは実際の機能で確認する必要があります。

【既存の写真や動画を素材にする】Googleは、カメラロールから写真や動画をアップロードし、テンプレートを適用できると説明しています。専門的な編集知識がなくても試作を始めやすくなる可能性があります。ただし、アップロードする素材に他人の顔や著作物が含まれる場合は、利用許諾や公開範囲を考慮しなければなりません。

【キャラクターの一貫性】連続する動画の場面で人物の外見や声が変わると、作品としてのつながりが損なわれます。GoogleはOmni Flashでキャラクターの一貫性が改善し、シーンをまたいでアイデンティティと声を保ちやすくなったとしています。これは長いストーリー制作に関わる重要な課題ですが、すべての生成結果で完全な一致が得られると考えるべきではありません。

【音声入力の提供範囲】公式発表では、画像、文章、動画、音声を参考情報として使う方向性が示されています。ただし、音声については開始時点で声の参照に対応し、その他の音声入力は今後追加する計画とされています。『マルチモーダル対応』という言葉だけで、すべての形式を同じ条件で利用できると判断しないことが大切です。

【SynthIDによる来歴確認】Googleは、Omniで作成した動画に、目に見えにくいSynthIDの電子透かしが含まれると説明しています。Geminiアプリ、Chrome内のGemini、検索を通じて確認できる仕組みも紹介しています。ただし、電子透かしは動画の内容が真実であることを示すものではなく、編集や再加工に対する検出の限界にも注意が必要です。

【YouTubeとの連携】YouTube Shorts RemixやYouTube CreateでもOmniの機能が提供され、対象ユーザーは無料で利用できるとGoogleは案内しています。既存のショート動画をもとに変更を加える使い方も紹介されています。ただし、対象となる動画や年齢などの条件があるため、利用前に提供画面の案内を確認する必要があります。

【提供条件を整理する】Googleの発表によると、Gemini Omni FlashはGoogle AI Plus、Pro、Ultraの加入者向けにGeminiアプリとGoogle Flowで展開されています。一方、YouTube Shorts RemixとYouTube Createでは18歳以上の対象ユーザーに無料提供するとしています。モデル名が同じでも、サービスによって使える操作や条件が異なる可能性があります。

【制作現場での評価ポイント】映像制作では、最初の生成速度だけでなく、修正指示に対する追従性、人物や背景の一貫性、素材の権利処理、納品可能な品質が重要です。生成結果がよく見えても、必要な箇所だけを変更できない場合は編集作業が増えることがあります。試作段階では、実際の制作フローに沿って複数回の修正を試すことが有効です。

【今後の展望】Gemini Omniは、動画生成を単独の機能として扱うのではなく、素材の理解と編集を会話の中でつなぐ方向を示しています。今後は音声などの対応拡大に加え、長い作品での一貫性、編集の精度、権利と来歴の管理が注目点です。発表時のデモと、一般利用で再現できる結果を分けて評価することが重要になります。

ただし、発表時のデモで可能な操作と、一般利用者がすぐ使える機能は必ずしも同じではありません。利用条件や提供地域を確認したうえで評価する必要があります。

情報源

Google Blog — Google I/O 2026 (May 20, 2026) ↗