Google「EmbeddingGemma 2」発表|画像・音声も横断検索する軽量AIの仕組み
Googleが2026年10月6日に発表したEmbeddingGemma 2を解説。テキスト、画像、動画、音声を共通のベクトル空間で扱う軽量モデルの特徴と端末内AIへの可能性を紹介。
Googleは2026年10月6日、テキストやコードに加えて画像、動画、音声を横断的に検索できる埋め込みモデル「EmbeddingGemma 2」を開発者向けに紹介しました。異なる形式のデータを共通の数値表現に変換することで、キーワードの一致だけに頼らない検索を可能にします。
埋め込み(embedding)とは、文章や画像などの意味的な特徴を数値の並びで表す技術です。EmbeddingGemma 2では複数の種類のデータを768次元の共通空間に写像します。例えば、文章で説明した場面に近い写真や動画を探すといった、形式をまたぐ検索への応用が考えられます。
【検索AIと文章生成AIの違い】EmbeddingGemma 2は、質問に対して長い説明文を書くためのモデルではありません。文章や画像を数値ベクトルへ変換し、内容が似ている情報を探すためのモデルです。生成AIアプリで使う場合、検索モデルが関連資料を見つけ、その結果を別の言語モデルが要約・回答するという役割分担が考えられます。
【共通ベクトル空間とは】異なる形式の情報を同じ768次元の空間へ写すことで、文章の質問と写真、動画、音声を比較できるようにします。例えば『夕日の海岸で波の音が聞こえる場面』という文章を、写真と音声の両方に照らして検索する使い方です。検索結果は意味的な近さをもとに順位付けされるため、必ずしも内容の正しさや同一性を保証しません。
【必要な機能だけ読み込む構成】Googleの開発者向け資料では、テキストとコードのみなら2億7,000万パラメータ、画像を加えると4億4,000万、音声を加えると5億7,000万、すべてを扱うと7億4,000万パラメータの構成になります。不要なエンコーダーを読み込まないことで、端末上のメモリ使用量を抑える狙いです。どの構成でも埋め込みの空間は共通です。
【画像・動画・音声の処理】画像向けエンコーダーは写真だけでなく、図表、スライド、PDFなどの視覚資料や動画フレームを扱います。音声エンコーダーは音声波形を直接入力できます。開発者ガイドでは動画を標準で毎秒1フレームとして扱い、音声は16kHzのモノラルを推奨しています。長時間の動画や音声では、入力長の制約に合わせた分割や前処理が必要になります。
【検索データを小さくする仕組み】EmbeddingGemma 2はMatryoshka Representation Learningに対応し、768次元のベクトルを512、256、128次元へ短縮できます。Googleの説明では、256次元は保存容量を約3分の1に減らしつつ、多くの検索品質を保てる構成です。128次元ではさらに小さくなりますが、特に画像・動画・音声の検索品質低下に注意が必要です。
【保存容量の目安】Googleはbfloat16で100万件の768次元ベクトルを保存すると約1.5GB、128次元なら約250MBになると説明しています。これはベクトルそのものの容量の例であり、検索インデックスの付帯情報や元のファイルの保存領域は含みません。検索対象が増えるほど、次元数と検索精度のバランスが重要になります。
【RAGでの利用】社内文書の質問応答では、まずEmbeddingGemma 2が関連する文書や画像を検索し、別の生成モデルへ渡す構成が考えられます。検索段階で不適切な資料を拾えば、生成された回答も誤る可能性があります。検索の適合率、更新頻度、アクセス権限の制御は、モデルのベンチマークとは別に検証する必要があります。
【端末内処理とプライバシー】ローカル実行できるモデルは、写真や文書を外部サーバーへ送らずに検索する設計を可能にします。ただし、アプリが別の分析サービスへデータを送信したり、クラウド上の生成モデルを呼び出したりすれば、システム全体が完全にオフラインになるわけではありません。利用者にデータの送信先を説明できる構成が望まれます。
【開発者が試す際のポイント】公式ガイドはsentence-transformersのバージョン6.1.0以降を用いた利用方法を紹介しています。検索用の質問と登録する文書には、それぞれ適切なタスク指示を付ける設計です。モデルを導入する際は、対象データの言語や形式、検索件数、必要な応答速度を決め、実際の検索例で精度を確認することが重要です。
【何が変わるのか】これまで写真検索、コード検索、音声検索を別々に構築していたシステムでは、共通の埋め込み空間を使うことで設計を簡素化できる可能性があります。一方で、すべての形式で同じ検索品質が得られるとは限りません。EmbeddingGemma 2は『AIが答えるための材料を探す』工程を、より小さな計算資源で実現するための基盤技術と位置付けられます。
Googleの開発者向け説明によると、モデルはGemma 4を基盤とし、Apache 2.0ライセンスで公開されています。テキストとコードのみを扱う構成は約2億7,000万パラメータ、すべてのモダリティを扱う構成は約7億4,000万パラメータで、必要なエンコーダーだけを読み込めるモジュール構成が特徴です。
端末上での利用も重要な狙いです。Google AI Edgeチームは、Pixel 11 Proでの動作例として、テキストのみの重みで約191MB、全モダリティで約567MBのアクティブRAMを使用すると説明しています。これは特定条件での実測例であり、あらゆる端末で同じメモリ使用量になるわけではありません。
用途としては、写真・音声・文書をまとめて検索するローカルライブラリ、社内資料の意味検索、検索拡張生成(RAG)の検索部分などが挙げられます。データを端末内で処理できれば、クラウドへの送信を減らせる可能性がありますが、実際のプライバシー保護はアプリ全体の設計にも左右されます。
EmbeddingGemma 2は会話を生成する汎用チャットAIではなく、情報を検索・照合しやすい形に変換するモデルです。生成AIの活用が広がるほど、必要な情報を正確に見つける基盤技術として、こうした小型のマルチモーダルモデルの重要性が高まりそうです。