EN ← トップへ戻る
テクノロジー

Google「ML Drift」公開|スマホやPCのAI処理をGPUで高速化する新基盤

GoogleがオープンソースのGPU推論エンジンML Driftを発表。LiteRTとの関係、対応API、写真編集や生成AIへの効果を一次情報から解説。

記事ID:TC-0006 公開: 更新:2026-10-10

GoogleのAI Edgeチームは2026年10月8日、端末上でAIモデルを動かすためのGPU計算エンジン「ML Drift」をオープンソースで公開しました。ライセンスはApache 2.0で、GoogleのLiteRTにおけるGPU高速化の中核としても利用されます。

端末上のAIは、スマートフォンやPCに搭載されたGPUを活用できれば、通信を待たずに処理を進められます。しかし端末ごとにGPUやドライバー、計算APIが異なるため、開発者は互換性と性能の両立に苦労してきました。

【端末内AIが注目される背景】スマートフォンの写真編集、音声処理、動画エフェクトなどでは、操作から結果が出るまでの待ち時間が体験を大きく左右します。クラウドへ送信して処理する方式には柔軟性がありますが、通信環境や送信するデータの扱いが課題になります。端末内で処理できれば応答を短くしやすい一方、限られた電力とメモリの中で計算する必要があります。

【GPU推論エンジンの役割】AIモデルは多数の行列計算やテンソル演算を実行します。GPUはこうした並列計算に適していますが、モデルの演算をGPUの命令へ効率よく変換する仕組みが必要です。ML Driftは、アプリ開発者がGPUごとの違いを細かく扱わずにAI推論を実行できるようにする基盤です。モデルそのものではなく、モデルを動かすための実行エンジンという位置付けです。

【異なるGPU APIを吸収する意義】Android、iOS、デスクトップ、Webでは、利用できるグラフィックス・計算APIが異なります。ML DriftはOpenGL ES、OpenCL、Metal、WebGPUなどのバックエンドに対応する設計です。開発者が環境ごとに別々の処理を用意する負担を減らすことが狙いですが、対応APIがあることと、すべての機器で同じ速度が出ることは別です。

【テンソルの仮想化とは】AIモデルが扱うテンソルは、多次元の数値配列です。ML Driftでは、モデルが想定する論理的なテンソルの形と、GPUのメモリ上にどう配置するかを分離します。これにより、演算の内容を変えずに、端末やGPUの特性に合わせたメモリ配置や処理方法を選びやすくなります。GPUごとの実装差を吸収する重要な設計です。

【生成AIに必要な最適化】言語モデルの推論は、入力された文章をまとめて処理する段階と、次のトークンを順番に生成する段階で計算の特徴が異なります。前者では大きな計算を並列に進めやすく、後者では少量の計算を繰り返すため、メモリ転送や待ち時間が重要になります。ML Driftはこうした違いに応じて実行を最適化する考え方を取り入れています。

【5次元テンソルへの対応】画像処理では高さ、幅、色などの軸を扱いますが、動画や複雑なモデルでは時間やバッチなど、さらに多くの軸が必要になります。ML Driftは5次元テンソルをサポートし、こうしたモデルを実行しやすくしています。ただし、次元数が増えるとメモリや計算量も大きくなる場合があり、実際の処理性能はモデル構造に左右されます。

【YouTube Shortsの事例をどう読むか】Googleは一部のShortsエフェクトで平均フレーム遅延が最大40%低下したと説明しています。フレーム遅延が小さくなれば、カメラ映像に重ねる効果が操作に追従しやすくなる可能性があります。ただし、対象となったエフェクトや測定条件に依存する結果であり、すべての動画処理で同じ改善が起きるわけではありません。

【Googleフォトの事例】Googleフォトの一部の処理では、旧GPUデリゲートと比較して最大2秒短縮したとされています。写真編集の待ち時間が短くなれば、試行錯誤しながら加工する体験に影響します。一方、比較した処理内容や端末が異なれば改善幅も変わるため、数値は公式発表の特定事例として理解する必要があります。

【LiteRTとの関係】LiteRTは端末内で機械学習モデルを実行するためのGoogleの基盤で、ML DriftはGPUによる高速化を担います。既存のアプリにとっては、モデル形式や対応端末を確認しながら実行基盤を更新することになります。Googleは従来のTensorFlow Lite GPUデリゲートへ新機能を追加しない方針を示しており、長期的には新しい基盤への移行を検討する必要があります。

【プライバシーと消費電力】ローカルでAIを動かせば、画像や音声をクラウドへ送らずに処理する設計が可能になります。しかし、アプリ全体が別の通信を行う場合もあるため、端末内推論だけでプライバシーが保証されるわけではありません。また、GPUの利用率が高くなれば発熱や電池消費にも影響します。速度だけでなく、持続性能と電力効率も評価が必要です。

【開発者が検証すべきこと】導入時は、利用者が実際に使う端末で、初回起動時間、処理遅延、メモリ使用量、電力消費、処理結果の一致を確認したいところです。平均値だけでなく、遅いケースや長時間利用時の性能低下を見ることも重要です。特に動画のリアルタイム処理では、処理速度のばらつきが操作感に直結します。

【今後の展望】ML Driftの価値は、特定のAIモデルを高速化するだけでなく、さまざまなGPU環境で端末内AIを開発しやすくする点にあります。モデルの小型化、端末の性能向上、実行エンジンの改善が進めば、これまでクラウド中心だった機能の一部をローカルへ移せる可能性があります。ただし、対応範囲や性能は実際の製品で確認する必要があります。

ML DriftはOpenGL ES、OpenCL、Metal、WebGPUなどの違いを吸収する設計です。Googleはテンソルの論理表現とGPU上の実際の配置を切り離す仕組みを導入し、異なる環境向けのシェーダーを個別に保守する負担の軽減を狙っています。

従来の画像認識に加え、生成AIのような負荷の大きい処理にも対応します。大規模言語モデルでは、入力を読み込む段階と文字を順に生成する段階で異なる最適化を使い分けると説明しています。複雑なモデル向けには5次元テンソルにも対応します。

Googleが示した事例では、YouTube Shortsの一部エフェクトで平均フレーム遅延が最大40%減少し、Googleフォトの一部処理では従来のGPUデリゲートと比べて最大2秒短縮したとしています。これらは特定の処理条件での事例であり、すべての端末で同じ改善が得られるわけではありません。

ML Driftは単体ライブラリとしても利用でき、既存のLiteRT利用者向けには移行経路が用意されています。Googleは旧TensorFlow Lite GPUデリゲートに新機能を追加しない方針も示しており、端末内AIの開発基盤が新世代へ移る節目となりそうです。

情報源

Google Developers Blog(2026年10月8日) ↗