ニュース

Google DeepMind、「EmbeddingGemma 2」を発表 ~テキストから動画まで扱えるオープン埋め込みモデル

7億4,000万パラメーターでスマートフォンでもオンデバイス動作

「EmbeddingGemma 2」

 米Google DeepMindは10月6日(現地時間)、オープンで軽量なマルチモーダル埋め込みモデル「EmbeddingGemma 2」を公開した。昨年公開されたテキスト専用「EmbeddingGemma」の後継で、コードや画像、動画、音声をも共通の埋め込み空間(ベクトル空間)に対応づけられるのが特徴だ。

 埋め込みモデルとは、意味の近さを比較できるようにデータを数値のベクトルに変換するモデル。検索やRAG(検索拡張生成)などに用いられる。先代の「EmbeddingGemma」はダウンロード数が2,000万回を超え、オンデバイスの検索ツールやプライバシーを重視したRAGのパイプラインに活用されてきた。

 今回発表された「EmbeddingGemma 2」は「Gemma 4」のアーキテクチャーをベースにしており、パラメーター数は7億4,000万に達する。テキスト、画像、音声を単一モデルで検索できるのが魅力で、たとえばこれまで複数のモデルを連携させる必要のあった処理――画像モデルでキャプション生成、音声モデルで文字起こし、テキスト埋め込みの3つを組み合わせた動画検索など――をひとまとめにすることが可能。レイテンシ削減、メモリ使用量削減、実装の簡略化などが期待できる。ライセンスは商用も可能な「Apache 2.0」。

 おもな特徴は、以下のとおり。

  • サイズに対して最高水準の性能:「MTEB」(Massive Text Embedding Benchmark)のコードや、「MAEB」(Massive Audio Embedding Benchmark)などで、10億パラメーター未満のマルチモーダル埋め込みモデルの中で最高水準のスコアを記録。テキスト、画像、音声のタスクでは、より大きな多くのモデルに匹敵または上回る
  • モジュール構成:テキストのみなら、わずか2億7,000万パラメーターで動作。画像(1億7,000万)と音声(3億)のエンコーダーを必要に応じて追加できる
  • ストレージ効率:「Matryoshka Representation Learning」(MRL)により、出力ベクトルを768次元から512、256、128次元へ切り詰め可能。保存するベクトルのデータ量を最大6分の1に削減できる(ただし、短縮すると精度が低下する場合があり、128次元は主にテキストのみの用途に適する)
  • オンデバイスでの動作:量子化することでスマートフォンでも利用可能なサイズに。「Google Pixel 11 Pro」の場合、テキストのみのモデルの重みに必要なアクティブRAMは約191MB、マルチモーダルモデル全体では約567MBとされる
  • 長いコンテキスト:コンテキストウィンドウは8Kトークンで、「EmbeddingGemma」の4倍。標準設定で、音声なら最大約5.5分、画像なら約29枚、動画なら約58フレームをローカルで処理できる。これらを組み合わせる場合は、共通の8Kトークンの範囲内で入力する

 コードを対象とした埋め込み性能が大きく向上したほか、多言語テキスト性能も「EmbeddingGemma」と同等を維持しているという。

コードを対象とした埋め込み性能の比較。横軸はモデルの規模、縦軸は「MTEB Code」の平均スコア(Google公表)

 そのほかにも、「Gemma 4」とはテキストのトークナイザーと音声エンコーダーを共有しているため、両方のモデルを組み合わせた1つのパイプラインとして実行すれば、合計のメモリ使用量を抑えられる。「Gemma 4」とのオンデバイスRAGのほか、「MediaPipe」の「Decision Task API」を使えば、学習データやファインチューニングなしに、入力を分類ラベルと照合して、意図を即座に振り分ける用途にも使える。

 モデルは現在、「Hugging Face」と「Kaggle」で公開中。「Gemini Enterprise Agent Platform」の「Model Garden」でも近日中に提供される。「Ollama」「LM Studio」などにも対応しており、今後数週間で「Android」の「ML Kit」からもサービスとして利用できるようになる予定だ。モデルを体験できるデモアプリも用意されている。