· ローカルAI

Google DeepMindが740Mパラメータのマルチモーダル埋め込みモデルEmbeddingGemma 2を公開

30秒でわかる内容解説

2026年10月6日、Google DeepMindはオープンソースのマルチモーダル埋め込みモデルEmbeddingGemma 2を公開した。テキストや画像、動画、音声を768次元の統一空間に圧縮するこのモデルは、総パラメータ数740Mと軽量設計だ。ノートPCやスマートフォンなどのコンシューマーハードウェア向けに最適化されており、ローカル推論の低レイテンシー化が期待される。RAGや分類、クラスタリングなどのローカルAIパイプラインに組み込みやすい点が特徴だ。

740Mパラメータの構造とマルチモーダル対応

EmbeddingGemma 2は、テキストバックボーンに視覚と音声のエンコーダを結合した構造を持つ。テキスト部分に270Mパラメータ、画像処理に170M、音声処理に300Mが割り当てられている。これらは必要に応じて読み込み切り替えが可能だ。

Matryoshka表現学習によるベクトル圧縮仕様
項目値
768d1:1
512d1:1.5
256d1:3
128d1:6

入力はすべて768次元のベクトルに変換される。100以上の言語とコードを理解でき、コード関連タスクでは前モデル比で約14%の性能向上を記録した。8192トークンのコンテキストウィンドウを備え、数分間の音声や動画処理にも対応する。

異なるメディアを混在させるインターリーブ形式にも対応する。画像は280トークン、動画はフレームあたり140トークン、音声は1秒あたり25トークンとして計算される。単一モーダルで最大約29枚の画像や約58フレームの動画、約327秒の音声を処理できる。

Matryoshka表現学習(MRL)により、ベクトル長を128dや256d、512dに切り詰めて使用できる。これにより最大6倍のストレージコスト削減を実現し、検索インデックスの軽量化に寄与する。推論精度はbfloat16またはfloat32が推奨される。float16では活性化範囲の上限を超えやすく、NaNや品質低下を引き起こす可能性がある。

検索や分類などのタスクに応じて、軽量なテキスト接頭辞を付与する機能も実装されている。接頭辞を正しく設定することで、ベクトル空間内の配置が最適化され、検索精度が向上する。

Gemma 4基盤のエッジデバイス最適化

本モデルはGemma 4のアーキテクチャと能力を基盤としている。 2025年1月をデータカットオフ日とする大規模な前学習データセットで訓練された。ウェブドキュメント、コード、画像、動画、音声が網羅され、140言語以上の内容が含まれる。

The model has 740M total parameters, combining a 270M parameter text model with modular vision (170M) and audio (300M) encoders.

本モデルは740Mの総パラメータを持ち、270Mのテキストモデルにモジュール式の視覚(170M)と音声(300M)エンコーダを結合している。

安全性の考慮は前学習データのフィルタリングに集中している。CSAMや個人情報、バイアスの除去が自動化された手法で実施された。生成モデルと異なり、後段の用途実装に安全性のリスクが委ねられる構造だ。

Apache 2.0ライセンスで公開され、商用利用も制限なく可能だ。SentenceTransformerやTransformersライブラリとの互換性が高く、既存のローカルAIエコシステムへの組み込みが容易になっている。

モジュール式設計により、テキストのみで利用する場合は270M、画像と音声も加えると740Mに肥大する。開発者は用途に合わせてエンコーダをオンオフできる。メモリ制約の厳しいローカル環境での展開を想定した工夫だ。

1Bパラメータ未満のマルチモーダル埋め込みモデルとしては最先端の位置づけだ。エッジデバイスやノートPCでの動作を想定し、メモリ使用量と推論速度のバランスが取れている。開発者はローカルGPUのVRAM容量に合わせてモデルを切り分けられる。

ベンチマークスコアと次元圧縮の実績

公式ベンチマークでは、MTEBマルチ言語版で61.36、コード検索で78.68のスコアを記録した。画像検索や動画分類、音声認識でも同系列の指標で評価が行われている。

MRLによる次元圧縮の結果、256dまでなら品質の低下はほぼ見られない。512dや256dに切り詰めることで、ベクトルデータベースのディスク容量を大幅に削減できる。128dはテキスト中心のワークロードに特化し、マルチモーダル性能は低下する。

推論時には切り詰めたベクトルのL2正規化(ベクトルの長さを1に揃える処理)が必須だ。正規化を忘れるとコサイン類似度の計算が正確に行われず、順位付けが崩れる。クエリとドキュメントは同じ次元数で揃える必要がある。

検索や分類の精度を高めるため、タスクに応じたテキスト接頭辞を付与することが推奨される。接頭辞を省略しても動作するが、検索精度は低下する。開発者は用途に合わせて設定する必要がある。

学習データのカットオフが2025年1月であるため、それ以降の最新事象の反映には限界がある。言語によって性能差が生じる可能性も示唆されている。

ローカル環境への展開と今後の推移

コンシューマーハードウェア向けに最適化されているため、日本のローカルAI愛好家やエンジニアにとって扱いやすいモデルだ。ノートPCやモバイルチップでの低レイテンシー推論を前提としている。

モジュール式アーキテクチャにより、メモリ容量が限られた環境でも必要なエンコーダのみを読み込ませられる。テキスト専用で270M、マルチモーダルで740Mというサイズ感だ。

日本語を含む100以上の言語に対応しており、国内のRAG(検索拡張生成)システムやドキュメント検索パイプラインへの適用が期待される。コード検索の強化は、開発者のローカル環境でのデバッグ作業にも寄与する。

今後はエッジAIアプリケーションでの実装例が増えると見られる。2026年10月6日の公開以降、Hugging FaceやGitHubでライブラリ連携の事例が蓄積されていく予定だ。

1Bパラメータ未満のモデルとして、ローカル推論の標準的な選択肢の一つになると位置づけられている。安全性の検証は開発者側で実施する必要がある。

出典