Google DeepMindが740Mパラメータのマルチモーダル埋め込みモデルEmbeddingGemma 2を公開
30秒でわかる内容解説
2026年10月6日、Google DeepMindはオープンソースのマルチモーダル埋め込みモデルEmbeddingGemma 2を公開した。テキストや画像、動画、音声を768次元の統一空間に圧縮するこのモデルは、総パラメータ数740Mと軽量設計だ。ノートPCやスマートフォンなどのコンシューマーハードウェア向けに最適化されており、ローカル推論の低レイテンシー化が期待される。RAGや分類、クラスタリングなどのローカルAIパイプラインに組み込みやすい点が特徴だ。
740Mパラメータの構造とマルチモーダル対応
EmbeddingGemma 2は、テキストバックボーンに視覚と音声のエンコーダを結合した構造を持つ。テキスト部分に270Mパラメータ、画像処理に170M、音声処理に300Mが割り当てられている。これらは必要に応じて読み込み切り替えが可能だ。
| 項目 | 値 |
|---|---|
| 768d | 1:1 |
| 512d | 1:1.5 |
| 256d | 1:3 |
| 128d | 1:6 |
入力はすべて768次元のベクトルに変換される。100以上の言語とコードを理解でき、コード関連タスクでは前モデル比で約14%の性能向上を記録した。8192トークンのコンテキストウィンドウを備え、数分間の音声や動画処理にも対応する。
異なるメディアを混在させるインターリーブ形式にも対応する。画像は280トークン、動画はフレームあたり140トークン、音声は1秒あたり25トークンとして計算される。単一モーダルで最大約29枚の画像や約58フレームの動画、約327秒の音声を処理できる。
Matryoshka表現学習(MRL)により、ベクトル長を128dや256d、512dに切り詰めて使用できる。これにより最大6倍のストレージコスト削減を実現し、検索インデックスの軽量化に寄与する。推論精度はbfloat16またはfloat32が推奨される。float16では活性化範囲の上限を超えやすく、NaNや品質低下を引き起こす可能性がある。
検索や分類などのタスクに応じて、軽量なテキスト接頭辞を付与する機能も実装されている。接頭辞を正しく設定することで、ベクトル空間内の配置が最適化され、検索精度が向上する。
Gemma 4基盤のエッジデバイス最適化
本モデルはGemma 4のアーキテクチャと能力を基盤としている。 2025年1月をデータカットオフ日とする大規模な前学習データセットで訓練された。ウェブドキュメント、コード、画像、動画、音声が網羅され、140言語以上の内容が含まれる。
The model has 740M total parameters, combining a 270M parameter text model with modular vision (170M) and audio (300M) encoders.
本モデルは740Mの総パラメータを持ち、270Mのテキストモデルにモジュール式の視覚(170M)と音声(300M)エンコーダを結合している。
安全性の考慮は前学習データのフィルタリングに集中している。CSAMや個人情報、バイアスの除去が自動化された手法で実施された。生成モデルと異なり、後段の用途実装に安全性のリスクが委ねられる構造だ。
Apache 2.0ライセンスで公開され、商用利用も制限なく可能だ。SentenceTransformerやTransformersライブラリとの互換性が高く、既存のローカルAIエコシステムへの組み込みが容易になっている。
モジュール式設計により、テキストのみで利用する場合は270M、画像と音声も加えると740Mに肥大する。開発者は用途に合わせてエンコーダをオンオフできる。メモリ制約の厳しいローカル環境での展開を想定した工夫だ。
1Bパラメータ未満のマルチモーダル埋め込みモデルとしては最先端の位置づけだ。エッジデバイスやノートPCでの動作を想定し、メモリ使用量と推論速度のバランスが取れている。開発者はローカルGPUのVRAM容量に合わせてモデルを切り分けられる。
ベンチマークスコアと次元圧縮の実績
公式ベンチマークでは、MTEBマルチ言語版で61.36、コード検索で78.68のスコアを記録した。画像検索や動画分類、音声認識でも同系列の指標で評価が行われている。
MRLによる次元圧縮の結果、256dまでなら品質の低下はほぼ見られない。512dや256dに切り詰めることで、ベクトルデータベースのディスク容量を大幅に削減できる。128dはテキスト中心のワークロードに特化し、マルチモーダル性能は低下する。
推論時には切り詰めたベクトルのL2正規化(ベクトルの長さを1に揃える処理)が必須だ。正規化を忘れるとコサイン類似度の計算が正確に行われず、順位付けが崩れる。クエリとドキュメントは同じ次元数で揃える必要がある。
検索や分類の精度を高めるため、タスクに応じたテキスト接頭辞を付与することが推奨される。接頭辞を省略しても動作するが、検索精度は低下する。開発者は用途に合わせて設定する必要がある。
学習データのカットオフが2025年1月であるため、それ以降の最新事象の反映には限界がある。言語によって性能差が生じる可能性も示唆されている。
ローカル環境への展開と今後の推移
コンシューマーハードウェア向けに最適化されているため、日本のローカルAI愛好家やエンジニアにとって扱いやすいモデルだ。ノートPCやモバイルチップでの低レイテンシー推論を前提としている。
モジュール式アーキテクチャにより、メモリ容量が限られた環境でも必要なエンコーダのみを読み込ませられる。テキスト専用で270M、マルチモーダルで740Mというサイズ感だ。
日本語を含む100以上の言語に対応しており、国内のRAG(検索拡張生成)システムやドキュメント検索パイプラインへの適用が期待される。コード検索の強化は、開発者のローカル環境でのデバッグ作業にも寄与する。
今後はエッジAIアプリケーションでの実装例が増えると見られる。2026年10月6日の公開以降、Hugging FaceやGitHubでライブラリ連携の事例が蓄積されていく予定だ。
1Bパラメータ未満のモデルとして、ローカル推論の標準的な選択肢の一つになると位置づけられている。安全性の検証は開発者側で実施する必要がある。
出典
- google/embeddinggemma-2 (feature-extraction)(Hugging Face trending) · 議論