AI・機械学習
上級
E5-V(イーファイブブイ)
Microsoft Research が 2024 年に発表した、大規模視覚言語モデルを画像とテキストを同一空間で比較できる単一ベクトル埋め込みモデルに変換するフレームワーク。
0 回閲覧
0 いいね
2026/6/6 更新
関連タグ
multimodal
embedding
microsoft
vision-language
rag
E5-V とは
E5-V は Microsoft Research が 2024 年に発表した研究で、大規模視覚言語モデル(LVL: Large Vision-Language Model)を汎用マルチモーダル埋め込みモデルに変換するフレームワーク。
E5-Mistral-7B などのテキスト埋め込みモデルで成功した "E5" アプローチを視覚モダリティに拡張したもので、画像とテキストを同一の高次元ベクトル空間に射影することで、クロスモーダルなセマンティック比較を実現する。
核心技術: Universal Multimodal Embedding
E5-V の特徴はプロンプトベースのアプローチにある。既存の視覚言語モデル(例: LLaVA-Next-8B)に対して、特定のプロンプトテンプレートで入力を構成し、最後のトークンの隠れ状態を埋め込みベクトルとして抽出する。これにより追加の埋め込みヘッドや大規模なマルチモーダルペアデータを必要とせず、単一モダリティのコントラスト学習のみで クロスモーダル埋め込みを学習できる。
アーキテクチャフロー
入力(画像 or テキスト)→ 統一プロンプトテンプレート → 視覚言語モデル(LLaVA-Next 等)→ 最終トークン hidden state 抽出 → L2 正規化 → ユニバーサル埋め込みベクトル(4096 次元等)
ベンチマーク性能
MMEB(Massive Multimodal Embedding Benchmark)において、従来の CLIP ベースモデルを大幅に上回り、画像テキスト検索・視覚的質問応答検索・マルチホップ推論検索で高スコアを達成。
活用シーン
- マルチモーダル RAG(画像と文書を混在インデックス化)
- EC サイトの画像テキスト横断検索
- 医療画像と診断テキストのセマンティックマッチング
制限事項
- 視覚言語モデルのサイズ分だけ推論コストが高い(CLIP 比 5〜10×)
- ベースモデルの視覚理解品質に依存