AI・機械学習
上級
ImageBind(イメージバインド)
Meta AI が 2023 年に発表した、画像・テキスト・音声・深度・熱・IMU の 6 モダリティを単一の埋め込み空間に統合するマルチモーダル埋め込みモデル。
0 回閲覧
0 いいね
2026/6/6 更新
関連タグ
multimodal
embedding
meta-ai
vision-language
cross-modal
ImageBind とは
ImageBind は Meta AI Research が 2023 年に発表したマルチモーダル埋め込みモデルで、6 種類のモダリティ(画像・テキスト・音声・深度・熱赤外線・IMU)を単一の共有埋め込み空間にマッピングすることを目的としている。
従来のマルチモーダルモデル(CLIP 等)は画像とテキストのペアのみを扱うのに対し、ImageBind は画像を「ハブ」として、画像と対応付けられた各モダリティのデータを利用することで、直接のペアデータなしに 6 モダリティ間の対応関係を学習する。
アーキテクチャ
モダリティごとに独立したエンコーダを持ち、それぞれが 1024 次元の共通埋め込み空間に射影される。学習は画像を基準とした InfoNCE コントラスト損失で行われ、音声・深度・熱などは画像とのペアデータのみを必要とする。
主な特徴
- クロスモーダルゼロショット転送: 音声クエリで画像を検索、熱画像でテキストを生成などが追加学習なしに実現
- モダリティ非対称な学習: 全モダリティ間の直接ペアデータ不要
- 6 モダリティ対応: 実世界センサー(IMU・熱赤外線)も含む広範なカバレッジ
活用例
- クロスモーダル検索: 音声クリップで関連画像・動画を検索
- マルチモーダル生成: 深度マップから画像生成モデルへの条件付け
- ロボティクス: IMU センサーデータと視覚情報の統合
CLIP との比較
CLIP はモダリティ数 2(画像・テキスト)でクロスモーダルは画像⇔テキストのみ。ImageBind はモダリティ数 6 で全モダリティ間のクロスモーダルが可能。
参考情報
- 論文: "ImageBind: One Embedding Space To Bind Them All" (Girdhar et al., 2023)
- ライセンス: CC BY-NC 4.0(研究・非商用)
- GitHub: facebookresearch/ImageBind