AI・機械学習
上級

Emu3(エミュースリー)

BAAI(北京人工知能研究院)が2024年9月に公開したユニファイドマルチモーダルモデル。テキスト生成・画像生成・画像理解を単一のトランスフォーマーデコーダーで処理するNext-Token-Predictionアーキテクチャ採用。

0 回閲覧
0 いいね
2026/6/6 更新
関連タグ
ユニファイドマルチモーダル
BAAI
画像生成
Next Token Prediction

Emu3 — テキスト・画像を統一トークンで扱う次世代VLM

概要

Emu3は、中国のBAAI(北京人工知能研究院)が2024年9月に公開したマルチモーダルモデル。8Bパラメータのオープンウェイト(Apache 2.0)モデルで、最大の特徴はテキストと画像を同一のトークン空間で処理するアーキテクチャ。

従来のVLMアーキテクチャ(LLaVA/InternVL/Qwen-VL等)は「テキストデコーダー+視覚エンコーダー」の2コンポーネント構成だが、Emu3は画像を離散視覚トークン(2^14 = 16,384語彙)に量子化し、テキストトークンと同列の系列として扱う。

アーキテクチャ比較

方式代表モデル画像処理画像生成
Encoder+DecoderLLaVA, InternVL, Qwen-VL連続埋め込み不可
Tokenize+DecodeEmu3, Chameleon離散トークン可能
Diffusion+LLMDALL-E 3+GPT-4連続別モデル

離散視覚トークン化

SBER-VQ-VAE(Vector Quantized VAE):

  • 入力画像 → 8×8グリッドのパッチ → 各パッチを16,384語彙から最近傍語彙インデックスに量子化
  • 512×512px画像 → 約4,096視覚トークン
  • 視覚語彙(<IMG_0>〜<IMG_16383>)はテキスト語彙と連結された統一辞書を形成

学習と能力

Emu3は以下の3タスクをNext-Token-Predictionで統一学習:

  1. テキスト→画像生成 (Text-to-Image)

    • プロンプトトークン列に続けて視覚トークン列を予測
    • SDXL比較でHuman Preference評価で勝利
  2. 画像理解/VQA (Image-to-Text)

    • 視覚トークン列をテキスト回答に変換
    • MMMU: 58.5(8Bクラス標準的水準)
  3. マルチターン対話

    • 前コンテキスト(画像+テキスト)を保持した対話継続

ベンチマーク(画像生成)

評価Emu3SDXL 1.0DALL-E 3
GenEval Overall0.660.550.67
FID (COCO)14.218.4-
Human Preference62%38%-

パラメータ数8Bで専用拡散モデルと競合する結果を示した。

現状の制約

  • 視覚解像度の上限: 512×512px(High-res処理は未対応)
  • 推論速度: 画像生成は拡散モデルより遅い(自己回帰的に4,096トークンを逐次生成)
  • ベンチマーク精度: 理解タスクでInternVL/Qwen2.5-VLより下

研究上の意義

Emu3のアーキテクチャは「マルチモーダルAIの将来は統一トークン空間にある」という仮説の実証実験として位置付けられる。GPT-4oの画像生成能力(2024年3月公開)もこの統一アプローチに近い。単一デコーダーで生成・理解を両立するアプローチが将来的に主流となるかが業界の注目点。

この記事について
カテゴリーAI・機械学習
難易度上級
作成日2026/6/6