AI・機械学習
上級
Emu3(エミュースリー)
BAAI(北京人工知能研究院)が2024年9月に公開したユニファイドマルチモーダルモデル。テキスト生成・画像生成・画像理解を単一のトランスフォーマーデコーダーで処理するNext-Token-Predictionアーキテクチャ採用。
0 回閲覧
0 いいね
2026/6/6 更新
関連タグ
ユニファイドマルチモーダル
BAAI
画像生成
Next Token Prediction
Emu3 — テキスト・画像を統一トークンで扱う次世代VLM
概要
Emu3は、中国のBAAI(北京人工知能研究院)が2024年9月に公開したマルチモーダルモデル。8Bパラメータのオープンウェイト(Apache 2.0)モデルで、最大の特徴はテキストと画像を同一のトークン空間で処理するアーキテクチャ。
従来のVLMアーキテクチャ(LLaVA/InternVL/Qwen-VL等)は「テキストデコーダー+視覚エンコーダー」の2コンポーネント構成だが、Emu3は画像を離散視覚トークン(2^14 = 16,384語彙)に量子化し、テキストトークンと同列の系列として扱う。
アーキテクチャ比較
| 方式 | 代表モデル | 画像処理 | 画像生成 |
|---|---|---|---|
| Encoder+Decoder | LLaVA, InternVL, Qwen-VL | 連続埋め込み | 不可 |
| Tokenize+Decode | Emu3, Chameleon | 離散トークン | 可能 |
| Diffusion+LLM | DALL-E 3+GPT-4 | 連続 | 別モデル |
離散視覚トークン化
SBER-VQ-VAE(Vector Quantized VAE):
- 入力画像 → 8×8グリッドのパッチ → 各パッチを16,384語彙から最近傍語彙インデックスに量子化
- 512×512px画像 → 約4,096視覚トークン
- 視覚語彙(
<IMG_0>〜<IMG_16383>)はテキスト語彙と連結された統一辞書を形成
学習と能力
Emu3は以下の3タスクをNext-Token-Predictionで統一学習:
-
テキスト→画像生成 (Text-to-Image)
- プロンプトトークン列に続けて視覚トークン列を予測
- SDXL比較でHuman Preference評価で勝利
-
画像理解/VQA (Image-to-Text)
- 視覚トークン列をテキスト回答に変換
- MMMU: 58.5(8Bクラス標準的水準)
-
マルチターン対話
- 前コンテキスト(画像+テキスト)を保持した対話継続
ベンチマーク(画像生成)
| 評価 | Emu3 | SDXL 1.0 | DALL-E 3 |
|---|---|---|---|
| GenEval Overall | 0.66 | 0.55 | 0.67 |
| FID (COCO) | 14.2 | 18.4 | - |
| Human Preference | 62% | 38% | - |
パラメータ数8Bで専用拡散モデルと競合する結果を示した。
現状の制約
- 視覚解像度の上限: 512×512px(High-res処理は未対応)
- 推論速度: 画像生成は拡散モデルより遅い(自己回帰的に4,096トークンを逐次生成)
- ベンチマーク精度: 理解タスクでInternVL/Qwen2.5-VLより下
研究上の意義
Emu3のアーキテクチャは「マルチモーダルAIの将来は統一トークン空間にある」という仮説の実証実験として位置付けられる。GPT-4oの画像生成能力(2024年3月公開)もこの統一アプローチに近い。単一デコーダーで生成・理解を両立するアプローチが将来的に主流となるかが業界の注目点。