AI・機械学習
中級
InstructPix2Pix(インストラクトピクストゥピクス)
テキスト指示で既存画像を編集するDiffusionモデル。「馬をシマウマにして」などの自然言語命令に従い、画像の内容を変更しながら構図や照明を保持する2023年の先駆的画像編集手法。UCバークレー発。
0 回閲覧
0 いいね
2026/6/8 更新
関連タグ
画像編集
Diffusion
テキスト指示
InstructPix2Pix
AI画像生成
CFG
InstructPix2Pix — テキスト指示で画像を編集する先駆的手法
概要
InstructPix2Pixは2023年にUCバークレーのTim Brooks、Aleksander Holynski、Alexei A. Efrosが発表した画像編集手法だ。「馬をシマウマに変えて」「雪を降らせて」「アニメスタイルにして」などの自然言語命令に従い、既存の画像を編集できる。ICCV 2023に採択され、テキスト指示型画像編集分野のパイオニア的論文として後続研究に広く引用されている。
手法の仕組み
学習データ生成パイプライン
InstructPix2Pixの最大の貢献は学習データの自動生成方式だ。手動でのペアデータ収集は困難なため、以下の自動パイプラインを構築した:
- キャプション生成: 既存画像にLLM(GPT-3.5)でキャプションを付与
- 編集指示生成: GPT-3.5でキャプションから編集指示と編集後キャプションのペアを生成(例: 「犬がいる」→「猫に変えて」→「猫がいる」)
- 画像生成: Stable DiffusionのPrompt-to-Promptで元画像と編集後画像のペアを生成
- フィルタリング: CLIPスコアで品質の低いペアを除外
このパイプラインで454,445件の学習ペアを自動生成した。
二重CFGによる推論制御
InstructPix2Pixの推論では2つのCFGスケールを独立制御する:
- 画像CFGスケール (s_I): 元画像への忠実度を制御。高いほど元画像に近い出力
- テキストCFGスケール (s_T): 編集指示への追従度を制御。高いほど指示通りに変換
この二重制御により「どれだけ変えるか」と「何を変えるか」を独立して調整できる。
性能と特徴
- 推論速度: A100 GPU上で約5秒/枚(512×512px)
- 解像度: 512×512px推奨(オリジナル)
- 保持性能: 構図・照明・アイデンティティの保持が得意
- 苦手な操作: 極めて細かい局所的編集(特定のピクセル領域のみ変更など)
主な用途
- グローバルスタイル変換(「油絵風にして」「アニメ風に」)
- 背景変換(「砂漠に変えて」「雨を降らせて」)
- オブジェクト置換(「犬を猫に」「赤い車を青に」)
- 季節・天気変更(「冬景色に」「夕暮れに」)
後続研究への影響
InstructPix2Pixの発表後、同コンセプトを発展させた研究が多数登場した:
- MGIE (2024): Multimodal LLMによる指示理解強化
- MagicBrush (2023): 高品質な人手アノテーションデータで精度向上
- Emu Edit (Meta, 2023): タスク別特化モデル群
- InstructDiffusion (2023): 汎用指示型画像処理
まとめ
InstructPix2Pixは「自然言語で画像を編集する」という直感的なインターフェースを初めて実用レベルで実現した画期的研究だ。二重CFGによる細かい制御性と、自動データ生成パイプラインによるスケーラビリティが後続の画像編集AI研究の標準的な方法論となっている。