AI・機械学習
初級

Stable Diffusion(ステーブルディフュージョン)

Stable Diffusionは、人工知能・機械学習分野における重要な概念・技術です。

0 回閲覧
0 いいね
2026/4/25 更新
関連タグ
AI
機械学習
初心者向け

Stable Diffusion

概要

Stable Diffusion は、2022 年 8 月に Stability AI、Runway、LMU Munich、CompVis の共同研究で公開された、オープンソースの Text-to-Image 拡散モデルです。従来のクラウド専用 AI 画像生成と異なり、コンシューマー GPU 上でローカル実行可能な点が革新的で、AI アート・クリエイティブ業界に大きな影響を与えました。2026 年現在、Stable Diffusion 3.5 まで進化しています。

モデルの進化

バージョンリリース解像度パラメータ特徴
SD 1.42022/8512×512860M初版
SD 1.52022/10512×512860M改良版、最も広く使われる
SD 2.02022/11768×768865MOpenCLIP 採用
SD 2.12022/12768×768865M2.0 の改良
SDXL2023/71024×10243.5BBase + Refiner
SDXL Turbo2023/11512×5123.5B1-4 ステップ生成
SD 3.02024/61024×10242-8BMultimodal DiT
SD 3.5 Large2024/101024×10248.1B最新版

仕組み

Latent Diffusion Model

Stable Diffusion は潜在空間で拡散プロセスを実行する Latent Diffusion Model(LDM)です:

  1. VAE Encoder: 画像を低次元潜在空間(64×64)に圧縮
  2. U-Net: 潜在空間でノイズを段階的に除去
  3. VAE Decoder: 潜在表現を画像(512×512 または 1024×1024)に復元

この設計により、ピクセル空間で直接拡散するより 16-64 倍メモリ効率が良くなります。

テキスト条件付け

  • CLIP Text Encoder: テキストプロンプトを埋め込み
  • Cross-Attention: U-Net でテキスト特徴を参照
  • 結果: プロンプトに従った画像生成

システム要件

Stable Diffusion 1.5

項目最低推奨
GPUGTX 1060 6GBRTX 3060 12GB
VRAM4GB12GB
RAM16GB32GB
ストレージ20GB100GB

SDXL / SD 3.5

項目最低推奨
GPURTX 3060 12GBRTX 4090 24GB
VRAM8GB24GB
RAM32GB64GB
ストレージ50GB500GB

主要な UI

AUTOMATIC1111 WebUI

最も広く使われている UI:

  • 機能: txt2img、img2img、inpainting、ControlNet
  • 拡張機能: 数百の拡張
  • コミュニティ: 巨大、情報豊富
  • 欠点: メンテナンスが停滞気味

ComfyUI

ノードベースの柔軟な UI:

  • 特徴: ワークフローをビジュアル化
  • カスタマイズ: 細かい制御が可能
  • メンテナンス: 活発
  • 学習曲線: やや急

Forge

AUTOMATIC1111 の高速化フォーク:

  • 速度: 30-75% 高速
  • VRAM 効率: 大幅改善
  • 互換性: A1111 の拡張機能対応

Fooocus

初心者向けシンプル UI:

  • 操作: ワンクリック生成
  • プリセット: 豊富
  • 品質: 高品質出力

InvokeAI

プロフェッショナル向け:

  • Canvas: iPad 風の直感的キャンバス
  • ワークフロー: 本格的な編集機能

主要な機能

Text-to-Image(txt2img)

プロンプトから画像生成:

prompt: "A cyberpunk gaming PC, neon lights, detailed"
negative: "blurry, low quality, watermark"
steps: 30
cfg_scale: 7
sampler: DPM++ 2M Karras

Image-to-Image(img2img)

既存画像を参考に生成:

  • denoising_strength: 0.0(元画像維持)〜 1.0(完全に新規)
  • 用途: スタイル変換、バリエーション生成

Inpainting

画像の一部を修正:

  • マスク: 編集したい領域を指定
  • 用途: オブジェクト除去、顔の修正

Outpainting

画像の外側を拡張:

  • 用途: 構図変更、アスペクト比変更

ControlNet

精密な制御を実現:

  • Canny: エッジ検出でポーズ指定
  • Depth: 深度マップで構図制御
  • OpenPose: 人物ポーズ制御
  • Scribble: 手書きスケッチから生成
  • Reference: 参考画像スタイル転送

LoRA(Low-Rank Adaptation)

小規模な追加学習ファイル:

  • サイズ: 10-200MB(ベースモデルは 2-8GB)
  • 学習: 単一 GPU で数時間
  • 用途: キャラクター、スタイル、コンセプト
  • 組み合わせ: 複数 LoRA を同時適用可能

Sampler(サンプリング手法)

サンプラーステップ数特徴
Euler a20-30高速、創造的
DPM++ 2M Karras20-30バランス、定番
DPM++ SDE Karras20-30高品質
UniPC10-20高速
LCM4-8超高速
Turbo1-4即時生成

プロンプトエンジニアリング

基本構造

[被写体] + [スタイル] + [品質] + [環境] + [技術指定]

例

a beautiful cyberpunk gamer girl,
anime style, masterpiece, best quality,
neon-lit bedroom, gaming PC in background,
highly detailed, 8k resolution,
(sharp focus:1.2), cinematic lighting

Negative Prompt

除外したい要素:

blurry, low quality, jpeg artifacts,
watermark, signature, bad anatomy,
extra limbs, deformed hands

代表的なモデル・派生版

リアル系

  • Realistic Vision: 実写風
  • Juggernaut XL: SDXL リアル
  • epiCRealism: 写実的
  • SD 3.5 Large: 公式最新

アニメ系

  • Anything V5: アニメ全般
  • Counterfeit: 高品質アニメ
  • NAI Diffusion: NovelAI 由来
  • Pony Diffusion: プロンプト精度

ファンタジー・アート系

  • Dreamshaper: ファンタジー
  • RevAnimated: 2.5D スタイル
  • AbyssOrangeMix: バランス良い

法的・倫理的課題

著作権

  • 学習データ: 著作権問題(LAION-5B)
  • 生成物の著作権: 各国で解釈が異なる
  • 商用利用: ライセンスを確認

安全性

  • NSFW フィルタ: モデルによって異なる
  • Deepfake リスク: 同意なしの顔生成
  • 透かし: C2PA などの来歴情報

競合サービス

サービス特徴
Stable Diffusionオープンソース、ローカル実行
Midjourney最高品質、Discord ベース
DALL-E 3ChatGPT 統合、自然言語
FLUX.1新世代、高品質
Adobe Firefly商用利用安全
Ideogramテキスト生成強い

関連用語

  • Latent Diffusion Model(LDM)
  • VAE、U-Net、CLIP
  • LoRA、ControlNet、Textual Inversion
  • AUTOMATIC1111、ComfyUI、Forge
  • Prompt Engineering、Negative Prompt
この記事について
カテゴリーAI・機械学習
難易度初級
作成日2025/7/11