AI・機械学習
初級
Stable Diffusion(ステーブルディフュージョン)
Stable Diffusionは、人工知能・機械学習分野における重要な概念・技術です。
0 回閲覧
0 いいね
2026/4/25 更新
関連タグ
AI
機械学習
初心者向け
Stable Diffusion
概要
Stable Diffusion は、2022 年 8 月に Stability AI、Runway、LMU Munich、CompVis の共同研究で公開された、オープンソースの Text-to-Image 拡散モデルです。従来のクラウド専用 AI 画像生成と異なり、コンシューマー GPU 上でローカル実行可能な点が革新的で、AI アート・クリエイティブ業界に大きな影響を与えました。2026 年現在、Stable Diffusion 3.5 まで進化しています。
モデルの進化
| バージョン | リリース | 解像度 | パラメータ | 特徴 |
|---|---|---|---|---|
| SD 1.4 | 2022/8 | 512×512 | 860M | 初版 |
| SD 1.5 | 2022/10 | 512×512 | 860M | 改良版、最も広く使われる |
| SD 2.0 | 2022/11 | 768×768 | 865M | OpenCLIP 採用 |
| SD 2.1 | 2022/12 | 768×768 | 865M | 2.0 の改良 |
| SDXL | 2023/7 | 1024×1024 | 3.5B | Base + Refiner |
| SDXL Turbo | 2023/11 | 512×512 | 3.5B | 1-4 ステップ生成 |
| SD 3.0 | 2024/6 | 1024×1024 | 2-8B | Multimodal DiT |
| SD 3.5 Large | 2024/10 | 1024×1024 | 8.1B | 最新版 |
仕組み
Latent Diffusion Model
Stable Diffusion は潜在空間で拡散プロセスを実行する Latent Diffusion Model(LDM)です:
- VAE Encoder: 画像を低次元潜在空間(64×64)に圧縮
- U-Net: 潜在空間でノイズを段階的に除去
- VAE Decoder: 潜在表現を画像(512×512 または 1024×1024)に復元
この設計により、ピクセル空間で直接拡散するより 16-64 倍メモリ効率が良くなります。
テキスト条件付け
- CLIP Text Encoder: テキストプロンプトを埋め込み
- Cross-Attention: U-Net でテキスト特徴を参照
- 結果: プロンプトに従った画像生成
システム要件
Stable Diffusion 1.5
| 項目 | 最低 | 推奨 |
|---|---|---|
| GPU | GTX 1060 6GB | RTX 3060 12GB |
| VRAM | 4GB | 12GB |
| RAM | 16GB | 32GB |
| ストレージ | 20GB | 100GB |
SDXL / SD 3.5
| 項目 | 最低 | 推奨 |
|---|---|---|
| GPU | RTX 3060 12GB | RTX 4090 24GB |
| VRAM | 8GB | 24GB |
| RAM | 32GB | 64GB |
| ストレージ | 50GB | 500GB |
主要な UI
AUTOMATIC1111 WebUI
最も広く使われている UI:
- 機能: txt2img、img2img、inpainting、ControlNet
- 拡張機能: 数百の拡張
- コミュニティ: 巨大、情報豊富
- 欠点: メンテナンスが停滞気味
ComfyUI
ノードベースの柔軟な UI:
- 特徴: ワークフローをビジュアル化
- カスタマイズ: 細かい制御が可能
- メンテナンス: 活発
- 学習曲線: やや急
Forge
AUTOMATIC1111 の高速化フォーク:
- 速度: 30-75% 高速
- VRAM 効率: 大幅改善
- 互換性: A1111 の拡張機能対応
Fooocus
初心者向けシンプル UI:
- 操作: ワンクリック生成
- プリセット: 豊富
- 品質: 高品質出力
InvokeAI
プロフェッショナル向け:
- Canvas: iPad 風の直感的キャンバス
- ワークフロー: 本格的な編集機能
主要な機能
Text-to-Image(txt2img)
プロンプトから画像生成:
prompt: "A cyberpunk gaming PC, neon lights, detailed"
negative: "blurry, low quality, watermark"
steps: 30
cfg_scale: 7
sampler: DPM++ 2M Karras
Image-to-Image(img2img)
既存画像を参考に生成:
- denoising_strength: 0.0(元画像維持)〜 1.0(完全に新規)
- 用途: スタイル変換、バリエーション生成
Inpainting
画像の一部を修正:
- マスク: 編集したい領域を指定
- 用途: オブジェクト除去、顔の修正
Outpainting
画像の外側を拡張:
- 用途: 構図変更、アスペクト比変更
ControlNet
精密な制御を実現:
- Canny: エッジ検出でポーズ指定
- Depth: 深度マップで構図制御
- OpenPose: 人物ポーズ制御
- Scribble: 手書きスケッチから生成
- Reference: 参考画像スタイル転送
LoRA(Low-Rank Adaptation)
小規模な追加学習ファイル:
- サイズ: 10-200MB(ベースモデルは 2-8GB)
- 学習: 単一 GPU で数時間
- 用途: キャラクター、スタイル、コンセプト
- 組み合わせ: 複数 LoRA を同時適用可能
Sampler(サンプリング手法)
| サンプラー | ステップ数 | 特徴 |
|---|---|---|
| Euler a | 20-30 | 高速、創造的 |
| DPM++ 2M Karras | 20-30 | バランス、定番 |
| DPM++ SDE Karras | 20-30 | 高品質 |
| UniPC | 10-20 | 高速 |
| LCM | 4-8 | 超高速 |
| Turbo | 1-4 | 即時生成 |
プロンプトエンジニアリング
基本構造
[被写体] + [スタイル] + [品質] + [環境] + [技術指定]
例
a beautiful cyberpunk gamer girl,
anime style, masterpiece, best quality,
neon-lit bedroom, gaming PC in background,
highly detailed, 8k resolution,
(sharp focus:1.2), cinematic lighting
Negative Prompt
除外したい要素:
blurry, low quality, jpeg artifacts,
watermark, signature, bad anatomy,
extra limbs, deformed hands
代表的なモデル・派生版
リアル系
- Realistic Vision: 実写風
- Juggernaut XL: SDXL リアル
- epiCRealism: 写実的
- SD 3.5 Large: 公式最新
アニメ系
- Anything V5: アニメ全般
- Counterfeit: 高品質アニメ
- NAI Diffusion: NovelAI 由来
- Pony Diffusion: プロンプト精度
ファンタジー・アート系
- Dreamshaper: ファンタジー
- RevAnimated: 2.5D スタイル
- AbyssOrangeMix: バランス良い
法的・倫理的課題
著作権
- 学習データ: 著作権問題(LAION-5B)
- 生成物の著作権: 各国で解釈が異なる
- 商用利用: ライセンスを確認
安全性
- NSFW フィルタ: モデルによって異なる
- Deepfake リスク: 同意なしの顔生成
- 透かし: C2PA などの来歴情報
競合サービス
| サービス | 特徴 |
|---|---|
| Stable Diffusion | オープンソース、ローカル実行 |
| Midjourney | 最高品質、Discord ベース |
| DALL-E 3 | ChatGPT 統合、自然言語 |
| FLUX.1 | 新世代、高品質 |
| Adobe Firefly | 商用利用安全 |
| Ideogram | テキスト生成強い |
関連用語
- Latent Diffusion Model(LDM)
- VAE、U-Net、CLIP
- LoRA、ControlNet、Textual Inversion
- AUTOMATIC1111、ComfyUI、Forge
- Prompt Engineering、Negative Prompt