カオスマップに戻る
Stable Diffusion

Stable Diffusion

概要

Stability AIStable Diffusion の開発元として知られるAI企業。オープンソース画像生成モデルのパイオニアで、2022年に初代 Stable Diffusion を公開して以降、コミュニティ主導の画像生成エコシステムを牽引してきました。2024年に発表された Stable Diffusion 3.5 が最新世代で、プロユースから個人利用まで幅広く対応しています。

最新モデル: Stable Diffusion 3.5

3つのバリアントを提供し、用途や必要なハードウェアに応じて選択できます。

3つのバリアント

モデルパラメータ用途特徴
SD 3.5 Large8.1Bプロユース1メガピクセル、最高品質
SD 3.5 Large Turbo8.1B(蒸留版)高速生成4ステップで高品質画像
SD 3.5 Medium2.5B消費者向けコンシューマGPUで動作

主な特徴

1. プロユース対応(SD 3.5 Large)

8.1Bパラメータの旗艦モデル。1メガピクセル解像度でプロフェッショナルな用途に対応。複雑なプロンプト追従と細部の表現力を備えます。

2. 高速生成(SD 3.5 Large Turbo)

蒸留版で、通常の Large より大幅に高速。わずか4ステップで高品質画像を生成しながら、プロンプト追従性も維持します。

3. 消費者ハードウェア対応(SD 3.5 Medium)

2.5Bパラメータの中型モデル。改良された MMDiT-X アーキテクチャを採用し、コンシューマGPU(RTX 3060 クラス以上)で動作します。

4. Query-Key Normalization

新しく導入された技術で、モデルのカスタマイズ性とプロンプト追従性を向上。ファインチューニングの効果を高めます。

5. TensorRT 最適化

NVIDIA RTX GPU で 最大2.3倍高速化VRAM 使用量40%削減。ローカル実行を大幅に改善。

6. Stable Video Diffusion

Stability AI は動画生成モデルも提供。静止画からショートクリップを生成します(ただし Sora や Runway ほど派手ではない)。

ライセンス

Stability AI Community License で提供。

  • 商用利用可能
  • 非商用利用も可能
  • ファインチューニング・カスタマイズ自由
  • ⚠️ 年間売上 $1M 超の企業は Enterprise ライセンスが必要

代表的な活用例

  • プロダクト画像生成: 商品画像・広告クリエイティブ
  • ゲームアセット: キャラクター・背景・UI 素材
  • カスタムモデル構築: LoRA / Fine-tuning でスタイル特化
  • ローカル実行: プライバシー重視・API コスト不要
  • クリエイティブワークフロー: ComfyUI、Automatic1111 などのUI と組み合わせ

提供形態

提供形態料金
モデルダウンロード無料(Community License)
Stability AI API従量課金
Platform SDKsPython SDK 等
Amazon BedrockAWS 経由で利用可

強み

  • オープンソース画像生成のパイオニア
  • 商用利用可能(Community License)
  • コンシューマGPUで動作(SD 3.5 Medium)
  • 高いカスタマイズ性(LoRA・Fine-tuning)
  • TensorRT 最適化で2倍高速化
  • 活発なコミュニティ(Hugging Face、Civitai 等)

弱み

  • 経営の不安定さ(2024年にリーダーシップ交代)
  • テキスト理解は Midjourney に劣る(文字の描画精度など)
  • 動画モデルは限定的(Runway・Kling に比べると機能少)
  • テキストモデルは弱い(画像生成特化)

公式情報

公式サイト