カオスマップに戻る
公式サイト
Stable Diffusion
概要
Stability AI は Stable Diffusion の開発元として知られるAI企業。オープンソース画像生成モデルのパイオニアで、2022年に初代 Stable Diffusion を公開して以降、コミュニティ主導の画像生成エコシステムを牽引してきました。2024年に発表された Stable Diffusion 3.5 が最新世代で、プロユースから個人利用まで幅広く対応しています。
最新モデル: Stable Diffusion 3.5
3つのバリアントを提供し、用途や必要なハードウェアに応じて選択できます。
3つのバリアント
| モデル | パラメータ | 用途 | 特徴 |
|---|---|---|---|
| SD 3.5 Large | 8.1B | プロユース | 1メガピクセル、最高品質 |
| SD 3.5 Large Turbo | 8.1B(蒸留版) | 高速生成 | 4ステップで高品質画像 |
| SD 3.5 Medium | 2.5B | 消費者向け | コンシューマGPUで動作 |
主な特徴
1. プロユース対応(SD 3.5 Large)
8.1Bパラメータの旗艦モデル。1メガピクセル解像度でプロフェッショナルな用途に対応。複雑なプロンプト追従と細部の表現力を備えます。
2. 高速生成(SD 3.5 Large Turbo)
蒸留版で、通常の Large より大幅に高速。わずか4ステップで高品質画像を生成しながら、プロンプト追従性も維持します。
3. 消費者ハードウェア対応(SD 3.5 Medium)
2.5Bパラメータの中型モデル。改良された MMDiT-X アーキテクチャを採用し、コンシューマGPU(RTX 3060 クラス以上)で動作します。
4. Query-Key Normalization
新しく導入された技術で、モデルのカスタマイズ性とプロンプト追従性を向上。ファインチューニングの効果を高めます。
5. TensorRT 最適化
NVIDIA RTX GPU で 最大2.3倍高速化、VRAM 使用量40%削減。ローカル実行を大幅に改善。
6. Stable Video Diffusion
Stability AI は動画生成モデルも提供。静止画からショートクリップを生成します(ただし Sora や Runway ほど派手ではない)。
ライセンス
Stability AI Community License で提供。
- ✅ 商用利用可能
- ✅ 非商用利用も可能
- ✅ ファインチューニング・カスタマイズ自由
- ⚠️ 年間売上 $1M 超の企業は Enterprise ライセンスが必要
代表的な活用例
- プロダクト画像生成: 商品画像・広告クリエイティブ
- ゲームアセット: キャラクター・背景・UI 素材
- カスタムモデル構築: LoRA / Fine-tuning でスタイル特化
- ローカル実行: プライバシー重視・API コスト不要
- クリエイティブワークフロー: ComfyUI、Automatic1111 などのUI と組み合わせ
提供形態
| 提供形態 | 料金 |
|---|---|
| モデルダウンロード | 無料(Community License) |
| Stability AI API | 従量課金 |
| Platform SDKs | Python SDK 等 |
| Amazon Bedrock | AWS 経由で利用可 |
強み
- ✅ オープンソース画像生成のパイオニア
- ✅ 商用利用可能(Community License)
- ✅ コンシューマGPUで動作(SD 3.5 Medium)
- ✅ 高いカスタマイズ性(LoRA・Fine-tuning)
- ✅ TensorRT 最適化で2倍高速化
- ✅ 活発なコミュニティ(Hugging Face、Civitai 等)
弱み
- ❌ 経営の不安定さ(2024年にリーダーシップ交代)
- ❌ テキスト理解は Midjourney に劣る(文字の描画精度など)
- ❌ 動画モデルは限定的(Runway・Kling に比べると機能少)
- ❌ テキストモデルは弱い(画像生成特化)
公式情報
- 公式サイト: https://stability.ai
- Stable Diffusion 3.5: https://stability.ai/news/introducing-stable-diffusion-3-5
- Stability API: https://platform.stability.ai
- Hugging Face: https://huggingface.co/stabilityai