输入文本图像图像
它是什么
Stable Diffusion 是 Stability AI 于 2022 年 8 月发布的开源文生图模型。它把扩散过程放在预训练自编码器的潜空间里进行,显著降低了计算量,使模型能在消费级显卡上运行。文本由 CLIP 文本编码器转为条件向量,通过交叉注意力注入去噪网络。最初的 1.x 版本原生输出 512×512,U-Net 约 8.6 亿参数,权重以开放许可发布。
为什么值得记住
它把文生图权重开源并压到消费级显卡可跑,直接催生了围绕微调、插件与本地生成的整个开源图像生态,是生成式图像走向大众的分水岭。
关键规格
- 原生分辨率
- 512×512(1.x)
- U-Net 参数量
- 约 8.6 亿
- 架构
- 潜空间扩散 + CLIP 文本编码器
- 权重开放
- 是
- 发布
- 2022-08
所属能力
相关概念
同类产品
Midjourney
2022Midjourney
以审美风格见长的文生图服务
应用 闭源
文本图像图像
DALL·E 3
2023OpenAI
把长提示词先改写成详细描述,再据此生成图像
模型 闭源
文本图像
FLUX
2024Black Forest Labs
用整流流 Transformer 生成高分辨率图像
模型 开放权重
文本图像图像
Imagen
2022Google DeepMind
用级联扩散与大型文本编码器生成写实图像
模型 闭源
文本图像
Firefly
2023Adobe
面向创作者的图像生成与编辑工具
应用 闭源
图像文本图像
Seedream
2024ByteDance (Seed)
原生高分辨率、擅长文字排版的文生图模型
模型 闭源
文本图像