Stable Diffusion
Открыла веса генерации изображений и сделала их посильными для потребительских видеокарт
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
Stable Diffusion is an open-source text-to-image model that Stability AI released in August 2022. It runs the diffusion process in the latent space of a pretrained autoencoder, sharply cutting computation so the model can run on consumer GPUs. Text is turned into conditioning vectors by a CLIP text encoder and injected into the denoising network through cross-attention. The first 1.x version natively outputs 512×512, with a U-Net of roughly 860 million parameters and weights released under an open licence.
Почему стоит запомнить
By open-sourcing text-to-image weights and making them runnable on consumer GPUs, it directly spawned the whole open-source image ecosystem of fine-tunes, plugins and local generation, marking the point where generative imagery reached a broad audience.
Ключевые характеристики
- Native resolution
- 512×512 (1.x)
- U-Net parameters
- About 860M
- Architecture
- Latent diffusion + CLIP text encoder
- Open weights
- Yes
- Released
- 2022-08
Возможности
Связанные концепции
Диффузия в латентном пространстве и условное управление
Проводить диффузию не по пикселям, а внутри сжатого смыслового пространства
Диффузионные модели
Научитесь тысяче мелких шагов удаления шума — и соберёте изображение из чистого шума
Автоэнкодеры и вариационные автоэнкодеры
Сжать информацию через «бутылочное горлышко», а затем восстановить её
Мультимодальная генерация
Одна модель учится говорить, рисовать, двигаться — и даже моделировать трёхмерный мир
Аналоги
Midjourney
2022Сервис генерации изображений, известный своим эстетическим стилем
DALL·E 3
2023Сначала переписывает длинный запрос в подробное описание, затем рисует изображение
FLUX
2024Создаёт изображения высокого разрешения с помощью трансформера rectified flow
Imagen
2022Создаёт фотореалистичные изображения каскадной диффузией и крупным текстовым энкодером
Firefly
2023Инструмент генерации и редактирования изображений для авторов
Seedream
2024Модель текст-изображение с нативным высоким разрешением и хорошей отрисовкой текста