Stable Diffusion
Abriu os pesos de texto para imagem e os tornou executáveis em GPUs de consumo
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE É
Stable Diffusion is an open-source text-to-image model that Stability AI released in August 2022. It runs the diffusion process in the latent space of a pretrained autoencoder, sharply cutting computation so the model can run on consumer GPUs. Text is turned into conditioning vectors by a CLIP text encoder and injected into the denoising network through cross-attention. The first 1.x version natively outputs 512×512, with a U-Net of roughly 860 million parameters and weights released under an open licence.
Por que vale a pena lembrar
By open-sourcing text-to-image weights and making them runnable on consumer GPUs, it directly spawned the whole open-source image ecosystem of fine-tunes, plugins and local generation, marking the point where generative imagery reached a broad audience.
Especificações-chave
- Native resolution
- 512×512 (1.x)
- U-Net parameters
- About 860M
- Architecture
- Latent diffusion + CLIP text encoder
- Open weights
- Yes
- Released
- 2022-08
Capacidades
Conceitos relacionados
Difusão latente e controle condicional
Fazer difusão não sobre pixels, mas dentro de um espaço semântico comprimido
Modelos de difusão
Aprenda mil pequenos passos de remoção de ruído e criará uma imagem a partir de ruído puro
Autoencoders e VAE
Comprima a informação por um gargalo e deixe-a crescer de volta
Geração multimodal
Um único modelo que aprende a falar, desenhar, mover-se e até modelar o mundo 3D
Produtos semelhantes
Midjourney
2022Um serviço de texto para imagem conhecido pelo estilo estético
DALL·E 3
2023Reescreve um prompt longo em descrição detalhada e depois desenha a imagem
FLUX
2024Gera imagens de alta resolução com um transformer de fluxo retificado
Imagen
2022Gera imagens fotorrealistas com difusão em cascata e um grande codificador de texto
Firefly
2023Uma ferramenta de geração e edição de imagens para criadores
Seedream
2024Um modelo texto para imagem de alta resolução nativa e bom render de texto