Stable Diffusion
Mở công khai trọng số tạo ảnh từ văn bản, đủ nhẹ để chạy trên GPU phổ thông
Toàn văn của trang này được trình bày bằng tiếng Anh; tiêu đề và phần dẫn đã được bản địa hóa.
NÓ LÀ GÌ
Stable Diffusion is an open-source text-to-image model that Stability AI released in August 2022. It runs the diffusion process in the latent space of a pretrained autoencoder, sharply cutting computation so the model can run on consumer GPUs. Text is turned into conditioning vectors by a CLIP text encoder and injected into the denoising network through cross-attention. The first 1.x version natively outputs 512×512, with a U-Net of roughly 860 million parameters and weights released under an open licence.
Vì sao đáng ghi nhớ
By open-sourcing text-to-image weights and making them runnable on consumer GPUs, it directly spawned the whole open-source image ecosystem of fine-tunes, plugins and local generation, marking the point where generative imagery reached a broad audience.
Thông số chính
- Native resolution
- 512×512 (1.x)
- U-Net parameters
- About 860M
- Architecture
- Latent diffusion + CLIP text encoder
- Open weights
- Yes
- Released
- 2022-08
Năng lực liên quan
Khái niệm liên quan
Khuếch tán trong không gian ẩn và điều khiển có điều kiện
Khuếch tán không trên điểm ảnh, mà trong một không gian ngữ nghĩa đã nén
Mô hình khuếch tán
Học ngàn bước khử nhiễu nhỏ, bạn tạo được ảnh từ nhiễu thuần
Autoencoder và VAE
Nén thông tin qua một nút thắt rồi để nó mọc lại
Sinh đa phương thức
Một mô hình học nói, vẽ, chuyển động — thậm chí mô hình hóa thế giới ba chiều
Sản phẩm cùng loại
Midjourney
2022Dịch vụ tạo ảnh từ văn bản nổi bật về phong cách thẩm mỹ
DALL·E 3
2023Viết lại câu lệnh dài thành mô tả chi tiết rồi vẽ hình ảnh
FLUX
2024Tạo ảnh độ phân giải cao bằng transformer luồng chỉnh lưu
Imagen
2022Tạo ảnh chân thực bằng khuếch tán theo tầng và bộ mã hóa văn bản lớn
Firefly
2023Công cụ tạo và chỉnh sửa ảnh cho người sáng tạo
Seedream
2024Mô hình văn bản thành ảnh có độ phân giải cao gốc và hiển thị chữ tốt