Imagen
Tạo ảnh chân thực bằng khuếch tán theo tầng và bộ mã hóa văn bản lớn
Toàn văn của trang này được trình bày bằng tiếng Anh; tiêu đề và phần dẫn đã được bản địa hóa.
NÓ LÀ GÌ
Imagen is a text-to-image model Google announced in May 2022. Its key move is to use a frozen large language model (T5-XXL) as the text encoder and to generate with cascaded diffusion: a base image at low resolution is produced first, then a series of super-resolution diffusion models enlarge it step by step. The paper showed that scaling the text encoder improved image–text alignment more than scaling the image generator alone. Imagen did not release its weights and was not offered directly to the public.
Vì sao đáng ghi nhớ
It showed that the size of the text encoder is a key lever for text–image alignment and pushed the cascaded-diffusion route to the frontier of photorealistic generation, shaping the design of later models.
Thông số chính
- Text encoder
- Frozen T5-XXL
- Generation
- Cascaded diffusion (base + super-resolution)
- Output resolution
- 1024×1024
- Open weights
- No
Năng lực liên quan
Khái niệm liên quan
Mô hình khuếch tán
Học ngàn bước khử nhiễu nhỏ, bạn tạo được ảnh từ nhiễu thuần
Sinh đa phương thức
Một mô hình học nói, vẽ, chuyển động — thậm chí mô hình hóa thế giới ba chiều
Cơ chế chú ý (Attention)
Mọi vị trí đều có thể nhìn thẳng vào mọi vị trí khác và phân bổ chú ý theo mức liên quan
Sản phẩm cùng loại
DALL·E 3
2023Viết lại câu lệnh dài thành mô tả chi tiết rồi vẽ hình ảnh
Stable Diffusion
2022Mở công khai trọng số tạo ảnh từ văn bản, đủ nhẹ để chạy trên GPU phổ thông
Midjourney
2022Dịch vụ tạo ảnh từ văn bản nổi bật về phong cách thẩm mỹ
FLUX
2024Tạo ảnh độ phân giải cao bằng transformer luồng chỉnh lưu