FLUX
Создаёт изображения высокого разрешения с помощью трансформера rectified flow
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
FLUX is a text-to-image model family Black Forest Labs released in August 2024. The team includes the original authors of Stable Diffusion, and FLUX.1 uses a rectified-flow transformer architecture with roughly 12 billion parameters in the main model. The family includes a closed pro version, an open-weight but non-commercial dev version, and a schnell version released under Apache 2.0. It supports text-to-image and image editing, and was widely adopted in the open image community after release.
Почему стоит запомнить
Built by the original Stable Diffusion authors, it brought the rectified-flow transformer into open-weight image generation and became a major open-source text-to-image line in 2024.
Ключевые характеристики
- Parameters
- About 12B in the main model
- Architecture
- Rectified-flow transformer
- Licence
- pro closed; dev open weights, non-commercial; schnell under Apache 2.0
- Released
- 2024-08
Возможности
Связанные концепции
Диффузионные модели
Научитесь тысяче мелких шагов удаления шума — и соберёте изображение из чистого шума
Диффузия в латентном пространстве и условное управление
Проводить диффузию не по пикселям, а внутри сжатого смыслового пространства
Мультимодальная генерация
Одна модель учится говорить, рисовать, двигаться — и даже моделировать трёхмерный мир
Аналоги
Stable Diffusion
2022Открыла веса генерации изображений и сделала их посильными для потребительских видеокарт
Midjourney
2022Сервис генерации изображений, известный своим эстетическим стилем
DALL·E 3
2023Сначала переписывает длинный запрос в подробное описание, затем рисует изображение
Imagen
2022Создаёт фотореалистичные изображения каскадной диффузией и крупным текстовым энкодером
Seedream
2024Модель текст-изображение с нативным высоким разрешением и хорошей отрисовкой текста