输入文本图像
它是什么
DALL·E 3 是 OpenAI 于 2023 年 10 月发布的文生图模型。它把提示词改写与图像生成放进同一条流程:模型先把用户输入的简短描述扩展为更详细的场景描述,再据此生成图像,从而改善了对长提示与复杂约束的遵循度。训练中使用了自动重述(recaptioning)为图像补充细粒度描述,缩小了图像与文字标注之间的差距。它通过 API 与 ChatGPT 提供。
为什么值得记住
它把「先理解提示、再画图」做成同一条链路,明显提升了对长提示词和约束的遵循度,也让对话式图像生成成为 ChatGPT 的常规能力。
关键规格
- 分辨率
- 1024×1024、1792×1024、1024×1792
- 提示词处理
- 训练时采用自动重述(recaptioning)
- 开放权重
- 否
- 提供方式
- API 与 ChatGPT
所属能力
相关概念
同类产品
Midjourney
2022Midjourney
以审美风格见长的文生图服务
应用 闭源
文本图像图像
Stable Diffusion
2022Stability AI
把文生图权重开源,并压到消费级显卡可运行
模型 开放权重
文本图像图像
FLUX
2024Black Forest Labs
用整流流 Transformer 生成高分辨率图像
模型 开放权重
文本图像图像
Imagen
2022Google DeepMind
用级联扩散与大型文本编码器生成写实图像
模型 闭源
文本图像
Firefly
2023Adobe
面向创作者的图像生成与编辑工具
应用 闭源
图像文本图像
Seedream
2024ByteDance (Seed)
原生高分辨率、擅长文字排版的文生图模型
模型 闭源
文本图像