跳到正文
AI 图鉴

GPT-4o

原生多模态的通用模型,文本、图像与音频走同一个入口

OpenAI 模型 闭源
输入文本图像音频文本音频

它是什么

GPT-4o 是 OpenAI 于 2024 年 5 月发布的通用模型,“o”指 omni,表示在单一模型中统一处理文本、图像与音频。它把视觉与语音理解放进同一次前向计算,语音对话的响应延迟接近实时。相比此前需要多个模型协作的流水线,GPT-4o 用端到端的多模态训练简化了交互入口。它同时通过 API 与 ChatGPT 提供,是 OpenAI 在多模态通用模型上的主力版本。

为什么值得记住

把多模态从“多个模型拼管线”推进到“一个模型端到端”,语音对话延迟也降到接近真人交谈的水平;此后通用模型普遍以原生多模态为默认目标。

关键规格

上下文窗口
128K tokens
模态
文本、图像、音频输入;文本、音频输出
发布
2024-05
开放权重
否

所属能力

相关概念

同类产品