输入文本图像音频文本音频
它是什么
GPT-4o 是 OpenAI 于 2024 年 5 月发布的通用模型,“o”指 omni,表示在单一模型中统一处理文本、图像与音频。它把视觉与语音理解放进同一次前向计算,语音对话的响应延迟接近实时。相比此前需要多个模型协作的流水线,GPT-4o 用端到端的多模态训练简化了交互入口。它同时通过 API 与 ChatGPT 提供,是 OpenAI 在多模态通用模型上的主力版本。
为什么值得记住
把多模态从“多个模型拼管线”推进到“一个模型端到端”,语音对话延迟也降到接近真人交谈的水平;此后通用模型普遍以原生多模态为默认目标。
关键规格
- 上下文窗口
- 128K tokens
- 模态
- 文本、图像、音频输入;文本、音频输出
- 发布
- 2024-05
- 开放权重
- 否
所属能力
相关概念
同类产品
Claude
2023Anthropic
以长上下文与安全对齐见长的通用对话模型
模型 闭源
文本图像文本
Gemini
2023Google DeepMind
原生多模态、可处理超长上下文的通用模型
模型 闭源
文本图像音频视频文本
Llama
2023Meta AI (FAIR)
把开放权重路线做成主流的通用模型家族
模型 开放权重
文本文本
Grok
2023xAI
与社交平台数据绑定的对话模型
模型 闭源
文本图像文本
Mistral Large
2024Mistral AI
欧洲开源实验室的旗舰商用模型
模型 闭源
文本文本
Command R
2024Cohere
为检索增强与工具调用设计的商用模型
模型 开放权重
文本文本
Kimi
2023Moonshot AI
以长上下文处理见长的中文对话助手
模型 闭源
文本文本