GPT-4o
Универсальная модель с нативной мультимодальностью: текст, изображение и звук через один вход
Полный текст статьи представлен на английском; заголовок и аннотация локализованы.
ЧТО ЭТО
GPT-4o is a general-purpose model OpenAI released in May 2024; the “o” stands for omni, meaning text, image and audio are handled inside one model. Vision and speech understanding share a single forward pass, and spoken conversation runs at near-real-time latency. Where earlier systems stitched several models into a pipeline, GPT-4o trains multimodality end to end and simplifies the interaction entry point. It is offered through both the API and ChatGPT, and serves as OpenAI’s main multimodal general model.
Почему стоит запомнить
It moved multimodality from “several models stitched into a pipeline” to “one model end to end” and cut spoken-dialogue latency to near human-conversation levels; general models have since treated native multimodality as the default target.
Ключевые характеристики
- Context window
- 128K tokens
- Modality
- Text, image, audio in; text, audio out
- Released
- 2024-05
- Open weights
- No
Возможности
Диалог и следование инструкциям
Понимать намерение по ходу диалога и выполнять его
Генерация текста
Продолжает текст слово за словом
Рассуждение и цепочка мыслей
Разбить трудную задачу на промежуточные шаги
Понимание изображений и визуальные вопросы
Смотреть на изображение и отвечать на свободные вопросы
Связанные концепции
Архитектура Transformer
Замена эстафеты по одному слову залом, где все говорят сразу, — и дальние зависимости оказываются в одном шаге
Мультимодальная генерация
Одна модель учится говорить, рисовать, двигаться — и даже моделировать трёхмерный мир
Промптинг и выравнивание
Сделать модель полезной, честной и безопасной труднее, чем просто увеличить её
Аналоги
Claude
2023Универсальная диалоговая модель, известная длинным контекстом и выравниванием по безопасности
Gemini
2023Универсальная модель с нативной мультимодальностью, рассчитанная на очень длинный контекст
Llama
2023Семейство моделей, сделавшее открытые веса массовым путём
Grok
2023Диалоговая модель, связанная с данными социальной платформы
Mistral Large
2024Флагманская коммерческая модель европейской лаборатории открытых весов
Command R
2024Коммерческая модель, рассчитанная на дополнение поиском и вызов инструментов
Kimi
2023Китайский чат-ассистент, известный работой с длинным контекстом