GPT-4o
Un modelo general nativamente multimodal: texto, imagen y audio por una misma puerta
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ ES
GPT-4o is a general-purpose model OpenAI released in May 2024; the “o” stands for omni, meaning text, image and audio are handled inside one model. Vision and speech understanding share a single forward pass, and spoken conversation runs at near-real-time latency. Where earlier systems stitched several models into a pipeline, GPT-4o trains multimodality end to end and simplifies the interaction entry point. It is offered through both the API and ChatGPT, and serves as OpenAI’s main multimodal general model.
Por qué merece la pena recordarlo
It moved multimodality from “several models stitched into a pipeline” to “one model end to end” and cut spoken-dialogue latency to near human-conversation levels; general models have since treated native multimodality as the default target.
Especificaciones clave
- Context window
- 128K tokens
- Modality
- Text, image, audio in; text, audio out
- Released
- 2024-05
- Open weights
- No
Capacidades
Conversación y seguimiento de instrucciones
Entender la intención en el diálogo y actuar en consecuencia
Generación de texto
Continúa un texto palabra por palabra
Razonamiento y cadena de pensamiento
Descomponer un problema difícil en pasos intermedios
Comprensión de imágenes y VQA
Mirar una imagen y responder preguntas libres
Conceptos relacionados
Arquitectura Transformer
Sustituir el relé palabra a palabra por una sala donde todos hablan a la vez, para que las dependencias lejanas estén a un salto
Generación multimodal
Un mismo modelo que aprende a hablar, dibujar, moverse e incluso modelar el mundo 3D
Ingeniería de prompts y alineación
Hacer que un modelo sea útil, honesto e inofensivo es más difícil que simplemente agrandarlo
Productos similares
Claude
2023Un modelo de chat general conocido por su contexto largo y su alineación de seguridad
Gemini
2023Un modelo general nativamente multimodal, pensado para contextos muy largos
Llama
2023La familia que llevó la ruta de pesos abiertos a la corriente principal
Grok
2023Un modelo de chat ligado a los datos de una red social
Mistral Large
2024El modelo comercial insignia de un laboratorio europeo de pesos abiertos
Command R
2024Un modelo comercial diseñado para recuperación aumentada y uso de herramientas
Kimi
2023Un asistente de chat chino conocido por manejar contextos largos