GPT-4o
Un modèle général nativement multimodal : texte, image et audio par une même entrée
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE C'EST
GPT-4o is a general-purpose model OpenAI released in May 2024; the “o” stands for omni, meaning text, image and audio are handled inside one model. Vision and speech understanding share a single forward pass, and spoken conversation runs at near-real-time latency. Where earlier systems stitched several models into a pipeline, GPT-4o trains multimodality end to end and simplifies the interaction entry point. It is offered through both the API and ChatGPT, and serves as OpenAI’s main multimodal general model.
Pourquoi il compte
It moved multimodality from “several models stitched into a pipeline” to “one model end to end” and cut spoken-dialogue latency to near human-conversation levels; general models have since treated native multimodality as the default target.
Caractéristiques clés
- Context window
- 128K tokens
- Modality
- Text, image, audio in; text, audio out
- Released
- 2024-05
- Open weights
- No
Capacités
Conversation et suivi d’instructions
Comprendre l’intention au fil des tours et agir
Génération de texte
Poursuit un texte mot après mot
Raisonnement et chaîne de pensée
Décomposer un problème difficile en étapes intermédiaires
Compréhension d’images et VQA
Regarder une image et répondre à des questions libres
Concepts liés
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut
Génération multimodale
Un seul modèle qui apprend à parler, dessiner, bouger — et même à modéliser le monde 3D
Ingénierie des prompts et alignement
Rendre un modèle utile, honnête et inoffensif est plus difficile que de simplement l’agrandir
Produits comparables
Claude
2023Un modèle de conversation général réputé pour son long contexte et son alignement sécurisé
Gemini
2023Un modèle général nativement multimodal, conçu pour de très longs contextes
Llama
2023La famille qui a fait des poids ouverts une voie grand public
Grok
2023Un modèle de conversation lié aux données d’une plateforme sociale
Mistral Large
2024Le modèle commercial phare d’un laboratoire européen de poids ouverts
Command R
2024Un modèle commercial conçu pour la recherche augmentée et l’usage d’outils
Kimi
2023Un assistant de conversation chinois réputé pour les longs contextes