Conversation et suivi d’instructions
Comprendre l’intention au fil des tours et agir
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE DÉSIGNE CETTE CAPACITÉ
Takes a multi-turn message sequence with roles (system, user, assistant) and outputs the next assistant turn. It is not merely continuation: the model must hold a persona across turns, remember earlier constraints, and obey format and tone instructions. It differs from plain text generation by its explicit role structure and the demand to follow instructions.
Comment c'est fait
The base is the same autoregressive language model; the difference lies in chat templates and post-training. System prompts and history are concatenated into a fixed sequence of special tokens, then instruction tuning teaches the model to answer rather than continue a web page. Preference data then shapes it through RLHF or a direct-preference method to favour helpful, harmless and honest behaviour. Tools and memory are injected into the prompt by external systems.
Produits représentatifs
30ChatGPT
2022La fenêtre de discussion qui a mis un grand modèle de langage entre toutes les mains
Claude
2023Un modèle de conversation général réputé pour son long contexte et son alignement sécurisé
Gemini
2024Une entrée de discussion qui réunit recherche, bureautique et modèle multimodal
Kimi
2023Un assistant de conversation chinois réputé pour les longs contextes
Doubao
2023Le modèle de conversation général et l’application de ByteDance
Character.AI
2022Un chat de rôle avec des personnages que vous définissez et côtoyez dans la durée
Microsoft Copilot
2023Une IA conversationnelle intégrée au système d’exploitation et à la bureautique
MiniMax-M
2025Un modèle de raisonnement à poids ouverts, à attention hybride et contexte d’un million de tokens
o3
2025Il raisonne longuement avant de répondre : du calcul à l’inférence contre plus de justesse
DeepSeek-R1
2025Un modèle de raisonnement entraîné par RL sur des chaînes de pensée, à poids ouverts sous licence MIT
DeepSeek-V3
2024Un MoE à poids ouverts de 671B paramètres, activant 37B par token
Apple Intelligence
2024Une IA au niveau du système, répartie entre l’appareil et le cloud privé
GPT-4o
2024Un modèle général nativement multimodal : texte, image et audio par une même entrée
Command R
2024Un modèle commercial conçu pour la recherche augmentée et l’usage d’outils
Jamba
2024Un modèle à poids ouverts mêlant un modèle d’espace d’états à un Transformer
DBRX
2024Modèle de langage MoE à poids ouverts de Databricks
Mistral Large
2024Le modèle commercial phare d’un laboratoire européen de poids ouverts
Gemini
2023Un modèle général nativement multimodal, conçu pour de très longs contextes
Grok
2023Un modèle de conversation lié aux données d’une plateforme sociale
Yi
2023Un modèle à poids ouverts bilingue chinois-anglais, avec des versions à très long contexte
Hunyuan
2023La famille de modèles généraux de Tencent, avec des versions à poids ouverts
Qwen
2023Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
Phi
2023Des petits modèles efficaces, bâtis sur des données sélectionnées
Step
2023Une famille de modèles généraux visant le multimodal et l’exécution locale
Baichuan
2023Un modèle général à poids ouverts visant l’usage en chinois
GLM
2023Un modèle général chinois parti d’un préentraînement par remplissage de blancs autorégressif
Llama
2023La famille qui a fait des poids ouverts une voie grand public
Pangu
2020La famille de modèles de base Pangu de Huawei
ERNIE
2019Un modèle chinois parti d’un préentraînement enrichi par la connaissance, version phare précoce
Siri
2011L’assistant vocal qui a porté le contrôle à la voix sur les téléphones grand public
Organisations concernées
Usages typiques
- General assistants and support bots
- Coding and study tutoring
- Role-play and companion apps
- Internal knowledge-helpdesk entry points
Comment on l'évalue
- Human-preference Elo
- Ranking by blind pairwise win rate
- Instruction-following rate
- Share of verifiable constraints (format, length, banned words) satisfied
- Safety violation rate
- Rate of violations under red-team prompts
Limites et points difficiles
- Constraints from early turns, especially format rules, are forgotten or softened in long chats
- It tends to agree with the user even when the premise is wrong — sycophancy
- Carefully crafted prompts can bypass safety policy; jailbreaks are hard to eliminate
Concepts sous-jacents
Ingénierie des prompts et alignement
Rendre un modèle utile, honnête et inoffensif est plus difficile que de simplement l’agrandir
Apprentissage par renforcement à partir de retours humains
Quand la « bonne réponse » ne s’écrit pas en formule, laissons les humains jouer le rôle de la récompense
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut