Génération de texte
Poursuit un texte mot après mot
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE DÉSIGNE CETTE CAPACITÉ
Given a passage as context, the model writes what comes next. Both input and output are text and no particular transformation is targeted: it can continue a story, finish an explanation or draft an email. It differs from conversation in that no instruction format is required, and from summarisation or translation in that neither compression nor a language switch is the goal — both ends stay in the same modality.
Comment c'est fait
The dominant route is an autoregressive Transformer language model: text is split into tokens, the model predicts the probability of the next token position by position, and training maximises likelihood over the corpus. GPT, Llama and Qwen all follow it, differing in scale, data and post-training recipe. At inference, temperature, top-k and top-p shape diversity, while long outputs reuse cached keys and values to cut cost.
Produits représentatifs
27GPT-4o
2024Un modèle général nativement multimodal : texte, image et audio par une même entrée
Llama
2023La famille qui a fait des poids ouverts une voie grand public
Qwen
2023Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
DeepSeek-V3
2024Un MoE à poids ouverts de 671B paramètres, activant 37B par token
Mistral Large
2024Le modèle commercial phare d’un laboratoire européen de poids ouverts
Gemini
2023Un modèle général nativement multimodal, conçu pour de très longs contextes
Claude
2023Un modèle de conversation général réputé pour son long contexte et son alignement sécurisé
MiniMax-M
2025Un modèle de raisonnement à poids ouverts, à attention hybride et contexte d’un million de tokens
DeepSeek-R1
2025Un modèle de raisonnement entraîné par RL sur des chaînes de pensée, à poids ouverts sous licence MIT
Apple Intelligence
2024Une IA au niveau du système, répartie entre l’appareil et le cloud privé
Command R
2024Un modèle commercial conçu pour la recherche augmentée et l’usage d’outils
Jamba
2024Un modèle à poids ouverts mêlant un modèle d’espace d’états à un Transformer
DBRX
2024Modèle de langage MoE à poids ouverts de Databricks
Gemini
2024Une entrée de discussion qui réunit recherche, bureautique et modèle multimodal
Grok
2023Un modèle de conversation lié aux données d’une plateforme sociale
Yi
2023Un modèle à poids ouverts bilingue chinois-anglais, avec des versions à très long contexte
Kimi
2023Un assistant de conversation chinois réputé pour les longs contextes
Hunyuan
2023La famille de modèles généraux de Tencent, avec des versions à poids ouverts
Microsoft Copilot
2023Une IA conversationnelle intégrée au système d’exploitation et à la bureautique
Doubao
2023Le modèle de conversation général et l’application de ByteDance
Phi
2023Des petits modèles efficaces, bâtis sur des données sélectionnées
Step
2023Une famille de modèles généraux visant le multimodal et l’exécution locale
Baichuan
2023Un modèle général à poids ouverts visant l’usage en chinois
GLM
2023Un modèle général chinois parti d’un préentraînement par remplissage de blancs autorégressif
ChatGPT
2022La fenêtre de discussion qui a mis un grand modèle de langage entre toutes les mains
Character.AI
2022Un chat de rôle avec des personnages que vous définissez et côtoyez dans la durée
ERNIE
2019Un modèle chinois parti d’un préentraînement enrichi par la connaissance, version phare précoce
Organisations concernées
Usages typiques
- First drafts and rewriting
- Drafting email, documents and copy
- Code comments and API docs
- Test data and synthetic corpora
Comment on l'évalue
- Perplexity
- Predictive uncertainty on held-out text; lower is better
- Human-preference Elo
- Preference ranking from pairwise comparison
- ROUGE/BLEU on constrained tasks
- Reference overlap when an answer key exists
Limites et points difficiles
- Fluency is not truth: the model states wrong facts with confidence — hallucination
- Over long outputs, earlier setup drifts and the text contradicts itself
- Poor sampling settings can trap the model in repetitive or degenerate loops
Concepts sous-jacents
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut
Pré-entraînement et affinage
Apprendre d’abord la langue sur d’immenses corpus non annotés, puis se spécialiser avec peu de données : le paradigme le plus économe en données
Ingénierie des prompts et alignement
Rendre un modèle utile, honnête et inoffensif est plus difficile que de simplement l’agrandir