Raisonnement et chaîne de pensée
Décomposer un problème difficile en étapes intermédiaires
Le texte intégral est présenté en anglais ; le titre et le résumé sont localisés.
CE QUE DÉSIGNE CETTE CAPACITÉ
Takes a problem requiring several steps — a maths problem, a logic puzzle, a task needing a plan — and returns the answer together with intermediate steps. Unlike free generation the goal is correctness rather than fluency, and unlike ordinary conversation it spends much of its compute on an internal scratchpad, showing the user mainly the result and a short rationale.
Comment c'est fait
One family relies on prompting: examples or instructions ask the model to think before answering, writing steps out explicitly — chain-of-thought. Another relies on training: large-scale reinforcement learning on verifiable problems such as maths and code teaches the model to generate a longer deliberation before committing. Self-consistency voting over several sampled chains, and combining deliberation with tool calls or search, are now common too.
Produits représentatifs
23o3
2025Il raisonne longuement avant de répondre : du calcul à l’inférence contre plus de justesse
DeepSeek-R1
2025Un modèle de raisonnement entraîné par RL sur des chaînes de pensée, à poids ouverts sous licence MIT
Gemini
2023Un modèle général nativement multimodal, conçu pour de très longs contextes
Claude
2023Un modèle de conversation général réputé pour son long contexte et son alignement sécurisé
Qwen
2023Une famille à poids ouverts couvrant de nombreuses tailles, avec des versions multimodales
MiniMax-M
2025Un modèle de raisonnement à poids ouverts, à attention hybride et contexte d’un million de tokens
DeepSeek-V3
2024Un MoE à poids ouverts de 671B paramètres, activant 37B par token
GPT-4o
2024Un modèle général nativement multimodal : texte, image et audio par une même entrée
Jamba
2024Un modèle à poids ouverts mêlant un modèle d’espace d’états à un Transformer
DBRX
2024Modèle de langage MoE à poids ouverts de Databricks
Mistral Large
2024Le modèle commercial phare d’un laboratoire européen de poids ouverts
Gemini
2024Une entrée de discussion qui réunit recherche, bureautique et modèle multimodal
Grok
2023Un modèle de conversation lié aux données d’une plateforme sociale
Yi
2023Un modèle à poids ouverts bilingue chinois-anglais, avec des versions à très long contexte
Hunyuan
2023La famille de modèles généraux de Tencent, avec des versions à poids ouverts
Doubao
2023Le modèle de conversation général et l’application de ByteDance
Phi
2023Des petits modèles efficaces, bâtis sur des données sélectionnées
Step
2023Une famille de modèles généraux visant le multimodal et l’exécution locale
Baichuan
2023Un modèle général à poids ouverts visant l’usage en chinois
GLM
2023Un modèle général chinois parti d’un préentraînement par remplissage de blancs autorégressif
Llama
2023La famille qui a fait des poids ouverts une voie grand public
ChatGPT
2022La fenêtre de discussion qui a mis un grand modèle de langage entre toutes les mains
Pangu
2020La famille de modèles de base Pangu de Huawei
Organisations concernées
Usages typiques
- Solving maths and physics problems
- Multi-step planning and scheduling
- Code and data problems needing derivation
- Reasoned choices under constraints
Comment on l'évalue
- Math benchmark accuracy
- Correct-answer rate on sets such as GSM8K, MATH, AIME
- pass@k
- Share of problems solved by at least one of k samples
- Chain-of-thought faithfulness
- Whether the written steps actually reflect how the answer was reached
Limites et points difficiles
- The written reasoning can be unfaithful: the answer comes first and a plausible rationale is added after
- In long chains an early misstep propagates, yet the final answer still sounds assured
- Deliberating at length on trivial questions inflates latency and cost
Concepts sous-jacents
Ingénierie des prompts et alignement
Rendre un modèle utile, honnête et inoffensif est plus difficile que de simplement l’agrandir
Apprentissage par renforcement à partir de retours humains
Quand la « bonne réponse » ne s’écrit pas en formule, laissons les humains jouer le rôle de la récompense
Architecture Transformer
Remplacer le relais mot à mot par une salle où tous parlent en même temps, pour que les dépendances lointaines soient à un saut