Raciocínio e cadeia de pensamento
Decompor um problema difícil em passos intermediários
O texto completo é apresentado em inglês; o título e o resumo estão traduzidos.
O QUE ESTA CAPACIDADE SIGNIFICA
Takes a problem requiring several steps — a maths problem, a logic puzzle, a task needing a plan — and returns the answer together with intermediate steps. Unlike free generation the goal is correctness rather than fluency, and unlike ordinary conversation it spends much of its compute on an internal scratchpad, showing the user mainly the result and a short rationale.
Como é feita tecnicamente
One family relies on prompting: examples or instructions ask the model to think before answering, writing steps out explicitly — chain-of-thought. Another relies on training: large-scale reinforcement learning on verifiable problems such as maths and code teaches the model to generate a longer deliberation before committing. Self-consistency voting over several sampled chains, and combining deliberation with tool calls or search, are now common too.
Produtos representativos
23o3
2025Raciocina longamente antes de responder, trocando computação na inferência por mais acerto
DeepSeek-R1
2025Um modelo de raciocínio treinado com RL sobre cadeias de pensamento, com pesos abertos sob licença MIT
Gemini
2023Um modelo geral nativamente multimodal, feito para contextos muito longos
Claude
2023Um modelo de conversa geral conhecido por contexto longo e alinhamento de segurança
Qwen
2023Uma família de pesos abertos com muitos tamanhos e versões multimodais
MiniMax-M
2025Um modelo de raciocínio de pesos abertos com atenção híbrida e contexto de um milhão de tokens
DeepSeek-V3
2024Um MoE de pesos abertos com 671B parâmetros, ativando 37B por token
GPT-4o
2024Um modelo geral nativamente multimodal: texto, imagem e áudio por uma única porta
Jamba
2024Um modelo de pesos abertos que mistura um modelo de espaço de estados com um Transformer
DBRX
2024Modelo de linguagem MoE de pesos abertos da Databricks
Mistral Large
2024O modelo comercial principal de um laboratório europeu de pesos abertos
Gemini
2024Uma entrada de chat que reúne busca, escritório e um modelo multimodal
Grok
2023Um modelo de conversa ligado aos dados de uma rede social
Yi
2023Um modelo de pesos abertos bilíngue chinês-inglês, com versões de contexto muito longo
Hunyuan
2023A família de modelos gerais da Tencent, com versões de pesos abertos
Doubao
2023O modelo de conversa geral e o aplicativo da ByteDance
Phi
2023Modelos pequenos e eficientes, construídos com dados selecionados
Step
2023Uma família de modelos gerais voltada à multimodalidade e ao uso no dispositivo
Baichuan
2023Um modelo geral de pesos abertos voltado ao uso em chinês
GLM
2023Um modelo geral chinês que começou com pré-treinamento de preenchimento de lacunas autorregressivo
Llama
2023A família que tornou a rota de pesos abertos mainstream
ChatGPT
2022A janela de chat que colocou um grande modelo de linguagem nas mãos de todos
Pangu
2020A família de modelos base Pangu da Huawei
Organizações relacionadas
Usos típicos
- Solving maths and physics problems
- Multi-step planning and scheduling
- Code and data problems needing derivation
- Reasoned choices under constraints
Como avaliar se funciona bem
- Math benchmark accuracy
- Correct-answer rate on sets such as GSM8K, MATH, AIME
- pass@k
- Share of problems solved by at least one of k samples
- Chain-of-thought faithfulness
- Whether the written steps actually reflect how the answer was reached
Limites e dificuldades
- The written reasoning can be unfaithful: the answer comes first and a plausible rationale is added after
- In long chains an early misstep propagates, yet the final answer still sounds assured
- Deliberating at length on trivial questions inflates latency and cost
Conceitos por trás
Engenharia de prompts e alinhamento
Tornar um modelo útil, honesto e inofensivo é mais difícil do que apenas torná-lo maior
Aprendizado por reforço a partir de feedback humano
Quando a «boa resposta» não cabe numa fórmula, deixe as pessoas servirem de recompensa
Arquitetura Transformer
Substituir o revezamento palavra a palavra por uma sala onde todos falam ao mesmo tempo, deixando dependências distantes a um salto