Razonamiento y cadena de pensamiento
Descomponer un problema difícil en pasos intermedios
El texto completo se presenta en inglés; el título y el resumen están traducidos.
QUÉ SIGNIFICA ESTA CAPACIDAD
Takes a problem requiring several steps — a maths problem, a logic puzzle, a task needing a plan — and returns the answer together with intermediate steps. Unlike free generation the goal is correctness rather than fluency, and unlike ordinary conversation it spends much of its compute on an internal scratchpad, showing the user mainly the result and a short rationale.
Cómo se consigue técnicamente
One family relies on prompting: examples or instructions ask the model to think before answering, writing steps out explicitly — chain-of-thought. Another relies on training: large-scale reinforcement learning on verifiable problems such as maths and code teaches the model to generate a longer deliberation before committing. Self-consistency voting over several sampled chains, and combining deliberation with tool calls or search, are now common too.
Productos representativos
23o3
2025Razona largamente antes de responder: cambia cómputo en inferencia por más aciertos
DeepSeek-R1
2025Un modelo de razonamiento entrenado con RL sobre cadenas de pensamiento, con pesos abiertos bajo licencia MIT
Gemini
2023Un modelo general nativamente multimodal, pensado para contextos muy largos
Claude
2023Un modelo de chat general conocido por su contexto largo y su alineación de seguridad
Qwen
2023Una familia de pesos abiertos con muchos tamaños y versiones multimodales
MiniMax-M
2025Un modelo de razonamiento de pesos abiertos con atención híbrida y contexto de un millón de tokens
DeepSeek-V3
2024Un MoE de pesos abiertos con 671B parámetros, activando 37B por token
GPT-4o
2024Un modelo general nativamente multimodal: texto, imagen y audio por una misma puerta
Jamba
2024Un modelo de pesos abiertos que mezcla un modelo de espacio de estados con un Transformer
DBRX
2024Modelo de lenguaje MoE de pesos abiertos de Databricks
Mistral Large
2024El modelo comercial insignia de un laboratorio europeo de pesos abiertos
Gemini
2024Una entrada de chat que reúne búsqueda, ofimática y un modelo multimodal
Grok
2023Un modelo de chat ligado a los datos de una red social
Yi
2023Un modelo de pesos abiertos bilingüe chino-inglés, con versiones de contexto muy largo
Hunyuan
2023La familia de modelos generales de Tencent, con versiones de pesos abiertos
Doubao
2023El modelo de chat general y la aplicación de ByteDance
Phi
2023Modelos pequeños y eficientes construidos con datos seleccionados
Step
2023Una familia de modelos generales orientada a la multimodalidad y el uso en dispositivo
Baichuan
2023Un modelo general de pesos abiertos orientado al uso en chino
GLM
2023Un modelo general chino que comenzó con preentrenamiento de relleno de espacios autorregresivo
Llama
2023La familia que llevó la ruta de pesos abiertos a la corriente principal
ChatGPT
2022La ventana de chat que puso un gran modelo de lenguaje en manos de todos
Pangu
2020La familia de modelos base Pangu de Huawei
Organizaciones relacionadas
Usos típicos
- Solving maths and physics problems
- Multi-step planning and scheduling
- Code and data problems needing derivation
- Reasoned choices under constraints
Cómo se evalúa
- Math benchmark accuracy
- Correct-answer rate on sets such as GSM8K, MATH, AIME
- pass@k
- Share of problems solved by at least one of k samples
- Chain-of-thought faithfulness
- Whether the written steps actually reflect how the answer was reached
Límites y dificultades
- The written reasoning can be unfaithful: the answer comes first and a plausible rationale is added after
- In long chains an early misstep propagates, yet the final answer still sounds assured
- Deliberating at length on trivial questions inflates latency and cost
Conceptos detrás
Ingeniería de prompts y alineación
Hacer que un modelo sea útil, honesto e inofensivo es más difícil que simplemente agrandarlo
Aprendizaje por refuerzo a partir de retroalimentación humana
Cuando la «buena respuesta» no cabe en una fórmula, deja que las personas actúen como recompensa
Arquitectura Transformer
Sustituir el relé palabra a palabra por una sala donde todos hablan a la vez, para que las dependencias lejanas estén a un salto