推理与思维链
把难题拆成中间步骤再求解
语言与知识进阶 #08
输入文本文本
这项能力指什么
输入一个需要多步推导的问题——数学题、逻辑谜题、需要规划的任务——输出答案以及通向答案的中间步骤。它与「文本生成」的区别是目标在于正确而非流畅;与「对话」的区别是它把大量计算花在内部草稿上,用户看到的只是结果与简要过程。
技术上如何做到
一类做法靠提示工程:在示例或指令中要求模型「先想再答」,把中间步骤显式写出,即思维链;另一类靠训练,用可验证的题目(数学、代码)做大规模强化学习,让模型学会在给出答案前生成更长的思考。近年常见的还有自一致投票(采样多条思路选多数)、以及把长思考与工具调用、搜索结合起来。
代表产品
23o3
2025OpenAI
回答前先生成长的推理链,用推理时的算力换更稳的正确率
模型 闭源
文本图像文本
DeepSeek-R1
2025DeepSeek
用强化学习训练推理链、权重以 MIT 许可开放的推理模型
模型 开放权重
文本文本
Gemini
2023Google DeepMind
原生多模态、可处理超长上下文的通用模型
模型 闭源
文本图像音频视频文本
Claude
2023Anthropic
以长上下文与安全对齐见长的通用对话模型
模型 闭源
文本图像文本
Qwen
2023Alibaba (Qwen)
覆盖多规格、含多模态版本的开放权重模型家族
模型 开放权重
文本图像文本
MiniMax-M
2025MiniMax
采用混合注意力、上下文达百万 token 的开放权重推理模型
模型 开放权重
文本文本
DeepSeek-V3
2024DeepSeek
671B 总参数、每 token 只激活 37B 的开放权重 MoE 模型
模型 开放权重
文本文本
GPT-4o
2024OpenAI
原生多模态的通用模型,文本、图像与音频走同一个入口
模型 闭源
文本图像音频文本音频
Jamba
2024AI21 Labs
把状态空间模型与 Transformer 混合的开放权重模型
模型 开放权重
文本文本
DBRX
2024Databricks
Databricks 的开放权重 MoE 语言模型
模型 开放权重
文本文本
Mistral Large
2024Mistral AI
欧洲开源实验室的旗舰商用模型
模型 闭源
文本文本
Gemini
2024Google DeepMind
把搜索、办公与多模态模型收进一个对话入口
应用 免费增值
文本图像音频文本图像音频
Grok
2023xAI
与社交平台数据绑定的对话模型
模型 闭源
文本图像文本
Yi
202301.AI
中英双语、提供超长上下文版本的开放权重模型
模型 开放权重
文本文本
Hunyuan
2023Tencent (Hunyuan)
腾讯的通用模型家族,含开放权重版本
模型 开放权重
文本图像文本
Doubao
2023ByteDance (Seed)
字节跳动的通用对话模型与应用
模型 闭源
文本图像文本
Phi
2023Microsoft
用小体量和精选数据做成的高效小模型
模型 开放权重
文本文本
Step
2023StepFun
面向多模态与端侧的通用模型系列
模型 闭源
文本图像文本
Baichuan
2023Baichuan AI
面向中文场景的开放权重通用模型
模型 开放权重
文本文本
GLM
2023Zhipu AI
以自回归填空预训练起步的中文通用模型
模型 闭源
文本文本
Llama
2023Meta AI (FAIR)
把开放权重路线做成主流的通用模型家族
模型 开放权重
文本文本
ChatGPT
2022OpenAI
把大模型变成一个人人可用的对话窗口
应用 免费增值
文本图像音频文本图像音频
Pangu
2020Huawei
华为的盘古系列基础模型
模型 闭源
文本文本
相关机构
典型用途
- 数学与物理等定式题目求解
- 多步规划与排期
- 需要推导的代码与数据问题
- 带约束条件的选择论证
怎么评价它好不好
- 数学题准确率
- 如 GSM8K、MATH、AIME 上的答案正确率
- pass@k
- 采样 k 条解答中至少一条正确的比例
- 思维链忠实度
- 写出的步骤是否真实反映得出答案的依据
边界与难点
- 写出的推理过程可能并不忠实:模型先得答案再补一段看似合理的解释
- 长链条上一步失误会向后传播,中间错了仍会给出确定的结论
- 对简单问题也展开冗长思考,会显著抬高延迟与成本