跳到正文
AI 图鉴

推理与思维链

把难题拆成中间步骤再求解

语言与知识进阶 #08
输入文本文本

这项能力指什么

输入一个需要多步推导的问题——数学题、逻辑谜题、需要规划的任务——输出答案以及通向答案的中间步骤。它与「文本生成」的区别是目标在于正确而非流畅;与「对话」的区别是它把大量计算花在内部草稿上,用户看到的只是结果与简要过程。

技术上如何做到

一类做法靠提示工程:在示例或指令中要求模型「先想再答」,把中间步骤显式写出,即思维链;另一类靠训练,用可验证的题目(数学、代码)做大规模强化学习,让模型学会在给出答案前生成更长的思考。近年常见的还有自一致投票(采样多条思路选多数)、以及把长思考与工具调用、搜索结合起来。

代表产品

23

o3

2025
OpenAI

回答前先生成长的推理链,用推理时的算力换更稳的正确率

模型 闭源
文本图像文本

DeepSeek-R1

2025
DeepSeek

用强化学习训练推理链、权重以 MIT 许可开放的推理模型

模型 开放权重
文本文本

Gemini

2023
Google DeepMind

原生多模态、可处理超长上下文的通用模型

模型 闭源
文本图像音频视频文本

Claude

2023
Anthropic

以长上下文与安全对齐见长的通用对话模型

模型 闭源
文本图像文本

Qwen

2023
Alibaba (Qwen)

覆盖多规格、含多模态版本的开放权重模型家族

模型 开放权重
文本图像文本

MiniMax-M

2025
MiniMax

采用混合注意力、上下文达百万 token 的开放权重推理模型

模型 开放权重
文本文本

DeepSeek-V3

2024
DeepSeek

671B 总参数、每 token 只激活 37B 的开放权重 MoE 模型

模型 开放权重
文本文本

GPT-4o

2024
OpenAI

原生多模态的通用模型,文本、图像与音频走同一个入口

模型 闭源
文本图像音频文本音频

Jamba

2024
AI21 Labs

把状态空间模型与 Transformer 混合的开放权重模型

模型 开放权重
文本文本

DBRX

2024
Databricks

Databricks 的开放权重 MoE 语言模型

模型 开放权重
文本文本

Mistral Large

2024
Mistral AI

欧洲开源实验室的旗舰商用模型

模型 闭源
文本文本

Gemini

2024
Google DeepMind

把搜索、办公与多模态模型收进一个对话入口

应用 免费增值
文本图像音频文本图像音频

Grok

2023
xAI

与社交平台数据绑定的对话模型

模型 闭源
文本图像文本

Yi

2023
01.AI

中英双语、提供超长上下文版本的开放权重模型

模型 开放权重
文本文本

Hunyuan

2023
Tencent (Hunyuan)

腾讯的通用模型家族,含开放权重版本

模型 开放权重
文本图像文本

Doubao

2023
ByteDance (Seed)

字节跳动的通用对话模型与应用

模型 闭源
文本图像文本

Phi

2023
Microsoft

用小体量和精选数据做成的高效小模型

模型 开放权重
文本文本

Step

2023
StepFun

面向多模态与端侧的通用模型系列

模型 闭源
文本图像文本

Baichuan

2023
Baichuan AI

面向中文场景的开放权重通用模型

模型 开放权重
文本文本

GLM

2023
Zhipu AI

以自回归填空预训练起步的中文通用模型

模型 闭源
文本文本

Llama

2023
Meta AI (FAIR)

把开放权重路线做成主流的通用模型家族

模型 开放权重
文本文本

ChatGPT

2022
OpenAI

把大模型变成一个人人可用的对话窗口

应用 免费增值
文本图像音频文本图像音频

Pangu

2020
Huawei

华为的盘古系列基础模型

模型 闭源
文本文本

相关机构

典型用途

  • 数学与物理等定式题目求解
  • 多步规划与排期
  • 需要推导的代码与数据问题
  • 带约束条件的选择论证

怎么评价它好不好

数学题准确率
如 GSM8K、MATH、AIME 上的答案正确率
pass@k
采样 k 条解答中至少一条正确的比例
思维链忠实度
写出的步骤是否真实反映得出答案的依据

边界与难点

  • 写出的推理过程可能并不忠实:模型先得答案再补一段看似合理的解释
  • 长链条上一步失误会向后传播,中间错了仍会给出确定的结论
  • 对简单问题也展开冗长思考,会显著抬高延迟与成本

背后的概念