跳到正文
AI 图鉴
06 强化学习入门本域第 1 篇

马尔可夫决策过程

把「一步一步做决定」写成五个符号,强化学习的一切都从这里开始

定义

马尔可夫决策过程(MDP)用五元组 ⟨S, A, P, R, γ⟩ 描述序贯决策:智能体处于状态 s ∈ S,选择动作 a ∈ A,环境按转移概率 P(s′ | s, a) 进入新状态并给出奖励 R,未来的奖励再按折扣因子 γ 打折。它是强化学习的标准数学框架,规定了「问题是什么」,剩下的只是「如何求解」。

直观理解

想象你在玩一个从没见过的棋类游戏。此刻的棋盘就是「状态」,你能走的每一步是「动作」,走完之后局面如何变化、你得多少分,由「转移」和「奖励」规定。整个模型只依赖一条假设:下一步会怎样,只取决于现在的局面,与你是怎么走到这里的无关。这条“只看现在”的性质就是马尔可夫性,也是这套框架能被写成数学的前提。

图 1

智能体与环境的交互循环:观测状态 → 选择动作 → 得到奖励 → 进入新状态,周而复始

观测状态 s_t选择动作 a_t执行并得到奖励 r_{t…进入新状态 s_{t+1}交互
图 2

折扣因子决定智能体看多远:第 k 步之后奖励的权重为 γ^k,γ=0.99 时十步之后权重仍近 0.9,γ=0.5 时三步就衰减到 1/8

  • γ = 0.99(有远见)
  • γ = 0.9
  • γ = 0.5(短视)

工作原理

  1. 01

    第一步 · 定义状态与动作

    先决定「世界要被压缩成什么」。状态应当包含做出最优决策所需的全部信息:多一点是浪费,少一点就破坏了马尔可夫性。动作空间可以是离散的(上下左右、落子),也可以是连续的(方向盘转角、关节力矩)。

  2. 02

    第二步 · 规定转移与奖励

    转移概率 P(s′ | s, a) 描述「在这个状态做这个动作,世界会怎样变」;奖励 R(s, a) 给这一步打一个即时分数。二者合起来定义了任务本身——换一个奖励函数,就换了一个完全不同的问题,这也是 RL 常被批评「奖励设计比算法更难」的根源。

  3. 03

    第三步 · 用折扣把未来折现

    把每一步的奖励乘以 γ^k 再求和,得到折扣回报。γ 接近 1 时智能体有耐心,愿意为长远利益牺牲当下;γ 接近 0 时它只盯着眼前。对可能永不结束的任务,γ < 1 还保证了回报是有限值。

  4. 04

    第四步 · 引入策略与值函数

    策略 π(a | s) 是「在每个状态下怎样选动作」的规则,是所有算法最终要学的东西;值函数则估计「遵循某个策略能拿到多少回报」。MDP 一旦写定,求解就归结为一句话:找到让期望折扣回报最大的策略。

关键公式

G_t = r_{t+1} + γ r_{t+2} + γ² r_{t+3} + …
折扣回报:从时刻 t 出发、把未来每一步奖励按 γ 的幂次折现后的总和,是「好坏」的最终度量。

应用场景

  • 机器人控制:机械臂的位置与关节角构成状态,动作是力矩或目标位姿
  • 游戏与博弈 AI:围棋、星际争霸等被写成 MDP,状态是局面、动作是落子或指令
  • 推荐与广告:用户历史构成状态,动作是推送内容,奖励是点击、停留或转化
  • 资源调度:数据中心制冷、电网调峰等把能耗或成本写成负奖励

常见误区

  • 真实问题很少完全满足马尔可夫性。只凭当前一帧画面往往不足以决策,需要堆叠历史帧或引入记忆——这就是部分可观测 MDP(POMDP),它比 MDP 难得多。
  • 奖励函数不是中立的。写错一个符号,智能体就会去优化你没打算优化的东西(奖励黑客)。MDP 框架保证求解正确,却不保证你问对了问题。
  • 平稳性假设容易被忽略:P 与 R 被假定不随时间改变,但现实系统会漂移(口味变化、设备老化),这需要用非平稳方法另作处理。

关键术语

状态 S
描述当前局面的变量,需满足马尔可夫性
动作 A
智能体可施加的影响,可离散也可连续
折扣因子 γ
0 到 1 之间,决定对未来奖励的重视程度
策略 π
从状态到动作(分布)的映射

延伸阅读