跳到正文
AI 图鉴
06 强化学习进阶本域第 5 篇

深度强化学习

让神经网络直接看像素做决定,再用几十年前的老办法把它按住

定义

深度强化学习用深度神经网络来近似价值函数或策略,从而突破表格法对状态数量的限制,可以直接从高维输入(如图像像素)学习控制。它把强化学习的自举目标与神经网络的函数逼近结合在一起,但这两者会互相干扰,因此需要经验回放、目标网络等专门技术才能稳定训练。

直观理解

之前所有方法都默认「局面」能用一张表列出来。但从一张 210×160 的游戏截屏出发,可能的画面比宇宙里的原子还多,表格永远列不完。深度强化学习的想法很直接:用会看图的神经网络替代表格。麻烦也随之而来——网络在变,它要追的目标也在变,等于「一边跑一边瞄移动靶」。于是要把靶子暂时钉住(目标网络),并把过去的经验存起来反复看(经验回放)。

图 1

AlphaZero 的自我对弈循环:网络指导搜索、搜索产生更强的棋局、棋局反过来训练出更强的网络——能力在闭环里自行爬升

网络指导 MCTS 搜索产生棋局与胜负结果以结果为监督信号更新…更强的网络 → 更强的…自我对弈
图 2

DQN 在部分 Atari 游戏上的人类归一化得分(100% = 人类水平):两极分化明显——在拳击、光束骑手等游戏上远超人类,却在蒙特祖玛的复仇上几乎得 0 分

工作原理

  1. 01

    经验回放与目标网络:两个稳定器

    把每一步的 (s, a, r, s′) 存进回放缓冲区,训练时随机抽小批量。这打破了样本之间的时间相关性,也让一条经验被多次利用。再单独保留一份「冻结」的目标网络来计算下一状态的值,避免目标随参数一起乱动。

  2. 02

    Atari:从像素到人类水平

    2015 年的 DQN 用同一套网络结构与超参数,在 49 款 Atari 游戏上仅凭原始像素和游戏分数,就在多数游戏中达到或超过此前所有专用算法,并在约一半游戏上超过了人类。它第一次证明单一大模型可以覆盖多种任务。

  3. 03

    AlphaGo / AlphaZero:搜索 + 自我对弈

    AlphaGo 把策略网络与价值网络同蒙特卡洛树搜索结合起来:网络负责「看哪里」,搜索负责「算清楚」。AlphaZero 更进一步,去掉人类棋谱,纯靠自我对弈与一套通用规则,在围棋、国际象棋、将棋上分别超越各自的顶尖程序。

  4. 04

    样本效率:最大的瓶颈

    DQN 在 Atari 上玩了约 5000 万帧才学会一款游戏,而人类只需要几十分钟。若把与仿真器或真机的每一次交互都计入成本,深度强化学习在真实物理系统上的代价极高。这正是模型驱动、离线强化学习与模仿学习被长期关注的原因。

应用场景

  • 游戏 AI:从 Atari 到《星际争霸 II》《Dota 2》,顶级系统大量使用深度强化学习
  • 机器人操控:抓取、行走、灵巧手,多为仿真中训练、再向真机迁移
  • 工业与科学控制:数据中心制冷、芯片布局、托卡马克等离子体控制
  • 大模型对齐:RLHF 本质上就是用深度强化学习去优化语言模型

常见误区

  • 「致命三角」:自举、离策略与函数逼近叠加时可能发散。实践中靠目标网络、经验回放、梯度裁剪等工程手段压制,但并不是被彻底消除。
  • 对超参数和随机种子极其敏感。同一个算法换一个种子,最终表现可能相差数倍,这让复现与公平比较变得异常困难。
  • 在仿真里表现好,不代表能迁移到真实世界。「现实差距」(sim-to-real gap)存在于感知、动力学与延迟各处,往往需要域随机化等额外处理。

关键术语

经验回放
存储历史转移、随机采样以打破相关性
目标网络
一份更新缓慢的网络,用来提供稳定的自举目标
蒙特卡洛树搜索
用采样模拟来评估动作、指导搜索的算法
自我对弈
让智能体与自己的历史版本对局来生成训练数据

延伸阅读