深度强化学习
让神经网络直接看像素做决定,再用几十年前的老办法把它按住
定义
深度强化学习用深度神经网络来近似价值函数或策略,从而突破表格法对状态数量的限制,可以直接从高维输入(如图像像素)学习控制。它把强化学习的自举目标与神经网络的函数逼近结合在一起,但这两者会互相干扰,因此需要经验回放、目标网络等专门技术才能稳定训练。
直观理解
之前所有方法都默认「局面」能用一张表列出来。但从一张 210×160 的游戏截屏出发,可能的画面比宇宙里的原子还多,表格永远列不完。深度强化学习的想法很直接:用会看图的神经网络替代表格。麻烦也随之而来——网络在变,它要追的目标也在变,等于「一边跑一边瞄移动靶」。于是要把靶子暂时钉住(目标网络),并把过去的经验存起来反复看(经验回放)。
AlphaZero 的自我对弈循环:网络指导搜索、搜索产生更强的棋局、棋局反过来训练出更强的网络——能力在闭环里自行爬升
DQN 在部分 Atari 游戏上的人类归一化得分(100% = 人类水平):两极分化明显——在拳击、光束骑手等游戏上远超人类,却在蒙特祖玛的复仇上几乎得 0 分
工作原理
- 01
经验回放与目标网络:两个稳定器
把每一步的 (s, a, r, s′) 存进回放缓冲区,训练时随机抽小批量。这打破了样本之间的时间相关性,也让一条经验被多次利用。再单独保留一份「冻结」的目标网络来计算下一状态的值,避免目标随参数一起乱动。
- 02
Atari:从像素到人类水平
2015 年的 DQN 用同一套网络结构与超参数,在 49 款 Atari 游戏上仅凭原始像素和游戏分数,就在多数游戏中达到或超过此前所有专用算法,并在约一半游戏上超过了人类。它第一次证明单一大模型可以覆盖多种任务。
- 03
AlphaGo / AlphaZero:搜索 + 自我对弈
AlphaGo 把策略网络与价值网络同蒙特卡洛树搜索结合起来:网络负责「看哪里」,搜索负责「算清楚」。AlphaZero 更进一步,去掉人类棋谱,纯靠自我对弈与一套通用规则,在围棋、国际象棋、将棋上分别超越各自的顶尖程序。
- 04
样本效率:最大的瓶颈
DQN 在 Atari 上玩了约 5000 万帧才学会一款游戏,而人类只需要几十分钟。若把与仿真器或真机的每一次交互都计入成本,深度强化学习在真实物理系统上的代价极高。这正是模型驱动、离线强化学习与模仿学习被长期关注的原因。
应用场景
- 游戏 AI:从 Atari 到《星际争霸 II》《Dota 2》,顶级系统大量使用深度强化学习
- 机器人操控:抓取、行走、灵巧手,多为仿真中训练、再向真机迁移
- 工业与科学控制:数据中心制冷、芯片布局、托卡马克等离子体控制
- 大模型对齐:RLHF 本质上就是用深度强化学习去优化语言模型
常见误区
- 「致命三角」:自举、离策略与函数逼近叠加时可能发散。实践中靠目标网络、经验回放、梯度裁剪等工程手段压制,但并不是被彻底消除。
- 对超参数和随机种子极其敏感。同一个算法换一个种子,最终表现可能相差数倍,这让复现与公平比较变得异常困难。
- 在仿真里表现好,不代表能迁移到真实世界。「现实差距」(sim-to-real gap)存在于感知、动力学与延迟各处,往往需要域随机化等额外处理。
关键术语
- 经验回放
- 存储历史转移、随机采样以打破相关性
- 目标网络
- 一份更新缓慢的网络,用来提供稳定的自举目标
- 蒙特卡洛树搜索
- 用采样模拟来评估动作、指导搜索的算法
- 自我对弈
- 让智能体与自己的历史版本对局来生成训练数据