跳到正文
AI 图鉴
06 强化学习入门本域第 4 篇

探索与利用

眼前最好的选择,未必是长期最好的选择

定义

探索与利用的权衡指:智能体既要利用当前已知的最佳选项来获得回报,又要探索尚未充分尝试的选项,以确认它是否更好。多臂老虎机是研究这一权衡的最简模型——若干摇臂各有未知的成功率,每轮只能拉一个,目标是在有限次数内最大化总收益。几乎所有强化学习算法,最终都要回答「什么时候停止利用、开始探索」。

直观理解

你搬到新城市,楼下有十家餐厅。头几次你可能换着吃(探索),一旦发现某家不错,就会常去(利用)。只吃已经确认的那家,可能永远错过更好的一家;一直乱试,则天天踩雷。关键不在「探索还是利用」这个二选一,而在于愿意用多少次短期的亏损,去换取一次可靠的信息——这正是各种算法要平衡的东西。

图 1

累计遗憾的两种增长形态:纯贪心近似线性增长(一直在为早期的错误判断买单),UCB 等乐观策略呈对数增长(差距随时间趋于平缓)

  • 纯贪心(近似线性)
  • UCB / 汤普森(对数)
图 2

一台五臂老虎机在 5000 次拉动后的探索分布:真正最优的摇臂(成功率 0.75)被拉得最多,而几乎没被尝试的摇臂(约 40 次)其估计值离真值最远

工作原理

  1. 01

    ε-贪心:最朴素的平衡

    以 1−ε 的概率选当前估计最好的动作,以 ε 的概率随机选一个。它简单、通用,但固定探索率的代价是长期一直浪费一部分次数;实践中通常让 ε 随时间衰减,早探索、晚利用。

  2. 02

    上置信界 UCB:乐观面对未知

    给每个动作算一个「乐观分数」:估计均值 + 一个与尝试次数成反比的不确定性项。从没试过的动作分数极高,必被优先尝试;试得多了,置信区间收窄,注意力自然回到真正高分的动作上。

  3. 03

    汤普森采样:用后验分配探索

    为每个动作维护一个后验分布(伯努利奖励下常取 Beta 分布)。每轮从各动作的后验里各抽一个样本,选样本值最大的那个。不确定性高的动作偶尔会抽到高值而被尝试,探索量因此自动流向「信息最缺」的地方。

  4. 04

    完整 RL 中的探索:给好奇心发奖金

    深度强化学习里,「好坏」依赖后续无数步,计数式的乐观奖励不再够用。于是出现内在奖励路线——好奇心(预测误差)、随机网络蒸馏、伪计数等,用「这个状态有多新奇」当作额外的探索奖金。

关键公式

a_t = argmax_a [ Q_t(a) + c · √( ln t / N_t(a) ) ]
UCB 的乐观选择:均值 Q_t(a) 加上随尝试次数 N_t(a) 增大而收缩的不确定性项,尝试越少加分越多。

应用场景

  • 在线广告与推荐:在展示已知高点击内容与试投新内容之间分配流量
  • A/B 测试与临床试验:把更多受试者分到目前更优的方案,同时不放弃验证其他方案
  • 超参数搜索:贝叶斯优化用类似汤普森采样的思路决定下一次评估哪组参数
  • 冷启动:新用户或新商品数据稀缺时,靠主动探索收集必要信息

常见误区

  • 贪心会「锁死」:早期一次偶然的坏运气,可能让某个其实最优的动作永远得不到足够尝试,从此被永久低估——这是探索不足最典型的失败模式。
  • 探索不是免费的。每一次探索都直接消耗了本可获得的回报,这就是「遗憾(regret)」的定义,也是评价 bandit 算法的核心指标。
  • 环境非平稳时,旧统计会过期。此时需要给历史打折扣或主动重新探索,否则会一直依赖已经失效的结论。

关键术语

多臂老虎机
每个摇臂奖励分布未知、每次只能拉一个的最简序贯决策模型
遗憾 Regret
实际累积收益与始终选最优动作的差距
ε-贪心
以概率 ε 随机探索,其余时间利用当前最优
汤普森采样
按后验概率抽取并选最大值,探索量自动流向不确定处

延伸阅读