探索与利用
眼前最好的选择,未必是长期最好的选择
定义
探索与利用的权衡指:智能体既要利用当前已知的最佳选项来获得回报,又要探索尚未充分尝试的选项,以确认它是否更好。多臂老虎机是研究这一权衡的最简模型——若干摇臂各有未知的成功率,每轮只能拉一个,目标是在有限次数内最大化总收益。几乎所有强化学习算法,最终都要回答「什么时候停止利用、开始探索」。
直观理解
你搬到新城市,楼下有十家餐厅。头几次你可能换着吃(探索),一旦发现某家不错,就会常去(利用)。只吃已经确认的那家,可能永远错过更好的一家;一直乱试,则天天踩雷。关键不在「探索还是利用」这个二选一,而在于愿意用多少次短期的亏损,去换取一次可靠的信息——这正是各种算法要平衡的东西。
累计遗憾的两种增长形态:纯贪心近似线性增长(一直在为早期的错误判断买单),UCB 等乐观策略呈对数增长(差距随时间趋于平缓)
- 纯贪心(近似线性)
- UCB / 汤普森(对数)
一台五臂老虎机在 5000 次拉动后的探索分布:真正最优的摇臂(成功率 0.75)被拉得最多,而几乎没被尝试的摇臂(约 40 次)其估计值离真值最远
工作原理
- 01
ε-贪心:最朴素的平衡
以 1−ε 的概率选当前估计最好的动作,以 ε 的概率随机选一个。它简单、通用,但固定探索率的代价是长期一直浪费一部分次数;实践中通常让 ε 随时间衰减,早探索、晚利用。
- 02
上置信界 UCB:乐观面对未知
给每个动作算一个「乐观分数」:估计均值 + 一个与尝试次数成反比的不确定性项。从没试过的动作分数极高,必被优先尝试;试得多了,置信区间收窄,注意力自然回到真正高分的动作上。
- 03
汤普森采样:用后验分配探索
为每个动作维护一个后验分布(伯努利奖励下常取 Beta 分布)。每轮从各动作的后验里各抽一个样本,选样本值最大的那个。不确定性高的动作偶尔会抽到高值而被尝试,探索量因此自动流向「信息最缺」的地方。
- 04
完整 RL 中的探索:给好奇心发奖金
深度强化学习里,「好坏」依赖后续无数步,计数式的乐观奖励不再够用。于是出现内在奖励路线——好奇心(预测误差)、随机网络蒸馏、伪计数等,用「这个状态有多新奇」当作额外的探索奖金。
关键公式
a_t = argmax_a [ Q_t(a) + c · √( ln t / N_t(a) ) ]应用场景
- 在线广告与推荐:在展示已知高点击内容与试投新内容之间分配流量
- A/B 测试与临床试验:把更多受试者分到目前更优的方案,同时不放弃验证其他方案
- 超参数搜索:贝叶斯优化用类似汤普森采样的思路决定下一次评估哪组参数
- 冷启动:新用户或新商品数据稀缺时,靠主动探索收集必要信息
常见误区
- 贪心会「锁死」:早期一次偶然的坏运气,可能让某个其实最优的动作永远得不到足够尝试,从此被永久低估——这是探索不足最典型的失败模式。
- 探索不是免费的。每一次探索都直接消耗了本可获得的回报,这就是「遗憾(regret)」的定义,也是评价 bandit 算法的核心指标。
- 环境非平稳时,旧统计会过期。此时需要给历史打折扣或主动重新探索,否则会一直依赖已经失效的结论。
关键术语
- 多臂老虎机
- 每个摇臂奖励分布未知、每次只能拉一个的最简序贯决策模型
- 遗憾 Regret
- 实际累积收益与始终选最优动作的差距
- ε-贪心
- 以概率 ε 随机探索,其余时间利用当前最优
- 汤普森采样
- 按后验概率抽取并选最大值,探索量自动流向不确定处