强化学习
在试错与延迟奖励中学会一连串决策
OVERVIEW
- 全部词条
- 6
- 入门
- 2
- 进阶
- 3
- 专家
- 1
强化学习处理的是“没有标准答案、只有后果”的问题:这一步好不好,要看很久之后才揭晓的回报。它引入了智能体、环境、状态、动作、奖励这套语言,并用价值函数与策略梯度两种思路去逼近最优行为。
这一域要回答的问题
- Q1
“延迟奖励”为什么让问题变难?
- Q2
价值函数和策略梯度有何分工?
- Q3
强化学习为何能改进大模型?
在试错与延迟奖励中学会一连串决策
OVERVIEW
强化学习处理的是“没有标准答案、只有后果”的问题:这一步好不好,要看很久之后才揭晓的回报。它引入了智能体、环境、状态、动作、奖励这套语言,并用价值函数与策略梯度两种思路去逼近最优行为。
“延迟奖励”为什么让问题变难?
价值函数和策略梯度有何分工?
强化学习为何能改进大模型?