跳到正文

强化学习

在试错与延迟奖励中学会一连串决策

OVERVIEW

全部词条
6
入门
2
进阶
3
专家
1

强化学习处理的是“没有标准答案、只有后果”的问题:这一步好不好,要看很久之后才揭晓的回报。它引入了智能体、环境、状态、动作、奖励这套语言,并用价值函数与策略梯度两种思路去逼近最优行为。