강화학습
시행착오와 지연 보상으로 일련의 결정을 학습한다
OVERVIEW
- 전체 항목
- 6
- 입문
- 2
- 중급
- 3
- 고급
- 1
Reinforcement learning addresses problems that have no answer key, only consequences: whether a step was good may only be revealed much later as reward. It introduces the vocabulary of agent, environment, state, action and reward, and approaches optimal behaviour through two families of ideas — value functions and policy gradients.
이 영역이 답하는 질문
- Q1
Why does delayed reward make the problem hard?
- Q2
How do value functions and policy gradients divide the work?
- Q3
Why can RL improve large language models?
이 영역의 항목
- 01마르코프 결정 과정입문‘한 걸음씩 결정하는 일’을 다섯 기호로 적는다. 강화학습의 모든 것이 여기서 시작된다
- 02가치 함수와 Q 러닝중급‘무엇을 할지’를 맞히기보다 먼저 ‘각 선택의 가치’를 계산한다
- 03정책 경사법중급정책 자체를 직접 조정해 ‘좋은 행동’이 더 자주 나오게 한다
- 04탐험과 활용입문지금 최선의 선택이 장기적으로 최선이라는 보장은 없다
- 05심층 강화학습중급신경망이 픽셀에서 곧바로 결정하게 하되, 오래된 아이디어로 안정화한다
- 06인간 피드백 기반 강화학습고급‘좋은 답’을 수식으로 쓸 수 없을 때는 인간이 보상 함수 역할을 한다