Aprendizado por reforço
Aprender sequências de decisões por tentativa, erro e recompensa atrasada
OVERVIEW
- Todos os conceitos
- 6
- Iniciante
- 2
- Intermediário
- 3
- Especialista
- 1
Reinforcement learning addresses problems that have no answer key, only consequences: whether a step was good may only be revealed much later as reward. It introduces the vocabulary of agent, environment, state, action and reward, and approaches optimal behaviour through two families of ideas — value functions and policy gradients.
Perguntas que este domínio responde
- Q1
Why does delayed reward make the problem hard?
- Q2
How do value functions and policy gradients divide the work?
- Q3
Why can RL improve large language models?
Entradas deste domínio
- 01Processo de decisão de MarkovInicianteEscrever «decidir passo a passo» com cinco símbolos: todo o aprendizado por reforço começa aqui
- 02Funções de valor e Q-learningIntermediárioEm vez de adivinhar o que fazer, primeiro estime quanto vale cada escolha
- 03Gradientes de políticaIntermediárioAjuste a política diretamente para que ações boas ocorram com mais frequência
- 04Exploração e explotaçãoInicianteA melhor opção agora não é necessariamente a melhor no longo prazo
- 05Aprendizado por reforço profundoIntermediárioDeixe uma rede neural decidir direto dos pixels, estabilizada com ideias antigas
- 06Aprendizado por reforço a partir de feedback humanoEspecialistaQuando a «boa resposta» não cabe numa fórmula, deixe as pessoas servirem de recompensa