Aprendizaje por refuerzo
Aprender secuencias de decisiones mediante ensayo, error y recompensa diferida
OVERVIEW
- Todos los conceptos
- 6
- Principiante
- 2
- Intermedio
- 3
- Experto
- 1
Reinforcement learning addresses problems that have no answer key, only consequences: whether a step was good may only be revealed much later as reward. It introduces the vocabulary of agent, environment, state, action and reward, and approaches optimal behaviour through two families of ideas — value functions and policy gradients.
Preguntas que responde este dominio
- Q1
Why does delayed reward make the problem hard?
- Q2
How do value functions and policy gradients divide the work?
- Q3
Why can RL improve large language models?
Entradas de este dominio
- 01Proceso de decisión de MarkovPrincipianteEscribir «decidir paso a paso» con cinco símbolos: todo el aprendizaje por refuerzo empieza aquí
- 02Funciones de valor y Q-learningIntermedioEn lugar de adivinar qué hacer, calcula primero cuánto vale cada opción
- 03Gradientes de políticaIntermedioAjusta la política directamente para que las buenas acciones ocurran más a menudo
- 04Exploración y explotaciónPrincipianteLa mejor opción ahora no es necesariamente la mejor a largo plazo
- 05Aprendizaje por refuerzo profundoIntermedioDeja que una red neuronal decida directamente desde píxeles, estabilizada con ideas antiguas
- 06Aprendizaje por refuerzo a partir de retroalimentación humanaExpertoCuando la «buena respuesta» no cabe en una fórmula, deja que las personas actúen como recompensa