Apprentissage par renforcement
Apprendre des séquences de décisions par essai, erreur et récompense différée
OVERVIEW
- Tous les concepts
- 6
- Débutant
- 2
- Intermédiaire
- 3
- Expert
- 1
Reinforcement learning addresses problems that have no answer key, only consequences: whether a step was good may only be revealed much later as reward. It introduces the vocabulary of agent, environment, state, action and reward, and approaches optimal behaviour through two families of ideas — value functions and policy gradients.
Les questions auxquelles ce domaine répond
- Q1
Why does delayed reward make the problem hard?
- Q2
How do value functions and policy gradients divide the work?
- Q3
Why can RL improve large language models?
Entrées de ce domaine
- 01Processus de décision markovienDébutantÉcrire « décider pas à pas » avec cinq symboles : tout l’apprentissage par renforcement part de là
- 02Fonctions de valeur et Q-learningIntermédiairePlutôt que de deviner quoi faire, estimez d’abord la valeur de chaque choix
- 03Gradients de politiqueIntermédiaireAjustez directement la politique pour que les bonnes actions surviennent plus souvent
- 04Exploration et exploitationDébutantLe meilleur choix à l’instant n’est pas forcément le meilleur à long terme
- 05Apprentissage par renforcement profondIntermédiaireLaissez un réseau de neurones décider directement depuis les pixels, stabilisé par des idées anciennes
- 06Apprentissage par renforcement à partir de retours humainsExpertQuand la « bonne réponse » ne s’écrit pas en formule, laissons les humains jouer le rôle de la récompense