Bestärkendes Lernen
Entscheidungsfolgen aus Versuch, Irrtum und verzögerter Belohnung lernen
OVERVIEW
- Alle Einträge
- 6
- Anfänger
- 2
- Fortgeschritten
- 3
- Experte
- 1
Reinforcement learning addresses problems that have no answer key, only consequences: whether a step was good may only be revealed much later as reward. It introduces the vocabulary of agent, environment, state, action and reward, and approaches optimal behaviour through two families of ideas — value functions and policy gradients.
Fragen, die dieser Bereich beantwortet
- Q1
Why does delayed reward make the problem hard?
- Q2
How do value functions and policy gradients divide the work?
- Q3
Why can RL improve large language models?
Einträge dieses Bereichs
- 01Markov-EntscheidungsprozessAnfänger„Schritt für Schritt entscheiden" in fünf Symbolen – hier beginnt alles im bestärkenden Lernen
- 02Wertfunktionen und Q-LearningFortgeschrittenStatt zu raten, was zu tun ist, schätze zuerst, was jede Option wert ist
- 03Policy-GradientenFortgeschrittenPasse die Politik direkt an, damit gute Aktionen häufiger auftreten
- 04Exploration und AusbeutungAnfängerDie beste Option im Moment ist nicht zwingend die beste auf lange Sicht
- 05Deep Reinforcement LearningFortgeschrittenLass ein neuronales Netz direkt aus Pixeln entscheiden – und halte es mit alten Kniffen stabil
- 06Bestärkendes Lernen aus menschlichem FeedbackExperteWenn die „gute Antwort" keine Formel hat, übernehmen Menschen die Rolle der Belohnungsfunktion