Обучение с подкреплением
Учиться последовательностям решений через пробы, ошибки и отложенную награду
OVERVIEW
- Все статьи
- 6
- Начальный
- 2
- Средний
- 3
- Экспертный
- 1
Reinforcement learning addresses problems that have no answer key, only consequences: whether a step was good may only be revealed much later as reward. It introduces the vocabulary of agent, environment, state, action and reward, and approaches optimal behaviour through two families of ideas — value functions and policy gradients.
Вопросы, на которые отвечает эта область
- Q1
Why does delayed reward make the problem hard?
- Q2
How do value functions and policy gradients divide the work?
- Q3
Why can RL improve large language models?
Статьи этой области
- 01Марковский процесс принятия решенийНачальный«Решать шаг за шагом» записывается пятью символами — отсюда начинается всё обучение с подкреплением
- 02Функции ценности и Q-обучениеСреднийВместо угадывания, что делать, сначала оцените, сколько стоит каждый выбор
- 03Градиенты политикиСреднийНастройте саму политику так, чтобы хорошие действия встречались чаще
- 04Исследование и использованиеНачальныйЛучший вариант сейчас не обязательно лучший в долгосрочной перспективе
- 05Глубокое обучение с подкреплениемСреднийПусть нейросеть решает прямо по пикселям — и удерживается давними приёмами
- 06Обучение с подкреплением на основе обратной связи от людейЭкспертныйКогда «хороший ответ» не выразить формулой, роль функции награды берут на себя люди