प्रबलन अधिगम
परीक्षण, त्रुटि और विलंबित पुरस्कार से निर्णयों का क्रम सीखना
OVERVIEW
- सभी प्रविष्टियाँ
- 6
- प्रारंभिक
- 2
- मध्यवर्ती
- 3
- विशेषज्ञ
- 1
Reinforcement learning addresses problems that have no answer key, only consequences: whether a step was good may only be revealed much later as reward. It introduces the vocabulary of agent, environment, state, action and reward, and approaches optimal behaviour through two families of ideas — value functions and policy gradients.
इस क्षेत्र में उत्तर देने वाले प्रश्न
- Q1
Why does delayed reward make the problem hard?
- Q2
How do value functions and policy gradients divide the work?
- Q3
Why can RL improve large language models?
इस क्षेत्र की प्रविष्टियाँ
- 01मार्कोव निर्णय प्रक्रियाप्रारंभिक«क़दम-दर-क़दम निर्णय लेना» को पाँच प्रतीकों में लिखें — सुदृढ़ीकरण अधिगम यहीं से शुरू होता है
- 02मूल्य फलन और Q-लर्निंगमध्यवर्ती«क्या करें» का अनुमान लगाने के बजाय पहले हर विकल्प का मूल्य आँकें
- 03नीति प्रवणतामध्यवर्तीनीति को सीधे समायोजित करें ताकि अच्छे कार्य अधिक बार हों
- 04अन्वेषण और उपयोगप्रारंभिकअभी का सर्वोत्तम विकल्प ज़रूरी नहीं कि लंबे समय में सर्वोत्तम हो
- 05गहन सुदृढ़ीकरण अधिगममध्यवर्तीतंत्रिका जाल को सीधे पिक्सेल से निर्णय लेने दें, पुराने विचारों से स्थिर करें
- 06मानव प्रतिक्रिया से सुदृढ़ीकरण अधिगमविशेषज्ञजब «अच्छा उत्तर» सूत्र में न लिखा जा सके, मनुष्य को पुरस्कार फलन बनने दें