التعلّم المعزّز
تعلّم سلاسل القرارات من التجربة والخطأ والمكافأة المتأخرة
OVERVIEW
- جميع المداخل
- 6
- مبتدئ
- 2
- متوسط
- 3
- متقدم
- 1
Reinforcement learning addresses problems that have no answer key, only consequences: whether a step was good may only be revealed much later as reward. It introduces the vocabulary of agent, environment, state, action and reward, and approaches optimal behaviour through two families of ideas — value functions and policy gradients.
الأسئلة التي يجيب عنها هذا المجال
- Q1
Why does delayed reward make the problem hard?
- Q2
How do value functions and policy gradients divide the work?
- Q3
Why can RL improve large language models?
مداخل هذا المجال
- 01عملية قرار ماركوفمبتدئنكتب «اتخاذ القرار خطوة بخطوة» بخمسة رموز، ومن هنا يبدأ كل التعلّم المعزّز
- 02دوال القيمة وتعلّم Qمتوسطبدل تخمين ما ينبغي فعله، احسب أولاً قيمة كل خيار
- 03تدرّجات السياسةمتوسطعدّل السياسة مباشرةً ليتكرّر وقوع الأفعال الجيدة أكثر
- 04الاستكشاف والاستغلالمبتدئالخيار الأفضل الآن ليس بالضرورة الأفضل على المدى الطويل
- 05التعلّم المعزّز العميقمتوسطدع شبكة عصبية تقرّر من البكسلات مباشرة، مع تثبيتها بأفكار قديمة
- 06التعلّم المعزّز من التغذية الراجعة البشريةمتقدمعندما يتعذّر كتابة «الإجابة الجيدة» كصيغة، دع البشر يقومون بدور دالة المكافأة