Học tăng cường
Học chuỗi quyết định từ thử và sai cùng phần thưởng trễ
OVERVIEW
- Tất cả mục từ
- 6
- Cơ bản
- 2
- Trung cấp
- 3
- Chuyên gia
- 1
Reinforcement learning addresses problems that have no answer key, only consequences: whether a step was good may only be revealed much later as reward. It introduces the vocabulary of agent, environment, state, action and reward, and approaches optimal behaviour through two families of ideas — value functions and policy gradients.
Những câu hỏi lĩnh vực này trả lời
- Q1
Why does delayed reward make the problem hard?
- Q2
How do value functions and policy gradients divide the work?
- Q3
Why can RL improve large language models?
Mục từ trong lĩnh vực này
- 01Quá trình quyết định MarkovCơ bảnViết «quyết định từng bước» bằng năm ký hiệu — mọi thứ trong học tăng cường bắt đầu từ đây
- 02Hàm giá trị và Q-learningTrung cấpThay vì đoán nên làm gì, hãy ước lượng mỗi lựa chọn đáng giá bao nhiêu
- 03Gradient chính sáchTrung cấpĐiều chỉnh trực tiếp chính sách để hành động tốt xuất hiện thường xuyên hơn
- 04Khám phá và khai thácCơ bảnLựa chọn tốt nhất hiện tại chưa chắc là tốt nhất về lâu dài
- 05Học tăng cường sâuTrung cấpĐể mạng nơ-ron quyết định thẳng từ điểm ảnh — rồi giữ ổn định bằng những mẹo cũ
- 06Học tăng cường từ phản hồi của con ngườiChuyên giaKhi «câu trả lời tốt» không viết được thành công thức, hãy để con người đóng vai hàm thưởng