2
#Inverse Reinforcement Learning
보상 설계 입문 — 강화 학습에서 "무엇을 극대화할 것인가"가 가장 어려운 이유
강화 학습 구현에서 보상 함수 설계는 알고리즘 자체보다 결과에 더 큰 영향을 미치는 경우가 많습니다. 이 글에서는 희소 보상과 밀집 보상, 포텐셜 기반 보상 설계의 정책 불변성, 보상 해킹의 실제 사례, 역 강화 학습, 그리고 제약 조건이 있는 강화 학습을 다룹니다.
Fundamentals · 13 분 읽기강화 학습 입문: 모방 학습과 역강화 학습
행동 복제, DAgger 및 역강화 학습은 보상을 설정하기 어려울 때 시연을 활용합니다. 이 입문 과정에서는 공변량 변화, 보상 추론, VLA 연결, 평가, 안전성 및 데이터 출처에 대해 다룹니다.
Fundamentals · 9 분 읽기