강화 학습은 에이전트가 관찰을 통해 행동을 선택하고 지연된 보상을 최대화하는 폐쇄 루프입니다. 이 입문서에서는 MDP, 가치 함수, 정책, 벨만 방정식, 탐색과 활용의 차이, 보상 설계, 그리고 시뮬레이션에서 실제 로봇 구현까지의 과정을 설명합니다.