Q-러닝은 벨만 최적성 목표를 사용하여 행동 값을 업데이트합니다. 이 입문서는 표 형식의 Q-테이블에서 심층 Q-네트워크에 이르는 과정을 따라가며 경험 재생, 목표 네트워크, 과대평가 및 로봇 스택에서의 안전한 배치에 대해 설명합니다.