강화학습
September 3, 2026
정책 경사법, PPO 및 SAC — 로봇을 위한 안정적인 연속 제어
정책 경사(Policy gradients)는 조향, 추력 및 관절 토크가 연속적으로 유지되도록 정책을 직접 업데이트합니다. 이 글에서는 액터-크리틱(Actor-Critic), PPO 및 SAC를 연결하고, 클리핑, 엔트로피 정규화, 평가 및 시뮬레이션에서 실제 환경으로의 전송을 위한 안전 경계에 대해 다룹니다.
Fundamentals · 10 분 읽기