3
#Sim-to-Real
강화학습
September 3, 2026
강화학습
September 3, 2026
강화 학습 기초 — MDP, 벨만 방정식 및 로봇 탐색
강화 학습은 에이전트가 관찰을 통해 행동을 선택하고 지연된 보상을 최대화하는 폐쇄 루프입니다. 이 입문서에서는 MDP, 가치 함수, 정책, 벨만 방정식, 탐색과 활용의 차이, 보상 설계, 그리고 시뮬레이션에서 실제 로봇 구현까지의 과정을 설명합니다.
Fundamentals · 10 분 읽기 강화학습 September 3, 2026모델 기반 강화 학습 및 시뮬레이션에서 현실로의 전환
실제 기계를 위한 세계 모델, 예측 오류, MPC, 도메인 무작위화, 시스템 식별 및 안전 모니터링.
Fundamentals · 7 분 읽기정책 경사법, PPO 및 SAC — 로봇을 위한 안정적인 연속 제어
정책 경사(Policy gradients)는 조향, 추력 및 관절 토크가 연속적으로 유지되도록 정책을 직접 업데이트합니다. 이 글에서는 액터-크리틱(Actor-Critic), PPO 및 SAC를 연결하고, 클리핑, 엔트로피 정규화, 평가 및 시뮬레이션에서 실제 환경으로의 전송을 위한 안전 경계에 대해 다룹니다.
Fundamentals · 10 분 읽기