Contents — find the section you need
강화 학습(RL)은 로봇이 환경과 상호작용하면서 장기적으로 어떤 행동이 효과적인지 학습하는 방식입니다. 입력과 레이블이 동시에 주어지는 이미지 분류와 달리, 로봇은 주변 환경을 관찰하고 모터를 움직여 보상을 받습니다. 보상은 대개 몇 초 후에 지급됩니다. 핵심적인 과정은 시도, 결과 관찰, 정책 업데이트입니다.
30초 요약
-
가장 작은 RL 전환은 시간 t에서 상태(또는 관찰) s_t, 행동 a_t, 보상 r_{t+1}, 그리고 다음 상태 s_{t+1}입니다.
-
마르코프 결정 과정(MDP)은 현재 상태와 행동이 다음 상태와 보상을 어떻게 생성하는지 모델링합니다. 상태는 예측을 위해 과거 이력을 충분히 요약해야 합니다.
-
정책 \pi(a\mid s)는 행동을 선택합니다. 가치 함수 V^\pi(s)은 해당 정책을 따랐을 때 예상되는 미래 수익을 나타냅니다.
-
이 수익은 \gamma을 사용하여 미래 보상을 할인합니다. 예측 기간이 너무 길면 학습이 불안정해질 수 있고, 너무 짧으면 근시안적이고 안전하지 않은 로봇이 만들어집니다.
- 탐색은 불확실한 행동을 시도하는 것이고, 활용은 현재 최선이라고 여겨지는 행동을 선택하는 것입니다. 하드웨어에서는 안전 제약 조건이 이 두 가지 모두에 적용됩니다.
1. 로봇을 에이전트로 보기
그림 1 — 에이전트가 행동한 후 환경이 변경되고 다음 관찰 및 보상이 반환됩니다. 실제 로봇은 이 루프에 통신 지연, 센서 노이즈 및 액추에이터 포화를 추가합니다.
차동 구동 로봇의 경우 에이전트는 카메라, LiDAR 및 엔코더 데이터를 상태로 사용하고 좌우 바퀴 속도를 행동으로 출력할 수 있습니다. 환경에는 차량 역학, 바닥 마찰, 장애물 및 배터리 상태가 포함됩니다. 목표 지점으로 이동하면 긍정적인 보상을 받을 수 있지만 충돌이나 급격한 조향 변경은 불이익을 받을 수 있습니다. "목표 지점 +1"과 같은 단일 신호는 일반적으로 너무 부족합니다. 거리, 속도, 정지 여유 및 에너지를 함께 고려해야 합니다.
2. MDP: 문제를 구성 요소로 분할
MDP는 상태 공간(\mathcal{S}), 행동 공간(\mathcal{A}), 전이 확률(P(s'\mid s,a)), 보상 함수(R(s,a,s')), 할인 계수(\gamma)로 정의됩니다.
에이전트가 상태(s_t)에서 행동(a_t)을 선택하면, 환경은 P에 따라 다음 상태(s_{t+1})로 전이하고 보상(r_{t+1}=R(s_t,a_t,s_{t+1}))을 반환합니다.
"마르코프"란 현재 상태를 알게 되면 과거 정보는 더 이상 미래 예측에 필요한 정보를 제공하지 않는다는 것을 의미합니다. 위치 정보만 포함하는 상태를 가진 이동 로봇은 정지한 로봇과 동일한 위치에서 미끄러지듯 이동하는 로봇을 구분할 수 없습니다. 속도, 각속도, 센서 신뢰도를 포함하거나, 이력을 유지하는 순환 모델을 사용하십시오.
완전한 상태 s_t를 직접 관측할 수 없는 경우, 해당 문제는 부분 관측 가능 마르코프 결정 과정(POMDP)입니다. 거의 모든 실제 로봇은 가림 현상과 LiDAR 반사 신호 누락으로 인해 POMDP에 해당합니다. 확장 칼만 필터(EKF), 요인 그래프 또는 학습된 모델과 같은 상태 추정기는 관측값 o_t을 유용한 내부 상태로 변환합니다. 센서 융합 관련 글에서 이 경계를 설명하고, ROS 2 입문에서 이를 재현 가능한 소프트웨어 구성 요소로 만드는 방법을 보여줍니다.
3. 가치 함수 및 반환
시간 t부터의 보상 합계를 할인한 값이 반환값 G_t입니다.
정책 \pi 하에서의 상태 s의 가치는 다음과 같습니다.
그리고 상태-행동 가치는 첫 번째 행동을 다음과 같이 지정합니다.
가장 큰 Q 값을 선택하는 것은 가치 기반 설계입니다. 신경 정책 \pi_\theta(a\mid s)의 매개변수 \theta를 직접 업데이트하는 것은 정책 기반 설계입니다. 연속적인 조향각과 관절 토크는 모든 가능한 행동을 열거하는 것이 불가능하기 때문에 정책 경사법이나 액터-크리틱 방법이 적합한 경우가 많습니다.
4. 벨만 방정식은 긴 예측 범위를 한 단계로 나눕니다.
미래 전체를 한 번에 평가하는 대신, 즉각적인 보상과 한 단계 후의 가치로 나눕니다. 벨만 기대 방정식은 다음과 같습니다.
최적 값 V^*(s)은 벨만 최적성 방정식을 따릅니다.
이것이 바로 사람이 제공한 레이블 대신 다른 추정치를 기반으로 목표값을 생성할 수 있는 이유입니다. 자기 참조는 불안정성의 원인이 될 수 있습니다. 목표 네트워크, 경험 재생, 보상 정규화는 이전 추정치를 현재 업데이트와 분리하여 유해한 상관관계를 줄입니다.
5. 탐색과 활용의 균형
항상 현재 가장 높은 추정치를 가진 행동을 선택하면 에이전트가 운 좋게 얻은 지역 해에 갇힐 수 있습니다. 탐색은 알려지지 않은 행동을 시도하지만, 실제 머신에서의 무작위 움직임은 충돌을 일으킬 수 있습니다. 일반적인 선택 사항은 다음과 같습니다.
| 방법 | 직관 | 강점 | 하드웨어 고려 사항 |
|---|---|---|---|
| ε-그리디 | 확률 ε로 무작위 선택 | 단순함 | 급격한 변화는 연속 토크에 위험함 |
| 볼츠만/소프트맥스 | 값에 비례하여 샘플링 | 유망한 옵션 선호 | 온도 조정 필요 |
| UCB | 불확실성이 높은 동작 시도 | 명확한 탐색 논리 | 불확실성 추정 필요 |
| 노이즈 정책 | 동작 또는 가중치에 연속 노이즈 추가 | 더 부드러운 탐색 | 포화 및 제한 필요 |
하드웨어에서는 검증된 작동 범위 내에서 탐색을 제한합니다. 모든 정책 출력을 차단할 수 있도록 학습기 외부에 속도 제한, 관절 소프트 제한, 힘/전류 제한, 워치독 및 비상 정지를 배치합니다. 시뮬레이터에서의 무작위화는 유용하지만, 기계에 무작위 명령을 적용할 수 있는 권한을 의미하는 것은 아닙니다.
6. 작은 그리드 환경에서 아이디어 검증
5×5 그리드는 학습 역학을 시각화하는 데 유용합니다. 셀을 상태, 위/아래/좌/우를 동작, 목표 보상을 +1, 벽 충돌을 -0.1, 각 단계를 -0.01로 설정합니다. Q를 0으로 초기화하고 시간차 업데이트를 반복합니다.
괄호 안의 항은 TD 오차, 즉 예측값과 한 단계 목표값의 차이입니다. \alpha가 너무 크면 새로운 경험이 지배적이고, 너무 작으면 정책이 변화하는 환경을 따라가지 못합니다. 단일 보상 곡선뿐만 아니라 성공률, 평균 단계 수, 충돌률, 그리고 방문하지 않은 상태의 비율을 기록해야 합니다.
7. 보상을 명세처럼 작성하세요
보상 설계는 알고리즘 세부 사항보다 더 중요할 때가 많습니다. 배달 로봇은 다음과 같은 방법을 사용할 수 있습니다.
진행 상황, 충돌, 입력 에너지, 그리고 부드러움을 결합합니다. 가중치 w를 증가시킨다고 해서 항상 동작이 개선되는 것은 아닙니다. 충돌 페널티가 지배적일 경우, 로봇은 안전하지만 무의미한 '움직이지 않는' 정책을 학습할 수 있습니다. 각 항을 개별적으로 기록하고 정책이 실제로 어떤 항을 최적화하는지 감사해야 합니다.
보상 조작 또한 실패 원인 중 하나입니다. 목표 감지기의 버그, 센서 사각지대, 또는 시뮬레이터 전용 접촉 규칙으로 인해 의도한 작업을 달성하지 않고도 높은 점수를 얻을 수 있습니다. 사람이 읽기 쉬운 목표, 물리 기반 제약 조건, 그리고 독립적인 평가 환경을 통해 이러한 편법을 더 쉽게 감지할 수 있습니다.
8. 연구와 제품의 만남
가치 기반 방법은 데이터 효율적이지만 종종 이산적인 상태와 동작을 가정합니다. 정책 경사법과 액터-크리틱 방법은 연속적인 제어를 처리하며, SAC는 엔트로피 목표를 추가하고, 모델 기반 강화 학습은 로봇을 움직이기 전에 학습되거나 분석된 동역학 모델을 사용하여 계획을 수립합니다. 모델 기반 방법은 실제 샘플 수를 줄일 수 있지만 모델 오류를 허용해야 합니다.
실제 생산 환경에서는 안전 모니터링부터 모터 전류까지 모든 계층에 강화 학습을 적용할 필요는 없습니다. 고전적인 PID 또는 MPC는 안전 영역을 제공하는 반면, 강화 학습(RL)은 파지 접촉, 경로 선호도 또는 이득 스케줄을 선택합니다. VLA 개요에서는 이와 유사한 경계를 설명합니다. 비전-언어 모델은 동작 덩어리를 제안하고, 검증된 저수준 컨트롤러는 토크와 속도를 제한합니다.
9. 하드웨어 구현 전 고려 사항
-
상태 데이터에 속도, 지연 시간, 센서 신뢰도가 포함되어 있습니까? 아니면 마르코프 가정이 암묵적으로 위반되었습니까?
-
보상 항목은 성공률 외에도 충돌률, 에너지, 입력 평활도, 정지 거리와 함께 별도로 기록됩니까?
-
동작 범위, 속도 제한, 감시 장치, 비상 정지 기능은 학습기와 독립적입니까?
-
마찰, 질량, 센서 지연, 조명, 패킷 손실은 시뮬레이션에서 무작위화되었으며, 실제 로그에서 분포 차이가 측정되었습니까?
-
학습 데이터와 별도로 미사용 평가 데이터 세트가 유지됩니까? 실패 데이터가 필터링되지 않고 포함됩니까?
-
프로세스 재시작 시 안전한 상태로 진입하여 이전 명령을 다시 실행하지 않는가?
요약
강화 학습은 로봇이 "올바른 동작"을 암기하도록 하는 것이 아닙니다. 상태, 행동, 전환, 보상을 마르코프 결정 과정(MDP)으로 정의한 다음, 벨만 방정식을 사용하여 한 단계씩 장기적인 가치를 추정합니다. 학습된 정책이 시뮬레이션을 벗어나 실제 환경에 적용되기 위해서는 탐색, 보상 조작, 하드웨어 안전성이 시스템 설계에 반드시 포함되어야 합니다. 이 시리즈의 다음 글에서는 Q-러닝/DQN, 정책 경사, PPO 및 SAC, 모방 학습, 시뮬레이션-실제 적용(Sim-to-Real) 등을 동일한 프레임워크 내에서 비교할 것입니다.
가장 높은 즉각적인 보상을 주는 행동이 항상 최선인가?
미래의 보상과 전환에 따라 답이 바뀔 수 있다.
즉각적인 보상과 할인된 수익을 구분하세요.
댓글
먼저 로그인해 주세요.
아직 데이터가 없습니다.