Contents — find the section you need
로봇에게 컵을 안전하게 놓거나, 좁은 통로에서 사람을 피하거나, 복잡한 도구를 조작하도록 가르치는 것은 생각보다 어렵습니다. 보상을 명확하게 정의하기 어렵기 때문입니다. 목표까지의 거리에 보상을 주면 물체를 밀어내는 행동을 유도할 수 있고, 최종 성공에만 보상을 주면 탐색에 유용한 신호를 주지 못할 수 있습니다. 모방 학습은 사람, 원격 조작자 또는 기존 정책의 시연을 통해 행동을 학습합니다. 반면 역강화 학습(IRL)은 시연된 행동을 합리적으로 만드는 목표, 즉 보상을 추론한 다음 해당 목표에 대한 정책을 도출합니다.
두 방법 모두 인간의 데이터를 사용한다고 해서 안전해지는 것은 아닙니다. 핵심 질문은 시연에 없는 상태에서 정책이 어떻게 작동하는지, 레이블의 시간적 및 속성 부여 방식은 무엇인지, 실패는 어떻게 수집되는지, 그리고 물리적 행동을 독립적으로 제한하는 요소는 무엇인지입니다. 이 글에서는 행동 복제(BC), 공변량 이동, DAgger, IRL, 비전-언어-행동 모델, 평가, 안전성 및 데이터 출처를 연결합니다. 관련 개념은 강화 학습 기초, PPO 및 SAC, VLA 입문을 참조하세요.
실질적인 결론
-
BC는 전문가가 제시한 상태 s에서 전문가의 행동 a로 지도 학습하는 방식입니다. 학습 속도는 빠르지만, 초기에 발생하는 작은 오류로 인해 정책이 이전에 경험하지 못한 상태 분포로 이동할 수 있습니다.
-
DAgger는 통제된 환경에서 현재 정책을 실행하고, 정책이 실제로 방문한 상태에서 전문가에게 행동을 묻고, 이러한 레이블을 집계하여 재학습합니다. 실패 모드를 데이터로 변환하지만, 안전한 실행과 신뢰할 수 있는 전문가 개입이 필요합니다.
-
IRL은 데모를 통해 보상 r_\theta(s,a)를 추정하고 이를 기반으로 정책을 최적화합니다. 보상은 고유하게 식별되지 않으므로, 그럴듯해 보이는 히트맵이 아닌, 별도의 조건에서의 동작과 명시적인 안전 제약 조건을 기준으로 판단해야 합니다.
-
VLA는 대규모 조건부 모방 정책을 사용할 수 있지만, 언어 및 이미지 크기가 물리적 한계, 타이밍, 접촉 안전성 또는 안전 정지 경로를 제거하지는 않습니다.
데모는 단순한 비디오가 아닌 운영 기록입니다.
유용한 데모는 관찰(이미지, 깊이, 힘, 관절 상태), 동작(관절 명령, 속도, 그리퍼, 정지), 타임스탬프, 프레임, 작업 지시, 성공/실패 여부, 작업자, 환경 조건 및 개입 이벤트를 결합합니다. 기록된 명령이 작업자가 의도한 명령이 아니라 운송 지연 후 로봇에 도달한 명령인 경우, 해당 지연 시간도 데이터 세트에 포함되어야 합니다. 100ms의 이미지-팔 오프셋은 올바른 동작을 일관성 없는 훈련 쌍으로 만듭니다.
데이터 출처에는 수집자의 동의, 기록 환경에 대한 허가, 개인정보 보호, 제3자 저작물, 로봇 안전 책임, 그리고 샘플의 출처를 추적할 수 있는 능력이 포함됩니다. 공개 데이터 세트를 혼합하려면 라이선스, 상업적 이용 약관, 재배포, 사람 및 오디오, 그리고 의도된 용도에 대한 보정 여부를 확인해야 합니다. "인터넷에서 찾았다"는 것은 출처가 아닙니다. 이는 추적 가능한 동의와 약관이 부재한 상태입니다.
다이어그램: Duskcoil, 개념도. 실제 배포는 데이터 수집을 의미하며, 이 다이어그램은 안전 모니터링, 정지 로직 또는 운영자 개입이 생략될 수 있음을 의미하지 않습니다.
행동 복제 및 공변량 변화
전문가 쌍 D=\{(s_i,a_i^*)\}_{i=1}^N이 주어졌을 때, 연속 행동 BC는 다음을 최소화할 수 있습니다.
이산 행동은 교차 엔트로피를 사용합니다. 유효한 행동이 두 개 이상인 경우, 단일 제곱 오차 예측은 "좌측 통과"와 "우측 통과"를 평균화하여 안전하지 않은 중간 행동을 생성할 수 있습니다. 조건부 분포, 혼합 모델 또는 확산형 정책은 여러 모드를 나타낼 수 있습니다. 컨텍스트, 운영자 스타일 및 작업 지침이 중요합니다.
BC는 보상 설계 또는 탐색 전에 오프라인으로 학습할 수 있다는 점에서 매력적입니다. 핵심적인 약점은 데모는 전문가 상태 분포 d_{\pi^*}(s)에서 가져오는 반면 배포는 d_{\pi_\theta}(s)을 생성한다는 것입니다. 작은 실수가 다음 관측에 영향을 미치고 누적될 수 있습니다. 단순화된 분석에서, 한 단계 오류 \epsilon는 순차적 시간 범위 T에 걸쳐 O(T^2\epsilon) 차수까지 증가할 수 있습니다. 정확한 상한은 가정에 따라 달라지지만, 인과 관계는 지속적입니다. 정책은 스스로 미래의 입력값을 생성합니다.
DAgger: 학습자가 진행하는 지점에서 레이블 집계
데이터셋 집계는 제어된 조건에서 학습된 정책을 실행하고, 실제로 방문한 상태 s에서 원하는 전문가 행동 a^*을 요청한 후, 해당 쌍을 D에 추가하고 재학습합니다. 반복 과정에서 정책 혼합을 사용할 수 있습니다. 이 방법은 훈련 분포를 실제 배포 분포에 가깝게 만듭니다.
DAgger는 로봇이 공개적으로 실패하도록 무조건 허용하는 것이 아닙니다. 시뮬레이션, 저속 주행, 물리적 안전장치, 원격 비상 정지, 즉각적인 전문가 개입, 행동 안전 필터 등을 활용하여 시작해야 합니다. 레이블은 전문가가 실제로 수행한 행동 또는 반사실적 행동일 수 있습니다. “이 상황에서 어떤 일이 일어났어야 했을까?”에 대한 답은 무엇일까요? 후자는 유용할 수 있지만 전문가 작업량, 지연 시간 및 주관적 변동성을 증가시킵니다. 행 수만 고려하지 말고 발견된 실패 모드를 중심으로 데이터 수집 계획을 세우십시오.
IRL: 동작 복사가 아닌 목표 추론
IRL은 전문가 정책 \pi_E에서 보상 r_\theta(s,a) 또는 r_\theta(s,a,s')를 추정합니다. 최대 엔트로피의 직관은 전문가 궤적이 유사하게 좋은 궤적들 사이에서 불필요하게 결정론적이지 않으면서 높은 보상을 선호한다는 것입니다. 개념적으로 궤적 \tau의 확률은 다음과 같습니다.
전문가 궤적의 가능성을 높이기 위해 \theta를 업데이트하면 RL 또는 최적 제어와 결합할 수 있는 보상이 생성됩니다. 이는 목표를 재최적화할 수 있기 때문에 새로운 초기 상태 또는 제약 조건에 직접 BC보다 더 잘 적응할 수 있습니다.
하지만 여러 보상이 동일한 현상을 설명할 수 있습니다. 관찰되지 않은 제약 조건과 연산자가 그 예입니다. 습관은 학습된 보상에 흡수될 수 있습니다. 훈련 궤적을 설명하는 보상은 위험할 정도로 일반화될 수 있습니다. GAIL 방식의 방법은 판별자를 통해 전문가와 학습자의 점유 분포를 일치시킵니다. 두 방식 모두 충돌, 끼임력, 인간 접근 금지 구역과 같은 금지 사항을 추론만으로 학습하는 것을 정당화하지 않습니다. 명시적인 안전 규칙은 명시적으로 유지됩니다.
VLA와의 연관성
비전-언어-행동(VLA) 모델은 이미지, 언어, 로봇 상태를 기반으로 다음 행동 또는 행동 덩어리를 조건화합니다. 넓은 의미에서 이는 대규모 조건부 모방입니다. 이 모델이 다루는 객체와 언어의 범위는 새로운 조명, 마찰, 카메라 위치, 모호한 지시 또는 접촉력 한계에 대한 외삽을 보장하지 않습니다. "컵을 선반에 올려놓으세요"라는 명령을 해석하는 VLA 자체가 힘, 충돌 거리, 관절 가동 범위 또는 정지 거리를 보장하는 것은 아닙니다. VLA 입문을 참조하십시오.
행동이 액추에이터에 도달하기 전에 좌표계, 단위, 속도, 가속도 및 최신성을 검증해야 합니다. 운동학, 충돌 검사, 임피던스 또는 위치/속도 제어기를 거쳐 경로를 지정합니다. 모호한 표현은 명확화, 거부 또는 저속 모드를 유발해야 하며, 인지 저하가 발생하면 실행을 중단해야 합니다. 데이터 규모는 물리적 안전 한계를 대체할 수 없습니다.
평가, 안전 및 출처
오프라인 작업 오류만으로 정책을 승인하지 마십시오. 초기 자세, 객체, 조명, 배경, 마찰, 지연 시간, 지침 문구 및 교란에 대한 검증 평가를 수행하십시오. 성공, 충돌, 중단, 개입 횟수, 최대 힘, 완료 시간 및 관찰된 최악의 사례를 보고하십시오. 높은 평균 성공률이 드물게 발생하는 인적 또는 장비 위험을 상쇄하지는 않습니다. 각 DAgger 반복, 소스 데모, 레이블러, 분할, 모델, 임계값, 실패 및 롤백 경로를 추적하십시오.
| 레이어 | 검증 | 실패 대응 |
|---|---|---|
| 데이터 | 동의, 라이선스, 시간, 프레임, 성공/실패 출처 | 격리, 재레이블링, 사용 중지 |
| 정책 | 검증 상태, 변경, 작업 불확실성 | 느린 속도, 전문가 질의, 회상 |
| 작동 | 제한, 속도, 충돌, 힘, 통신 | 안전 필터, 정지, 비상 정지 |
| 운영 | 관리자, 복구, 로그, 변경 관리 | 롤백 및 근본 원인 검토 |
모방이 시연자의 이유를 복원할 수 있습니까?
행동 재현과 보상 추론은 서로 다른 작업입니다. 여러 보상이 동일한 행동을 설명할 수 있으므로 실제 상황 가정을 검토하십시오.
참고 문헌
- Pomerleau, 1989: ALVINN
- Ross et al., 2011: DAgger
- [Ziebart et al., 2008: Maximum Entropy] IRL](https://cdn.aaai.org/AAAI/2008/AAAI08-227.pdf)
- 강화 학습 기초, PPO 및 SAC, VLA 입문
댓글
먼저 로그인해 주세요.
아직 데이터가 없습니다.