Contents — find the section you need
결론
모델 기반 강화 학습(MBRL)은 상태와 행동을 예측된 다음 상태에 매핑하는 세계 모델(\hat f)을 학습하고, 그 안에서 행동 시퀀스를 테스트하며, 지도 학습된 행동만 하드웨어에 적용합니다. 모델 없는(Model-free) 방법은 보상으로부터 직접 정책을 학습합니다. MBRL은 데이터 효율성이 더 높고 제약 조건을 표현할 수 있지만, 모델 오류로 인해 시뮬레이터에서만 성공적인 결과를 얻을 수 있습니다. 강화 학습 기초, Q 학습, PPO/SAC, MPC를 참조하십시오.
세계 모델 및 계획
그림 1 — Duskcoil이 생성한 개념적 SVG이며, 측정된 시스템 데이터가 아닙니다.
\hat s_{t+1}=\hat f_\theta(s_t,a_t)를 학습하고 후퇴 예측 목표를 최적화합니다.
시뮬레이션-실제 구현, 식별 및 안전성
한 단계 오류는 장기간의 시뮬레이션 과정에서 누적됩니다. 앙상블 알고리즘은 불확실성을 추정할 수 있으며, 계획자는 분산이 높은 영역을 피하고 짧은 예측 기간을 사용할 수 있습니다. 도메인 무작위화는 질량, 마찰, 지연, 센서 노이즈, 조명 및 카메라 자세를 변화시킵니다. 시스템 식별은 관성, 마찰, 모터 상수 및 지연 시간을 측정하여 이러한 범위가 임의적인 것이 아니라 타당한 범위가 되도록 합니다.
데이터 로깅에서 저속 섀도우 제어, 그리고 제한된 지도 학습 시뮬레이션으로 진행합니다. 비상 정지, 독립적인 속도/힘/온도 모니터링, 통신 두절 시 정지, 그리고 사람 분리는 학습된 정책에서 제외합니다. 일반적인 오류에는 고정 마찰 시뮬레이션으로 인한 바퀴 미끄러짐, 조명 과적합, 진동을 유발하는 보상 조작, 모델링되지 않은 지연으로 인한 불안정성 등이 있습니다. 위반 횟수, 정지 거리, 불확실성으로 인한 오류를 보고합니다. 기피 및 최악의 경우 행동까지 고려하며, 평균 보상뿐만 아니라 다른 요소도 포함합니다.
모델 기반 및 비모델 기반 역할
모델 기반 강화 학습(MBRL)은 경험을 통해 정책이나 값을 직접 업데이트합니다. 접촉 역학을 모델링하기 어려울 때 표현력이 풍부하지만, 모든 개선 사항에 실제 시행착오가 소요될 수 있습니다. MBRL은 각 전환을 재사용하여 예측기를 학습하고, 해당 예측기에서 여러 후보 시퀀스를 평가합니다. 예측기에 체계적인 편향이 있는 경우, 계획기는 시뮬레이터 전용 단축 최적화를 수행합니다.
| 측면 | 모델 기반 | 비모델 기반 |
|---|---|---|
| 하드웨어 데이터 | 낮은 효율성 ~ 중간 효율성 | 모델 범위 내에서 중간 ~ 높은 효율성 |
| 실행 시간 | 일반적으로 가벼운 정책 추론 | 매 주기마다 롤아웃 및 최적화 |
| 제약 조건 | 일반적으로 간접적인 보상/안전 계층 | 계획 문제에 자연스럽게 포함됨 |
| 주요 실패 요인 | 희소 데이터로부터의 낮은 외삽률 | 장기 모델 오류 |
| 일반적인 적합성 | 복잡한 접촉 및 시각 정책 | 단기 동작, 에너지 및 열 계획 |
하이브리드 스택은 흔히 사용됩니다. 학습된 정책은 후보를 제안하고, 학습된 모델은 단기 예측을 수행하며, MPC는 속도, 힘, 전류 제약 조건을 적용합니다. 알고리즘을 대체재로 취급하기보다는 타이밍 및 안전 책임을 할당하는 데에는 PPO/SAC 문서와 MPC 문서를 참조하십시오.
불확실성을 하나의 숫자로 축소하지 마십시오
인식적 불확실성은 훈련 데이터 부족에서 발생하고, 확률적 불확실성은 줄일 수 없는 센서 및 환경 변동에서 발생합니다. 앙상블 분산은 전자에 대한 유용한 신호이지만, 앙상블은 여전히 동일한 편향을 공유할 수 있습니다. 예측 분산이 임계값을 초과하면 예측 기간을 단축하거나, 속도를 줄이거나, 기존 제어기로 전환하거나, 계획 수립 전에 추가 관측값을 수집하십시오. 이러한 유보 정책은 배포 전에 명시해야 합니다.
1단계 잔차 e_t=s_{t+1}-\hat s_{t+1}의 경우, 평균 제곱 오차 외에도 로그 분위수와 최악의 경우를 고려해야 합니다. 평균 오차가 낮으면 접촉 직전에 큰 오차가 숨겨질 수 있습니다. 확률적 예측 구간을 안전 인증서로 절대 해석하지 마십시오. 충돌, 힘, 온도 및 전류를 독립적으로 모니터링해야 합니다.
식별 실험 설계
시스템 식별은 단일 교정 문제가 아니라 실험 설계 문제입니다. 모터의 경우 정지 마찰, 여러 속도에서의 관성, 부하에 따른 토크, 통신 왕복 지연 시간을 각각 측정해야 합니다. 유압 액추에이터의 경우 압력, 유량, 실린더 속도, 오일 온도, 밸브 명령에 타임스탬프를 한 번에 기록해야 합니다. 데이터를 날짜, 층, 탑재량, 조명 및 온도별로 분할해야 하며, 인접한 프레임을 무작위로 분할해서는 안 됩니다. 그래야 최종 데이터 세트가 완전히 새로운 데이터가 됩니다.
간단한 수치적 직관
속도가 매 T_s=0.1\,\mathrm{s}마다 0.1u만큼 변하는 1kg 카트를 생각해 보십시오. 마찰이 없는 모델은 5시간 동안 u=1 동안 속도가 0.5\,\mathrm{m/s}만큼 증가할 것으로 예측합니다. 단계. 실제 카트가 마찰로 인해 단계마다 0.02\,\mathrm{m/s}만큼 손실된다면, 5단계 오차는 0.1\,\mathrm{m/s}에 도달합니다. 더 짧은 예측 기간, 온라인 식별, 속도 제약 조건의 여유, 그리고 측정값을 기반으로 한 재계획은 이 간단한 모델을 유용하게 유지시켜 줍니다.
공개할 증거
방정식과 함께 학습 기간, 센서 전송률, 지연 시간, 난수 시드, 환경 매개변수, 솔버 마감 시간, 그리고 대체 정책을 기록하십시오. 예측 잔차, 제약 조건 위반, 정지 거리, 그리고 불확실성으로 인한 실행 중단 횟수를 보상과 동일한 실험 ID로 그래프로 표시하십시오. 원시 로그를 공유할 수 없는 경우, 익명화된 통계, 시뮬레이션 설정, 단위, 그리고 기준 날짜를 게시하여 주장의 범위를 확인할 수 있도록 하십시오.
학습된 모델이 장기간 롤아웃에서 안정적인 성능을 보장합니까?
작은 모델 오류가 예측 전반에 걸쳐 누적됩니다. 롤아웃 길이를 확인하십시오.
익숙하지 않은 상태 및 실제 환경에서의 검증.참고 문헌
월드 모델 유형 및 플래너
물리 모델은 해석 가능하지만 접촉 처리에 어려움을 겪을 수 있습니다. 잠재 모델 및 앙상블 모델은 효율적일 수 있지만 실제 공간 안전성에 대한 검증이 필요합니다. 후보 동작은 슈팅, CEM 또는 미분 가능한 MPC를 사용할 수 있으며, 마감 시 대체 기능을 포함할 수 있습니다.
데이터셋 관리
포화된 센서, 시간 오류, 제한 장치 개입, 보간된 값 및 최종 원인을 표시합니다. 모델 업데이트로 인해 회귀 오류가 숨겨지지 않도록 평가 세트를 변경 불가능하게 유지합니다.
증거 경계
예측 정확도, 보상 및 안전한 하드웨어 동작은 별개의 주장입니다. 측정 지표를 공개하고, 테스트 조건 및 각 조건에 대한 책임 있는 안전 계층.
(테스트 조건 및 각 조건에 대한 책임 있는 안전 계층)
댓글
먼저 로그인해 주세요.
아직 데이터가 없습니다.