Contents — find the section you need
로봇 내비게이션은 현재 위치에서 지도상의 목표 지점까지 경로를 계획하고, 장애물을 피하면서 해당 경로를 따라 이동하는 기술입니다. 뉴봇이 사용하는 Nav2와 같은 고전적인 파이프라인은 여전히 실무에서 주류를 이루고 있으며, 강화 학습 및 비전-언어 모델을 기반으로 하는 엔드투엔드 접근 방식에 대한 연구도 빠르게 확장되고 있습니다.
이미지: Robot 운영 체제 로고, Wikimedia Commons (CC BY-SA 4.0)
자율 내비게이션 개요
다이어그램: Duskcoil. Nav2와 같은 계층적 내비게이션 스택에서 책임 분담이 간소화되었습니다.
내비게이션은 단순히 최단 경로를 한 번 계산하는 것 이상의 의미를 지닙니다. 전역 경로 계획기는 지도 전체를 살펴보고, 지역 제어기는 주변 장애물과 차량 제약 조건을 고려하여 경로를 속도 명령으로 변환합니다. 그리고 움직임 후 관찰을 통해 다음 결정을 업데이트합니다. 정지, 경로 재계획 및 복구 또한 시스템의 일부입니다. 따라서 아래 섹션들은 경로 계획, 제어, 학습 및 언어 명령이 이 공통 폐쇄 루프에 어떻게 통합되는지를 질문하는 것으로 이해할 수 있습니다.
고전적인 파이프라인: 비용 지도와 경로 계획 분리
Nav2로 대표되는 고전적인 내비게이션 스택은 센서 데이터를 기반으로 비용 지도(장애물 위험을 나타내는 2D 지도)를 구축한 다음, 그 위에 전역 경로 계획과 지역 궤적 추적을 별도의 모듈로 실행합니다. 각 모듈의 역할은 명확하고, 결과적인 동작은 사람이 쉽게 이해하고 조정할 수 있지만, 예상치 못한 환경(낯선 장애물 모양, 밀집된 군중)에 적응하는 능력에는 한계가 있습니다. 뉴봇(newbot) 역시 이러한 고전적인 파이프라인을 사용합니다. 구현 세부 사항은 "매핑 및 자율 내비게이션 작동 방식"을 참조하십시오.
기본 운동학: 차동 구동 속도 변환
어떤 내비게이션 방식을 사용하든, 컨트롤러가 최종적으로 출력하는 값은 두 가지입니다. 바로 병진 속도(v)와 각속도(\omega)입니다. 뉴봇과 같은 차동 구동 로봇(좌우 두 바퀴)의 경우, 이 두 값을 좌/우 바퀴 속도(v_l, v_r)로 변환하는 운동학 모델이 기본이 됩니다.
L은 좌/우 바퀴 사이의 거리(트레드 폭)입니다. 역변환은 계획된 속도((v, \omega))에서 각 바퀴의 목표 속도로 변환하는 데 사용됩니다. 이 간단한 두 방정식은 차동 구동 자체의 근본적인 제약 조건(측면 이동 불가, 회전에는 항상 바퀴 간 속도 차이가 필요함)을 나타냅니다. 아무리 정교한 코스트맵이나 경로 계획이 사용되더라도 모터는 궁극적으로 이 운동학적 모델을 통해 구동됩니다. 뉴봇의 구현 방식은 "안전한 속도 제어 작동 방식"에서도 자세히 설명되어 있습니다.
Nav2 내부: 코스트맵, 컨트롤러, 동작 트리
기존 파이프라인 내부의 모듈들이 어떻게 상호 작용하는지 좀 더 구체적으로 살펴보겠습니다. Nav2는 여러 "레이어"를 쌓아 코스트맵(장애물 위험을 나타내는 2D 지도)을 구축합니다. 정적 지도 데이터를 반영하는 레이어, 카메라 또는 심도 센서 데이터에서 동적 장애물을 감지하고 추적하는 레이어, 규칙에 따라 코스트맵을 재구성하는 레이어 등 다양한 역할을 가진 레이어를 쌓아 올리면 단일 알고리즘으로는 표현할 수 없는 다양한 정보 소스를 하나의 지도 표현에 통합할 수 있습니다.
경로 추적을 담당하는 controller_server는 로컬 코스트맵을 참조하면서 가장 최근에 계획된 전역 경로를 따라 로봇을 조종하고, 진행 상황 확인 및 목표 확인 플러그인과 같은 지원 플러그인과 함께 작동합니다. 복구 동작(제자리 회전, 후진)을 처리하는 behavior_server는 controller_server와 동일한 로컬 코스트맵을 실시간으로 참조하도록 설계되어 있어, 환경 표현 객체를 중복해서 저장하는 것을 방지하는 효율적인 구조를 갖습니다.
이러한 개별 서버들이 호출되는 순서와 조건을 제어하는 것은 Behavior Tree입니다. Nav2는 BehaviorTree.CPP라는 라이브러리를 사용하는데, 트리 구조의 노드가 "틱"(실행 트리거)될 때마다 플래너, 컨트롤러, 동작 서버와 같은 액션 서버를 호출합니다. 이러한 설계 덕분에 "경로 계획에 실패하면 다른 복구 동작으로 전환하기 전에 최대 N번 재시도"와 같은 복잡한 분기 로직을 개별 서버 코드 수정 없이 Behavior Tree의 설정만으로 재배열할 수 있습니다.
엔드투엔드 학습 기반 내비게이션의 확산
기존 파이프라인에 대한 최근의 대안은 센서 입력값을 직접 입력받아 동작을 출력하는 엔드투엔드 학습 기반 내비게이션입니다. 문을 통과하는 것과 같은 현실적인 협업 장면에서 학습 기반 방식이 모델 기반 방식보다 우수한 성능을 보인다는 연구 결과가 있으며, 심층 강화 학습(DRL)은 ROS 기반 내비게이션 연구의 주요 트렌드 중 하나로 자리 잡았습니다. TD3(Twin-Delayed DDPG), DDPG, DQN과 같은 알고리즘은 실시간 객체 탐지, 추적 및 내비게이션에 적용되어 왔으며, 모방 학습(전문가 시연을 통해 초기 정책 학습)과 강화 학습(해당 정책을 지속적으로 개선)을 결합한 하이브리드 방식도 등장했습니다.
내비게이션 기초 모델의 방향
최근에는 내비게이션 자체를 "기초 모델"로 학습하려는 시도가 주목받고 있습니다. 오프라인 비디오 사전 학습과 시뮬레이션 기반 강화 학습을 통한 사후 학습을 결합한 프레임워크(S2E: Seeing-to-Experiencing)는 일반화 성능을 유지하면서 상호작용성을 강화하도록 설계되었습니다. 시각-언어 모델을 내비게이션에 접목한 연구(예: Navi2Gaze) 또한 활발히 진행되고 있으며, 내비게이션 목표를 지도상의 좌표가 아닌 자연어 또는 목표 이미지로 지정하는 방향을 모색하고 있습니다(이는 VLA 분야와도 연관됩니다. 자세한 내용은 "VLA 기술 동향"을 참조하십시오).
사회적 내비게이션
사람들이 움직이는 환경에서 작동하는 실내 로봇의 경우, 단순히 장애물을 피하는 것을 넘어 "인간과 유사한" 경로를 따라가는 것이 중요한 연구 주제가 되었습니다. 사회적 내비게이션 분야에서는 일반적으로 세 가지 주요 연구 과제가 있습니다. 인간의 움직임을 정확하게 예측할 수 있는 모델, 혼잡한 환경을 현실적으로 시뮬레이션하는 학습 환경, 그리고 실제 세계의 복잡성을 반영할 수 있는 평가 지표입니다. 현재 활발한 연구에서는 가치 기반, 정책 기반, 액터-크리틱 등 다양한 강화 학습 알고리즘 계열과 피드포워드, 순환, 컨볼루션, 그래프, 트랜스포머 등 다양한 신경망 아키텍처를 결합하고 있습니다.
학습 기반 내비게이션의 구체적인 성과: 2026년 통계
2026년까지의 연구는 "성능 향상"과 같은 모호한 주장보다는 구체적인 수치로 뒷받침되는 사례가 점점 늘어나고 있습니다. 사전 지도가 없는 미지의 환경을 탐색하는 CORE Planner(2026년 6월 출시)는 희소 가시성 그래프 표현과 트랜스포머를 결합하여 기존 FAR Planner 대비 이동 거리를 13%, 다른 학습 기반 기준선 대비 최대 48%까지 줄이는 동시에 추가 학습 없이 시뮬레이션에서 실제 환경으로의 제로샷 전이를 달성했습니다. FlashNav(2026년 6월 출시)는 학습 시간을 획기적으로 단축하고, 불필요한 렌더링과 고화질 물리 엔진을 시뮬레이션에서 제거하며, GPU 상주 학습 파이프라인을 실행하여 RTX 5090에서 20초 이내에 정책 학습을 완료하고 100% 성공률을 달성했습니다. 또한 학습된 정책을 실제 로봇에 성공적으로 적용했습니다.
소셜 내비게이션 분야에서도 양적인 발전이 나타나고 있습니다. HUMA(2026년 7월 출시)는 사람이 근처에 있을 때만 VLM(Vision-Language Model) 추론을 선택적으로 활성화하고, 그렇지 않을 때는 강화 학습 정책의 계산 효율성을 활용하는 하이브리드 접근 방식을 통해 Social-MP3D 및 Social-HM3D 벤치마크에서 각각 20%와 3%의 작업 성공률 향상을 보고했습니다. 핵심 설계 원칙은 "항상 비용이 많이 드는 추론을 실행"하는 것이 아니라 "실제로 필요할 때만 실행"하는 것으로, 정확도와 계산 비용 간의 균형을 맞추는 것입니다.
내비게이션 기반 모델의 구체화: VLN 구현 사례
"내비게이션 기반 모델" 방향(S2E 등)은 2026년까지 더욱 구체적인 구현 사례들로 발전하고 있습니다. SuperMap(2026년 8월 발표, RSS 2026 학회 채택)은 고주파 기하학적 SLAM과 비동기 개방형 어휘 인식을 통합하여 객체 의미 및 관계에 대한 구성적 쿼리를 지원하는 4차원 장면 그래프(공간+시간)를 구축합니다. 이는 동적인 환경에서도 안정적인 객체 식별(3차원 공간에서 객체 매칭 및 재인식)을 유지하도록 설계되었으며, 자연어 명령 기반 로봇 내비게이션의 기반 역할을 합니다.
더 가벼운 구현 사례로는 GemNav(2026년 7월 발표)가 있습니다. GemNav는 고정된 사전 학습된 멀티모달 LLM을 적용하여 이산 토큰을 통한 웨이포인트 내비게이션을 처리합니다. 별도의 시각 인코더가 필요 없으며, 적은 양의 훈련 데이터만으로도 대규모 기반 모델을 완전히 미세 조정할 필요 없이, 이전에 접하지 못한 실내외 환경으로의 제로샷 전이를 달성하는 "데이터 효율적인 대안"으로 자리매김하고 있습니다. 또한 클라우드 의존성 없이 온디바이스에서 완전히 실행되는 오프라인 비전-언어 내비게이션 방식(2026년 7월)도 있습니다. 이 방식은 개방형 어휘 객체 탐지, 프롬프트 기반 분할, LiDAR 기하학을 결합하여 소규모 언어 모델만을 사용하여 실외 목표 위치를 추정합니다. 이러한 기술들을 종합해 보면, "자연어로 지시하는 내비게이션"이 연구 주제를 넘어 실제 구현 단계로 나아가고 있음을 알 수 있습니다.
실제 현황
현재로서는 이러한 기술들이 Nav2와 같은 기존 파이프라인을 대체할 단계는 아닙니다. 학습 기반 방법들은 연구 환경에서는 좋은 결과를 보여주지만, 실제 하드웨어에서 재현성과 안전성을 검증하는 데 드는 비용이 높고, 상용화 및 대량 사용에는 아직 한계가 있습니다. 뉴봇 자체 설계는 고전적인 경로 계획기와 독립적인 안전 감시 계층(물리적 킬 스위치 포함)을 결합한 형태로, (자세한 내용은 "안전한 속도 제어 작동 방식" 참조) 이 분야의 실질적인 기술 수준을 반영한다고 볼 수 있습니다. 학습 기반 방식이 실용화 단계로 나아가고 있지만, 적어도 가까운 미래에는 고전적인 안전 메커니즘을 기반으로 한 하이브리드 방식이 현실적인 선택이 될 것으로 보입니다.
정확한 위치 파악이 목표 달성을 보장합니까?
지도 작성, 장애물 처리, 계획 및 제어 또한 성공해야 합니다.
위치 정확도는 내비게이션 성능의 한 부분일 뿐입니다.참고 문헌
- 소셜 로봇 내비게이션: 학습 기반 방법 검토 및 벤치마킹
- 보는 것에서 경험하는 것으로: 강화 학습을 이용한 내비게이션 기초 모델 확장 (arXiv)
- Nav2 GitHub (ros-navigation)
- 내비게이션 개념 — Nav2 공식 문서
- 상세 행동 트리 분석 — Nav2 공식 문서
- CORE Planner 논문 (arXiv)
- FlashNav 논문 (arXiv)
- 중요한 순간에 생각하기(HUMA) 논문(arXiv)
- SuperMap 논문(RSS 2026, arXiv)
- GemNav 논문(arXiv)
- newbot의 구현은 "지도 및 자율 내비게이션 작동 방식" 및 "안전한 속도 제어 작동 방식"에서도 다룹니다.
댓글
먼저 로그인해 주세요.
아직 데이터가 없습니다.