Contents — find the section you need
SLAM(동시 위치 추정 및 지도 작성)은 센서만을 사용하여 "내가 어디에 있는지"와 "주변 환경이 어떻게 생겼는지"를 동시에 추정하는 기술입니다. 이 글에서는 SLAM 기술 전반의 흐름과 세부적인 내용(Visual-SLAM, LiDAR-SLAM 등)을 각각 별도의 글에서 다룹니다.
핵심 아이디어: SLAM은 로봇의 위치를 먼저 찾고 지도를 나중에 작성하는 일방향 파이프라인이 아닙니다. 이는 결합된 추정 문제입니다. 불확실한 지도는 위치를 추정하는 데 도움을 주고, 추정된 위치는 지도를 업데이트하는 데 사용됩니다.
이미지: Robot 운영 체제 로고, Wikimedia Commons (CC BY-SA 4.0)
SLAM 시스템 개요
다이어그램: Duskcoil. 대표적인 그래프 기반 SLAM 시스템을 간략화한 것입니다. 루프 클로저는 재방문을 감지하고 제약 조건을 추가하며, 그래프 백 엔드는 궤적과 지도를 수정합니다. 구성 요소 경계는 구현에 따라 다릅니다.
SLAM 방법이 변화하더라도 비교 축은 여전히 명확하게 구분됩니다. 프런트 엔드는 대응점과 상대 운동 제약 조건을 생성하고, 백 엔드는 시간에 따른 제약 조건을 조정하며, 루프 클로저는 재방문 시 장거리 제약 조건을 추가합니다. 학습 기반 방법은 이러한 구성 요소의 일부 또는 전부를 대체하는 반면, 3DGS와 NeRF는 주로 지도를 확장합니다. 표현 방식. 아래 역사는 각 부분이 어떻게 변화해 왔는지에 대한 이야기로 이해하는 것이 가장 쉽습니다.
첫 번째 흐름: 필터 기반 방식에서 시작
다이어그램: Duskcoil. 학습, 맵 표현 및 의미론을 통한 추정 및 직교 확장의 변화가 구분되어 있습니다. 기존 방식과 새로운 방식이 여전히 공존하며 응용 분야에 따라 결합됩니다.
초기 SLAM은 확장 칼만 필터(EKF) 또는 파티클 필터를 통한 순차적 추정이 주를 이루었으며, 새로운 센서 관측값이 도착할 때마다 상태를 업데이트했습니다. 계산 비용은 저렴했지만, 오류가 쉽게 누적되고 대규모 맵에서는 제대로 작동하지 않는 경향이 있다는 단점이 있었습니다.
두 번째 흐름: 그래프 최적화로의 전환
그 후로 지배적인 기술로 자리 잡은 것은 포즈 그래프 최적화(graph SLAM)였습니다. 이 기술은 로봇의 궤적을 따라 특정 지점에서의 포즈를 각 노드로, 센서 관측값에서 도출된 상대적 관계를 각 에지로 나타내는 그래프를 구축한 다음, 전체를 비선형 최소제곱 문제로 한 번에 최적화합니다. 루프 클로저(이전에 방문한 위치를 인식하고 누적된 오류를 소급적으로 수정하는 기술)와 결합하여 대규모 환경에서도 안정적인 지도를 구축할 수 있게 되었습니다. Newbot에서 사용되는 slam_toolbox는 이러한 계보에 속합니다. FAST-LIO는 포즈 그래프 대신 반복 칼만 필터를 사용하여 LiDAR-IMU 오도메트리를 긴밀하게 결합합니다.
그래프 최적화의 내부 구조: 비선형 최소제곱법으로 표현
graph SLAM이 내부적으로 해결하는 문제를 좀 더 구체적으로 살펴보겠습니다. graph SLAM은 로봇의 궤적을 따라 특정 시점에서의 포즈를 각 노드로, 센서 관측값에서 도출된 상대적 관계를 각 에지로 나타내는 그래프를 구축합니다. 센서 관측값으로부터 도출된 상대적 위치 관계는 모든 노드의 위치를 모든 에지의 제약 조건과 최대한 일치하도록 조정하는 비선형 최소 제곱 문제로 공식화됩니다. 센서 관측값에는 노이즈가 포함되어 있으므로 에지 간의 제약 조건은 어느 정도 서로 충돌할 수밖에 없으며, 이 최적화의 목표는 이러한 충돌을 가능한 한 "가장 불합리하지 않은" 방식으로 분산하는 것입니다.
형식적으로, 해결해야 할 전체 포즈 집합 \mathbf{x} = (\mathbf{x}_1, \dots, \mathbf{x}_n)에 대해, 문제는 다음 목적 함수를 최소화하는 것입니다.
여기서 \mathcal{C}은 센서 관측값에 의해 제약되는 노드 쌍(에지)의 집합이고, \mathbf{e}_{ij}은 노드 i와 j의 추정 포즈와 센서 관측값 간의 불일치를 나타내는 오차 함수이며, \Sigma_{ij}^{-1}은 해당 오차 함수의 가중치입니다. 관측값의 신뢰도(역공분산)를 구합니다.
가우스-뉴턴 또는 레벤버그-마르쿼트와 같은 반복법을 사용하여 이를 해결합니다. 오차 함수는 현재 추정값( \mathbf{e}_{ij}(\mathbf{x} + \Delta\mathbf{x}) \approx \mathbf{e}_{ij}(\mathbf{x}) + \mathbf{J}_{ij}\Delta\mathbf{x} )을 중심으로 선형화되고, 정규 방정식 \mathbf{J}^\top \mathbf{J} \, \Delta\mathbf{x} = -\mathbf{J}^\top \mathbf{e}을 풀어 업데이트 \Delta\mathbf{x}를 구하는 과정을 수렴할 때까지 반복합니다. 관측된 특징점(랜드마크)의 3D 위치를 카메라 포즈와 함께 최적화 대상으로 포함할 경우, 이 과정을 번들 조정(Bundle Adjustment)이라고 합니다. SLAM 문제는 많은 변수(포즈, 랜드마크)를 가지고 있지만, 각 관측값은 그중 극히 일부에만 영향을 미치므로 결과 행렬(야코비 행렬, 헤시안 행렬)은 희소 행렬이 됩니다. 이러한 희소성을 활용하여 효율적으로 해결하는 것이 핵심이며, Ceres Solver, g2o, GTSAM과 같은 범용 최적화 프레임워크가 이러한 희소 비선형 최소제곱법을 위한 라이브러리로 널리 사용됩니다. 문제점.
세 번째 흐름: 학습 기반, AI 네이티브 SLAM
현재 진행 중인 흐름은 딥러닝을 SLAM 파이프라인에 통합하는 것입니다. 명시적인 특징 추출 및 매칭을 딥러닝으로 대체하는 것은 조명 변화 및 텍스처가 부족한 환경에 대한 견고성을 향상시키기 위한 활발한 연구 분야입니다. 최근에는 "AI 네이티브" 또는 "시맨틱 SLAM"이라는 새로운 방향도 등장했는데, 이는 그래프 신경망, 심지어 대규모 언어 모델(LLM) 및 비전-언어-행동(VLA) 모델을 SLAM 파이프라인에 통합하는 것입니다. 목표는 더 이상 "내가 어디에 있는가"를 찾는 것이 아니라, "무엇이 있는가"를 동시에 이해하는 시맨틱 지도를 구축하는 것입니다.
지도 표현 자체의 변화
가장 눈에 띄는 최근 변화는 지도의 "표현 형식" 자체의 재창조입니다. 기존의 포인트 클라우드 및 점유 그리드를 넘어, 신경 방사 필드(NeRF) 및 3D 가우시안 기반의 지도 표현이 등장하고 있습니다. 3D 가우시안 맵(3DGS) 기술이 빠르게 발전하고 있습니다. 이러한 기술은 매핑 정확도, 렌더링 품질, 계산 효율성 측면에서 기존 방식을 능가하고 있으며, MHED-SLAM, GTS-SLAM, MTE-SLAM, HL-SLAM, PMET-SLAM 등 새로운 3DGS/NeRF 기반 기술들이 2026년까지 주요 학회 및 학술지에 지속적으로 발표되고 있습니다. 자세한 내용은 별도 기사 "Visual-SLAM의 기술 동향"을 참조하십시오.
2026년 후반 스냅샷: 3DGS-SLAM, 도메인별 다양화
2026년 8월까지 발표된 논문들을 통해 위에서 언급한 3DGS/NeRF 기반 기술들을 구체적으로 살펴보면, 대상 도메인이 크게 다양화되었다는 점이 눈에 띕니다. RoSe-SLAM은 동적 장면의 단안 비디오에서 의미론적으로 태그된 3D 가우시안 맵을 구축합니다(IROS 2026 발표 예정). Daniel Cremers 연구실의 Stipple은 점진적으로 실시간으로 시각 데이터와 관성 데이터를 긴밀하게 결합하여 지도를 구축하는 GLAM-SLAM은 흐름 밀집화 및 공간 분해를 통해 도시 블록 규모의 환경으로 확장 가능하며(IROS 2026 채택), Real-Time LiDAR Gaussian Splatting SLAM은 LiDAR 포인트 클라우드를 3D 가우시안 분포와 직접 결합합니다. 실내/실외, 동적 장면, 대규모 환경 등 다양한 축을 중심으로 전문화가 진행되고 있습니다. 이러한 접근 방식은 로봇 공학을 넘어 의학 분야로도 확산되고 있는데, EndoMD-SLAM은 내시경 SLAM을, Track2Map(MICCAI 2026 채택)은 복강경 수술을 목표로 합니다.
의미 이해 통합: 개방형 어휘 및 기초 모델 결합 SLAM
"학습 기반, AI 네이티브 SLAM"이라는 흐름을 더 자세히 살펴보면, 2026년에는 비전 기초 모델 특징을 SLAM 파이프라인에 직접 연결하는 여러 방법들이 등장했습니다. RADIO-ViPE(2026년 4월)는 응집형 비전 기반 모델에서 얻은 멀티모달 임베딩을 온라인으로 긴밀하게 결합하여, 동적 환경에서도 지도상에서 텍스트로 지정된 임의의 범주를 정확하게 찾아낼 수 있는 개방형 어휘 기반의 시맨틱 SLAM을 구현합니다. FeatureSLAM(2026년 1월)은 비전 기반 모델에 정렬된 특징들을 3D 가우시안 스플래팅 맵의 각 가우시안에 래스터화하여, 실시간 성능을 유지하면서 의미적으로 검색 가능한 지도를 구축합니다. 이러한 방향은 2025년 10월에 발표된 설문조사 "시맨틱 비주얼 SLAM: 현황, 과제 및 미래 방향에 대한 조사"에서 체계적으로 제시되었으며, 이 설문조사는 대규모 언어 모델 통합까지 범위를 확장하여 SLAM이 순수 기하학적 추정에서 의미적 이해를 포함하는 시스템으로 진화하고 있음을 보여줍니다.
센서 모달리티 확장: 4D 레이더를 하나의 옵션으로
LiDAR 및 카메라 외에도, 악천후에 대한 내성이 뛰어난 4D 레이더(거리, 방위각, 고도, 도플러 속도를 제공하는 밀리미터파 레이더)를 세 번째 센서 모달리티로 활용하는 연구가 활발히 업데이트되고 있습니다. 3D 가우시안 모델링과 다중 가설 스캔 매칭을 결합한 4D 레이더-관성 오도메트리(4D Radar-Inertial Odometry)는 카메라와 LiDAR 모두 성능 저하를 보이는 안개, 비, 먼지 환경에서 오도메트리 정확도를 향상시키는 것을 목표로 합니다. 2024년 말에 처음 발표된 이 기술은 2026년 3월에 개정되었습니다. 벤치마크 데이터셋 또한 더욱 현실적인 작동 조건을 반영하도록 발전하고 있으며, 360도 카메라와 IMU를 사용하고 평면도 정보를 통합한 Hilti-Trimble-Oxford 데이터셋(2026년 7월)이 그 예입니다.
산업 및 연구 분야의 지역별 패턴
SLAM 관련 특허 및 논문 분석 결과, LiDAR 중심의 2D 분야에서 중국이 특히 큰 비중을 차지하고 있는 것으로 나타났습니다. SLAM, ROS 기반 구현, 그래프 최적화, 그리고 멀티 로봇/엣지 컴퓨팅 연구. 드론, 서비스 로봇과 같은 실용적인 응용 분야의 수요가 연구 방향을 강력하게 이끌고 있는 것으로 보입니다.
요약: 세 가지 흐름은 상호 배타적이지 않습니다
순차 필터링과 그래프 최적화는 추정 백엔드에서 선택할 수 있는 방법입니다. 학습된 특징 추출, 3DGS/NeRF 맵 표현, 그리고 의미론적 통합은 각각 별개의 축을 형성하며, 이들과 결합될 수 있습니다. 예를 들어, newbot에 사용되는 FAST-LIO는 반복 칼만 필터를 기반으로 구축되었으며, FAST-LIO2는 별도의 특징 추출 단계 없이 원시 포인트를 맵에 직접 등록합니다. 어떤 조합을 선택할지는 사용 가능한 컴퓨팅 자원, 센서 구성, 그리고 맵이 실제로 필요한 용도에 따라 달라집니다. 이것이 현재 시점에서의 실질적인 결론입니다.
새로운 맵 표현 방식이 모든 문제를 해결할 수 있을까요?
SLAM 문제?
외관, 위치 파악, 루프 폐쇄 및 계산은 별개의 차원입니다. 기여가 개선하는 특정 구성 요소를 식별하십시오.
참고 문헌
- NeRF와 3D 가우시안 스플래팅이 SLAM을 어떻게 재편하고 있는가: 설문 조사
- Visual-SLAM에 대한 리뷰: 기하학적 모델링에서 학습 기반 의미론적 장면 이해까지의 발전 (arXiv)
- Semantic Visual SLAM: 최첨단 기술, 과제 및 미래 방향에 대한 설문 조사 (arXiv)
- RADIO-ViPE 논문 (arXiv)
- Hilti-Trimble-Oxford 데이터셋 논문 (arXiv)
- FAST-LIO2: Fast Direct LiDAR-inertial Odometry (arXiv)
- newbot의 구현은 "자체 위치 파악 및 센서 융합 작동 방식" 및 "지도 작성 및 자율 내비게이션 작동 방식"에서도 다룹니다.
댓글
먼저 로그인해 주세요.
아직 데이터가 없습니다.