Contents — find the section you need

Visual-SLAM은 카메라 영상(또는 카메라와 IMU 조합)만을 이용하여 자체 위치 추정 및 지도 작성을 수행하는 기술군입니다. LiDAR와 같은 고가의 거리 측정 센서가 필요하지 않지만, 조명 변화와 질감이 부족한 장면에 민감하다는 단점이 있습니다. 이러한 단점을 극복하기 위한 노력이 바로 이 기술 발전의 핵심입니다.

OpenCVOpenCV

이미지: OpenCV 로고, Wikimedia Commons (Apache 2.0)

Visual-SLAM 개요

Diagram 1 · Use the button to switch views
Visual-SLAM은 키포인트 또는 밀집 상관 관계를 사용하여 프레임 간의 대응점을 찾고, 자세와 깊이를 추정하며, 번들 조정을 통해 궤적과 지도를 동시에 일치시킵니다.

다이어그램: Duskcoil. 기존 방식과 학습 기반 방식이 공유하는 기하학적 관계를 보여줍니다.

Visual-SLAM의 핵심 문제는 프레임 간에 동일한 위치를 연결하고, 이러한 연결을 일관되게 만드는 카메라 움직임과 3D 구조를 동시에 복원하는 것입니다. 고전적인 방법은 희소한 특징점을 명시적으로 매칭하는 반면, 학습 기반 방법은 밀집된 특징점이나 학습된 사전 정보를 통해 대응점을 추론합니다. 두 방법 모두 관측값-자세-구조의 일관성이라는 제약을 받습니다. 맵이 희소한 포인트 클라우드인지, 밀집된 깊이 정보인지, 아니면 신경망 표현인지 여부 또한 중요한 실질적인 선택 사항입니다.

특징점 기반 엔드포인트: ORB-SLAM3

고전적인 비주얼 SLAM의 한 엔드포인트는 ORB-SLAM3입니다. ORB-SLAM3는 단안, 스테레오 또는 RGB-D 설정에서 비주얼, 비주얼-관성 또는 멀티맵 SLAM을 실시간으로 실행할 수 있으며, ORB라는 특징 디스크립터를 사용하여 이미지 간의 대응점을 찾은 다음 번들 조정을 통해 자세와 맵 포인트를 최적화합니다. 번들 조정은 카메라 자세 (\mathbf{R}_j, \mathbf{t}_j)에서 이미지에 투영된 3D 맵 포인트 \mathbf{X}_i의 위치와 이미지에서 실제로 관측된 해당 특징점 \mathbf{u}_{ij}의 위치 사이의 불일치(재투영 오차)의 합을 최소화합니다.

\min_{\{\mathbf{R}_j, \mathbf{t}_j\}, \{\mathbf{X}_i\}} \sum_{i,j} \left\| \pi\left( \mathbf{R}_j \mathbf{X}_i + \mathbf{t}_j \right) - \mathbf{u}_{ij} \right\|^2

여기서 \pi(\cdot)은 카메라의 내부 매개변수를 기반으로 3D 점에서 이미지 평면으로의 투영 함수입니다. 카메라 포즈와 지도 포인트 모두에 대해 이 표현식을 공동으로 최적화하는 것이 번들 조정의 핵심이며, 앞서 다룬 그래프 최적화와 동일한 비선형 최소 제곱 프레임워크 내에서 해결됩니다(자세한 내용은 "SLAM 기술 동향" 참조). 출시된 지 수년이 지났지만, 여전히 연구 논문에서 비교 기준선, 즉 사실상의 표준 참조 구현으로 인용되고 있습니다.

딥러닝을 통한 엔드투엔드: DROID-SLAM

특징 추출 및 매칭의 명시적인 프로세스를 딥러닝으로 완전히 대체하는 추세도 뚜렷하게 나타나고 있습니다. DROID-SLAM은 이러한 추세의 대표적인 예로, 반복적인 업데이트와 조밀한 번들 조정 레이어를 통해 카메라 포즈와 픽셀 단위 깊이를 추정합니다. 단안 영상만으로 학습되었지만, 테스트 시에는 스테레오 또는 RGB-D 영상까지 활용하여 정확도를 높일 수 있을 만큼 유연합니다. 다만, 기존 방식보다 연산량이 훨씬 많아 추론에만 11GB 이상의 GPU 메모리가 필요합니다.

DROID-SLAM 내부: 상관 볼륨 및 미분 가능한 번들 조정

DROID-SLAM이 명시적인 특징 추출 과정 없이 자세와 깊이를 추정하는 방식을 좀 더 자세히 살펴보겠습니다. 먼저, 두 개의 CNN(하나는 특징 추출용, 다른 하나는 문맥 정보 처리용)을 사용하여 입력 해상도의 1/8에 해당하는 조밀한 특징 맵을 계산합니다. 각 프레임 쌍에 대해 모든 특징 벡터 쌍의 내적을 계산하여 "4D 상관 볼륨"을 구축하고, 이를 기반으로 픽셀 단위 대응 관계를 추정합니다.

추정 자체는 반복적인 업데이트 연산자를 통해 처리됩니다. 상관 볼륨에서 추출한 특징과 이전 반복에서 얻은 잔차(보정값)는 컨볼루션 레이어를 거쳐 ConvGRU(컨볼루션 게이트 순환 유닛)로 들어가고, ConvGRU는 흐름(겉보기 움직임)에 대한 보정값을 출력합니다. 네트워크가 어떤 정보를 통합하고 어떤 정보를 버릴지 선택적으로 제어할 수 있게 하는 게이팅 메커니즘이 바로 이 네트워크가 학습한 핵심 부분입니다.

이 반복 업데이트의 출력은 미분 가능한 Dense Bundle Adjustment(DBA) 레이어로 전달되어 카메라 포즈와 픽셀 단위의 역깊이를 동시에 업데이트합니다. 이처럼 기하학적 제약 조건을 네트워크에 명시적으로 포함시키면 단안 카메라로 학습된 모델이라도 재학습 없이 스테레오 또는 RGB-D 입력을 처리할 수 있는 유연성을 갖게 됩니다.

지도 표현 방식의 혁신: 3D 가우시안 스플래팅 및 NeRF

현재 가장 빠르게 발전하고 있는 분야는 지도 표현 형식 자체의 혁신입니다. 신경 방사 필드(NeRF)와 3D 가우시안 스플래팅(3DGS)은 단순한 포인트 클라우드가 아닌, 사실적인 3D 장면을 간결한 파라미터 집합으로 표현할 수 있습니다. 이러한 특성 덕분에 SLAM의 매핑 정확도, 렌더링 품질, 그리고 계산 효율성이 동시에 향상되고 있습니다.

2026년에도 주요 학회와 학술지에는 3DGS/NeRF 기반의 새로운 방법들이 꾸준히 발표되고 있습니다. 대표적인 방법으로는 RGB 비디오 데이터만을 사용하여 전역 최적화를 수행하는 Splat-SLAM, LiDAR, IMU, 그리고 카메라 데이터를 융합하는 Gaussian-LIC/Gaussian-LIC2, 지하 광산과 같은 열악한 환경에 최적화된 GTS-SLAM, 시맨틱 SLAM을 지향하는 MTE-SLAM(ICRA 2026), 그리고 사실적인 매핑과 효율적인 추적을 균형 있게 구현하는 PMET-SLAM 등이 있습니다. 기존 방식과 비교했을 때, 렌더링 품질과 맵 재사용성(사후 임의의 시점에서 환경을 다시 렌더링할 수 있는 능력)이 뚜렷한 강점으로 꼽힙니다.

2025-2026년 전망: 피드포워드 3D 기반 모델 기반 SLAM

DROID-SLAM의 설계(반복적 추정 및 미분 가능한 번들 조정)를 한 단계 더 발전시킨 MASt3R-SLAM(2024년 말 발표된 CVPR 2025 하이라이트 논문)은 두 시점 3D 재구성 및 대응 관계 학습을 통해 사전 학습된 기반 모델인 MASt3R의 출력을 "사전 지식"으로 활용합니다. 카메라 내부 매개변수를 알 수 없는 경우에도 단일 프레임워크 내에서 포인트맵 매칭, 카메라 추적, 로컬 맵 융합 및 루프 클로저 감지를 처리하며, 알려진 카메라 모델에서는 초당 15프레임으로 실행되고 여러 벤치마크에서 최첨단 정확도를 달성하는 것으로 알려져 있습니다.

이러한 기반 모델 계열은 2025년 VGGT(Visual Geometry Grounded Transformer)의 등장으로 더욱 탄력을 받았습니다. VGGT는 다중 시점 이미지에서 카메라 포즈, 깊이, 포인트 클라우드를 단일 순방향 패스로 동시에 출력하는 피드포워드 3D 기반 모델입니다. VGGT의 출력을 기반으로 한 파생 연구들이 2026년까지 이어졌습니다. VGGT-SLAM++(2026년 4월)는 VGGT의 트랜스포머 출력을 빈번한 지역 최적화(공시성 그래프 및 시각적 위치 인식을 통해)와 결합하여 궤적을 안정화함으로써 완전한 SLAM 시스템으로 구현했습니다. VGGT-Align(2026년 8월)은 각 청크의 포인트 클라우드에서 추출한 주요 기하학적 불변량을 사용하여 크기를 제한함으로써 긴 시퀀스에서 발생하는 청크 간 크기 편차 문제를 해결합니다. Co-VGGT(2026년 7월)와 같은 분석 연구도 등장했는데, 이 연구는 VGGT가 명시적인 감독 신호 없이도 시점 간 동일 영역 공유(covisibility)를 암묵적으로 인코딩한다는 것을 보여주었습니다. 이는 이러한 기초 모델들의 내부 표현이 실제로 무엇을 포착하는지 이해하려는 적극적인 노력의 일환입니다.

벤치마크 결과: 정확도는 높아졌지만 만능 해결책은 아니다

2026년 하반기에는 기초 모델 기반 SLAM의 실제 성능을 정량화한 여러 연구가 발표되었습니다. DJI 드론의 고고도 나디르 영상에 대해 5개의 단안 SLAM 시스템을 비교 평가한 결과, MASt3R-SLAM이 경로 길이의 0.53%로 가장 낮은 평균 수평 절대 오차를 달성했지만, 수직(고도) 정확도는 여전히 해결해야 할 과제로 남아 있습니다. 합성 데이터와 실제 데이터 손상 환경 모두에서 단안 SLAM을 평가한 별도의 연구(2026년 8월)에 따르면, 기존의 특징 기반 방식은 데이터 손상 환경에서 "치명적인 추적 실패"를 보이는 경향이 있는 반면, 학습 기반 추적 방식은 이러한 치명적인 실패를 "지속적이고 때로는 심각한 드리프트"로 대체하는 것으로 나타났습니다. 즉, 학습 기반 방식은 눈에 띄게 드러나는 실패 모드를, 눈에 띄지 않게 오류가 누적되는 조용한 모드로 대체하는 것일 수 있습니다. 이는 정확도 지표만으로는 어떤 접근 방식이 실제로 더 나은지 판단할 수 없다는 점을 시사합니다.

단안 영상만으로는 절대 거리 스케일을 복원할 수 없는 고전적인 약점인 스케일 모호성 문제에 대해서도 새로운 접근 방식이 등장하고 있습니다. 확률적 요인 그래프에 학습된 깊이 예측을 통합한 Scalix(2026년 8월)는 절대 스케일 및 상대 스케일 벤치마크 모두에서 최첨단 성능을 보고했습니다.

실용적인 선택 기준

현재 실용적인 선택 기준은 다음과 같습니다.

  • 자원 제약이 있고 검증된 실적이 있는 경우: ORB-SLAM3 계열의 특징점 기반 방식 — 임베디드 하드웨어에서도 풍부한 실제 실적 보유
  • 정확도 우선, 충분한 GPU 자원이 있는 경우: DROID-SLAM 계열의 엔드투엔드 딥러닝 방식
  • 낯선 환경에 대한 일반화, 보정 불필요: MASt3R-SLAM/VGGT 계열의 피드포워드 3D 파운데이션 모델 방식 — 수직 정확도 및 장시간 작동 시 드리프트와 같은 해결해야 할 과제가 남아 있음
  • 실사적인 지도 재사용 필요: 3DGS/NeRF 기반 방식 — 하지만 많은 방식이 아직 연구 단계에 있으며 실제 배포는 개발 중

이러한 방식들이 서로를 완전히 대체하는 것은 아니며, 현재로서는 사용 사례별로 구분되어 자리 잡고 있는 추세입니다.

이해한 내용을 점검해 보세요
좋은 새로운 시점 렌더링은 정확한 카메라 포즈를 설정합니까?

렌더링 품질을 기하학적 정확도 및 궤적 정확도와 별도로 측정합니다.

시각적 품질만으로는 위치 추정 방법의 순위를 매길 수 없습니다.

참고 자료

What to read next

Review the backgroundLiDAR-SLAM 기술 동향Continue the series내비게이션 기술 동향Explore another aspect of this field휴머노이드 로봇 기술 동향