Contents — find the section you need

단안 카메라는 단일 렌즈와 단일 이미지 센서로 전방 도로를 촬영한 후 이미지 처리를 통해 차선, 표지판, 신호등, 보행자 및 차량을 인식합니다. LiDAR나 레이더와 달리, 단안 카메라는 능동적으로 전파나 빛을 방출하지 않고 단순히 반사된 가시광선을 수신하기 때문에 구조가 단순하고 비용과 설치 공간 측면에서 유리한 점이 있습니다. 자율주행 차량용 ADAS(첨단 운전자 보조 시스템)에서 차선 이탈 경고, 차선 유지 보조(LKA) 및 영상 기반 어댑티브 크루즈 컨트롤(ACC)에 널리 사용되는 센서 중 하나입니다.

앞유리에 장착된 Mobileye 시스템 카메라Mobileye의 앞유리 장착 카메라(2017년 촬영)

이미지: Car Mobileye 시스템 앞유리 카메라 (Ranbar, CC BY-SA 4.0), Wikimedia Commons. 본문에서 언급된 최신 EyeQ6L 기반 카메라가 아니라 이전 모델의 예입니다.

원리: 단일 이미지에는 "절대적인 크기"가 없다

단안 카메라의 가장 큰 약점은 원칙적으로 단일 이미지만으로는 물체까지의 절대 거리(실제 크기)를 정확하게 측정할 수 없다는 것입니다. 카메라는 핀홀 카메라 모델로 근사화할 수 있습니다. 3D 공간의 점 (X, Y, Z)는 초점 거리 f를 통해 이미지 평면의 점 (x, y)에 투영됩니다. 그 식은 다음과 같습니다.

x = f \frac{X}{Z}, \qquad y = f \frac{Y}{Z}

이 식에서 알 수 있듯이, 이미지 좌표 (x, y)에서 복구할 수 있는 것은 실제 좌표 (X, Y, Z)를 깊이 Z로 정규화한 비율뿐입니다. 깊이 Z 자체는 단일 이미지만으로는 역산할 수 없습니다. 이미지에서 같은 크기로 투영되는 두 물체는 가까이 있는 작은 물체일 수도 있고 멀리 있는 큰 물체일 수도 있는데, 이 식만으로는 둘을 구분할 수 없습니다. 이는 두 렌즈 사이의 시차를 이용한 삼각측량을 통해 깊이 Z를 직접 계산할 수 있는 스테레오 카메라와는 정반대입니다.

이미지: Pinhole 카메라 모델 기하학 (KYN, CC0 1.0 공개 도메인), Wikimedia Commons.

이러한 제약을 극복하기 위해 단안 카메라 기반 시스템은 일종의 "알려진 기준"을 사용하여 거리를 추정합니다. Mobileye에서 사용하는 대표적인 기술은 역원근 매핑(IPM)을 통한 단일 시점 기하학입니다. 이 기술은 도로 표면이 평면이라고 가정하고 차선 너비와 같이 실제 크기가 알려진 물체를 기준으로 이미지상의 위치에서 실제 거리를 역산합니다(관련 특허: US8164628B2). 다른 기술로는 물체의 겉보기 크기(차량이나 보행자의 일반적인 실제 크기)를 기반으로 거리를 추정하거나, 연속 프레임의 움직임(광학 흐름)을 기반으로 거리와 속도를 추정하는 방법이 있습니다. 이러한 방법들은 모두 가정에 의존하기 때문에 도로 표면이 경사져 있거나 물체의 크기가 가정한 크기와 다를 경우 오차가 커지는 경향이 있습니다.

최근 몇 년 동안 딥러닝을 활용하여 이러한 격차를 직접적으로 해소하는 "단안 심도 추정(Monocular Depth Estimation, MDE)" 연구가 빠르게 발전해 왔습니다. 기존 방법들은 상대적인 심도(근거리-원거리 순서)만 출력할 수 있었지만, 2025년에는 실제 미터 단위의 절대 거리를 출력하는 "미터법" 단안 심도 추정에 초점을 맞춘 연구 논문(arXiv:2501.11841)이 발표되었습니다. 이는 신경망을 사용하여 단안 심도 추정의 근본적인 한계를 극복하는 것이 이제 주요 연구 과제가 되었음을 보여줍니다.

주요 제품 사양 비교

| 제품 | 해상도 | 시야각(FOV) | 참고 사항 | |---|---|---|---| | Mobileye EyeQ6L (EyeQ6 Lite) | 800만 화소 | 120도 | EyeQ4M 카메라보다 20도 더 넓은 화각. EyeQ4M보다 약 4.5배 빠른 처리 성능, 절반 정도의 칩 면적 | | Tesla HW4 카메라 | 500만 화소 | HW3(1.2MP)보다 훨씬 넓은 화각 - 정확한 수치는 공개되지 않음 | HW3의 1.2MP에서 5MP로 대폭 업그레이드됨. 후면 카메라는 더 강한 어안 효과와 더 넓은 화각을 제공 | | Continental MFC500 (MFC525/MFC526) | 최대 800만 화소 | 최대 125도 | 카메라 내부 또는 외부 ADCU(통합 제어 장치)에서 인식 처리를 실행할 수 있는 모듈식 확장형 카메라 플랫폼 | | comma.ai openpilot (comma 4) | (애프터마켓 추가 장치, 단안 카메라 + 전용 SoC) | — | 999달러짜리 애프터마켓 키트로, 양산 차량에 레벨 2 운전자 보조 시스템(ADAS)을 추가합니다. "슈퍼콤보"라는 단일 엔드투엔드 신경망이 단안 이미지에서 자율주행 차량의 미래 궤적을 직접 예측합니다. | | 소니 IMX490 이미지 센서 | 약 8.8 메가픽셀 | (센서만 해당, 렌즈 독립형) | 150dB의 넓은 동적 범위와 LED 플리커 완화 기능을 갖춘 자동차 등급 CMOS 센서로, 모빌아이, 콘티넨탈 등의 카메라 모듈에 공통적으로 사용되는 부품입니다. |

모빌아이의 EyeQ6L은 2024년에 발표된 ADAS SoC(시스템 온 칩)로, 독립형 단안 카메라보다는 "카메라 + 프로세싱 칩" 세트 형태로 제공됩니다. 8MP 해상도와 120도 광각 시야각(FOV)을 통해 차선 유지 및 자동 차선 변경 기능을 구현할 수 있으며, 현재 차선뿐만 아니라 양쪽 두 차선의 차선 중심까지 감지합니다. 테슬라 HW4는 2023년부터 출시된 하드웨어 세대로, HW3의 1.2MP에서 5MP로 해상도가 크게 향상되어 표지판과 번호판 인식 정확도가 높아졌습니다. 콘티넨탈의 MFC500은 뛰어난 유연성을 자랑하는데, 인식 처리 엔진을 카메라 본체 내부 또는 외부 장치에 탑재할 수 있으며, 트럭용 MFC526까지 제품군이 확장되었습니다. comma.ai의 openpilot은 자동차 제조사의 순정 시스템이 아닌 애프터마켓 추가 장치로, 단안 카메라 이미지에서 직접 차량의 미래 궤적을 예측하는 엔드투엔드 신경망 "Supercombo"를 사용합니다.

히브리대학교 연구실에서 모빌아이, 그리고 테슬라의 레이더 "삭제"까지

히브리대학교 연구실에서 150억 파운드 이상에 인텔에 인수되기까지 — 모빌아이는 1999년 예루살렘 히브리대학교의 컴퓨터 비전 연구원이었던 암논 샤슈아와 경영진인 지브 아비람이 공동 설립했습니다. 모빌아이 설립 전, 샤슈아는 자동차 및 항공우주 분야 광학 측정 시스템 회사인 코그니텐스와 비디오 분석 기술 회사인 코그니테크를 설립하는 데 참여했으며, 모빌아이는 이러한 경험을 바탕으로 대중 시장 차량에 저렴한 비전 시스템을 제공하는 것을 목표로 설립되었습니다. 회사의 첫 번째 칩인 EyeQ1은 초기 로드맵보다 10년 늦은 2004년에 출시되었습니다. 모빌아이는 2014년 나스닥에 상장되었으며 당시 기업 가치는 약 53억 파운드였습니다. 그리고 2017년 인텔이 153억 파운드에 모빌아이를 인수했는데, 이는 당시 이스라엘 역사상 최대 규모의 기술 기업 인수였습니다. 테슬라는 2022년 말 인텔 산하의 독립 상장 기업으로 나스닥에 재상장했으며, 이후 ADAS(첨단 운전자 보조 시스템)에서 자율 주행 및 "물리적 AI" 분야로 사업을 확장해 왔습니다.

2021년, 테슬라 비전이 레이더를 "제거"한 순간 — 2021년 5월부터 북미 지역의 모델 3와 모델 Y는 레이더 센서가 없는 구성으로 전환되면서 카메라와 신경망 처리 기술에만 의존하는 "테슬라 비전"으로의 전환이 시작되었습니다. 당시 테슬라의 AI 책임자였던 안드레이 카르파티는 그해 6월, 주요 컴퓨터 비전 컨퍼런스인 CVPR 2021의 자율 주행 워크숍에서 기조연설을 통해 "우리는 레이더를 제거하고 이 차량들에서 오직 비전 기술만으로 주행하고 있습니다."라고 명확히 밝혔으며, 테슬라의 딥러닝 비전 시스템이 기존의 레이더보다 약 100배 뛰어난 수준에 도달했다고 설명했습니다. 그는 또한 "차량을 둘러싼 8개의 카메라에서 촬영한 영상을 기반으로 차량 내에서 일어나는 모든 일이 처음으로 발생한다"고 말하며, 시각 정보만을 사용하는 방식의 기술적 어려움을 인정하면서도, 일단 성공하면 지구 어디에서든 적용 가능한 범용 시각 시스템이 될 수 있다고 주장했습니다. 이후 유럽과 중동 지역의 모델 3/Y에도 레이더를 사용하지 않는 테슬라 비전이 적용되었는데, 이는 자동차 제조업체가 센서 융합 방식 대신 단안 카메라(및 다중 카메라) 기반 방식을 의도적으로 선택한 획기적인 사례입니다.

애프터마켓 단안 운전자 보조 시스템: comma.ai - 어떤 자동차 제조업체의 순정 ADAS와도 별개로, 아이폰 탈옥으로 유명한 조지 호츠가 설립한 comma.ai는 999달러짜리 애프터마켓 장치(comma 3X/4)를 앞유리에 장착하여 지원 차량에 레벨 2 차선 유지 보조 및 어댑티브 크루즈 컨트롤 기능을 추가하는 openpilot을 판매합니다. 기존의 모듈식 인식 파이프라인 대신, 이 시스템은 "슈퍼콤보(Supercombo)"라는 엔드투엔드 신경망을 사용하여 단안 카메라 영상에서 차량의 미래 궤적과 도로 구조를 직접 예측합니다. 오픈 소스이기 때문에 DIY 및 연구 커뮤니티에서 널리 사용되고 있습니다.

성능을 결정하는 요소

  • 해상도(픽셀 수): 멀리 있는 표지판, 신호등, 작은 장애물의 인식 정확도를 직접적으로 결정합니다. 테슬라 HW4는 HW3 대비 해상도가 약 4배 향상되었는데, 이는 주로 멀리 있는 작은 목표물의 가시성을 개선하기 위한 것입니다. 자동차용 단안 카메라의 해상도는 매년 꾸준히 상승하고 있으며, 콘티넨탈의 MFC500과 소니의 IMX490은 모두 800만 화소급에 도달했습니다.
  • 시야각(FOV): 시야각이 넓을수록 단일 카메라로 더 넓은 주변 환경을 포착할 수 있습니다. 예를 들어, 횡단보도를 건너는 보행자나 교차로에서 합류하는 차량을 감지할 수 있습니다. 모빌아이의 EyeQ6L은 EyeQ4M보다 20도 넓은 120도 시야각을 확보하여 바로 이러한 목적을 달성합니다. 콘티넨탈의 MFC500은 125도까지 시야각을 넓혀 교차로에서 측면에서 오는 차량까지 감지하는 데 초점을 맞춥니다.
  • 다이내믹 레인지: 터널 입구/출구, 헤드라이트 불빛, 야간 역광 등 극심한 명암 대비가 있는 장면에서 밝은 부분이 과다 노출되거나 어두운 부분이 뭉개지지 않고 인식이 유지되는지 여부를 결정합니다. 소니 IMX490의 150dB 다이내믹 레인지와 LED 플리커 완화 기능(LED 신호등의 깜빡임을 억제)은 이러한 문제를 직접적으로 해결합니다.
  • 거리 추정 전제 조건: 단안 카메라는 평평한 도로 표면, 알려진 차선 너비, 표준 물체 크기 등의 가정을 기반으로 거리를 추정하기 때문에 울퉁불퉁한 도로, 경사로 또는 크기가 특이한 장애물에서는 오차가 커지는 경향이 있습니다. 고정밀 거리 측정이 필요한 애플리케이션은 일반적으로 스테레오 카메라, LiDAR 또는 레이더와의 조합을 전제로 하지만, 테슬라 비전과 같은 접근 방식은 신경망 학습 규모를 통해 이러한 제약을 뛰어넘으려 합니다.
  • 비용 및 장착 공간: 단 하나의 렌즈와 센서만 필요하기 때문에 단안 카메라는 스테레오 카메라나 심도 카메라보다 크기가 작고 제작 비용이 저렴합니다. 이는 여러 센서가 공간을 놓고 경쟁하는 차량의 좁은 앞유리 상단 레이아웃에서 큰 장점입니다. comma.ai의 999달러라는 가격표는 이러한 저비용 이점을 잘 보여줍니다.
  • 처리 성능(SoC 측면): 단안 카메라의 실제 유용성은 캡처된 이미지 처리의 정교함에 크게 좌우됩니다. EyeQ6L의 EyeQ4M 대비 4.5배 향상된 연산 성능은 인식 정확도와 지원 특징 개수를 늘리기 위한 것입니다.

수치 예제를 통한 단안 거리 확인

도로를 평면으로 근사하고 카메라 높이를 H, 초점 거리를 f, 수평선에서 물체 접점까지의 픽셀 오프셋을 y로 가정하면, 단순화된 역원근 관계식은 다음과 같습니다.

Z=\frac{fH}{y}

H=1.4\,\mathrm{m}, f=1200\,\mathrm{px}, y=84\,\mathrm{px}의 경우, 이 관계식은 Z\simeq20\,\mathrm{m}을 제공합니다. 동일한 가정 하에서, 접점의 2픽셀 오차는 미분 근사법 \sigma_Z\simeq fH\sigma_y/y^2을 사용했을 때 약 0.48\,\mathrm{m}의 거리 오차를 발생시킵니다. 도로 경사, 카메라 자세, 차선 높이, 그리고 모호한 접촉점은 오차를 더욱 증가시킵니다.

이 계산은 신경망 기반 단안 심도 추정의 타당성을 부정하는 것이 아닙니다. 학습된 결과를 도로 기하학, 알려진 물체 크기, 스테레오 또는 레이더와 비교하여 검증하는 기준을 제공합니다. 평균 오차 하나만 보고하는 대신, 거리 대역, 역광, 경사, 강우, 야간, 그리고 물체 높이별로 테스트 결과를 보고하십시오.

Diagram 1 · Use the button to switch views
평지 도로에서 단안식 거리 측정 시 10, 20, 30미터 거리에서 2픽셀 접점 오차가 어떻게 증가하는지 보여주는 다이어그램
Diagram 2 · Use the button to switch views
Z=fH/y: pixel offset shrinks with rangerange Zpixel offset from horizon ythe same 2px causes more range error
다이어그램: Duskcoil.
측정된 것이 아니라 개념적인 것입니다. 픽셀 오프셋과 거리 사이의 반비례 관계를 보여줍니다.
이해력 점검
이미지 하나로 객체의 거리를 결정할 수 있습니까?

추가적인 가정이 없으면 스케일이 모호합니다.

추정치가 알려진 크기, 여러 시점 또는 학습된 사전 정보를 사용하는지 여부를 식별합니다.

참고 자료

What to read next

Review the backgroundLiDAR 작동 원리 및 주요 제품 — Livox, Velodyne, HesaiContinue the series스테레오 카메라 작동 방식 및 주요 제품 — ZED 2i, Subaru EyeSightExplore another aspect of this field정지형 IMU 로그 판독: 편향, 산포 및 알란 편차