Contents — find the section you need

이벤트 카메라(Dynamic Vision Sensor, DVS)는 기존의 프레임 기반 카메라와는 근본적으로 다른 방식으로 빛을 포착하는 센서입니다. 기존 카메라는 고정된 간격으로 전체 장면을 촬영하지만, 이벤트 카메라의 경우 각 픽셀이 다른 픽셀과 독립적으로 비동기적으로 작동하여 자체 밝기가 설정된 값 이상 변하는 순간만을 마이크로초 단위의 시간 해상도로 보고합니다.

원리: 각 픽셀은 독립적으로 "변화"만 보고

기존의 CMOS/CCD 이미지 센서는 각 노출 간격마다 모든 픽셀의 값을 동시에 읽어 절대 밝기 값을 격자 형태의 프레임으로 출력합니다. 반면, 이벤트 카메라의 픽셀은 마지막으로 값을 보고했을 때의 로그 밝기 값을 기준값으로 저장하고, 현재 로그 밝기 값이 기준값에서 임계값(C) 이상 변하는 순간 해당 픽셀에서만 "이벤트"가 발생합니다. 픽셀 (x, y)이 시간 t에 발광한다는 이벤트가 생성됩니다.

\left| \ln I(x, y, t) - \ln I(x, y, t_{\text{last}}) \right| \geq C

이 조건이 충족되는 순간, 출력은 좌표, 타임스탬프, 극성을 나타내는 4개의 튜플로 구성된 비동기 시퀀스 e_k = (x_k, y_k, t_k, p_k)가 됩니다. 매번 좌표와 타임스탬프만 출력하는 이 방식을 AER(Address-Event Representation)이라고 하며, 밝기 증가(ON)와 밝기 감소(OFF)를 극성 p_k로 구분합니다. 프레임 개념이 없기 때문에 장면에 움직임이 없으면 아무것도 출력되지 않고, 움직임이 빠를수록 더 짧은 간격으로 더 많은 이벤트가 발생합니다.

이 방식의 두 가지 핵심 속성은 모두 로그 응답 회로 설계에서 직접적으로 비롯됩니다. 첫째, 시간 해상도입니다. 각 픽셀이 임계값 결정을 독립적으로 내리기 때문에 원칙적으로 마이크로초 단위의 변화를 감지할 수 있습니다. 2008년에 발표된 초기 DVS 칩(아래에서 설명)조차도 15마이크로초의 지연 시간을 달성했습니다. 프레임 속도 개념에 얽매이지 않기 때문에 프레임 기반 카메라에서 피할 수 없는 모션 블러가 원칙적으로 발생하지 않습니다. 둘째, 동적 범위입니다. 각 픽셀이 로그 스케일에서 임계값 결정을 독립적으로 내리기 때문에 기존 센서의 최대 감도가 60~70dB(포토다이오드가 축적할 수 있는 전하의 상한)인 반면, 이벤트 센서는 100dB를 초과하고 일부 제품에서는 140dB에 도달합니다. 따라서 햇빛이 비치는 도로 표면과 그늘진 터널 입구가 같은 장면에 동시에 존재하는 등 빛과 어둠의 차이가 극명한 장면에서도 밝은 부분이 과다 노출되거나 어두운 부분이 뭉개지지 않고 변화를 지속적으로 포착할 수 있습니다.

구현 방식은 크게 두 가지 유형으로 나뉩니다. DVS에는 변화 감지만 수행하는 "순수 DVS" 방식(DVS128, iniVation DVXplorer, Prophesee GenX320 등)과, 변화가 감지된 픽셀에 대해서만 실제 밝기 값(회색조)을 측정하는 회로를 기존 변화 감지 회로에 추가하는 하이브리드 방식(iniVation DAVIS346 및 ATIS(아래에서 설명) 등)이 있습니다. 후자는 비동기 이벤트 출력과 (낮은 프레임 속도에서는) 기존 회색조 이미지를 동시에 생성할 수 있어 이벤트 방식의 장점을 활용하면서 기존 이미지 처리 파이프라인과의 호환성을 유지합니다. 하지만 변화가 없는 픽셀에서는 밝기 값을 얻을 수 없다는 제약 조건도 그대로 적용됩니다.

위는 기존 프레임 기반 카메라로 촬영한 달리는 치타 영상이고, 아래는 동일 장면을 이벤트 카메라로 촬영한 이벤트 포인트 클라우드 비교 이미지동일 장면에서 프레임 기반 카메라(위)와 이벤트 카메라(아래)가 출력한 데이터의 차이

이미지: Event 카메라 비교 (TimoStoffregen, CC BY-SA 4.0), Wikimedia Commons.

위 비교 이미지에서 볼 수 있듯이, 프레임 기반 카메라는 고정된 간격으로 "장면 전체의 사진"을 출력하는 반면, 이벤트 카메라는 움직이는 윤곽선을 따라 흩어져 있는 드문드문한 이벤트 클러스터만 출력합니다. 정지된 배경은 어떠한 데이터도 생성하지 않기 때문에, 센서가 장면의 중복성을 처음부터 제거한 데이터를 전달하는 것으로도 설명할 수 있습니다. Prophesee는 자체 이벤트 기반 산업용 비전 기술을 통해 음료수 상자 생산 라인이나 레이저 용접 로봇의 시각 검사와 같은 응용 분야에서 초당 10미터 이상의 속도로 움직이는 물체를 초당 1,000개 이상의 속도로 측정할 수 있으며, 기존 프레임 기반 방식에 비해 처리해야 할 데이터 양을 약 100분의 1로 줄일 수 있다고 밝혔습니다. 이는 센서가 애초에 "변경되지 않은 픽셀"에 대한 데이터를 생성하지 않기 때문입니다.

주요 제품 사양 비교

제품 해상도 동적 범위 지연 시간/시간 해상도 참고 사항
iniVation DVXplorer 640×480 (VGA) 최대 110dB 1밀리초 미만의 지연 시간, 200µs 시간 해상도 최대 1억 6,500만 이벤트/초 처리량, 내장 6축 IMU(최대 3.2kHz 자이로스코프), 5V에서 140mA 미만 소비 전력
iniVation DAVIS346 346×260(이벤트), 동일 해상도의 프레임 출력 이벤트 출력 120dB, 프레임 출력 55dB 이벤트 1µs 시간 해상도 및 1ms 미만 지연 시간, 프레임 40fps 변화 감지 및 그레이스케일 프레임을 동시에 출력하는 하이브리드 설계. 최대 1,200만 이벤트/초, 18.5µm 픽셀 피치
Sony IMX636 (Prophesee Metavision) 1280×720(0.92 메가픽셀) 5~100,000lux에서 86dB 이상, 0.08~100,000lux 저조도 차단 시 120dB 이상 고속, 저지연 응답 (수치는 적용 분야에 따라 다름) 소니와 프로페시가 공동 개발한 적층형 센서, 4.86µm 픽셀 피치, 완전 디지털 16라인 병렬 출력
프로페시 GenX320 320×320 140dB 이상 1000lux에서 픽셀 지연 시간 150µs 미만 초저전력 모드에서 36µW까지 감소 가능, 6.3×6.3µm 픽셀, 초소형 3×4mm 패키지, 내장 플리커 억제 및 이벤트 속도 제어
삼성 DVS-Gen4 1280×960 100dB 150µs 4.95µm 픽셀 피치를 갖춘 이 카메라는 픽셀 내 Cu-Cu 접합 및 GIDL 억제 회로를 통해 고해상도와 저전력 소비를 동시에 구현합니다.
삼각대에 장착된 Prophesee 이벤트 카메라 평가 키트, 렌즈와 microSD 카드 슬롯이 보임Prophesee 이벤트 카메라 평가 키트

이미지: Prophesee 이벤트 카메라 평가 키트 (Auledas, CC BY 4.0), Wikimedia Commons.

iniVation DVXplorer는 VGA 해상도에 해당하는 640×480 해상도와 내장 6축 IMU를 갖춘 순수 DVS 카메라로, 로봇 연구에 널리 사용됩니다. DAVIS346은 단일 칩에 변화 감지 회로와 그레이스케일 프레임 출력을 모두 내장한 하이브리드 설계입니다. 이벤트 출력 자체는 120dB의 동적 범위를 갖지만, 동시에 출력할 수 있는 프레임 수는 55dB 및 40fps로 제한됩니다. 이 제품은 순수 DVS의 장점과 프레임 기반 처리와의 호환성 사이에 상충 관계가 있음을 명확히 보여줍니다. 소니 IMX636은 소니의 적층형 센서 제조 기술과 프로페시(아래에서 설명)의 이벤트 감지 노하우를 결합한 제품으로, 1280×720 해상도로 이벤트 카메라 중 고해상도에 속합니다. 또한 산업용 카메라 제조업체인 IDS Imaging Development Systems가 2025년에 발표한 "uEye EVS" 시리즈에도 채택되었습니다. GenX320은 320×320 해상도로 다소 낮지만, 소비 전력을 36µW까지 줄일 수 있는 초저전력 모드를 제공하여 상시 작동 웨어러블 기기 및 IoT용 엣지 센싱에 적합한 설계입니다. 삼성 DVS-Gen4는 1280×960의 가장 높은 화소 수를 자랑하며, 화소 내 구리-구리 접합(구리와 구리를 직접 접합하는 적층 기술)과 GIDL(게이트 유도 드레인 누설)을 억제하는 회로 설계를 통해 고해상도에서 발생하는 누설 전류 증가를 최소화합니다.

전자 눈의 기원: 실리콘 망막에서 이벤트 카메라 산업까지

1988년, 캘리포니아 공과대학의 실리콘 망막 — 이벤트 카메라의 직접적인 기원은 집적 회로의 아버지 중 한 명으로 알려진 카버 미드와 당시 대학원생이었던 미샤 마호왈드가 1988년에 발표한 논문 "초기 시각 처리의 실리콘 모델(A Silicon Model of Early Visual Processing)"로 거슬러 올라갑니다. 두 사람은 실제로 아날로그 CMOS 회로를 사용하여 망막의 초기 시각 처리 과정을 모방한 "실리콘 망막"을 제작했고, 이를 통해 뇌의 정보 처리 과정을 하드웨어로 재현하려는 시도인 "뉴로모픽 엔지니어링"이라는 분야를 개척했습니다. 미드는 이 업적으로 캘텍에서 뉴로모픽 엔지니어링 평생 공로상을 수상했습니다.

2008년, 취리히 연방 공과대학교(ETH Zurich)에서 개발된 완전 비동기식 DVS — 패트릭 리히슈타이너, 크리스토프 포쉬, 토비 델브뤼크는 IEEE Journal of Solid-State Circuits에 "A 128×128 120 dB 15 μs Latency Asynchronous Temporal Contrast Vision Sensor"라는 논문을 발표했습니다. 이 논문은 128×128 픽셀, 120dB의 동적 범위, 15마이크로초의 지연 시간을 갖는 완전 비동기식 센서를 시연했으며, 이는 현재 "DVS"라고 불리는 기술의 프로토타입입니다. 이 논문은 해당 저널에서 지난 10년간 인용 횟수 4위를 기록할 정도로 널리 인용되었으며, 이후 이벤트 카메라 연구의 사실상 출발점이 되었습니다.

2011년, ATIS(비동기 시간 기반 이미지 센서) - 변화 감지와 밝기 측정의 결합 — 크리스토프 포쉬는 오스트리아 공과대학(AIT)으로 자리를 옮겨 ATIS를 발표했습니다. ATIS는 변화 감지 회로와 변화가 감지된 픽셀에 대해서만 시간 경과에 따른 실제 밝기(회색조 값) 측정 회로를 결합한 센서입니다. ATIS는 143dB 이상의 동적 범위를 달성했으며, "변화뿐 아니라 이미지까지"라는 실제 응용 분야의 요구에 부응하는 설계로서 이후 DAVIS 및 기타 하이브리드형 제품의 기술적 기반이 되었습니다.

2014년, 크로노캠 설립 및 ETH/취리히 대학교 스핀오프 기업 두 곳 설립 — 2014년, 포쉬는 파리의 스타트업 스튜디오 iBionext에서 랴드 베노스만, 베르나르 질리, 루카 베레와 함께 크로노캠을 설립하고 AIT에서 개발한 ATIS 기술을 상용화하기 시작했습니다. 크로노캠은 2018년 1,900만 달러 규모의 시리즈 B 투자 유치와 함께 회사명을 프로페시(Prophesee)로 변경했습니다. 한편, DVS128을 개발한 취리히 대학교/취리히 연방 공과대학교 신경정보학 연구소(INI) 출신의 토비 델브뤼크, 로드니 더글러스, 키넌 엥, 스벤-에릭 야콥센 네 명은 2015년에 iniVation을 설립했고, 다른 팀은 2017년에 SynSense를 설립했습니다. 같은 연구소에서 기술을 가져온 이 두 회사는 2024년 SynSense가 iniVation의 모든 지분을 인수하면서 다시 합병되었습니다. 중국에서는 상하이에 본사를 둔 CelePixel이 2017년 천수순 외 여러 명에 의해 설립되었고, 2019년 OmniVision의 모회사인 Will Semiconductor에 인수되었습니다. 그리고 2020년, 소니는 적층형 이미지 센서 제조 기술을, Prophesee는 이벤트 감지 노하우를 결합하여 IMX636을 제품화했습니다. 신경과학 연구실에서 개발된 틈새 기술이 10여 년 만에 소니와 같은 주요 이미지 센서 제조업체와 협력하는 단계에 이르기까지, 이것이 바로 이 센서의 현재까지의 이야기입니다.

실제 사례: 취리히를 누빈 스테레오 이벤트 카메라 시스템 "DSEC"

이벤트 카메라는 아직 자동차 제조업체의 양산 라인에 탑재되는 센서는 아니지만, 연구 개발 단계에서 그 이전 단계에 있는 여러 대의 카메라가 존재합니다. 취리히 연방 공과대학교(ETH Zurich)/취리히 대학교 로봇공학 및 인지 그룹에서 2021년에 공개한 DSEC(A Stereo Event Camera Dataset for Driving Scenarios) 데이터셋은 차량에 좌우 60cm 간격으로 장착된 두 대의 Prophesee Gen3.1 이벤트 카메라(640×480)로 구성된 스테레오 리그와 두 대의 FLIR Blackfly S 컬러 프레임 카메라, LiDAR, RTK-GPS를 동기화하여 취리히, 툰, 인터라켄 등 여러 스위스 도시를 주행하며 1시간 이상 주행 데이터를 수집한 것입니다. 이 시스템은 특히 일반 카메라가 노출 제어의 한계에 부딪히는 고해상도 장면(예: 터널 입구 및 출구, 일몰 및 일출 시 강한 역광)을 목표로 설계되었다는 점에서 주목할 만합니다. 또한 단안 카메라 시스템과 마찬가지로 스테레오 모드에서도 넓은 베이스라인을 사용하여 먼 거리까지 시차 정확도를 확보하는 동시에, 프레임 카메라가 하이라이트를 과다 노출시키거나 블랙 영역을 과소 노출시키는 상황에서도 이벤트 카메라가 변화를 지속적으로 포착할 수 있는지 검증하도록 설계되었습니다. DSEC는 일반 카메라가 어려움을 겪는 저조도 환경에서 Visual-SLAM과 같은 자체 위치 추정 알고리즘을 얼마나 안정적으로 실행할 수 있는지에 대한 연구의 기반이 되었으며, 오늘날까지도 계속해서 참조되고 있습니다.

노이즈만 가득한 영상에서 얼굴을 인식하는 연구 및 UAV에 탑재된 SLAM 기술

카자흐스탄의 이벤트 스트림 기반 얼굴 검출 데이터셋 — 나자르바예프 대학교 ISSAI(스마트 시스템 및 인공지능 연구소)는 Bissarinova, Rakhimzhanova, Kenzhebalin, Varol이 공동 저술한 "이벤트 스트림의 얼굴(Faces in Event Streams, FES): 이벤트 카메라용 주석이 달린 얼굴 데이터셋"을 2024년 Sensors 저널(24권 5호, 논문 번호 1409)에 발표했습니다. 이 데이터셋은 689분 분량의 이벤트 스트림에서 160만 개의 얼굴과 5점 얼굴 특징점을 주석 처리한 최초의 대규모 데이터셋이며, 함께 개발된 12개의 모델은 mAP50에서 90% 이상의 정확도로 얼굴과 얼굴 특징점을 검출하는 것으로 알려져 있습니다. 아래 이미지는 GitHub 저장소의 표지 이미지로, 단순한 노이즈처럼 보이는 영상에서 여러 사람의 얼굴과 윤곽선이 일련의 사건들을 통해 나타나는 모습을 보여줍니다. 이벤트 카메라의 핵심 원리, 즉 움직이지 않는 것은 절대 기록되지 않는다는 점은 사진적 질감이 없는 "윤곽선과 움직임만" 담긴 영상을 만들어냅니다. 이러한 특성 덕분에 개인 정보 보호에 민감한 감시 및 모니터링 분야에서 활용 가능성이 제기되고 있습니다.

이벤트 카메라로 포착된 네 개의 얼굴. 얼굴 윤곽선, 경계 상자 및 랜드마크가 점선 노이즈에서 나타납니다이벤트 스트림에서 나타나는 얼굴과 감지 상자(FES 데이터셋 표지 이미지)

이미지: Faces in Event Streams (Ulzhanbis, CC BY 4.0), Wikimedia Commons. ISSAI(나자르바예프 대학교)의 FES 데이터셋 논문(Bissarinova et al., Sensors 2024, 24(5):1409)의 GitHub 표지 이미지.

UAV에 탑재된 스테레오 이벤트 SLAM 및 "던져진 물체" 회피 실험 — 로봇 공학은 이벤트 카메라의 낮은 지연 시간과 높은 동적 범위가 가장 큰 효과를 발휘하는 분야입니다. 2026년 5월에 발표된 논문 "AERO-VIS: Asynchronous Event-based Real-time Onboard Visual-Inertial SLAM"(arXiv:2605.07885)은 스테레오 이벤트 카메라와 IMU를 결합하고, 이벤트 스트림을 비동기적으로 처리하는 특징 검출기를 구현하여, 기존 이벤트 기반 SLAM으로는 달성할 수 없었던 정확도를 실제로 무인 항공기(UAV)에 탑재하고 실행하여 달성했다고 보고합니다. 한편, 다비데 스카라무자(Davide Scaramuzza) 교수가 이끄는 취리히 대학교 로봇 및 인지 연구 그룹은 단안 이벤트 카메라만을 사용하여 장애물을 회피하는 쿼드콥터 실험에서 3.5밀리초 이내에 접근하는 물체를 81~97%의 확률로 감지하고, 3미터 거리에서 초속 10미터로 던져진 물체를 90% 이상의 확률로 회피하는 데 성공했다고 보고했습니다. 같은 연구 그룹은 이벤트 카메라를 사용하면 드론 비행 속도를 최대 10배까지 높일 수 있다고 밝혔으며, 프레임 기반 카메라로는 원칙적으로 따라잡을 수 없는 속도 영역에서 이벤트 카메라가 얼마나 뛰어난 인지 능력을 발휘할 수 있는지에 대한 연구가 진행 중입니다.

성능을 결정하는 요소

  1. 해상도/대역폭 절충: GenX320의 320×320 해상도는 엣지 컴퓨팅 및 웨어러블 기기 사용을 위한 저전력 설계인 반면, 삼성 DVS-Gen4의 1280×960 및 소니 IMX636의 1280×720 해상도는 고화질 애플리케이션을 위한 것입니다. 하지만 이벤트 카메라는 움직임이 빠를수록, 해상도가 높을수록 더 많은 이벤트를 생성하기 때문에 하위 처리에서 요구되는 대역폭이 더욱 급격하게 증가합니다. 이는 프레임 속도에 대한 기존 사고방식과 다른 점입니다.
  2. 다이내믹 레인지: GenX320의 140dB 이상, IMX636의 120dB 이상(저조도 차단 시)에 비해 삼성 DVS-Gen4는 100dB로 다소 낮은 수준입니다. 터널이나 역광과 같은 고다이내믹 레인지 장면이 주요 경쟁 무대인 DSEC와 같은 애플리케이션에서는 이 수치가 실제 사용 가능 여부를 직접적으로 결정합니다.
  3. 지연 시간/시간 해상도: 2008년의 DVS128은 이미 15마이크로초를 달성했지만, GenX320과 삼성 DVS-Gen4의 지연 시간은 1000룩스에서 약 150마이크로초라고 합니다. 이는 단순히 세대 간 개선 경쟁이 아니라 조명 조건과 처리 회로 설계 정책(예: 초저전력 우선 여부) 간의 절충에 의해 결정되는 수치이므로 주의가 필요합니다.
  4. 대비 임계값: GenX320의 정격 임계값인 25%와 마찬가지로 밝기 변화를 이벤트로 감지하는 임계값 설정 자체도 노이즈와 감도 사이의 절충입니다. 임계값을 낮추면 미세한 변화까지 감지할 수 있지만 노이즈 이벤트가 더 많이 발생합니다. 볼륨을 높이면 노이즈는 줄어들지만 빠른 변화를 놓칠 수 있습니다.
  5. 전력 소비: DVXplorer는 5V에서 140mA 미만(약 700mW)을 소비하는 반면, GenX320의 초저전력 모드는 36µW에 불과합니다. 동일한 "이벤트 카메라" 범주 내에서 전력 소비량이 거의 4배 가까이 차이가 나는 제품들이 존재합니다. 상시 작동하는 웨어러블/IoT 기기에 사용할 것인지, 아니면 로봇에 장착하여 대량의 이벤트를 고속으로 처리할 것인지에 따라 어떤 제품을 선택해야 할지가 완전히 달라집니다.
  6. 순수 DVS 또는 하이브리드: DAVIS346과 같은 하이브리드 유형은 회색조 프레임도 동시에 출력할 수 있어 기존 이미지 인식 파이프라인을 직접 재사용할 수 있다는 장점이 있지만, 55dB/40fps의 프레임 출력은 이벤트 자체 출력 성능에 미치지 못합니다. Pure DVS(DVXplorer, GenX320 등)는 기존 파이프라인과의 호환성을 희생하는 대신 이벤트의 모든 장점을 활용하는 데 중점을 둡니다.
이해도 확인
정지된 물체는 이벤트 카메라에 어떻게 나타나나요?

이벤트는 밝기 변화에 반응합니다.

변화가 없으면 기존 프레임처럼 정적인 모습이 지속적으로 새로 고쳐지지 않습니다.

참고 문헌

What to read next

Review the background초음파 센서의 작동 원리 및 주요 제품 — 보쉬, 무라타, 도요타 ICSContinue the series온도 센서의 작동 원리와 대표적인 제품 — 열전대, PT100, DS18B20Explore another aspect of this field정지형 IMU 로그 판독: 편향, 산포 및 알란 편차