Contents — find the section you need

事件相机(动态视觉传感器,DVS)是一种采用与传统帧式相机截然不同的光线捕捉方式的传感器。传统帧式相机以固定的时间间隔拍摄整个场景,而事件相机的每个像素独立且异步地工作,仅报告自身亮度变化超过设定值的瞬间,时间分辨率达到微秒级。

原理:每个像素独立报告“变化”

传统的CMOS/CCD图像传感器在每个曝光间隔同时读取所有像素,并将绝对亮度值输出为网格状帧。相比之下,事件相机的每个像素都保存着上次该像素报告值的对数亮度值作为参考值,当当前对数亮度值与该参考值的变化超过阈值C时,该像素就会触发一个“事件”。当像素 (x, y) 在时间 t 触发时,会生成事件

\left| \ln I(x, y, t) - \ln I(x, y, t_{\text{last}}) \right| \geq C
。

当此条件满足时,输出将变为一个异步的四元组序列 e_k = (x_k, y_k, t_k, p_k)(坐标、时间戳、极性)。这种每次只输出坐标和时间戳的方案称为 AER(地址事件表示),它通过极性 p_k 来区分亮度增加(ON)和亮度减少(OFF)。由于不存在帧的概念,因此如果场景中没有运动,则不会输出任何内容;运动速度越快,触发的事件就越多,间隔也越短。

该方案的两个关键特性都直接来源于其对数响应电路设计。首先是时间分辨率:由于每个像素独立做出阈值决策,理论上可以检测到微秒级的变化——即使是2008年发布的早期DVS芯片(下文将讨论)也实现了15微秒的延迟。由于它不依赖于帧速率,因此理论上不会出现基于帧的摄像机无法避免的运动模糊。其次是动态范围:由于每个像素在对数尺度上独立做出阈值决策,而传统传感器的动态范围上限约为60-70dB(受限于阱容量,即光电二极管可累积电荷的上限),事件传感器的动态范围超过100dB,某些产品甚至达到140dB。这就是为什么即使在明暗对比极其强烈的场景中——例如,同一场景中同时存在阳光照射的路面和阴影笼罩的隧道入口——也能连续捕捉变化,而不会出现高光过曝或暗部细节丢失。

大致可以分为两大类实现方式。有一种“纯动态视觉传感器”(DVS),仅执行变化检测,例如 DVS128、iniVation DVXplorer 和 Prophesee GenX320;另一种是混合式方法,例如 iniVation DAVIS346 和 ATIS(下文将讨论),它在变化检测电路的基础上增加了一个电路,用于测量检测到变化的像素的实际亮度值(灰度值)。后者既能输出异步事件,又能以低帧率同时输出传统的灰度图像,从而既能利用事件的优势,又能与现有的图像处理流程兼容——但它也继承了一个限制,即无法从没有变化的像素中获取亮度值。

对比图,上图为传统帧式相机拍摄的奔跑猎豹视频,下图为事件相机对同一场景捕捉到的事件点云帧式相机(上)和事件相机(下)对同一场景的数据输出差异

图片:Event 相机对比 (TimoStoffregen, CC BY-SA 4.0), Wikimedia Commons.

如上图所示,帧式相机以固定间隔输出“整个场景的照片”,而事件相机仅输出沿移动轮廓线散布的稀疏事件簇。由于静止的背景不会产生任何数据,因此也可以将其描述为传感器在传输数据时就已经去除了场景中的冗余信息。Prophesee 表示,在其基于事件的工业视觉应用中,例如饮料纸盒生产线的视觉检测和激光焊接机器人,它可以以每秒超过 1000 次的速度测量移动速度超过每秒 10 米的物体,同时将需要处理的数据量减少到传统基于帧的方法的大约百分之一——这直接源于传感器从一开始就不会为“未发生变化的像素”生成数据。

主要产品规格对比

产品 分辨率 动态范围 延迟/时间分辨率 备注
iniVation DVXplorer 640×480 (VGA) 最高 110dB 亚毫秒级延迟,200µs 时间分辨率 吞吐量高达 1.65 亿事件/秒,内置 6 轴 IMU(陀螺仪频率高达 3.2kHz),5V 电压下电流低于 140mA
iniVation DAVIS346 346×260(事件),帧输出分辨率相同 事件输出增益 120dB,帧输出增益 55dB 事件时间分辨率 1µs,延迟低于 1ms,帧输出 40fps 混合设计,可同时输出变化检测帧和灰度帧。吞吐量高达 1200 万事件/秒,像素间距 18.5µm
Sony IMX636(Prophesee Metavision) 1280×720(0.92 兆像素) 在 5-100,000 勒克斯光照条件下,灵敏度超过 86dB;在 0.08-100,000 勒克斯光照条件下,低光照截止时灵敏度超过 120dB 高速、低延迟响应(具体数值取决于应用) 由索尼和 Prophesee 联合开发的堆叠式传感器,4.86µm 像素间距,全数字 16 线并行输出
Prophesee GenX320 320×320 灵敏度超过 140dB 在 1000 勒克斯光照条件下,像素延迟低于 150µs 超低功耗模式下功耗可降至 36µW,6.3×6.3µm 像素,超紧凑型 3×4mm 封装,内置闪烁抑制和事件速率控制
三星 DVS-Gen4 1280×960 100dB 150µs 4.95µm 像素间距,通过像素内铜-铜键合和 GIDL 抑制电路实现高分辨率和低功耗
Prophesee 事件相机评估套件安装在三脚架上,镜头和 microSD 卡槽清晰可见Prophesee 事件相机评估套件

图片:Prophesee 事件相机评估套件 (Auledas, CC BY 4.0), Wikimedia Commons.

IniVation DVXplorer 具有 640×480 的 VGA 等效分辨率和内置的 6 轴 IMU,是一款广泛应用于机器人研究的纯 DVS 相机。 DAVIS346 是一款混合型设计,将变化检测电路和灰度帧输出集成在单个芯片上:事件输出本身具有 120dB 的动态范围,但其可同时输出的帧数限制为 55dB 和 40fps——该产品清楚地表明,纯 DVS 的优势和与基于帧的处理兼容性之间存在权衡关系。索尼 IMX636 结合了索尼的堆叠式传感器制造技术和 Prophesee(下文将讨论)的事件感知技术,其 1280×720 的分辨率使其跻身事件摄像机的高分辨率行列;工业相机制造商IDS Imaging Development Systems于2025年发布的“uEye EVS”系列也采用了这项技术。GenX320的分辨率略低,为320×320,但其超低功耗模式可将功耗降低至36µW,使其成为一款面向物联网的常开可穿戴设备和边缘传感应用的理想之选。三星DVS-Gen4拥有最高的像素密度,为1280×960,其像素内Cu-Cu键合(一种将铜直接连接到铜的堆叠技术)以及抑制栅极感应漏极漏电(GIDL)的电路设计,有效控制了高分辨率带来的漏电流增加。

电子眼的起源:从硅视网膜到事件相机产业

1988 年,加州理工学院的硅视网膜——事件相机的直接起源可以追溯到 1988 年卡弗·米德(Carver Mead)与当时还是研究生的米沙·马霍瓦尔德(Misha Mahowald)共同发表的论文《早期视觉处理的硅模型》。米德被誉为集成电路之父之一。两人利用模拟 CMOS 电路构建了一个“硅视网膜”,模拟了视网膜早期的视觉处理过程,从而开创了“神经形态工程”这一领域——即尝试用硬件重现大脑的信息处理过程。米德后来因这项工作获得了加州理工学院颁发的神经形态工程终身成就奖。

2008 年,苏黎世联邦理工学院/苏黎世大学推出了一款全异步动态视觉传感器 (DVS)——Patrick Lichtsteiner、Christoph Posch 和 Tobi Delbrück 在 IEEE 固态电路期刊上发表了题为“128×128 120 dB 15 μs Latency Asynchronous Temporal Contrast Vision Sensor”的论文,展示了一款具有 128×128 像素、120dB 动态范围和 15 微秒延迟的全异步传感器——这正是如今被称为“DVS”的原型。该论文被广泛引用,在过去十年中,其在该期刊的引用量排名第四,并已成为事件相机研究的实际起点。

2011年,ATIS将变化检测与亮度测量相结合——克里斯托夫·波施(Christoph Posch)加入奥地利技术研究院(AIT),并提出了ATIS(异步时间图像传感器)。ATIS将变化检测电路与实时测量实际亮度(灰度值)的电路相结合,但仅针对检测到变化的像素进行测量。ATIS实现了超过143dB的动态范围,其设计满足了实际应用中“不仅要检测变化,还要检测图像”的需求,并成为后来DAVIS和其他混合型产品的技术基础。

2014年,Chronocam成立,以及两家苏黎世联邦理工学院(ETH)/苏黎世大学的衍生公司成立——2014年,波施与里亚德·贝诺斯曼(Ryad Benosman)、伯纳德·吉利(Bernard Gilly)和卢卡·韦尔(Luca Verre)在巴黎创业孵化器iBionext内共同创立了Chronocam,旨在将AIT开发的ATIS技术商业化。 Chronocam 于 2018 年更名为 Prophesee,并完成了 1900 万美元的 B 轮融资。与此同时,苏黎世大学/苏黎世联邦理工学院神经信息学研究所 (INI) 的四位成员——Tobi Delbrück、Rodney Douglas、Kynan Eng 和 Sven-Erik Jacobsen——于 2015 年创立了 iniVation 公司,而另一支团队则于 2017 年创立了 SynSense 公司。INI 曾研发出 DVS128 芯片。这两家公司都源自同一研究所,并于 2024 年合并,SynSense 收购了 iniVation 的全部股份。在中国,总部位于上海的 CelePixel 由陈守顺等人于 2017 年创立,并于 2019 年被 OmniVision 的母公司 Will Semiconductor 收购。 2020年,索尼将其堆叠式图像传感器制造技术与Prophesee的事件感知技术相结合,共同开发出上文提到的IMX636传感器。这项源自神经科学实验室的小众技术,历经十余年,最终与索尼这样的大型图像传感器制造商达成合作——这就是这款传感器的发展历程。

一个真实案例:在苏黎世展出的立体事件相机装置“DSEC”

事件相机目前还不是汽车制造商量产生产线上的传感器,但在研发阶段,已经出现了多台样机的身影。 DSEC 数据集(用于驾驶场景的立体事件相机数据集)由苏黎世联邦理工学院/苏黎世大学机器人与感知小组于 2021 年发布。该数据集由一辆载有两台 Prophesee Gen3.1 事件相机(640×480)立体装置的车辆采集,相机分别安装在车辆左右两侧,基线距离为 60 厘米,并与两台 FLIR Blackfly S 彩色帧相机、激光雷达和 RTK-GPS 同步。车辆行驶穿过包括苏黎世、图恩和因特拉肯在内的多个瑞士城市,采集了一个多小时的驾驶数据。值得注意的是,DSEC 专门针对高动态范围场景进行录制,而标准摄像机在这些场景中往往难以达到曝光控制的极限——例如隧道入口和出口、日落和日出时的强逆光——并且,与单目设置一样,它也采用了宽基线立体成像设计,以确保远距离视差精度,同时验证事件摄像机是否能够在帧摄像机高光过曝或暗部细节丢失的情况下持续捕捉变化。作为研究如何在普通摄像机难以应对的低光照环境下稳健运行诸如 Visual-SLAM 等自定位算法的基础,DSEC 至今仍被广泛引用。

研究从看似只有噪声的视频中识别人脸,以及在无人机上运行的SLAM

来自哈萨克斯坦的事件流人脸检测数据集 — 纳扎尔巴耶夫大学智能系统与人工智能研究所 (ISSAI) 的 Bissarinova、Rakhimzhanova、Kenzhebalin 和 Varol 于 2024 年在 Sensors 期刊(第 24 卷,第 5 期,文章编号 1409)上发表了题为“事件流中的人脸 (FES):事件摄像机的带标注人脸数据集”的论文。这是首个此类大规模数据集,标注了 689 分钟事件流中的 160 万人脸和 5 个面部特征点,并报告称,配套的 12 个模型在 mAP50 下检测人脸和面部特征点的准确率超过 90%。下图是其 GitHub 代码库的封面图,图中显示多张人脸和轮廓从看似杂乱无章的噪点素材中逐渐显现出来。事件相机的原理——即不记录静止的物体——使得拍摄的视频只包含“轮廓和运动”,不包含任何照片纹理。此外,该技术在注重隐私的监控应用场景中也展现出巨大的潜力。

事件相机捕捉到的四张人脸。面部轮廓、边界框和地标从点状噪声中显现出来事件流中出现的人脸和检测框(FES 数据集的封面图像)

图片:Faces in Event Streams (Ulzhanbis, CC BY 4.0), Wikimedia Commons。ISSAI(纳扎尔巴耶夫大学)FES 数据集论文的 GitHub 封面图像(Bissarinova 等人,Sensors 2024, 24(5):1409)。

在无人机上运行的立体事件 SLAM,以及一项躲避“抛掷物”的实验 — 事件相机的低延迟和高动态范围在机器人领域发挥着最大作用。 2026年5月发表的论文“AERO-VIS:异步事件驱动的实时机载视觉惯性SLAM”(arXiv:2605.07885)将立体事件相机与惯性测量单元(IMU)相结合,实现了一个能够异步处理事件流的特征检测器,并报告称,通过将该系统实际安装在无人机(UAV)上并进行机载运行,实现了传统事件驱动SLAM无法达到的精度。此外,由Davide Scaramuzza领导的苏黎世大学机器人与感知小组报告称,在一项仅依靠单目事件相机避障的四旋翼飞行器实验中,该飞行器在3.5毫秒内以81-97%的概率检测到来袭物体,并以超过90%的概率成功躲避了从3米外以10米/秒的速度抛出的物体。同一研究团队还指出,使用事件相机可以将无人机的飞行速度提高至多 10 倍,目前正在进行研究,以探索在帧式相机原则上无法跟上的高速范围内,事件相机究竟能将感知信息传递多远。

决定性能的参数

  1. 分辨率/带宽权衡:GenX320 的 320×320 分辨率设计优先考虑低功耗,适用于边缘计算和可穿戴设备;而三星 DVS-Gen4 的 1280×960 分辨率和索尼 IMX636 的 1280×720 分辨率则面向更高保真度的应用。然而,由于事件摄像机产生的事件数量更多,运动速度越快、分辨率越高,对下游处理带宽的需求峰值也越高——这一点与传统的帧速率概念有所不同。

  2. 动态范围:与 GenX320 的 140dB 以上和 IMX636 的 120dB 以上(低光照截止)相比,三星 DVS-Gen4 的动态范围略显逊色,为 100dB。在DSEC等应用中,隧道和背光等高动态范围场景是主要战场,该数值直接决定了其是否具有实际应用价值。

  3. 延迟/时间分辨率:虽然2008年的DVS128已经达到了15微秒的延迟,但据称GenX320和三星DVS-Gen4在1000勒克斯光照下的延迟约为150微秒——这里需要谨慎对待,因为这并非简单的代际改进竞赛,而是一个取决于光照条件和处理电路设计策略(例如是否优先考虑超低功耗)权衡的结果。

  4. 对比度阈值:与GenX320的25%额定阈值一样,设置用于检测亮度变化的阈值本身就是噪声和灵敏度之间的权衡。降低阈值可以检测到哪怕是微小的变化,但代价是会产生更多的噪声事件;提高灵敏度可以降低噪声,但会错过一些快速变化。

  5. 功耗:DVXplorer 在 5V 电压下功耗低于 140mA(约 700mW),而 GenX320 的超低功耗模式功耗仅为 36µW——在同一“事件相机”类别中,功耗差异近四个数量级的产品并存。应用场景是始终开启的可穿戴设备/物联网应用,还是安装在机器人上高速处理大量事件,会彻底改变您应该选择的产品。
  6. 纯 DVS 还是混合型:像 DAVIS346 这样的混合型产品可以同时输出灰度帧,其优势在于可以直接复用现有的图像识别流程,但其 55dB/40fps 的帧输出低于事件输出本身的能力。纯DVS(例如DVXplorer、GenX320等)牺牲了与现有流程的兼容性,以换取充分发挥事件的优势。
检查你的理解
事件摄像机如何呈现静止物体?

事件会响应亮度变化。

静态图像不会像传统帧那样持续刷新,除非进行更改。

参考资料

What to read next

Review the background超声波传感器的工作原理及主要产品——博世、村田、丰田ICSContinue the series温度传感器的工作原理及代表产品——热电偶、PT100、DS18B20Explore another aspect of this field读取静止IMU日志:偏差、散布和艾伦偏差