Contents — find the section you need
单目摄像头使用单个镜头和单个图像传感器捕捉前方道路,然后利用图像处理技术识别车道线、标志、交通信号灯、行人和车辆。与激光雷达或雷达不同,它不主动发射无线电波或光——它只是接收反射的可见光——因此结构简单,并且在成本和安装空间方面都具有优势。在自动驾驶汽车的高级驾驶辅助系统 (ADAS) 中,它是应用最广泛的传感器之一,用于车道偏离预警、车道保持辅助 (LKA) 和仅基于视觉的自适应巡航控制 (ACC)。
Mobileye 的窗口安装摄像头(摄于 2017 年)图片:Car Mobileye 系统窗口摄像头(Ranbar,CC BY-SA 4.0),Wikimedia Commons。这不是文中讨论的最新款基于 EyeQ6L 的摄像头,而是早期型号的示例。
原理:单张图像没有“绝对比例”
单目摄像头的最大缺点是,原则上,单张图像无法确定物体的绝对距离(真实世界比例)。可以用针孔相机模型来近似模拟相机:三维空间中的点 (X, Y, Z) 通过焦距 f 投影到图像平面上的点 (x, y),如
正如该公式所示,你只能从图像坐标 (x, y) 中恢复出真实坐标 (X, Y, Z) 与深度 Z 的比值——深度 Z 本身无法仅从单张图像反算得出。在图像中投影到相同大小的两个物体可能是附近的小物体,也可能是远处的大物体,仅凭该公式无法区分它们。这与立体相机截然不同,立体相机可以通过两个镜头之间的视差进行三角测量,直接计算出 Z。
图片:Pinhole 相机模型几何形状 (KYN, CC0 1.0 公共领域),Wikimedia Commons。
为了克服这一限制,基于单目相机的系统会使用某种“已知参考”来估计距离。Mobileye 使用的一种典型技术是通过逆透视映射 (IPM) 实现的单视图几何形状:它假设路面是平面的,并使用一个具有已知实际尺寸的物体(例如车道宽度)作为参考,根据图像中的位置反向计算实际距离(相关专利:US8164628B2)。其他技术包括根据物体的视尺寸(例如车辆或行人的典型实际尺寸)估计距离,以及根据连续帧的运动(光流)估计距离和速度。由于所有这些方法都依赖于假设,因此当路面倾斜或物体尺寸与假设值偏差时,误差往往会增大。
近年来,利用深度学习直接弥补这一缺陷的“单目深度估计”(MDE)研究取得了快速进展。早期方法只能输出相对深度(近远排序),而一篇专门针对“度量”单目深度估计的综述论文于2025年发表,该论文以米为单位输出绝对距离(arXiv:2501.11841)。这表明,利用神经网络克服单目深度估计的根本缺陷已成为当前研究的重点领域。
主要产品规格对比
| 产品 | 分辨率 | 视场角 (FOV) | 备注 |
|---|---|---|---|
| Mobileye EyeQ6L(EyeQ6 Lite) | 800万像素 | 120度 | 比EyeQ4M的摄像头视角宽20度。处理性能约为EyeQ4M的4.5倍,芯片面积约为其一半。 |
| Tesla HW4摄像头 | 500万像素 | 比HW3(120万像素)视角宽广得多——具体数值未公开 | 从HW3的120万像素到500万像素的重大升级。后置摄像头具有更强的鱼眼效果和更广的视角。 |
| Continental MFC500(MFC525/MFC526) | 最高800万像素 | 最高125度 | 模块化、可扩展的摄像头平台,识别处理可以在摄像头内部运行,也可以在外部ADCU(集成控制单元)中运行。 |
| comma.ai openpilot(comma 4) | (售后附加设备,单目摄像头 + 专用 SoC) | — | 一款售价 999 美元的售后套件,可为量产车辆添加 L2 级驾驶辅助功能。名为“Supercombo”的端到端神经网络可直接从单目图像预测车辆的未来轨迹。 |
| 索尼 IMX490 图像传感器 | 约 880 万像素 | (仅传感器,与镜头无关) | 这是一款车规级 CMOS 传感器,具有 150dB 的宽动态范围和 LED 闪烁抑制功能,是 Mobileye、Continental 等厂商摄像头模块的常用组件。 |
Mobileye 的 EyeQ6L 是一款 ADAS SoC(系统级芯片),预计于 2024 年发布,其产品更像是“摄像头 + 处理芯片”组合,而非独立的单目摄像头。其 800 万像素分辨率和 120 度广角视野使其具备车道保持和自动变道功能,不仅能检测当前车道,还能检测两侧各两条车道的车道中心线。特斯拉 HW4 是将于 2023 年推出的硬件版本,其分辨率从 HW3 的 120 万像素大幅提升至 500 万像素,显著提高了对标志和车牌的识别精度。大陆集团的 MFC500 以其灵活性脱颖而出——识别处理引擎既可以集成在摄像头内部,也可以安装在外部单元中——该系列产品还包括面向卡车的 MFC526。comma.ai 的 openpilot 则显得有些另类,它是这里唯一一款售后市场附加产品,而非汽车制造商的原厂系统。它采用端到端神经网络“Supercombo”,可直接从单目图像预测车辆的未来行驶轨迹。
从希伯来大学实验室到 Mobileye,以及特斯拉“移除”雷达
从希伯来大学实验室到英特尔以超过 150 亿美元收购 — Mobileye 由耶路撒冷希伯来大学计算机视觉研究员 Amnon Shashua 和高管 Ziv Aviram 于 1999 年创立。在创立 Mobileye 之前,Shashua 曾参与创立 CogniTens(汽车和航空航天光学测量系统)和 CogniTech(视频分析技术),Mobileye 的成立正是基于这些工作,旨在为大众市场车辆提供价格合理的视觉系统。其首款芯片 EyeQ1 于 2004 年出货,比公司最初的路线图晚了十年。Mobileye 于 2014 年在纳斯达克上市,估值约为 53 亿美元。2017 年,英特尔以 153 亿美元的价格收购了该公司——这在当时是以色列历史上规模最大的科技收购案。特斯拉于2022年底以独立上市公司的身份重返纳斯达克(仍隶属于英特尔),此后业务范围从高级驾驶辅助系统(ADAS)扩展到自动驾驶和“物理人工智能”。
2021年特斯拉视觉系统“移除”雷达的时刻——从2021年5月开始,北美地区的Model 3和Model Y车型开始采用无雷达传感器的配置,标志着特斯拉视觉系统向“特斯拉视觉”的转型正式启动——该系统完全依赖摄像头和神经网络处理。同年6月,时任特斯拉人工智能负责人的安德烈·卡帕西在CVPR 2021(计算机视觉领域的顶级会议)自动驾驶研讨会上发表主题演讲,直言不讳地表示:“我们移除了雷达,这些车辆完全依靠视觉来驾驶。”他还解释说,特斯拉的深度学习视觉系统已经比它所取代的雷达系统先进了大约一百倍。他还表示,“车内发生的一切,都是首次基于环绕车辆的八个摄像头拍摄的视频而呈现”,他承认纯视觉方法的技术难度,但同时指出,一旦成功,它将成为一套可在全球任何地方部署的通用视觉系统。欧洲和中东地区的Model 3/Y车型后来也采用了无雷达的特斯拉视觉系统——这是一个具有里程碑意义的案例,表明汽车制造商有意选择基于单目(以及多摄像头)而非传感器融合的方法。
售后单目驾驶辅助系统:comma.ai——comma.ai由以破解iPhone而闻名的George Hotz创立,该公司销售的openpilot独立于任何汽车制造商的原厂ADAS系统,通过安装在挡风玻璃上的单个售价999美元的售后设备(comma 3X/4),为支持的车辆添加L2级车道保持辅助和自适应巡航功能。它并非采用传统的模块化感知流程,而是使用名为“Supercombo”的端到端神经网络,直接从单目摄像头画面预测车辆的未来轨迹和道路结构。由于它是开源的,因此在DIY爱好者和研究社区中得到广泛应用。
决定性能的参数
-
分辨率(像素数):直接决定对远处标志、交通信号灯和小型障碍物的识别精度。特斯拉HW4的分辨率比HW3提升了约4倍,主要目的是为了提高对远处小型目标的可见度。汽车单目摄像头的分辨率逐年提高,例如大陆集团的MFC500和索尼的IMX490都已达到800万像素级别。
-
视场角(FOV):更宽的视场角可以让单个摄像头覆盖更多周围环境,例如行人过马路和十字路口并线的车辆。 Mobileye 的 EyeQ6L 拥有 120 度的视角,比 EyeQ4M 宽 20 度,正是针对这一需求而设计的。Continental 的 MFC500 则更进一步,视角达到 125 度,旨在检测十字路口侧面的横向来车。
-
动态范围:决定了在对比度极高的场景(例如隧道入口/出口、夜间车灯眩光和逆光)中,识别效果是否稳定,避免高光过曝或阴影过暗。Sony IMX490 的 150dB 动态范围和 LED 闪烁抑制功能(可抑制 LED 交通信号灯的闪烁)直接解决了这一难题。
-
距离估计的前提条件:由于单目摄像头基于一些假设(例如平坦的路面、已知的车道宽度和标准尺寸的物体)来估计距离,因此在崎岖不平的路面、坡道或异常大小的障碍物上,误差往往会增大。需要高精度测距的应用通常需要搭配立体摄像头、激光雷达或雷达,但像 Tesla Vision 这样的方案则试图通过神经网络训练的规模来突破这一限制。
-
成本和安装空间:单目摄像头只需要一个镜头和一个传感器,因此比立体摄像头或深度摄像头更小巧、更便宜——这在车辆狭窄的挡风玻璃顶部空间布局中尤为有利,因为多个传感器会争夺空间。comma.ai 的 999 美元售价正是这种低成本优势的体现。
-
处理性能(SoC 端):单目摄像头的实际应用价值很大程度上取决于其图像处理能力的强弱。 EyeQ6L 的计算性能比 EyeQ4M 提升了 4.5 倍,其存在的目的正是为了提高识别精度和支持的特征数量。
通过数值示例检查单目距离
如果将道路近似为平面,相机高度为 H,焦距为 f,从地平线到物体接触点的像素偏移量为 y,则简化的反透视关系为:
对于 H=1.4\,\mathrm{m}、f=1200\,\mathrm{px} 和 y=84\,\mathrm{px},该关系式得出 Z\simeq20\,\mathrm{m}。在相同的假设下,接触点 2 像素的误差会导致使用微分近似 \sigma_Z\simeq fH\sigma_y/y^2 计算出的距离误差约为 0.48\,\mathrm{m}。道路坡度、相机姿态、车道高度以及模糊的接触点都会增加误差。
此计算并非否定神经单目深度估计。它提供了一个参考值,用于将学习到的输出与道路几何形状、已知物体尺寸、立体视觉或雷达数据进行比较。请按距离范围、逆光、坡度、雨天、夜间和物体高度等因素报告测试结果,而不仅仅是平均误差。
一张图像能否确定物体的距离?
如果没有额外的假设,比例尺是不确定的。
确定该估计是使用已知尺寸、多视角还是学习到的先验信息。参考资料
-
单目距离估计专利:US8164628B2
-
[comma.ai] OpenPilot 官方网站](https://comma.ai/openpilot)
-
[单目度量深度估计调查] (arXiv:2501.11841)](https://arxiv.org/abs/2501.11841)
评论
请先登录。
暂无数据。