Contents — find the section you need
单目深度估计通过一张 RGB 图像预测每个像素的距离。单张图像无法唯一区分大小相同的近处小物体和远处大物体。因此,首要问题是模型预测的是相对深度(前后顺序)还是以米等物理单位表示的度量深度。
简述
-
单目图像通常无法确定绝对比例。相对深度描述的是顺序和形状;度量深度则旨在表示单位距离。
-
即使是输出度量深度的模型,也可能出现超出其学习的相机、场景和训练分布范围的尺度漂移或局部误差。
-
没有真实值的图像无法确定深度精度。需要区分深度误差、相对顺序、遮挡边界以及是否使用了尺度对齐。
为什么图像无法确定比例
对于针孔相机,三维点 (X,Y,Z) 的投影近似为 u=fX/Z, v=fY/Z。将所有坐标和深度值按相同比例缩放不会改变图像位置。这就是单目尺度歧义。深度模型利用物体大小、透视、阴影、纹理和学习到的场景先验信息,通过统计方法解决这个问题。
如果模型输出 \hat D 仅为相对深度,则评估时可能会将其与 a\hat D+b 对齐。较低的后对齐误差并不能证明模型可以直接恢复米级深度。切勿将未对齐的度量评估与已对齐的相对评估混用。
区分输出类型
| 输出 | 支持的功能 | 附加条件 |
|---|---|---|
| 相对深度 | 前后顺序和形状 | 仍然需要绝对尺度 |
| 反向深度 | 一种强调邻近区域的表示 | 不要将 1/Z 与深度 Z 混淆 |
| 度量深度 | 距离单位为米或其他单位 | 验证相机、域和尺度校准 |
当度量深度决定障碍物距离或尺寸时,需修正域真实值、传感器同步、相机内参、有效范围和无效值处理策略。模型名称或看似合理的图像并不能证明其在实际应用中的准确性。
最小评估协议
在同一有效像素集上比较真实深度 D 和预测深度 \hat D。常用指标包括绝对相对误差 \mathrm{AbsRel}=\mathrm{mean}(|\hat D-D|/D)、均方根误差 (RMSE) 和阈值精度 \delta。记录无效像素、遮挡处理、排除的远距离以及有效像素的数量。
对于相对模型,需说明尺度对齐是针对每个测试图像单独估计,还是从训练数据中固定。逐幅图像对齐有助于比较相对形状,但可能会掩盖模型无法恢复稳定物理尺度的问题。
常见失效情况
-
镜子、透明物体、天空和无纹理的墙壁提供的可靠视觉线索很少。
-
不熟悉的照明、相机、区域、物体或视野可能会破坏尺度和边界。
-
即使平均指标较低,薄结构和遮挡边界也可能包含对安全至关重要的局部误差。
-
视频预测可能出现帧间闪烁。单图像指标无法保证时间稳定性。
总结
单目深度是一个结合图像证据和视觉先验的推理问题;它并非简单的软件距离传感器。在比较结果之前,应将相对深度、度量深度和尺度对齐分开,并记录真实值和有效像素条件。特定模型的实验室应等到获得授权输入、固定版本、参考深度和硬件条件后再进行测试。
良好的相对深度得分是否能证明以米为单位的距离是正确的?
否。请分别检查尺度对齐、度量标准真实值以及相机和数据分布条件。

评论
请先登录。
暂无数据。