目次 — 知りたいところから読む

単眼深度推定は、1枚のRGB画像から画素ごとの奥行きを推定する技術である。画像だけでは、同じ見かけの大きさを持つ小さな近物体と大きな遠物体を一意に区別できない。そのため、出力が「手前/奥」の順序を表す相対深度なのか、メートルなどの単位を持つmetric depthなのかを最初に分けて読む必要がある。

30秒要約

  • 単眼画像だけでは一般に絶対尺度が決まらない。相対深度は順序や形状を、metric depthは単位付き距離を目指す。
  • 学習モデルがmetric depthを出力しても、カメラ・環境・学習データの条件から外れると尺度ずれや局所的な破綻が起こる。
  • ground truthがない画像だけで「精度」を主張できない。深度誤差、相対順序、遮蔽境界、尺度整列の有無を分けて評価する。

画像から深度が決まらない理由

ピンホールカメラでは、3D点 (X,Y,Z) の画像位置は概ね u=fX/Z, v=fY/Z で決まる。すべての座標と奥行きを同じ倍率で拡大しても画像位置は変わらない。これが単眼画像における尺度不定性である。単眼深度モデルは、物体の大きさ、遠近、陰影、テクスチャ、学習済みの場面知識などを事前情報として使い、この曖昧さを推測する。

図1 · ボタンで表示を切り替え
単眼深度の尺度と評価

モデル出力 \hat D が相対深度だけを表す場合、評価前に a\hat D+b のような尺度・オフセット整列を行うことがある。整列後の誤差が小さくても、実際のメートル距離を直接推定できたことを意味しない。整列なしのmetric評価と、整列ありのrelative評価を混ぜてはいけない。

予測の種類を分ける

出力 何が分かるか 追加条件
相対深度 どちらが手前か、形状の順序 絶対尺度は別途必要
inverse depth 近い領域を強調した深度表現 1/Z と深度 Z を混同しない
metric depth mなどの単位付き距離 カメラ・学習分布・尺度校正の検証が必要

metric depthの出力を使って障害物距離や寸法を決めるなら、対象ドメインのground truth、センサー同期、カメラ内部パラメータ、深度の有効範囲を固定して検査する。モデル名や入力画像の見た目だけから実環境の精度を推定しない。

評価の最小セット

ground truth深度 D と予測 \hat D を同じ有効画素集合で比較する。代表的には絶対相対誤差 \mathrm{AbsRel}=\mathrm{mean}(|\hat D-D|/D)、RMSE、閾値内割合 \delta を使う。無効値、遮蔽境界、極端に遠い画素を除外したなら、除外規則と有効画素数を結果へ記録する。

相対モデルを評価する場合は、尺度整列のパラメータをテスト画像ごとに推定したか、訓練データから固定したかを明記する。テストごとの整列は相対形状の比較には有用だが、実際の尺度再現性を隠すことがある。

失敗しやすい条件

  • 鏡面・透明物体、空、無地の壁は画像だけの手がかりが少ない。
  • 学習分布にない照明、カメラ、地域、物体、画角では尺度や境界が崩れることがある。
  • 細い構造や遮蔽境界では、平均誤差が小さくても安全上重要な局所誤りが残る。
  • 動画ではフレームごとの深度が時間的に揺れる。単画像の指標だけで安定性を保証しない。

まとめ

単眼深度は、画像から距離を直接「測る」だけでなく、視覚的な事前知識を使って奥行きを推定する問題である。相対深度・metric depth・尺度整列を分離し、ground truthと有効画素の条件を記録して初めて評価結果を比較できる。実モデルや重みを使うLabは、許諾済み入力、固定版、基準深度、機材条件が揃ってから別途設計する。

理解を確かめる
相対深度の評価値が良ければ、距離[m]も正しい?

必ずしも正しくない。尺度整列の有無、metric ground truth、カメラとデータ分布の条件を分けて確認する。

参考資料

次に読む

単眼画像と平面仮定による距離推定の前提を確認する単眼カメラの仕組みと主要製品 — Mobileye・Tesla・Continental焦点距離と内部パラメータを確認するカメラキャリブレーション入門 — レンズ歪みと内部パラメータを求める前提を確認するVisual-SLAM入門 — カメラで「自分がどこにいるか」を知る技術