Contents — find the section you need

L'estimation de profondeur monoculaire prédit une distance par pixel à partir d'une image RVB. Une seule image ne permet pas de distinguer clairement un petit objet proche d'un grand objet éloigné de même taille apparente. La première question est donc de savoir si un modèle prédit une profondeur relative (ordre avant-arrière) ou une profondeur métrique avec une unité physique comme le mètre.

En bref

  • Une image monoculaire ne détermine généralement pas l'échelle absolue. La profondeur relative décrit l'ordre et la forme ; la profondeur métrique vise une distance en direction unitaire.

  • Même un modèle qui fournit une profondeur métrique peut présenter une dérive d'échelle ou des erreurs locales en dehors de la caméra, de la scène et de la distribution d'entraînement utilisée.

  • Une image sans vérité terrain ne permet pas d'établir la précision de la profondeur. Il faut dissocier l'erreur de profondeur, l'ordre relatif, les limites d'occlusion et l'utilisation éventuelle d'un alignement d'échelle.

Pourquoi l'image ne fixe pas l'échelle

Pour une caméra sténopé, un point 3D (X,Y,Z) est projeté approximativement comme u=fX/Z, v=fY/Z. Mettre à l'échelle toutes les coordonnées et la profondeur par le même facteur ne modifie pas la position de l'image. C'est ce qu'on appelle l'ambiguïté d'échelle monoculaire. Un modèle de profondeur la résout statistiquement en utilisant la taille de l'objet, la perspective, l'ombrage, la texture et les connaissances a priori sur la scène.

Diagram 1 · Use the button to switch views
Échelle et évaluation pour la profondeur monoculaire

Si la sortie du modèle \hat D est uniquement relative, l'évaluation peut l'aligner avec a\hat D+b. Une faible erreur après alignement ne prouve pas que le modèle peut directement reconstituer les mètres. Ne mélangez jamais une évaluation métrique non alignée avec une évaluation relative alignée.

Séparer les types de sortie

Sortie Fonctionnalités prises en charge Condition supplémentaire
Profondeur relative Ordre avant/arrière et forme L'échelle absolue reste nécessaire
Profondeur inverse Représentation mettant l'accent sur les régions proches Ne pas confondre 1/Z avec la profondeur Z
Profondeur métrique Distance en mètres ou autre unité Valider l'étalonnage de la caméra, du domaine et de l'échelle

Lorsque la profondeur métrique détermine la distance ou la dimension d'un obstacle, il est impératif de corriger les valeurs de référence du domaine, la synchronisation des capteurs, les paramètres intrinsèques de la caméra, la plage de validité et la politique de gestion des valeurs invalides. Un nom de modèle ou une image d'apparence plausible ne garantit pas la précision en conditions réelles.

Protocole d'évaluation minimal

Comparer la profondeur de référence D et la prédiction \hat D sur le même ensemble de pixels valides. Les mesures courantes incluent l'erreur relative absolue \mathrm{AbsRel}=\mathrm{mean}(|\hat D-D|/D), l'erreur quadratique moyenne (RMSE) et la précision du seuil \delta. Enregistrer les pixels invalides, la gestion des occlusions, les plages éloignées exclues et le nombre de pixels valides.

Pour un modèle relatif, indiquer si l'alignement de l'échelle est estimé séparément pour chaque image de test ou fixé à partir des données d'entraînement. L'alignement par image est utile pour comparer les formes relatives, mais il peut masquer l'incapacité du modèle à restituer une échelle physique stable.

Conditions de défaillance courantes

  • Les miroirs, les objets transparents, le ciel et les murs sans texture fournissent peu d'indices visuels fiables.

  • Un éclairage, des caméras, des régions, des objets ou des champs de vision inhabituels peuvent entraîner des problèmes d'échelle et de limites.

  • Les structures fines et les zones d'occlusion peuvent contenir des erreurs locales critiques pour la sécurité, malgré une métrique moyenne faible.

  • Les prédictions vidéo peuvent scintiller d'une image à l'autre. Les métriques basées sur une seule image ne garantissent pas la stabilité temporelle.

Résumé

La profondeur monoculaire est un problème d'inférence qui combine des informations visuelles avec des connaissances a priori ; il ne s'agit pas simplement d'un capteur de distance logiciel. Il est important de séparer la profondeur relative, la profondeur métrique et l'alignement d'échelle, et d'enregistrer les conditions de vérité terrain et de pixels valides avant de comparer les résultats. Un laboratoire dédié à un modèle spécifique devrait attendre que les entrées sous licence, les versions corrigées, la profondeur de référence et les conditions matérielles soient disponibles.

Vérifiez votre compréhension
Un bon score de profondeur relative prouve-t-il que les distances en mètres sont correctes ?

Non. Vérifiez séparément l'alignement des échelles, la vérité terrain métrique, ainsi que les conditions de la caméra et de la distribution des données.

Références

What to read next

Review monocular imaging and planar distance assumptionsFonctionnement des caméras monoculaires et principaux produits — Mobileye, Tesla, ContinentalReview focal length and camera intrinsicsGuide d'étalonnage des appareils photo — Correction de la distorsion de l'objectif et récupération des paramètres intrinsèquesReview the backgroundIntroduction au Visual-SLAM — Comment une caméra apprend « Où suis-je ? »"