Contents — find the section you need

Les méthodes 3D neuronales apprennent une représentation d'une scène à partir de plusieurs images et poses de caméra, puis génèrent une image depuis un point de vue non capturé. Alors que la méthode SfM estime principalement les poses et les points épars, et que la méthode MVS reconstruit principalement la géométrie dense, la 3D neuronale modélise également l'apparence d'une scène depuis une position et une direction de vue données.

En bref

  • NeRF représente une scène comme une fonction qui renvoie la densité et la luminance en fonction de la position et de la direction de vue ; le 3D Gaussian Splatting optimise de nombreux éléments gaussiens 3D explicites.

  • Bien reproduire les vues d'entraînement ne prouve pas que les vues ou la géométrie non vues sont correctes.

  • Distinguer les métriques d'image telles que le PSNR/SSIM de l'évaluation géométrique de la profondeur, des points, des normales et des poses. La synthèse de nouvelles vues ne constitue pas une preuve de la précision d'un relevé topographique.

Diagram 1 · Use the button to switch views
Entraînement et évaluation 3D neuronaux

Choix de représentation

NeRF évalue (\sigma,\mathbf{c})=F_\theta(\mathbf{x},\mathbf{d}) à des points d'échantillonnage le long des rayons de la caméra et utilise le rendu volumique pour former une image. L'entraînement minimise la différence entre les images rendues et d'entrée. Le 3D Gaussian Splatting projette des gaussiennes avec position, covariance, opacité et couleur, et optimise ces éléments à partir de points épars.

Représentation Points forts Limites
Famille NeRF Champ de radiance continu et apparence dépendante du point de vue Nombreux points d'échantillonnage des rayons ; l'entraînement et le rendu dépendent de la configuration
3D Gaussian Splatting Les éléments projetés explicites peuvent être rendus rapidement Validation séparée de la densité, de la géométrie invisible et des objets dynamiques
Maillage / MVS La géométrie de surface est explicite et facile à inspecter Sensible aux réflexions, aux occlusions, aux trous et aux textures faibles

Séparation des vues d'entraînement et d'évaluation

Le rendu de chaque image d'entrée utilisée pour l'entraînement ne mesure que la reconstruction des vues observées. Il n'établit pas d'interpolation dans les régions non vues. Séparez les images ou la trajectoire de la caméra en vues d'entraînement, de validation et de test, et fixez l'espacement des vues, le chevauchement, les objets en mouvement et la source de la pose de la caméra. Si les poses sont estimées, enregistrez également leur incertitude.

Le PSNR, le SSIM et le LPIPS peuvent mesurer la similarité d'images, mais ils mesurent l'apparence. L'évaluation géométrique doit comparer séparément la profondeur, les points, les normales, les poses de la caméra et l'erreur de reprojection. Une représentation floue peut améliorer le score d'une image tout en plaçant incorrectement un mur ou une structure fine.

Conditions d'échec courantes

  • Les miroirs, les surfaces transparentes, les reflets et les variations d'éclairage remettent en cause l'hypothèse selon laquelle un point a une apparence cohérente.

  • Les régions situées en dehors de la trajectoire d'entraînement ou cachées par une occlusion peuvent sembler plausibles sans preuve solide.

  • Les personnes, véhicules ou plantes en mouvement, traités comme une géométrie statique, peuvent créer des images fantômes et des surfaces dupliquées. Si les poses ou l'échelle des images SfM sont instables, les images rendues seules ne permettent pas d'en identifier la cause.

Résumé

Neural 3D apprend une représentation de la scène dépendante du point de vue à partir d'images et de poses. NeRF et 3D Gaussian Splatting utilisent des représentations et des stratégies de rendu différentes, mais les deux nécessitent une séparation claire entre la reconstruction de la vue d'entraînement et la généralisation à partir de la vue de test. Il est essentiel d'enregistrer indépendamment la qualité visuelle, la géométrie, l'erreur de pose, le contenu dynamique et les divisions de vue avant d'interpréter un résultat.

Vérifiez votre compréhension
Un PSNR élevé sur la vue d'entraînement prouve-t-il que la géométrie 3D est correcte ?

Non.

Vérifiez séparément les vues mises de côté, les métriques de profondeur ou de nuage de points, et l'erreur de pose de la caméra. ## Références - [Mildenhall et al., NeRF : Représentation de scènes sous forme de champs de radiance neuronaux pour la synthèse de vues](https://arxiv.org/abs/2003.08934) - [Kerbl et al., Splatting gaussien 3D pour le rendu de champs de radiance en temps réel](https://arxiv.org/abs/2308.04079)

What to read next

Review camera poses and sparse points from input imagesIntroduction à la reconstruction 3D à partir du mouvement — Reconstituer simultanément la 3D et les positions de la caméra à partir d'un ensemble de photos non ordonnéesReview classical dense reconstruction from multiple viewsIntroduction à la stéréoscopie multivue — Remplir un nuage de points épars pour obtenir une forme 3D denseReview the backgroundEstimation de la profondeur monoculaire — De l'ordre relatif à la distance métrique