Contents — find the section you need

Los métodos 3D neuronales aprenden una representación de la escena a partir de múltiples imágenes y poses de cámara, y luego renderizan una imagen desde un punto de vista no capturado. Mientras que la SfM estima principalmente poses y puntos dispersos, y la MVS reconstruye principalmente geometría densa, el 3D neuronal también modela cómo se ve una escena desde una posición y dirección de visualización.

En resumen

  • NeRF representa una escena como una función que devuelve densidad y radiancia a partir de la posición y la dirección de visualización; 3D Gaussian Splatting optimiza muchos elementos gaussianos 3D explícitos.

  • Reproducir bien las vistas de entrenamiento no prueba que las vistas o la geometría no vistas sean correctas.

  • Separe las métricas de imagen, como PSNR/SSIM, de la evaluación geométrica de profundidad, puntos, normales y poses. La síntesis de vistas novedosas no es una prueba de precisión de la exploración.

Diagram 1 · Use the button to switch views
Entrenamiento y evaluación neuronal 3D

Opciones de representación

NeRF evalúa (\sigma,\mathbf{c})=F_\theta(\mathbf{x},\mathbf{d}) en muestras a lo largo de los rayos de la cámara y utiliza renderizado volumétrico para formar una imagen. El entrenamiento minimiza la diferencia entre las imágenes renderizadas y de entrada. El splatting gaussiano 3D proyecta gaussianas con posición, covarianza, opacidad y color, y optimiza estos elementos a partir de puntos dispersos.

Representación Ventajas Advertencias
Familia NeRF Campo de radiancia continuo y apariencia dependiente de la vista Muchas muestras de rayos; el entrenamiento y el renderizado dependen de la configuración
Splatting gaussiano 3D Los elementos proyectados explícitos se pueden renderizar rápidamente Valida la densidad, la geometría no visible y los objetos dinámicos por separado
Malla / MVS La geometría de la superficie es explícita y fácil de inspeccionar Sensible a reflejos, oclusiones, agujeros y texturas débiles

Separación de vistas de entrenamiento y evaluación

Renderizar cada imagen de entrada utilizada para el entrenamiento solo mide la reconstrucción de las vistas observadas. No establece la interpolación en regiones no vistas. Divide las imágenes o la trayectoria de la cámara en vistas de entrenamiento, validación y reserva, y fija el espaciado entre vistas, la superposición, los objetos en movimiento y la fuente de la pose de la cámara. Si se estiman las poses, registra también su incertidumbre.

PSNR, SSIM y LPIPS pueden medir la similitud de las imágenes, pero miden la apariencia. La evaluación geométrica debe comparar por separado la profundidad, los puntos, las normales, las poses de la cámara y el error de reproyección. Una representación borrosa puede mejorar la puntuación de una imagen, pero coloca incorrectamente una pared o una estructura delgada.

Condiciones de fallo comunes

  • Los espejos, las superficies transparentes, los reflejos y la iluminación cambiante invalidan la suposición de que un punto tiene una apariencia consistente.

  • Las regiones fuera de la trayectoria de entrenamiento o ocultas por oclusión pueden parecer plausibles sin pruebas sólidas.

  • Las personas, vehículos o plantas en movimiento, tratados como geometría estática, pueden crear imágenes fantasma y superficies duplicadas.

  • Si las poses o la escala de SfM son inestables, las imágenes renderizadas por sí solas no permiten identificar la causa.

Resumen

Neural 3D aprende una representación de escena dependiente de la vista a partir de imágenes y poses. NeRF y 3D Gaussian Splatting utilizan diferentes representaciones y estrategias de renderizado, pero ambas requieren una clara separación entre la reconstrucción de la vista de entrenamiento y la generalización de la vista de prueba. Registre la calidad visual, la geometría, el error de pose, el contenido dinámico y las divisiones de vista de forma independiente antes de interpretar un resultado.

Comprueba tu comprensión
¿Un PSNR alto en la vista de entrenamiento demuestra que la geometría 3D es correcta?

No. Compruebe por separado las vistas no vistas, las métricas de profundidad o nube de puntos y el error de pose de la cámara.

## Referencias - [Mildenhall et al., NeRF: Representación de escenas como campos de radiancia neuronal para la síntesis de vistas](https://arxiv.org/abs/2003.08934) - [Kerbl et al., Distribución gaussiana 3D para la renderización de campos de radiancia en tiempo real](https://arxiv.org/abs/2308.04079)

What to read next

Review camera poses and sparse points from input imagesIntroducción a la reconstrucción 3D a partir de imágenes: cómo recuperar la posición de la cámara y los datos 3D a partir de un conjunto de fotos sin ordenar.Review classical dense reconstruction from multiple viewsIntroducción a la estereoscopía multivista: cómo rellenar una nube de puntos dispersa para formar una figura 3D densa.Review the backgroundEstimación de profundidad monocular: del orden relativo a la distancia métrica.