Contents — find the section you need
Lo que recupera la técnica de Structure from Motion es una nube de puntos 3D dispersa que conecta únicamente puntos característicos. Se puede distinguir el contorno de un edificio o las esquinas de su textura, pero las paredes y las superficies curvas quedan prácticamente sin puntos, y el resultado no puede utilizarse como "forma" tal cual. La técnica Multi-View Stereo (MVS) toma como base las poses de la cámara ya conocidas de SfM o calibración de cámara, y estima la profundidad de casi cada píxel de la imagen, completándola en una densa nube de puntos o malla. La división del trabajo —la estimación de la pose es tarea de SfM, la recuperación densa de la forma es tarea de MVS— es el punto de partida para comprender la relación entre estas dos tecnologías.
0. Resumen de 30 segundos
-
MVS es una tecnología que estima la profundidad densa, píxel a píxel, a partir de múltiples imágenes con poses conocidas, y la integra en una nube de puntos o malla. Es el proceso posterior que completa la nube de puntos dispersa de SfM para formar una estructura densa.
-
Su principio fundamental es la fotoconsistencia: se asume la profundidad correcta para un punto 3D, y los píxeles correspondientes en las múltiples imágenes que lo captan deben tener un color y brillo similares.
-
Existen dos enfoques clásicos representativos: el barrido de planos, que evalúa la consistencia al barrer los candidatos de profundidad como planos, y el basado en parches (PMVS), que expande y filtra iterativamente pequeños parches.
-
En los últimos años, los métodos basados en aprendizaje profundo que procesan un volumen de costos mediante convolución (como MVSNet) superan cada vez más a los métodos clásicos en precisión y robustez.
-
Los mapas de profundidad multivista resultantes se utilizan directamente como nube de puntos o se convierten en una malla mediante fusión TSDF o reconstrucción de superficie de Poisson. La estimación de profundidad en tiempo real con cámaras estéreo o de profundidad comparte el principio de consistencia fotográfica, pero difiere en el número de puntos de vista, la posibilidad de procesamiento fuera de línea y el presupuesto computacional.
1. ¿Qué información recibe como entrada y qué problema resuelve?
MVS recibe como entrada la siguiente información, ya obtenida mediante SfM o calibración de la cámara:
- La pose de la cámara y los parámetros intrínsecos P_i = K_i[R_i\mid\mathbf{t}_i] de cada imagen i (considerados conocidos).
- Un conjunto de imágenes \{I_1,\dots,I_N\} que capturan la escena objetivo.
La salida es un mapa de profundidad denso \{D_i\} para cada imagen (o un conjunto seleccionado de imágenes de referencia), o la nube de puntos/malla obtenida al integrarlas. Si la salida de SfM (la nube de puntos dispersa y las poses de la cámara) es el "esqueleto", MVS es el proceso que le da "carne". No se puede recuperar una forma densa con poses desconocidas; MVS siempre se ejecuta después de SfM o la calibración, y conviene tener en cuenta este orden desde el principio.
2. ¿Por qué no basta con una nube de puntos dispersa?
La razón por la que SfM no genera directamente una nube de puntos densa es que su entrada depende de la coincidencia de puntos característicos. Como vimos en la Introducción a la Detección de Características, solo los píxeles "distintivos" (esquinas, bordes) se pueden detectar y coincidir de forma estable. Una región con textura uniforme, como una pared lisa, no tiene puntos característicos, lo que deja un gran hueco en la nube de puntos 3D de SfM.
Por otro lado, MVS puede aprovechar la fuerte restricción de que las poses ya se conocen, por lo que no necesita puntos característicos. Para cualquier píxel, puede evaluar directamente "¿este candidato a profundidad se mantiene consistente en las demás imágenes?". Esto abre la posibilidad de estimar la profundidad incluso para una pared con poca textura, siempre que haya al menos algún patrón o sombreado con el que trabajar (una superficie completamente sin características sigue siendo un punto débil, como se explica más adelante).
3. El principio fundamental: Fotoconsistencia
Casi todos los métodos MVS se basan en la suposición de fotoconsistencia. Supongamos que la profundidad del punto 3D correspondiente al píxel \mathbf{u} en una imagen de referencia es d; Ese punto 3D se puede recuperar como
y la suposición de fotoconsistencia es que reproyectarlo en otra imagen k, en el píxel \mathbf{u}' = \pi_k(\mathbf{X}(\mathbf{u},d)), debería dar un color y brillo similares a los de I_{\text{ref}}(\mathbf{u}). Esto se entiende mejor como una generalización, de dos puntos de vista a los puntos de vista N, de la búsqueda de disparidad de la cámara estéreo: el proceso, descrito en Cómo funcionan las cámaras de profundidad y Cómo funcionan las cámaras estéreo, de encontrar píxeles correspondientes entre las imágenes izquierda y derecha mediante la igualación del brillo. De hecho, la profundidad para una cámara estéreo de dos ojos se calcula mediante la fórmula simple:
utilizando la distancia focal f, la longitud de la línea base B y la disparidad d_{\text{disp}}. MVS consiste precisamente en esta operación de "búsqueda de disparidad y conversión a profundidad", extendida a cualquier número de cámaras en cualquier configuración.
Una implementación típica utiliza una pequeña ventana W alrededor del píxel y mide esta concordancia mediante la correlación cruzada normalizada (NCC).
\mathbf{x}' es el punto correspondiente obtenido al mapear \mathbf{x} en la imagen k, asumiendo un plano local en el candidato de profundidad d. \mathrm{NCC} es robusto ante cambios en la escala de brillo y el desplazamiento, por lo que funciona incluso con cierta diferencia de exposición o iluminación entre las imágenes. El cálculo de esta puntuación de concordancia para cada par de imágenes y cada candidato de profundidad, y la selección de la profundidad con la mejor puntuación, conforman la estructura computacional de MVS.
4. El flujo de trabajo básico
La forma básica clásica de MVS es una estructura de dos etapas: primero, se elige el método de barrido de planos o el basado en parches para encontrar el mapa de profundidad denso de cada imagen, y luego se fusionan en una forma 3D consistente en la segunda etapa. Los métodos modernos basados en aprendizaje profundo siguen en gran medida esta misma estructura de dos etapas, reemplazando los mecanismos internos de estimación de profundidad con una red neuronal.
5. El método de barrido de planos
El método de barrido de planos se remonta a un enfoque de coincidencia de múltiples imágenes con escaneo espacial que Collins propuso en CVPR 1996. Alinea planos virtuales, espaciados a intervalos regulares, perpendiculares al eje óptico de la cámara de referencia (o orientados según la escena) dentro del cono de visión de la cámara de referencia, y evalúa a medida que barre la profundidad de superficial a profunda.
Suponiendo un plano a cierta profundidad d, se pueden mapear los puntos de ese plano. Se transforma la imagen de referencia en otra imagen mediante una transformación de homografía. Utilizando una transformación del tipo H = K_k(R+\mathbf{t}\mathbf{n}^\mathsf{T}/d)K_{\text{ref}}^{-1}, descrita en la Introducción a la Homografía, la otra imagen I_k se deforma al punto de vista de referencia. La fotoconsistencia (como la NCC de la sección anterior) se calcula en cada píxel entre la imagen deformada y la imagen de referencia, y el coste se acumula para cada candidato de profundidad.
Una vez calculado el coste para cada candidato de profundidad, se elige la profundidad de coste mínimo por píxel. Esta es una búsqueda de profundidad discreta, que se combina bien con la paralelización en GPU, evaluando múltiples hipótesis de profundidad simultáneamente. Muchas implementaciones combinan esto con la agregación de costes semilocal (regularización similar a la Coincidencia Semiglobal), interpolando suavemente la profundidad a partir de la información vecina, incluso en regiones con poca textura. El módulo de reconstrucción densa de COLMAP también adopta este enfoque. Similar al método Plane-Sweep, la optimización de la selección de vista por píxel (Pixelwise View Selection) —el artículo de Schönberger et al. en ECCV 2016 es un ejemplo representativo.
6. El método basado en parches (PMVS)
En lugar de barrer la profundidad píxel a píxel, el método basado en parches genera y expande directamente un conjunto de pequeños parches rectangulares que cubren la superficie de la escena. Un ejemplo representativo es PMVS (Patch-based Multi-View Stereo), publicado por Furukawa y Ponce en IEEE TPAMI en 2010.
El procesamiento repite tres etapas: "coincidencia, expansión y filtrado".
-
Coincidencia: primero se genera un pequeño número de parches iniciales a partir de puntos de correspondencia fáciles de detectar como puntos característicos, como las esquinas SIFT o Harris. Cada parche contiene una posición central, una dirección normal y el conjunto de imágenes que ven ese punto (visibilidad).
-
Expansión: se propagan nuevos parches en la vecindad de los parches iniciales, ampliando el área cubierta. píxeles circundantes. La posición y la normal de cada parche propagado se optimizan localmente para maximizar la fotoconsistencia con las imágenes circundantes.
-
Filtro: elimina los parches con contradicciones de visibilidad (como cuando un parche es supuestamente visible a pesar de estar detrás de otro) o con baja fotoconsistencia.
A diferencia de Plane-Sweep, que determina la profundidad de forma independiente para cada píxel, PMVS incorpora la información adicional de la normal del parche, por lo que tiende a tener una mayor precisión de reconstrucción para superficies oblicuas. Por otro lado, debido a que se basa en la expansión y el filtrado iterativos, la expansión no progresa bien en regiones con pocos parches iniciales o textura deficiente, y la reconstrucción tiende a presentar huecos.
7. Métodos basados en aprendizaje profundo: la idea del volumen de coste
En los últimos años, los métodos que representan la concordancia por candidato de profundidad no con una métrica diseñada manualmente (como NCC), sino con características aprendidas por una red neuronal convolucional y un volumen de coste, se han popularizado. Un ejemplo representativo es MVSNet, publicado Por Yao et al. en ECCV 2018.
MVSNet obtiene un mapa de características de cada imagen mediante un extractor de características entrenado, asume planos de profundidad discretos dentro del frustum de visión de la cámara de referencia y alinea el mapa de características de cada imagen con el punto de vista de referencia mediante una deformación homográfica diferenciable. Combina la varianza de los mapas de características de múltiples imágenes en un único volumen de coste, lo regulariza con convolución 3D y, a continuación, realiza una regresión de la profundidad mediante una función softmax en la dirección de la profundidad. Su estructura básica sigue la idea de Plane-Sweep de "explorar candidatos de profundidad y evaluarlos", pero la diferencia con los métodos clásicos radica en que el cálculo de la fotoconsistencia en sí mismo se vuelve aprendible.
Los métodos basados en aprendizaje tienden a comportarse de forma más robusta en condiciones donde las métricas de fotoconsistencia diseñadas manualmente presentan dificultades (patrones repetitivos, textura débil), siempre que los datos de entrenamiento incluyan situaciones similares. Por otro lado, el rendimiento puede degradarse en escenas muy alejadas de la distribución del conjunto de datos de entrenamiento (materiales desconocidos, extremos). iluminación).
8. Fusión y mallado de mapas de profundidad
Dado que los mapas de profundidad multivista se estiman de forma independiente, superponerlos como puntos 3D tal cual genera contradicciones por ruido y oclusión (puntos ligeramente desplazados en la misma ubicación que se acumulan en varias capas, o discrepancias en la profundidad entre diferentes puntos de vista). La fusión es el proceso que consolida estos mapas de profundidad en una única representación coherente.
-
Fusión como nube de puntos: se adoptan solo los píxeles donde la profundidad es coherente entre los puntos de vista, se descartan los de baja confianza y se integran. COLMAP y otros generan una nube de puntos densa de esta manera.
-
Fusión TSDF (Función de Distancia con Signo Truncada): un método volumétrico, propuesto por Curless y Levoy en SIGGRAPH 1996, que divide el espacio en vóxeles y acumula una distancia con signo en cada uno. Ampliamente utilizado en la fusión de profundidad y cámara en tiempo real (como KinectFusion), y también aplicable a la fusión de mapas de profundidad multivista.
-
Mallado: a partir de una nube de puntos o un campo de distancias con signo, métodos como la Reconstrucción de Superficies de Poisson (2006), de Kazhdan et al., generan una malla poligonal suave. La adición de mapeo de texturas completa un modelo 3D que también se puede utilizar visualmente.
9. Comparación de Algoritmos Representativos
| Aspecto | Barrido de Planos | Basado en Parches (PMVS) | Basado en Aprendizaje (familia MVSNet) |
|---|---|---|---|
| Principio | Barre planos de profundidad, evalúa la fotoconsistencia por píxel | Expande y filtra pequeños parches de forma iterativa | Regulariza un volumen de costos con una CNN y realiza una regresión de la profundidad |
| Precisión | Depende de la resolución de profundidad y del diseño de agregación de costos; de moderada a alta | Tiende a ser preciso para formas locales oblicuas o complejas | Alta precisión en condiciones cercanas a los datos de entrenamiento |
| Costo computacional | Fácilmente paralelizable en GPU, rápido | Tiende a ser Más lento que Plane-Sweep debido al procesamiento iterativo | Inferencia rápida tras el entrenamiento; el coste del entrenamiento es independiente |
Robustez | Débil en regiones con poca textura | Tiende a dejar huecos en regiones con pocos parches iniciales | Comparativamente robusto ante texturas débiles o patrones repetitivos |
Dificultad de implementación | Moderada (deformación de homografía y agregación de costes) | Alta (gestión de visibilidad y diseño de expansión iterativa) | Alta (requiere datos de entrenamiento y diseño de red) |
Implementaciones representativas | COLMAP denso, numerosas herramientas de fotogrametría comerciales | PMVS/CMVS | MVSNet, métodos posteriores basados en aprendizaje |
10. Relación con las cámaras estéreo y de profundidad
MVS comparte su principio fundamental —«encontrar la profundidad a partir de la correspondencia entre múltiples puntos de vista»— con las cámaras estéreo y de profundidad, pero ocupan posiciones diferentes.
-
Las cámaras estéreo utilizan una configuración fija de dos ojos, lo que restringe la búsqueda de disparidad a una dimensión a lo largo de la línea epipolar, y están diseñadas para el procesamiento en tiempo real. El método Plane-Sweep de MVS puede entenderse como una generalización de esta búsqueda de disparidad a cualquier número de cámaras en cualquier configuración.
-
Las cámaras de profundidad (luz estructurada, ToF, estéreo activa) proyectan luz activamente, lo que les permite obtener distancias de forma estable incluso en superficies con poca textura. Dado que MVS se basa únicamente en la fotoconsistencia pasiva, presenta una desventaja inherente en superficies con pocos patrones, una clara diferencia con las cámaras de profundidad activas.
-
MVS es fundamentalmente offline, construyendo formas de alta precisión y densidad a partir de muchas imágenes (de decenas a cientos), mientras que las cámaras estéreo y de profundidad están optimizadas para generar profundidad fotograma a fotograma, en tiempo real.
Dependiendo de la aplicación, los robots o la realidad aumentada que requieren rendimiento en tiempo real son adecuados para las cámaras estéreo/de profundidad, mientras que los modelos 3D offline de alta precisión para la documentación del patrimonio cultural, El levantamiento arquitectónico o la fotogrametría son adecuados para MVS.
11. Condiciones difíciles y casos de fallo comunes
-
Superficies con poca textura o uniformes: las paredes blancas, los suelos lisos y los cielos ofrecen poca información sobre la fotoconsistencia, lo que provoca que la profundidad quede indeterminada o se vea afectada por el ruido ambiental.
-
Objetos especulares, transparentes o translúcidos: el vidrio, las superficies de agua y los brillos metálicos cambian de apariencia según el punto de vista, lo que invalida la suposición de fotoconsistencia.
-
Patrones repetitivos: las baldosas, los ladrillos y las hileras de cultivos en un campo pueden producir "soluciones fantasma", donde una profundidad incorrecta aún muestra una alta fotoconsistencia local.
-
Oclusión: las regiones visibles solo desde algunos puntos de vista pueden terminar evaluando la fotoconsistencia con la imagen incorrecta si la visibilidad se estima erróneamente, lo que invalida la estimación de profundidad.
-
Puntos de vista insuficientes o paralaje: si el número de puntos de vista que cubren la imagen es pequeño o hay paralaje. Demasiado pequeño, simplemente no hay resolución disponible en la dirección de profundidad.
12. Opciones prácticas
-
Si las poses ya se conocen mediante SfM o calibración, y el objetivo es la reconstrucción 3D offline con máxima precisión (documentación del patrimonio cultural, levantamiento arquitectónico, fotogrametría para producción de vídeo), una implementación de la familia Plane-Sweep, como la densa canalización de COLMAP, es un punto de partida accesible.
-
Si la precisión para superficies oblicuas o formas locales complejas es una prioridad, considere un enfoque basado en parches de la familia PMVS, o una implementación híbrida que incorpore sus ideas.
-
Si sabe de antemano que la escena tiene poca textura o muchos patrones repetitivos, los métodos basados en aprendizaje (familia MVSNet) tienden a ser más robustos. Dado que el rendimiento puede degradarse en escenas fuera de la distribución de datos de entrenamiento, evalúe con datos cercanos a su dominio objetivo antes de adoptar uno.
-
Para aplicaciones que requieren rendimiento en tiempo real (robots, RA/RV, detección de obstáculos en conducción autónoma), considere [estéreo]. Se pueden usar cámaras de profundidad (o cámaras de profundidad) en lugar de MVS. El principal ámbito de MVS es la reconstrucción offline de alta densidad y alta precisión.
-
Si el resultado final debe ser una malla o un modelo 3D texturizado, elija la fusión TSDF o la reconstrucción de superficie de Poisson en la etapa de fusión de mapas de profundidad; si una nube de puntos es suficiente, puede detenerse ahí.
13. Resumen
Multi-View Stereo toma como datos las poses de la cámara ya conocidas a partir de SfM o calibración, y recupera la profundidad densa utilizando la fotoconsistencia como clave. Los dos enfoques clásicos, Plane-Sweep y Patch-based, presentan diferentes ventajas y desventajas, y en los últimos años, los métodos de la familia MVSNet, que aprenden un volumen de costos, están mejorando aún más la precisión y la robustez. Todo el proceso culmina con la fusión y la creación de la malla de los mapas de profundidad resultantes, y la comprensión de la división (MVS). Sacrificar el rendimiento en tiempo real por la precisión, frente a las cámaras estéreo/de profundidad que priorizan el rendimiento en tiempo real, es la base para tomar la decisión práctica correcta.
¿Una nube de puntos más densa garantiza una geometría más precisa?
Un mayor número de profundidades incorrectas no mejora la precisión. Comprueba la consistencia multivista, la oclusión, la reflexión y la textura por separado de la densidad.
Referencias
- Collins, A Space-Sweep Approach to True Multi-Image Matching (CVPR 1996)
- Furukawa & Ponce, Accurate, Dense, and Robust Multi-View Stereopsis (IEEE TPAMI, 2010)
- Seitz, Curless, Diebel, Scharstein & Szeliski, A Comparación y evaluación de algoritmos de reconstrucción estéreo multivista (CVPR 2006)
- Schönberger, Zheng, Pollefeys y Frahm, Selección de vista píxel a píxel para estéreo multivista no estructurado (ECCV 2016)
- Yao, Luo, Li, Fang y Quan, MVSNet: Inferencia de profundidad para estéreo multivista no estructurado (ECCV 2018)
- Curless y Levoy, Un método volumétrico para construir modelos complejos a partir de imágenes de rango (SIGGRAPH 1996)
- Kazhdan, Bolitho y Hoppe, Reconstrucción de superficie de Poisson (Simposio Eurographics sobre procesamiento de geometría, 2006)
- Documentación oficial de COLMAP: Reconstrucción densa
Comentarios
Inicia sesión para continuar.
Todavía no hay datos.