Contents — find the section you need
Al analizar un vídeo fotograma a fotograma, no resulta intuitivamente obvio qué parte de la imagen se ha movido ni cuánto. El flujo óptico representa, como un vector, la posición del brillo de cada píxel en el siguiente fotograma. Se convierte en un lenguaje común para cualquier proceso que implique movimiento: predicción de colisiones en vehículos autónomos, autolocalización de drones, análisis deportivo e interpolación de vídeo.
0. Resumen de 30 segundos
-
El flujo no es "la velocidad del objeto en sí", sino su movimiento aparente en la imagen. En él se combinan el movimiento de la cámara, el movimiento del objeto y la profundidad.
-
La ecuación de constancia de brillo proporciona una sola ecuación por píxel, por lo que debe resolverse añadiendo una suposición de suavidad de ventana local, puntos característicos o regularización.
-
El método de Lucas-Kanade trata una ventana pequeña como una única velocidad: un método de seguimiento disperso. El método de Horn-Schunck utiliza la suavidad en toda la imagen: un método de estimación densa.
-
Los grandes desplazamientos requieren una pirámide de imágenes; La oclusión, los reflejos y el desenfoque requieren medidas de confianza y el manejo de valores atípicos. El efecto de obturador rodante también exige la corrección de la diferencia en la sincronización de las filas.
-
Los métodos basados en aprendizaje, como RAFT, son muy precisos, pero solo deben adoptarse tras comprobar la memoria de la GPU, el comportamiento fuera de la distribución, el rendimiento en tiempo real y las licencias.
1. De la constancia de brillo a la ecuación de restricción de flujo
Figura 1: Una pirámide maneja primero los grandes desplazamientos y luego refina un campo vectorial denso a escalas más finas. Las máscaras de confianza y oclusión deben desplazarse con los vectores.
Si un patrón pequeño y estacionario se mueve entre fotogramas, podemos idealizarlo como si tuviera brillo constante.
Una expansión de Taylor de primer orden junto con \Delta t\to0 da como resultado:
Dado que hay dos componentes de velocidad desconocidas (u,v) pero solo una ecuación, esta por sí sola no se puede resolver. En un borde, el movimiento a lo largo de la dirección del borde es invisible; en una región plana, No hay gradiente alguno. Este es el problema de la apertura.
2. Lucas-Kanade y Horn-Schunck
Lucas-Kanade asume que la velocidad es la misma en toda una ventana local W y minimiza el error cuadrático resultante.
Utiliza solo las esquinas donde la matriz de gradiente está suficientemente bien condicionada y combina esto con la misma pirámide y actualización iterativa que se usa en el seguimiento de puntos característicos (véase la sección anterior). calcOpticalFlowPyrLK de OpenCV es una implementación de esta familia.
Horn-Schunck trata el campo de flujo en toda la imagen como la incógnita y minimiza simultáneamente la restricción de brillo y la suavidad de la velocidad.
Un valor mayor de \alpha produce un campo de flujo más suave; uno menor permite discontinuidades locales. El suavizado a través del contorno de un objeto mezcla las velocidades de diferentes objetos, por lo que se requieren pérdidas robustas. o bien se utiliza la regularización que preserva los bordes.
3. Flujo Disperso y Flujo Denso
| Tipo | Puntos estimados | Métodos representativos | Ventajas | Desventajas |
|---|---|---|---|---|
| Disperso | Cientos o miles de puntos, por ejemplo, esquinas | LK, KLT | Ligero, se integra directamente en la estimación de pose | Deja huecos en regiones con poca textura |
| Semidenso | Píxeles con gradiente | VO directo, métodos basados en la matriz hessiana | Equilibra la información geométrica con el coste computacional | No cubre toda la imagen |
| Denso | Casi todos los píxeles | Horn-Schunck, TV-L1, RAFT | Eficaz para objetos en movimiento, fluidos e interpolación | Coste computacional elevado, ambigüedad en los límites de oclusión |
Para la odometría visual, pasar correspondencias dispersas al cálculo geométrico tiende a ser más estable. Por otro lado, enmascarar regiones de peatones en movimiento o utilizar El movimiento píxel a píxel para la interpolación de vídeo requiere un flujo denso. Decidir la densidad necesaria de antemano, para el propósito en cuestión, es más efectivo que simplemente aumentar la capacidad de la GPU.
4. Manejo de grandes desplazamientos, oclusión y cambios de brillo
Una aproximación diferencial de un píxel falla ante grandes movimientos. Se construye una pirámide gaussiana reduciendo la imagen a escalas de 1/2, 1/4 y 1/8; los grandes desplazamientos se estiman a nivel grueso, luego se remuestrean a nivel fino y se refinan iterativamente. Demasiados niveles de la pirámide hacen que los objetos pequeños desaparezcan; muy pocos dejan un rango de búsqueda insuficiente.
Cuando cambia la iluminación, la constancia del brillo falla, por lo que se utilizan la normalización local, la dirección del gradiente, la pérdida robusta de Charbonnier o la diferencia de color relativa. En el límite de un objeto en movimiento, un píxel visible en el fotograma anterior puede quedar oculto en el siguiente (oclusión). Se utilizan indicadores de oclusión, consistencia hacia adelante y hacia atrás, y máscaras de visibilidad en lugar de forzar un seguimiento. Esto.
5. Métodos basados en aprendizaje: Cómo leer RAFT
RAFT (Transformación de Campo Recurrente de Todos los Pares) se caracteriza por calcular la correlación entre todos los pares de píxeles de dos imágenes y luego refinar el flujo con un operador de actualización iterativo. Dado que puede utilizar un conjunto mucho más amplio de candidatos de correspondencia que la "ventana local" de los métodos clásicos, puede ser eficaz en áreas con texturas repetitivas o bajo grandes desplazamientos.
Sin embargo, un error promedio de punto final (EPE) bajo en un conjunto de datos de referencia no garantiza su seguridad en un robot real en condiciones reales. Si la lente de la cámara, la exposición, el obturador rodante, el polvo o la iluminación nocturna difieren de los datos de entrenamiento, la confianza disminuye. La evaluación debe incluir el tiempo de inferencia, la resolución de entrada, el error de cuantización, el controlador de la GPU y la licencia del modelo.
6. Separación del movimiento de la cámara de los objetos dinámicos
Convertir el flujo en movimiento de la cámara requiere la matriz intrínseca de la cámara K y la profundidad Z. En coordenadas normalizadas de un punto de imagen \mathbf{x}, el flujo debido a la traslación de la cámara \mathbf{t} y la velocidad angular \boldsymbol{\omega} se puede expresar conceptualmente como:
El componente traslacional varía con 1/Z —los objetos más cercanos se mueven más que los más lejanos—, mientras que el componente rotacional no depende de la profundidad. El flujo consistente con un único modelo de movimiento, obtenido mediante RANSAC, se trata como fondo; las regiones con grandes residuos se convierten en posibles objetos dinámicos. En escenas con muchos vehículos o peatones, se utilizan la detección de objetos y las máscaras semánticas junto con la estimación geométrica.
7. Métricas de evaluación y medición reproducible
Dado el flujo de referencia (u^*,v^*), el error promedio del punto final es:
Informe no solo la media, sino también el percentil 95 y el error en Límites de oclusión, error en regiones de baja textura y error desglosado por velocidad. Dado que la verdad fundamental es difícil de obtener en hardware real, generalmente se combina a partir de la captura de movimiento, la trayectoria conocida de un brazo robótico, imágenes sintéticas, consistencia hacia adelante y hacia atrás, y el error de reproyección de VO.
Los registros deben conservar las marcas de tiempo de la cámara, la exposición, la resolución, los niveles de la pirámide, el tamaño de la ventana, el número de iteraciones, la GPU/CPU, la temperatura y la confianza del flujo. Incluso con el mismo nombre de algoritmo, los resultados no son comparables si estas condiciones difieren.
8. Resumen
El flujo óptico restringe el movimiento aparente de los píxeles con ecuaciones y lo resuelve utilizando ventanas locales, suavidad de la imagen completa, pirámides de imágenes y correlación basada en aprendizaje. El LK disperso es adecuado para la autolocalización; el flujo denso es adecuado para objetos dinámicos y procesamiento de video. Considerar el movimiento de la cámara frente al movimiento del objeto, la oclusión, la iluminación y el obturador rodante por separado, y evaluar las condiciones de fallo en lugar de solo el error promedio, ayuda a evitar una elección de implementación incorrecta.
¿El movimiento de la imagen es la velocidad física del objeto?
El movimiento de la cámara, el movimiento del objeto y la profundidad afectan al movimiento proyectado. Convertir píxeles por segundo a metros por segundo requiere información geométrica.
Comentarios
Inicia sesión para continuar.
Todavía no hay datos.