Contents — find the section you need
Ni Visual-SLAM ni LiDAR-SLAM funcionan por sí solos en todas partes. Una cámara tiene dificultades en la oscuridad o con movimiento rápido; el LiDAR tiene dificultades en entornos con pocos detalles y es más caro. La clave para superar estas limitaciones es la IMU (Unidad de Medición Inercial), que mide la aceleración y la velocidad angular a alta frecuencia. La odometría visual-inercial (VIO) y la odometría inercial-LiDAR (LIO), que combinan una cámara o un LiDAR con una IMU, se han convertido en la configuración estándar de facto en muchos robots móviles autónomos, drones y dispositivos de realidad aumentada/virtual (RA/RV) actuales. Este artículo parte del principio que explica por qué una IMU por sí sola no puede mantener una estimación de posición, aborda el concepto de fusión de sensores, las dos filosofías de diseño de estimación basada en filtros y en optimización, y finalmente los algoritmos más importantes: ROVIO, OKVIS, VINS-Mono, OpenVINS, LIO-SAM y FAST-LIO2.
Ejemplo de IMU/INS
Ejemplo de LiDARImágenes: Xsens MTi-G (Kallap85, CC BY-SA 4.0) / Livox Mid-40, Horizon y Tele-15 (Dllu, CC BY-SA 4.0), Wikimedia Commons. Sensores de entrada representativos, no una configuración de hardware VIO/LIO requerida.
0. Contenido de este artículo
- Qué mide una IMU y por qué una IMU por sí sola no puede recuperar la posición con el tiempo.
- Las limitaciones de una cámara y un LiDAR, respectivamente, y por qué combinarlos con una IMU funciona tan bien.
- Qué significan VIO y LIO, y en qué se diferencian.
- La diferencia entre las filosofías de diseño basadas en filtros (EKF/MSCKF) y en optimización (grafo factorial).
- Qué aportan ROVIO, OKVIS, VINS-Mono, VINS-Fusion y OpenVINS (VIO), y LIO-SAM, FAST-LIO y FAST-LIO2 (LIO).
- Cómo elegir entre VIO y LIO en la práctica, según el caso de uso.
1. Breve explicación: Qué son una IMU, una VIO y una LIO
En una frase para cada una: **Una IMU (Unidad de Medición Inercial) es un sensor. Este sistema combina un acelerómetro y un giroscopio para medir su propia aceleración y velocidad angular a alta frecuencia, sin referencia alguna a puntos de referencia externos. La odometría visual-inercial (VIO) es la técnica que combina esta unidad de medición inercial (IMU) con una cámara para estimar la posición y orientación propias; la odometría inercial-LiDAR (LIO) realiza la misma función combinando una IMU con un LiDAR.
Una IMU indica, a alta frecuencia (normalmente cientos de Hz hasta aproximadamente 1 kHz), la intensidad de la aceleración y la velocidad de rotación en este preciso instante; sin embargo, su magnitud integrada, la posición, se desvía rápidamente con el tiempo (analizaremos esto en detalle en la Sección 3). Una cámara o un LiDAR, al contrastar con el entorno circundante, pueden proporcionar información sobre la posición relativa, pero solo a baja frecuencia (decenas de Hz), y ambos pierden su funcionalidad por completo en ciertas situaciones: oscuridad, escenas con pocos detalles y movimiento rápido. La idea central de VIO y LIO es combinar esta "IMU de alta frecuencia pero con deriva" con una "cámara/LiDAR de baja frecuencia con modos de fallo dependientes del entorno", de modo que cada una compense las debilidades de la otra.
2. ¿Qué mide realmente una IMU?
Dentro de una IMU existen, en términos generales, dos tipos de sensores.
Un acelerómetro mide una fuerza específica en su sistema de coordenadas. Idealmente, \mathbf{f}_b=R_{wb}^{T}(\mathbf{a}_w-\mathbf{g}_w), donde R_{wb} rota las coordenadas del sensor al sistema de coordenadas global, \mathbf{a}_w es la aceleración en el sistema global y \mathbf{g}_w es la gravedad. Su valor es de aproximadamente 1 g en reposo y casi cero en caída libre ideal. Antes de la integración, se corrige el sesgo, se rota al sistema de coordenadas global y se añade la gravedad. Consulte las definiciones de coordenadas y sesgo en el modelo IMU de OpenVINS.
Un giroscopio mide la velocidad angular del propio sensor. La combinación simultánea de los tres ejes proporciona la velocidad de rotación en los ejes de balanceo, cabeceo y guiñada.
Al combinar estos dos tipos de sensores, una IMU puede generar información de movimiento con seis grados de libertad (tres de traslación y tres de rotación) a alta frecuencia, basándose únicamente en su estado interno, sin referencia alguna a puntos de referencia externos (como un elemento geográfico o una señal de radio). Esta característica de "ausencia total de referencia externa" es, a la vez, la mayor fortaleza y la mayor debilidad de la IMU: su fortaleza reside en su robustez, que se mantiene inalterable incluso en la oscuridad total o dentro de una habitación con paredes de cristal; su debilidad radica en el error acumulativo que analizaremos en la Sección 3.
La salida de una IMU siempre contiene sesgo y ruido. El sesgo es un error de compensación intrínseco al sensor: la salida no es cero incluso cuando el valor real es cero, y varía lentamente con el tiempo debido a factores como los cambios de temperatura (inestabilidad del sesgo). El ruido es una fluctuación aleatoria que se añade con cada lectura. Las IMU MEMS (Sistemas Microelectromecánicos) más económicas tienden a tener mayor sesgo y ruido, y esta es la causa principal de la deriva que se analiza a continuación.
3. Determinación de la posición a partir de una IMU (Integración y deriva)
Recuperar la posición a partir de la salida de la IMU requiere integrar la aceleración dos veces: la velocidad es la integral de la aceleración, y la posición es la integral de la velocidad.
Aquí, p_0 es la posición inicial, v_0 la velocidad inicial y a(s) la aceleración en el instante s. La fórmula en sí es simple, pero la aceleración a(s) que se usa en la práctica siempre lleva el sesgo b que se analiza en la Sección 2. La doble integración de una aceleración que incluye el sesgo, a(s) + b, produce un término de error impulsado por el sesgo de la forma:
que diverge en proporción al cuadrado del tiempo transcurrido. El sesgo del giroscopio, además, distorsiona gradualmente la estimación de la orientación, y ese error de orientación contamina la dirección en la que se integra la aceleración; por lo tanto, el error de posición total tiende a crecer en el orden de O(t^2) a O(t^3). Este fenómeno, donde el error se acumula sin límite con el tiempo, se denomina deriva.
Un valor numérico concreto ayuda a comprenderlo mejor. Supongamos que una IMU MEMS económica tiene un sesgo del acelerómetro de aproximadamente 0.01\,\mathrm{m/s^2}. Tras 10 segundos, el error de posición resultante es de aproximadamente \frac{1}{2} \times 0.01 \times 10^2 = 0.5\,\mathrm{m}. Tras un minuto, el valor asciende a 18\,\mathrm{m}. Un IMU por sí solo solo es fiable para estimar la posición en escalas de tiempo muy cortas (de segundos a unas pocas decenas de segundos), y esta es la razón fundamental por la que un IMU por sí solo no puede funcionar como un sistema de autolocalización. Dicho de otro modo: un IMU destaca en la detección de cambios de alta frecuencia a corto plazo y es deficiente en la determinación de la posición absoluta a largo plazo; un perfil de fortalezas y debilidades exactamente opuesto al de una cámara o un LiDAR.
4. Las cámaras y los LiDAR también tienen sus limitaciones
Si una IMU por sí sola no puede recuperar la posición, lo lógico sería usar una cámara (véase "Visual-SLAM Primer") o un LiDAR (véase "LiDAR-SLAM Technology Trends"). Esto es cierto hasta cierto punto, pero tanto una cámara como un LiDAR tienen sus propias limitaciones.
Las limitaciones de una cámara son la degradación de la imagen en condiciones de poca luz (los puntos característicos, o los gradientes de brillo en los que se basa un método directo, se vuelven imposibles de calcular), los entornos con poca textura (una pared blanca lisa o un suelo de color uniforme no generan puntos de correspondencia) y el desenfoque por movimiento en movimientos rápidos (la imagen se difumina durante el tiempo de exposición, desestabilizando los descriptores de características). Todos estos problemas comparten la misma causa subyacente: la cámara no recibe suficiente señal visual para funcionar correctamente.
Las debilidades del LiDAR radican en entornos con pocos detalles (en un túnel largo o un plano abierto, los métodos de registro de nubes de puntos como ICP/NDT no convergen a una solución única, lo que se conoce como degeneración geométrica) y en el coste del sensor. El LiDAR emite un láser para medir la distancia, por lo que es resistente a la oscuridad y a la contraluz, pero en entornos con geometría dispersa, pierde precisión de forma similar a una cámara.
La debilidad de la IMU, como se explica en la Sección 3, reside en la deriva ilimitada que se acumula con el tiempo y en su incapacidad para recuperar la posición absoluta por sí sola.
Lo importante es que las situaciones en las que fallan estos tres sensores apenas se solapan. Una IMU sigue funcionando sin problemas en la oscuridad, donde una cámara tiene dificultades, y continúa proporcionando información de movimiento de alta frecuencia incluso en el momento en que una cámara o un LiDAR pierden sus características. Las observaciones de la cámara y el LiDAR limitan la deriva mediante la geometría del entorno. Sin embargo, no garantizan una precisión de posición absoluta a largo plazo sin restricciones como un mapa conocido, GNSS o el cierre de un bucle. Esta complementariedad es el punto de partida para la fusión de sensores que se analiza en la siguiente sección.
5. La idea de la fusión de sensores
La fusión de sensores es el marco para combinar las características de error y las fortalezas de varios sensores para obtener una estimación más precisa, de mayor frecuencia y más robusta que la que obtendría cualquier sensor por separado (para una idea general de la fusión, consulte "Introducción a la fusión de sensores"). El esqueleto compartido por VIO y LIO se puede organizar como un bucle Predicción-Actualización:
Figura 1 — La IMU (de alta frecuencia) continúa prediciendo el estado mediante propagación (integración). Observaciones A partir de la coincidencia de características/puntos con la cámara/LiDAR (a baja frecuencia), se corrige esa predicción en el paso de actualización. El sesgo de la IMU estimado durante esa corrección se retroalimenta a la siguiente propagación, suprimiendo continuamente la acumulación de deriva.
Este bucle tiene dos puntos clave. Primero, la propagación impulsada por la IMU se ejecuta a alta frecuencia de forma continua y nunca deja de predecir la pose, incluso en los momentos en que no hay observación de la cámara/LiDAR disponible (oscuridad, baja textura, espacio con pocas características, movimiento rápido). Segundo, el paso de actualización, que solo se activa cuando llega una observación de la cámara/LiDAR, reduce la deriva que de otro modo se acumularía sin límite solo con la IMU, y actualiza simultáneamente la estimación del propio sesgo de la IMU, retroalimentándola a la propagación. Esta combinación —«predicción que se ejecuta continuamente a alta frecuencia» más «corrección que reduce los errores en las direcciones restringidas por la observación»— es la filosofía de diseño compartida por VIO y LIO.
6. VIO (Odometría Visual-Inercial)
VIO La odometría visual-inercial (OVI) es la configuración en la que una cámara desempeña el rol de sensor de actualización dentro de este marco. La combinación de la predicción de alta frecuencia de la IMU con las observaciones de puntos característicos de la cámara resuelve la ambigüedad de escala que afecta a la odometría visual monocular (mencionada en la Sección 4: el hecho de que las imágenes monoculares por sí solas no pueden recuperar una distancia métrica real), utilizando la información de aceleración métrica de la IMU. Y en movimientos rápidos, donde una cámara tiene dificultades, la IMU sigue proporcionando cambios de orientación a alta frecuencia, lo que reduce considerablemente la probabilidad de que el seguimiento falle por completo.
La OVI se divide además en configuraciones acopladas de forma flexible y acopladas de forma estrecha, dependiendo de cómo estén conectadas la cámara y la IMU. Un sistema acoplado de forma flexible calcula la estimación de pose de la cámara y la estimación de pose de la IMU de forma independiente y luego fusiona ambos resultados; es sencillo de implementar, pero debido a que la IMU no puede aprovechar la estructura de error interna de la cámara, La estimación del lado de la cámara (que indica qué observación de características es más o menos incierta) pierde precisión. Un sistema estrechamente acoplado trata los datos brutos de la IMU y las observaciones de características de la imagen como un único problema de estado estimado conjuntamente desde el principio; la implementación es más compleja, pero se utiliza toda la información de ambos sensores, lo que resulta en una mayor precisión. Las implementaciones modernas representativas de VIO que analizamos en las Secciones 8, 9 y 10 (OKVIS, VINS-Mono, OpenVINS y otras) adoptan un acoplamiento estrecho.
7. LIO (Odometría Inercial LiDAR)
LIO (Odometría Inercial LiDAR) utiliza el mismo marco, pero con un LiDAR desempeñando el rol de actualización. Las nubes de puntos LiDAR capturan la geometría del entorno directamente y con alta precisión, pero un solo escaneo tarda decenas o cientos de milisegundos en completarse, y si el sensor se mueve durante ese intervalo, la nube de puntos resultante se distorsiona (distorsión por movimiento). Con la información de orientación de alta frecuencia de la IMU disponible, este sistema El movimiento durante el escaneo se puede corregir, reconstruyendo una nube de puntos sin distorsiones.
Al igual que con VIO en la Sección 6, en entornos geométricamente degenerados con los que LIO tiene dificultades (túneles largos, planos abiertos), la predicción continua de la pose a corto plazo de la IMU reduce considerablemente la probabilidad de divergencia en el registro de la nube de puntos (métodos como ICP/NDT). En la práctica, LIO también se implementa predominantemente como un sistema estrechamente acoplado: LIO-SAM y FAST-LIO/FAST-LIO2, descritos en la Sección 10, adoptan este diseño de acoplamiento estrecho.
8. Basado en filtros (Filtro de Kalman / EKF / MSCKF)
El núcleo de VIO y LIO —la fusión de predicción y observación— se implementa bajo una de dos filosofías de diseño generales: Basado en filtros o el enfoque Basado en optimización, que se describe en la siguiente sección.
La base del enfoque basado en filtros es el Filtro de Kalman, un marco que alterna Actualización basada en predicción y observación para derivar recursivamente la estimación de estado óptima para un sistema con dinámica lineal. Para un problema como VIO/LIO, donde la composición de la integración de la IMU (composición de pose) y la proyección de la cámara son inherentemente no lineales, se utiliza la extensión no lineal: el Filtro de Kalman Extendido (EKF). Un EKF linealiza cada función no lineal alrededor de la estimación actual (una expansión de Taylor de primer orden) y luego aplica las mismas ecuaciones de actualización que un Filtro de Kalman ordinario.
Aquí, \hat{x}_k^{-} es el estado predicho por la propagación, z_k la observación real, h(\cdot) el modelo de observación que predice una observación a partir del estado, y K_k la ganancia de Kalman: el peso que decide cuánto confiar en la predicción frente a la observación. P_k^{-} es la covarianza (incertidumbre) de la Estado predicho, H_k el jacobiano que linealiza el modelo de observación, y R la covarianza del ruido de observación. Intuitivamente, cuanto mayor sea la incertidumbre predicha P_k^{-} en relación con el ruido de observación R, mayor será la ganancia de Kalman K_k, y más se incorporará la información de la observación z_k a la corrección del estado.
Implementar un VIO basado en EKF requiere ingenuamente incluir cada punto característico individual de la imagen en el vector de estado, y el costo computacional aumenta rápidamente a medida que crece el número de puntos característicos. El MSCKF (Filtro de Kalman de Restricción Multiestado), propuesto por Mourikis y Roumeliotis en 2007, resuelve precisamente este problema. El MSCKF no incluye los puntos característicos en el estado del filtro; en su lugar, mantiene múltiples poses de la cámara (una ventana deslizante) en el estado. y actualiza el estado utilizando únicamente la restricción geométrica de que se haya observado el mismo punto característico en varias de esas poses. Al excluir los puntos característicos del estado, evita el aumento excesivo de la complejidad computacional con el recuento de características, al tiempo que aprovecha las observaciones que abarcan múltiples fotogramas: un diseño VIO eficiente basado en filtros que ahora se utiliza ampliamente.
9. Basado en optimización (Ajuste de haces / Grafo de factores)
La estimación basada en filtros se actualiza recursivamente, pero métodos como MSCKF pueden conservar temporalmente poses pasadas clonadas. El enfoque basado en optimización mantiene el estado y las observaciones abarcando una ventana deslizante o un grafo y resuelve una optimización no lineal para su consistencia conjunta. Es útil pensar en ello como una extensión del Ajuste de haces de Visual-SLAM (véase «Visual-SLAM Primer», Sección 10) para incorporar también información de la IMU.
Las aceleraciones y velocidades angulares de la IMU son observaciones conocidas, no variables de optimización. Se añade un estado en cada IMU. El uso de marcas de tiempo o la reintegración de cada intervalo en cada relinealización aumenta el costo. La Preintegración de la IMU, propuesta por Forster et al. en 2015 (arXiv:1512.02363), resume las mediciones entre fotogramas clave como un factor de movimiento relativo con corrección de sesgo. El estado puede incluir velocidad y sesgos, y en algunos sistemas también puntos de referencia; el costo se controla mediante el diseño de la ventana y la relinealización, en lugar de simplemente por la frecuencia de muestreo de la IMU.
El factor de preintegración de la IMU resultante, junto con los factores derivados de las observaciones de la cámara/LiDAR (error de reproyección o error de coincidencia de escaneo), se colocan en un grafo de factores común, y todo se resuelve como un problema de estimación de máxima verosimilitud (o máxima probabilidad a posteriori); esta es la forma básica del enfoque basado en optimización.
\mathcal{X} es el conjunto de poses, velocidades, sesgos y (cuando sea necesario) puntos del mapa que se utilizarán. Estimado; r_{\mathrm{IMU}} es el residuo del factor de preintegración. La estimación basada en filtros controla el costo mediante actualizaciones secuenciales e historial limitado; la estimación basada en optimización puede relinealizar una ventana deslizante. La precisión y el costo dependen de la longitud de la ventana, la inicialización, el cronograma de relinealización, el modelo y el presupuesto de cómputo, por lo que ninguno es universalmente superior.
Figura 2: La gran cantidad de mediciones de la IMU (cientos de Hz) que llegan entre los fotogramas clave i y i{+}1 se integran previamente mediante la preintegración y se gestionan en el gráfico de factores como un único factor de movimiento relativo. Esto mantiene el número de variables de optimización independiente de la frecuencia de muestreo de la IMU, dependiendo únicamente del número de fotogramas clave.
10. Algoritmos de puntos de referencia
VIO
ROVIO (Robust Visual Inertial Odometry), presentado por Bloesch et al. en IROS 2015, es un VIO basado en EKF. En lugar de hacer coincidir descriptores de puntos característicos, introduce información de brillo de parches de imagen directamente en el modelo de observación del EKF, un enfoque de método directo que lo convierte en un ejemplo representativo de la combinación de la estimación basada en filtros con un método directo.
OKVIS (Open Keyframe-based Visual-Inertial SLAM), presentado por Leutenegger et al. en IJRR 2015, es un sistema VIO basado en fotogramas clave y en optimización no lineal. Combinando la preintegración de la IMU (Sección 9) con la minimización del error de reproyección mediante ajuste de haces, constituye una de las primeras implementaciones de referencia de VIO basado en optimización.
VINS-Mono, desarrollado por Qin, Li y Shen en la Universidad de Ciencia y Tecnología de Hong Kong, es un sistema VIO para cámaras monoculares que se basa en la optimización no lineal sobre la preintegración de la IMU (Sección 9), incorpora el cierre de bucle para la corrección global y ofrece un diseño flexible que permite alternar entre un funcionamiento débil y uno fuerte para cada componente. VINS-Fusion es el sucesor que amplía VINS-Mono para admitir múltiples configuraciones de sensores (cámaras estéreo, GPS), priorizando la practicidad en configuraciones de hardware más diversas.
OpenVINS, de Geneva, Eckenhoff, Lee, Yang, Huang y colaboradores, es una plataforma de investigación VIO de código abierto basada en MSCKF. Basada en el eficiente diseño de filtros de MSCKF (Sección 8), se utiliza ampliamente como una implementación que prioriza la facilidad de extensión y validación para fines de investigación.
LIO
LIO-SAM (Odometría Inercial LiDAR de Acoplamiento Estrecho mediante Suavizado y Mapeo), presentada por Shan, Englot, Meyers, Wang, Ratti, Rus y colaboradores en IROS 2020, es una LIO de acoplamiento estrecho construida sobre un grafo de factores. Unifica varios tipos de factores —un factor de preintegración de IMU, un factor de odometría a partir de la coincidencia de escaneos LiDAR, un factor GPS y un factor de cierre de bucle— en el mismo grafo de factores, y es un ejemplo representativo de la aplicación de la filosofía de diseño basada en optimización (Sección 9) a LiDAR.
FAST-LIO (Odometría Inercial LiDAR Rápida), desarrollado por Xu, Zhang y colaboradores del Laboratorio MARS de la Universidad de Hong Kong, es un sistema LIO rápido basado en un filtro de Kalman iterativo acoplado. A diferencia del LIO-SAM, basado en optimización, se basa en filtros, diseñado para procesar directamente nubes de puntos LiDAR de alta velocidad y prioriza el funcionamiento en tiempo real en plataformas con recursos computacionales limitados. FAST-LIO2 es su sucesor: al gestionar la nube de puntos directamente con una estructura de búsqueda incremental del vecino más cercano (un árbol iKD), reduce drásticamente el coste de reconstrucción del mapa, logrando un sistema LIO acoplado más rápido y preciso.
11. Comparación VIO vs. LIO
| Aspecto | VIO (representante: VINS-Mono/OpenVINS) | LIO (representante: LIO-SAM/FAST-LIO2) |
|---|---|---|
| Sensor principal | Cámara (mono/estéreo) + IMU | LiDAR + IMU |
| Entornos que prefiere | Escenas interiores/exteriores ricas en textura, donde el reconocimiento de color y patrón tiene significado | Entornos ricos en estructura geométrica; funciona en la oscuridad o a contraluz |
| Entornos con los que tiene dificultades | Oscuridad, poca textura, a contraluz/luz solar intensa | Espacios geométricamente degenerados: túneles largos, planos abiertos |
| Coste del sensor | Relativamente bajo (cámara + IMU MEMS) | Alto (la propia unidad LiDAR, especialmente los modelos de largo alcance y alta resolución) |
| Características del mapa | Puntos característicos dispersos o profundidad densa con un enfoque basado en aprendizaje | Mapa de nube de puntos denso y geométricamente preciso |
| Ambigüedad de escala | Presente en principio para una configuración monocular (resuelta mediante la IMU) | No presente en principio, ya que la medición de distancia LiDAR es inherentemente métrica |
| Cálculo | Moderado (coste de extracción de características y cálculo de descriptores) | El procesamiento de nubes de puntos (búsqueda del vecino más cercano, coincidencia de escaneos) tiene un coste comparable |
| Filosofía de diseño representativa | Tanto los sistemas basados en filtros (MSCKF) como los basados en optimización (preintegración + análisis de balance de carga) están ampliamente implementados | Tanto los sistemas basados en filtros (FAST-LIO2) como los basados en optimización (LIO-SAM) están ampliamente implementados |
Las ventajas de VIO residen en el bajo coste de sus sensores y en la comprensión ambiental de alto nivel que proporciona el reconocimiento de color y patrones (una combinación natural con el reconocimiento de objetos); las ventajas de LIO residen en su precisión geométrica y su robustez ante la oscuridad y las inclemencias del tiempo; esa es la división básica del trabajo.
12. Elección práctica
La elección entre VIO, LIO o una combinación de ambos depende de los sensores que pueda transportar, su presupuesto y el entorno en el que prevea operar.
-
Robots de servicio para interiores / aspiradoras robot: Si el bajo costo es la prioridad, VIO (o una configuración de cámara e IMU con acoplamiento flexible) suele ser la mejor opción; si la precisión y un mapa geométricamente exacto son la prioridad, se suele elegir LIO. En un entorno interior convencional con muchos pasillos y paredes, la mejora en la precisión que ofrece el LiDAR es más fácil de justificar.
-
Drones: Con limitaciones estrictas de carga útil y energía, una configuración VIO ligera de cámara e IMU suele ser la más utilizada. En espacios exteriores abiertos, también es común el emparejamiento con GPS.
-
RA/RV: La odometría visual-inercial (VIO) que utiliza la cámara y la IMU integradas en el casco es el estándar de facto; Salvo algunos modelos de gama alta con LiDAR integrado, las limitaciones de coste y peso hacen de VIO la opción predeterminada.
-
Conducción autónoma / Robots móviles autónomos para exteriores: Dada la necesidad de robustez en condiciones climáticas adversas, contraluz y conducción nocturna, LIO suele ser la base, combinada con VIO y GNSS (véase «Introducción a la fusión de sensores»).
-
Espacios geométricamente degenerados: túneles, largos pasillos rectos: El LiDAR o el LIO por sí solos tienden a presentar inestabilidad en el registro, por lo que es importante añadir una fuente de información independiente (VIO u odometría de ruedas) para compensar la degeneración.
La regla general es: si el presupuesto y el peso del sensor lo permiten y la precisión geométrica es la máxima prioridad, elija LIO; si el coste y el peso ligero son prioritarios y además desea aprovechar la comprensión del entorno basada en colores y patrones, elija VIO. En el desarrollo real de productos, rara vez se eligen exclusivamente ambos sensores; en cambio, tienden a evolucionar hacia una fusión multisensor (véase «Introducción a la fusión de sensores») que pondera VIO, LIO, GNSS y la odometría de las ruedas según la situación.
13. Resumen
Una IMU proporciona información de movimiento de alta frecuencia y completamente autónoma, pero la posición recuperada mediante la integración se desvía rápidamente, en proporción al cuadrado o al cubo del tiempo transcurrido. Una cámara (VIO) o un LiDAR (LIO) corrigen periódicamente este error acumulado, pero cada uno presenta sus propias limitaciones: oscuridad y baja textura para la cámara, y entornos geométricamente degenerados para el LiDAR. VIO y LIO combinan estas debilidades complementarias mediante un ciclo de Predicción (predicción de IMU de alta frecuencia) - Actualización (corrección de cámara/LiDAR), implementado bajo el marco basado en filtros (EKF/MSCKF) o en optimización (preintegración de IMU + grafo de factores), para lograr una robustez y precisión que ningún sensor individual puede alcanzar por sí solo.
¿Debe integrarse directamente la lectura de aproximadamente 1 g en reposo?
Transforma la fuerza específica al sistema de referencia global y ten en cuenta primero la gravedad y el sesgo. Una velocidad creciente en reposo indica un problema con el modelo o el sistema de referencia.
Comentarios
Inicia sesión para continuar.
Todavía no hay datos.