Contents — find the section you need
El sensor giratorio en la parte superior de un coche autónomo o la pequeña ventana en la parte superior de una aspiradora robot: muchos de estos dispositivos son LiDAR (detección y medición de distancia mediante luz), un sensor que mide la distancia a su entorno directamente mediante luz láser. LiDAR-SLAM es la tecnología que realiza la autolocalización y el mapeo simultáneamente utilizando únicamente los datos de la nube de puntos que devuelve un LiDAR (opcionalmente con la ayuda de sensores como una IMU). Mientras que Visual-SLAM (véase "Visual-SLAM Primer") intenta recuperar indirectamente la estructura 3D a partir de las imágenes 2D de una cámara, LiDAR-SLAM parte de la información directa de la distancia 3D; esa es la diferencia clave. Este artículo parte del principio de lo que mide un LiDAR, analiza los dos algoritmos principales para alinear nubes de puntos (ICP y NDT), el diseño basado en características que representa LOAM, Loop Closure y Graph SLAM, y finalmente, el origen de los algoritmos de puntos de referencia y cómo elegirlos en la práctica. Los avances actuales se tratan en "Tendencias tecnológicas en LiDAR-SLAM".
Familia LiDAR Velodyne
Ejemplos de LiDAR LivoxImágenes: Velodyne Familia de sensores LiDAR (APJarvis, CC BY-SA 4.0) / Livox Mid-40, Horizon y Tele-15 (Dllu, CC BY-SA 4.0), Wikimedia Commons. Familias de productos representativas, no necesariamente los modelos más recientes mencionados en el texto.
0. Contenido de este artículo
- Qué mide realmente un LiDAR y por qué obtiene la distancia "directamente"
- Cómo se manifiesta el problema fundamental de SLAM en el mundo de las nubes de puntos
- Cómo funcionan los dos algoritmos de coincidencia de escaneo de pilares, ICP (Punto Más Cercano Iterativo) y NDT (Transformación de Distribuciones Normales), y en qué se diferencian
- La diferencia entre los dos modos de odometría LiDAR: Escaneo a Escaneo y Escaneo a Mapa
- Por qué LOAM extrae características (bordes y planos) y el razonamiento de diseño detrás de ello
- Cómo se relacionan el Cierre de Bucle y la optimización del Grafo de Pose
- Las diferencias entre los algoritmos de puntos de referencia — ICP / NDT / LOAM / LeGO-LOAM / A-LOAM / Cartographer / LIO-SAM / FAST-LIO2 — y cómo elegir el más adecuado
1. ¿Qué es LiDAR-SLAM?
En una frase: LiDAR-SLAM es la tecnología que utiliza un conjunto de mediciones de distancia de alta precisión (una nube de puntos) obtenidas a partir del tiempo de vuelo (o desfase) de la luz láser, registrando repetidamente escaneos sucesivos entre sí (coincidencia de escaneos), para estimar simultáneamente la trayectoria del sensor y un mapa 3D de su entorno.
La entrada es la nube de puntos que un LiDAR emite a intervalos fijos (desde unos pocos miles hasta cientos de miles de puntos por escaneo), y la salida —al igual que en Visual-SLAM— consta de dos elementos: la pose del sensor con 6 grados de libertad en cada instante (3 para la posición y 3 para la orientación), y un mapa 3D de la nube de puntos del entorno circundante. Un coche autónomo que mantiene relaciones de distancia precisas con los vehículos, peatones e infraestructura vial circundantes mientras estima su propia posición; un robot móvil autónomo que navega con precisión entre las estanterías de un almacén; Un dron volando a través de espacios geométricamente complejos como túneles o interiores de edificios: en todos estos casos, el LiDAR-SLAM es la tecnología que se utiliza.
2. ¿Qué mide realmente un LiDAR?
Los principios de medición de distancias LiDAR se dividen en dos grandes categorías. En el método ToF (Tiempo de Vuelo), el sensor emite un pulso láser y mide el tiempo que tarda la reflexión en regresar al objetivo. A partir de este tiempo, calcula la distancia D utilizando la velocidad de la luz c.
Dado que la luz realiza un viaje de ida y vuelta, el tiempo medido T debe dividirse por la mitad para obtener el tiempo de propagación unidireccional. El otro método, desplazamiento de fase (FMCW/AMCW), transmite un haz láser modulado continuamente y calcula la distancia a partir de la diferencia de fase entre las señales transmitida y reflejada. En cualquier caso, un LiDAR no solo detecta la presencia de un objeto, sino que también determina su distancia absoluta en una sola observación, una capacidad de la que carece por completo una cámara. Como veremos en la sección 4, una sola imagen monocular de una cámara nunca puede recuperar la escala del mundo real por sí sola, mientras que una nube de puntos LiDAR incorpora la escala métrica desde el principio.
Existen dos familias de hardware LiDAR. El LiDAR mecánico giratorio rota un conjunto apilado de múltiples elementos transmisores/receptores láser para generar una nube de puntos completa de 360 grados; Velodyne y Ouster son fabricantes representativos. El LiDAR de estado sólido no tiene partes mecánicas giratorias; en su lugar, utiliza espejos MEMS o matrices de fase óptica para escanear un campo de visión limitado, logrando un tamaño y un coste menores; Livox es un ejemplo representativo. Las unidades de estado sólido sacrifican un campo de visión más estrecho a cambio, en muchos productos, de un patrón de escaneo no repetitivo (escanean el mismo punto siguiendo una trayectoria ligeramente diferente cada vez), lo que significa que las nubes de puntos se vuelven más densas a medida que se acumulan.
Las nubes de puntos LiDAR también poseen una estructura de la que carecen por completo las imágenes de cámara. Un LiDAR giratorio dispara múltiples láseres apilados verticalmente (por ejemplo, 16, 32 o 128 capas) mientras rota horizontalmente, produciendo nubes de puntos densas horizontalmente pero dispersas y estratificadas verticalmente: una distribución anisotrópica. Esta estructura influye directamente en el diseño de la extracción de características de LOAM y la estimación de la normal de ICP, que se abordarán más adelante.
3. El problema fundamental de SLAM: "¿Dónde se ubica la nube de puntos actual en el mapa?"
Así como Visual-SLAM resuelve el problema de "¿dónde se corresponde la imagen actual con las imágenes anteriores y el mapa?" mediante la correspondencia de puntos característicos, LiDAR-SLAM resuelve el problema de "¿dónde se corresponde el escaneo actual (nube de puntos) con los escaneos anteriores y el mapa?" mediante la alineación de nubes de puntos entre sí. El problema subyacente es esencialmente el mismo independientemente del sensor: una sola observación por sí sola nunca puede determinar la posición absoluta; La única forma de avanzar es seguir estimando la posición actual utilizando la correspondencia con observaciones anteriores (el mapa) como pista.
La diferencia radica en la naturaleza de dicha correspondencia. Visual-SLAM detecta "puntos prominentes" (características) en una imagen, codifica numéricamente su apariencia como un descriptor y busca correspondencias mediante la similitud de descriptores. Una nube de puntos LiDAR, en cambio, prácticamente no contiene información de "apariencia", como brillo o color (si bien dispone de intensidad de reflectancia, esta es mucho menos discriminativa que un descriptor de imagen). En consecuencia, la correspondencia entre nubes de puntos se basa, en la mayoría de los casos, exclusivamente en la proximidad espacial: "¿qué punto está geométricamente más cerca?". El proceso general de encontrar la transformación rígida (rotación R, traslación \mathbf{t}) entre dos nubes de puntos se denomina Scan Matching y constituye el núcleo de LiDAR-SLAM.
La conclusión de esta sección es sencilla: mientras que Visual-SLAM utiliza la coincidencia de características y la geometría epipolar, LiDAR-SLAM la sustituye por la coincidencia de escaneos. Las dos secciones siguientes abordan los dos algoritmos fundamentales para la coincidencia de escaneos: ICP y NDT.
4. Comprensión de ICP
ICP (Punto Más Cercano Iterativo) es un algoritmo clásico para el registro de nubes de puntos, publicado por Besl y McKay en 1992 en IEEE Transactions on Pattern Analysis and Machine Intelligence, y que aún se utiliza ampliamente. Como su nombre indica, se basa en una idea simple: tratar el "punto más cercano" como el punto correspondiente y luego refinarlo repetidamente.
El algoritmo se puede organizar en tres pasos.
- Búsqueda de correspondencia: para cada punto p_i en la nube de puntos que se está moviendo (el origen), encontrar el punto más cercano q_i en la nube de puntos fija (el destino), generalmente utilizando una estructura de búsqueda espacial como un árbol KD.
- Estimación de la transformación: dado este conjunto de correspondencias \{(p_i, q_i)\}, encuentre la rotación R y la traslación \mathbf{t} que minimicen la suma de las distancias entre los puntos correspondientes. La versión más simple, el error Punto a Punto, se define de la siguiente manera:
- Aplicar e iterar: aplique las transformaciones resultantes R y \mathbf{t} a toda la nube de puntos de origen, luego regrese al paso 1 y busque correspondencias nuevamente. Este ciclo de búsqueda de correspondencias → estimación de la transformación → aplicación se repite hasta que el error sea suficientemente pequeño (o deje de disminuir).
El error punto a punto es intuitivo, pero al alinear dos planos amplios y planos —como una pared—, desde la perspectiva del error, la posición exacta de los puntos a lo largo de ese plano apenas importa (un pequeño desplazamiento a lo largo del plano apenas afecta al error, siempre que la desviación perpendicular sea pequeña), por lo que la convergencia tiende a ser lenta. El error punto a plano resuelve este problema: estima un vector normal n_i a partir de la forma local alrededor del punto correspondiente q_i y minimiza únicamente la discrepancia en la dirección normal (la distancia punto-plano).
El error punto a plano tolera desviaciones a lo largo del plano, penalizando estrictamente solo la discrepancia perpendicular a este, y es bien sabido que converge más rápido y de forma más estable que el error punto a punto, especialmente en entornos con muchos planos, como interiores de edificios. Dicho esto, como se menciona en la sección 2, la nube de puntos de un LiDAR giratorio tiene una estructura estratificada y verticalmente dispersa, por lo que estimar las normales de forma ingenua puede generar normales ruidosas, arrastradas por la estratificación; la estimación de normales en sí misma requiere cuidado.
ICP tiene dos debilidades principales. Primero, dado que la búsqueda de correspondencias se basa exclusivamente en el "vecino geométrico más cercano", un gran desplazamiento inicial conduce a correspondencias incorrectas y a la convergencia a un mínimo local; se requiere una buena estimación inicial. Segundo, ejecutar la búsqueda del vecino más cercano repetidamente sobre nubes de puntos con decenas de miles de puntos por fotograma es computacionalmente costoso, y su costo aumenta con el tamaño de la nube. NDT, que se describe a continuación, adopta un enfoque diferente que evita por completo la búsqueda de correspondencias.
5. Comprensión de NDT
NDT (Transformación de Distribuciones Normales) es un algoritmo de coincidencia de escaneos con un enfoque fundamentalmente diferente al de ICP, publicado por Biber y Straßer en 2003 en la Conferencia Internacional IEEE/RSJ sobre Robots y Sistemas Inteligentes (IROS). El método original se propuso para escáneres láser 2D; posteriormente se extendió para procesar también nubes de puntos 3D.
La idea central de NDT es representar una nube de puntos no como un conjunto de puntos individuales, sino como una distribución de probabilidad definida por vóxel en una cuadrícula regular. La distribución de puntos dentro de cada vóxel se aproxima mediante una distribución gaussiana (normal) con media \mu y matriz de covarianza \Sigma.
Al representar toda la nube de puntos objetivo de esta manera —como un conjunto de distribuciones gaussianas por vóxel que forman una función de densidad de probabilidad diferenciable y continua por partes— ya no es necesario buscar correspondencias punto a punto para alinear la nube de origen. En cambio, para una transformación T (rotación y traslación) aplicada a cada punto fuente \mathbf{x}_i, que da como resultado \mathbf{x}_i' = T(\mathbf{x}_i), se calcula la "plausibilidad" de ese punto transformado bajo la distribución gaussiana de su vóxel correspondiente, como una función de puntuación, y se encuentra el T que la maximiza.
Esta optimización se resuelve con métodos basados en gradientes, como el método de Newton. A diferencia de ICP, no es necesario alternar entre la "búsqueda de correspondencia" y la "estimación de la transformación" como pasos separados; simplemente se evalúa el gradiente con respecto a los parámetros gaussianos precalculados, por lo que se evita por completo el coste de la búsqueda del vecino más cercano. Y dado que el ruido en los puntos individuales se absorbe en una media y covarianza por vóxel, el resultado tiende a ser robusto frente al ruido.
Sin embargo, NDT tiene su propia desventaja: la elección del tamaño del vóxel. Los vóxeles más grandes son computacionalmente más ligeros, pero promedian las pequeñas diferencias de forma, lo que perjudica la precisión de la alineación. Los vóxeles más pequeños aumentan la resolución de la forma, pero dejan menos puntos por vóxel, lo que hace que la estimación gaussiana sea inestable, y el aumento del número de vóxeles también incrementa el coste computacional. Este parámetro ajustable, que el usuario debe configurar correctamente, es lo que hace que el NDT sea prácticamente engorroso de usar.
6. Odometría LiDAR (de escaneo a escaneo / de escaneo a mapa)
El proceso de usar ICP o NDT para encontrar el movimiento relativo entre fotogramas sucesivos y acumular esas estimaciones a lo largo del tiempo se denomina Odometría LiDAR. Al igual que con la Odometría Visual en Visual-SLAM, sin algún mecanismo para conciliar con el mapa en su conjunto (Cierre de Bucle), la deriva se acumula con el tiempo y no se puede evitar.
La Odometría LiDAR se presenta en dos variantes, según con qué se compare. De escaneo a escaneo registra cada escaneo solo con respecto al escaneo inmediatamente anterior; Es computacionalmente económico, pero dado que cada error de estimación se traslada directamente a la estimación inicial del siguiente escaneo, la deriva tiende a acumularse. Scan-to-Map registra el escaneo actual no con respecto a un único escaneo anterior, sino con respecto a todo el mapa local acumulado; al utilizar más observaciones, es menos sensible al ruido y, en general, más preciso que Scan-to-Scan, aunque a costa de un mayor coste computacional debido a que la nube de puntos de referencia es mayor.
La mayoría de las implementaciones prácticas de LiDAR-SLAM combinan ambos métodos. Primero se obtiene una estimación inicial rápida y aproximada —mediante Scan-to-Scan, predicción de IMU o una alineación aproximada basada en NDT de la sección 5— y luego esa estimación inicial se refina con un registro preciso de Scan-to-Map. El siguiente diagrama ilustra un flujo de procesamiento general de LiDAR-SLAM basado en esta idea de dos etapas.
Figura 1: La ruta rápida por escaneo va desde la corrección de inclinación hasta el registro local, pasando por las actualizaciones de pose y mapa local, alimentando la siguiente estimación inicial y el mapa de referencia. Una ruta separada de menor velocidad verifica las revisitas del historial de fotogramas clave, admite restricciones de bucle y utiliza la optimización de gráficos para corregir la trayectoria global y mapa.
El paso de corrección de inclinación (corrección de la distorsión durante el escaneo) que se muestra en el diagrama es específico de LiDAR. El escaneo de un LiDAR giratorio no se captura instantáneamente; tarda entre decenas y cientos de milisegundos en adquirirse. Si el sensor se mueve durante ese intervalo, los puntos capturados antes y después en el mismo escaneo terminan representando observaciones de momentos y posiciones realmente diferentes, mezcladas dentro de un mismo escaneo (distorsión por movimiento). La corrección de inclinación utiliza una IMU (o la estimación de velocidad previa) para corregir este movimiento durante el escaneo, reconstruyendo la nube de puntos como si se hubiera capturado en un solo instante. Esta corrección está estrechamente relacionada con la fusión de IMU descrita en VIO/LIO (véase "VIO/LIO Primer").
7. Comprensión de LOAM
LOAM (Lidar Odometry and Mapping in Real-time), publicado por Zhang y Singh en 2014 en Robotics: Science and El sistema RSS (Reflection System and System) es la base del diseño de muchas implementaciones LiDAR-SLAM actuales. La principal innovación de LOAM consiste en extraer únicamente puntos geométricamente distintivos en lugar de utilizar todos los puntos de la nube.
LOAM evalúa la suavidad local (curvatura) alrededor de cada punto y extrae los puntos con alta curvatura en relación con su entorno como características de borde (esquinas afiladas o contornos de objetos), y los puntos con baja curvatura como características planas (parte de una superficie continua y suave, como una pared o un suelo). En lugar de utilizar un escaneo completo con decenas de miles de puntos para el registro, reducirlo a solo estas características disminuye drásticamente el coste computacional de la correspondencia de escaneos.
Una vez extraídas las características, la formulación del error reproduce las ideas de ICP de la sección 4, pero el elemento geométrico con el que se compara es una "línea" o un "plano" en lugar de un "punto". Una característica de borde p_i se compara minimizando su distancia a la línea formada por dos puntos correspondientes. p_a y p_b en el escaneo anterior (o en el mapa).
Una característica planar se compara minimizando su distancia al plano definido por tres puntos correspondientes (la misma forma que el error de punto a plano en la sección 4). La suma de estas distancias y su minimización durante la rotación y la traslación produce el movimiento relativo entre fotogramas.
Otra decisión de diseño fundamental de LOAM es su estructura de dos niveles de odometría LiDAR de alta frecuencia y mapeo LiDAR de baja frecuencia. La odometría LiDAR realiza una comparación escaneo a escaneo basada en características con el escaneo inmediatamente anterior a alta frecuencia (en cada escaneo), lo que produce una estimación de pose aproximada pero rápida. El mapeo LiDAR toma esa estimación aproximada como su aproximación inicial y realiza una comparación escaneo a mapa con el mapa acumulado en su conjunto, a una frecuencia menor que la odometría LiDAR, lo que produce una pose más precisa y un mapa más exacto. Al ejecutar ambos procesos en paralelo a diferentes frecuencias, El resultado del mapeo LiDAR corrige la estimación de la odometría LiDAR, logrando simultáneamente una salida de alta frecuencia y una alta precisión. Esta filosofía de diseño de "estimación gruesa de alta frecuencia + corrección precisa de baja frecuencia" ha sido adoptada por muchas de las implementaciones posteriores de LiDAR-SLAM y LIO descritas en la sección 9.
8. Cierre de bucle y SLAM de grafos
La odometría LiDAR, al igual que la odometría visual en el SLAM visual, acumula deriva con el tiempo, e incluso después de que un robot regresa a su punto de partida, la trayectoria estimada no lo detecta. El mecanismo que corrige este error acumulado es el cierre de bucle.
El cierre de bucle en el mundo LiDAR se divide en dos pasos principales. El primero es el reconocimiento de lugar: determinar si la nube de puntos actual se asemeja a una nube de puntos de una ubicación visitada previamente. Dado que las nubes de puntos no contienen información de brillo como las imágenes, esto se basa en enfoques que codifican la distribución de la forma de la propia nube de puntos como un descriptor; por ejemplo, métodos como el contexto de escaneo, que dividen Un escaneo se divide en celdas en forma de abanico y se codifica la altura máxima de cada celda como un descriptor, o bien se utilizan métodos que resumen las características geométricas de toda la nube de puntos. El segundo paso es la verificación geométrica: para los pares de escaneos propuestos como candidatos mediante el reconocimiento de lugares, se intenta la coincidencia de escaneos con ICP o NDT y se comprueba si coinciden lo suficiente. Solo después de superar ambas etapas se considera que una restricción que vincula la "posición actual" con la "posición en la que se visitó ese lugar previamente" es lo suficientemente fiable como para adoptarse.
El uso de esta restricción de cierre de bucle para corregir las poses acumuladas y mapearlas en un conjunto coherente es la función de la optimización del grafo de poses, o más generalmente, del marco Graph SLAM. Este marco construye un grafo cuyos nodos representan la pose del sensor en cada instante y cuyas aristas son restricciones sobre el movimiento relativo entre fotogramas (o entre dos instantes distantes vinculados por un bucle). A continuación, ajusta los nodos (poses) mediante optimización no lineal para que todas las restricciones de las aristas sean lo más coherentes posible. La arista recién añadida por el cierre de bucle redistribuye la deriva, que hasta entonces solo había... Se propaga en una sola dirección: a lo largo de toda la ruta que conforma el bucle. Esta optimización, al igual que en Visual-SLAM (véase "Visual-SLAM Primer", sección 10), también se basa comúnmente en bibliotecas como g2o, GTSAM y Ceres Solver dentro de las implementaciones de LiDAR-SLAM.
9. Algoritmos de puntos de referencia
La historia de LiDAR-SLAM se comprende mejor a través de dos ejes: cómo se registran las nubes de puntos y hasta qué punto el diseño reduce las cosas a características explícitas.
ICP (Besl y McKay, 1992) es, como se explica en la sección 4, el algoritmo fundamental clásico y aún ampliamente utilizado para el registro de nubes de puntos. Rara vez se utiliza de forma independiente para SLAM en tiempo real, pero alguna forma de minimización basada en correspondencias derivada de él perdura en casi todos los métodos posteriores.
NDT (Biber y Straßer, LOAM (Zhang y Singh, 2014)** es, como se explica en la sección 5, un método de coincidencia de escaneo basado en la distribución gaussiana que evita la búsqueda de correspondencias y, junto con ICP, constituye la otra opción fundamental, ampliamente utilizada desde SLAM para robots 2D en interiores hasta aplicaciones de conducción autónoma 3D.
LOAM (Zhang y Singh, 2014) es, como se explica en la sección 7, el método que introdujo la extracción de características de bordes/planos junto con el diseño de odometría de alta frecuencia y mapeo de baja frecuencia de dos niveles, que sirve de base para el diseño de muchas implementaciones de LiDAR-SLAM y LIO hasta la fecha.
LeGO-LOAM (Ligero y optimizado para terrenos LiDAR, Odometría y mapeo, Shan y Englot, publicado en 2018 en la Conferencia Internacional IEEE/RSJ sobre Robots y Sistemas Inteligentes (IROS)) extiende LOAM específicamente para vehículos terrestres. Primero separa la nube de puntos en puntos terrestres y no terrestres, utilizando los puntos terrestres para estimar el balanceo, la inclinación y la elevación, y los puntos no terrestres para Estima los grados de libertad restantes (posición horizontal y guiñada), logrando un diseño ligero capaz de operar en tiempo real incluso en sistemas embebidos con recursos computacionales limitados.
A-LOAM (Advanced LOAM) es una reimplementación simplificada de código abierto de las ideas de LOAM, basada en la optimización no lineal con Ceres Solver, publicada por grupos como el Grupo de Robótica Aérea de la HKUST. Elimina parte del ajuste de ingeniería detallado del LOAM original en favor de un código más claro, y se cita frecuentemente como una implementación accesible para aprender y experimentar con la familia de algoritmos LOAM.
Cartographer (Hess, Kohler, Rapp, Andor, publicado en 2016 en la Conferencia Internacional IEEE sobre Robótica y Automatización (ICRA), Google) realiza la coincidencia de escaneos locales basada en Ceres Solver por submapa (un submapa es un conjunto de varios escaneos), combinada con una detección rápida de cierre de bucle mediante una búsqueda de ramificación y acotación de divide y vencerás sobre el espacio de candidatos. Es compatible con 2D y 3D, y, gracias a las implementaciones de código abierto ampliamente disponibles para ROS, se ha adoptado ampliamente en el mapeo de interiores.
LIO-SAM (Odometría Inercial LiDAR de Acoplamiento Estrecho mediante Suavizado y Mapeo, Shan, Englot, Meyers, Wang, Ratti, Rus, publicado en 2020 en IROS) es un método de Odometría Inercial LiDAR (LIO) de acoplamiento estrecho que optimiza conjuntamente los factores de preintegración de la IMU, los factores de odometría de coincidencia de escaneo LiDAR, los factores GPS y los factores de cierre de bucle dentro de un grafo de factores compartido (consulte "VIO/LIO Primer" para obtener más detalles).
FAST-LIO2, publicado por Xu, Zhang y sus colegas del Laboratorio MARS de la Universidad de Hong Kong, es un LIO rápido basado en un Filtro de Kalman Iterado de Acoplamiento Estrecho. Al gestionar la nube de puntos directamente con Una estructura de búsqueda secuencial del vecino más cercano (un árbol k-d incremental, iKD-Tree) registra la nube de puntos directamente sobre el mapa sin un paso explícito de extracción de características, y su diseño prioriza el funcionamiento en tiempo real en plataformas pequeñas con recursos computacionales limitados. Los desarrollos actuales de 2026 se tratan en "Tendencias tecnológicas en LiDAR-SLAM".
10. Comparación de métodos
| Método | Principio | Precisión | Coste computacional | Robustez | Dificultad de implementación |
|---|---|---|---|---|---|
| ICP | Búsqueda del vecino más cercano + minimización iterativa de transformación rígida | Alta precisión con una buena estimación inicial; de lo contrario, cae en mínimos locales | Media-alta (coste de la búsqueda iterativa del vecino más cercano) | Débil en entornos geométricamente sin características o con grandes desplazamientos iniciales | Baja (conceptualmente simple, muchas implementaciones existentes) |
| NDT | Maximización del ajuste a distribuciones gaussianas por vóxel | Depende del tamaño del vóxel; relativamente robusto al ruido | Medio (sin búsqueda de correspondencia, pero con cálculo de gradiente) | Robusto al ruido, pero requiere ajuste del tamaño del vóxel | Medio (el ajuste requiere cierta habilidad) |
| LOAM | Extracción de características de borde/planares + odometría/mapeo de dos niveles | Alta precisión en entornos ricos en características | Medio (más ligero que usar toda la nube de puntos, gracias a la selección de características) | Débil en entornos con pocas características (túneles, etc.) | Medio-alto (parámetros y diseño complejos) |
| LeGO-LOAM | Separación de puntos terrestres + optimización de dos niveles al estilo LOAM | Alta precisión para vehículos terrestres; las suposiciones fallan para plataformas aéreas | Medio (más ligero que LOAM) | Depende en gran medida de la presencia de un plano de tierra plano | Medio |
| A-LOAM | Reimplementación simplificada de LOAM usando Ceres Solver | Aproximadamente Equivalente a LOAM (varía según la implementación) | Medio | Hereda las mismas debilidades de LOAM | Bajo-medio (fácil de consultar para aprender) |
| Cartographer | Coincidencia de escaneo por submapa + cierre de bucle de ramificación y acotación | Alta precisión en interiores (2D); fuerte en consistencia global | Medio-alto (gestión de submapas y costo de búsqueda de ramificación y acotación) | Fuerte en entornos interiores con muchos bucles | Medio (fácil de adoptar dentro del ecosistema ROS) |
| LIO-SAM | Optimización de grafo factorial de la preintegración de IMU + odometría LiDAR + GPS + cierre de bucle | Alta precisión con fusión de IMU; la consistencia global mejora aún más con GPS | Alto (costo de optimización de grafo factorial) | La IMU ayuda a contrarrestar la degeneración geométrica | Medio-alto (supuestos específicos del sensor, p. ej., IMU de 9 ejes) |
| FAST-LIO2 | Registro directo mediante filtro de Kalman iterado + árbol iKD | Alta precisión a alta frecuencia (especialmente pronunciada en LiDAR de estado sólido) | Bajo-medio (el método directo evita Costo de extracción de características) | Depende de la IMU en condiciones de degeneración; débil en condiciones de geometría extremadamente baja | Medio (la implementación es pública, pero la optimización interna requiere experiencia) |
En general, es útil considerar ICP y NDT como los "algoritmos de registro fundamentales", la familia LOAM (LOAM/LeGO-LOAM/A-LOAM) como "mejoras de eficiencia mediante el diseño de características", Cartographer como "consistencia global eficiente y cierre de bucle", y LIO-SAM/FAST-LIO2 como "mejoras de robustez mediante un acoplamiento estrecho de la IMU"; cada uno representa un eje de mejora distinto basado en lo anterior.
11. Dónde LiDAR-SLAM tiene dificultades
Debido a que LiDAR emite luz láser activamente para medir la distancia, funciona bien en condiciones de oscuridad y contraluz, entornos donde Visual-SLAM tiene dificultades. Sin embargo, LiDAR-SLAM también tiene sus propias debilidades.
-
Degeneración geométrica: en entornos donde la forma de la nube de puntos apenas cambia a lo largo de una dirección particular. —un túnel largo o un amplio estacionamiento plano— la coincidencia de escaneos no puede determinar de forma unívoca la traslación o rotación en esa dirección. Esto sucede porque la optimización ICP/NDT aterriza en un "valle plano" donde el error apenas cambia para cualquier valor en esa dirección; comparte la misma causa raíz subyacente que la debilidad que presenta Visual-SLAM contra paredes sin características distintivas.
-
Condiciones climáticas adversas: la lluvia, la nieve, la niebla y el polvo dispersan y absorben la luz láser, atenuando los reflejos que de otro modo regresarían o generando puntos de ruido (reflejos espurios que aparecen en posiciones donde en realidad no hay nada).
-
Espejos y objetos transparentes: el vidrio y los espejos pueden reflejar especularmente la luz láser, generando puntos espurios en una ubicación distinta a la posición real del objeto (la ubicación de la imagen especular).
-
Objetos dinámicos: usar puntos en objetos en movimiento —peatones, vehículos— como si fueran parte de un entorno estático durante el registro introduce un error en la estimación del propio movimiento del sensor. Detectar y excluir objetos dinámicos, o modelarlos explícitamente, se vuelve necesario.
-
El Compromiso entre densidad de puntos y coste computacional**: Las nubes de puntos de mayor resolución y frecuencia tienden a producir un registro más preciso, pero cuantos más puntos haya por fotograma, mayor será el coste computacional de la coincidencia de escaneos. En sistemas embebidos o drones con capacidad de cómputo limitada, este compromiso entre densidad y velocidad se convierte en una importante limitación de diseño.
-
Coste del hardware: Los LiDAR giratorios de alta resolución y largo alcance siguen siendo sustancialmente más caros que las cámaras, y el coste suele ser una barrera real para su adopción.
Muchas de estas limitaciones van en una dirección distinta a las de una cámara, lo que hace que la combinación de cámara (Visual-SLAM) y LiDAR (LiDAR-SLAM) —fusión de sensores (véase "Introducción a la fusión de sensores")— sea una forma eficaz de compensar las limitaciones de cualquiera de los sensores por separado.
12. Elección en la práctica
La elección entre los métodos LiDAR-SLAM depende en gran medida de los sensores que se puedan instalar, la capacidad de cómputo disponible y la precisión requerida. y el carácter geométrico del entorno.
-
Robots de servicio para interiores y aspiradoras robot: el LiDAR 2D de bajo coste sigue siendo una opción sólida y persistente, y las implementaciones robustas de SLAM 2D, como Cartographer, se utilizan ampliamente. Los espacios interiores, ricos en estructuras como paredes y mobiliario, rara vez presentan degeneración geométrica, lo que los convierte en un entorno favorable para LiDAR-SLAM.
-
Vehículos autónomos: el LiDAR 3D de alta resolución combinado con la fusión multisensor de GPS, IMU y cámara es la premisa básica. Para contrarrestar tramos geométricamente degenerados como túneles y pasos elevados, las configuraciones con acoplamiento IMU estrecho, como LIO-SAM/FAST-LIO2, tienen una importancia significativa.
-
Drones: dadas las estrictas limitaciones de peso y energía, el LiDAR de estado sólido (p. ej., Livox) combinado con un método directo de computación eficiente como FAST-LIO2 suele ser la opción preferida.
-
AGV/AMR para almacenes y fábricas: los entornos con una estructura regular, similar a un pasillo, son... Es común que los métodos de escaneo a mapa basados en LiDAR 2D (por ejemplo, Cartographer) sean una opción práctica. En entornos donde la disposición de las estanterías cambia con frecuencia, la frecuencia de actualización del mapa también influye en la selección.
-
Entornos degenerados: túneles, espacios subterráneos, largos pasillos rectos: El LiDAR por sí solo tiende a generar un registro inestable, por lo que un acoplamiento estrecho con IMU (LIO-SAM/FAST-LIO2) o la combinación con una fuente independiente como la odometría de ruedas se vuelve prácticamente esencial.
-
Interiores vs. exteriores: Los espacios interiores tienen una estructura rica con abundantes referencias geométricas, lo que favorece a LiDAR-SLAM, mientras que los espacios exteriores plantean el desafío de la degeneración en áreas abiertas y condiciones climáticas adversas, lo que hace que la fusión IMU/GNSS sea más importante.
Como regla general práctica: un método directo como FAST-LIO2 para computación limitada y salida de alta frecuencia, LIO-SAM para consistencia global que también incorpora GPS, y Cartographer por su trayectoria en entornos 2D y su estrecha integración con el ecosistema ROS. Una configuración sin IMU (ICP/NDT/LOAM independiente) se ha convertido en una opción prácticamente inviable hoy en día, dada la necesidad de resiliencia ante entornos adversos. La mayoría de los sistemas operativos se diseñan ahora partiendo de un acoplamiento estrecho entre las IMU.
13. Referencias
- Besl y McKay, “Un método para el registro de formas 3D” (IEEE TPAMI, 1992)
- Zhang y Singh, “LOAM: Odometría y mapeo LiDAR en tiempo real” (RSS, 2014)
- Xu et al., “FAST-LIO2: Odometría inercial LiDAR directa y rápida” (IEEE T-RO, 2022)
14. Resumen
LiDAR-SLAM toma la información de distancia a escala métrica (nubes de puntos) obtenida del tiempo de vuelo de un láser, realiza la correspondencia de escaneos con ICP (registro iterativo de puntos más cercanos) o NDT (ajuste a distribuciones gaussianas por vóxel) y acumula una trayectoria a través de La odometría LiDAR combina escaneo a escaneo y escaneo a mapa, y corrige continuamente el error acumulado mediante el cierre de bucle y la optimización del grafo de pose, logrando así la autolocalización y el mapeo simultáneos. La familia de algoritmos de puntos de referencia —LOAM (eficiencia mediante la extracción de características), Cartographer (consistencia global eficiente) y LIO-SAM/FAST-LIO2 (robustez mediante un acoplamiento estrecho con la IMU)— evolucionó como respuesta a un desafío específico. En lo que respecta a la gestión de entornos geométricamente degenerados, la mayoría de los sistemas operativos han convergido en diseños basados en un acoplamiento estrecho con la IMU como base.
¿Determina la pose LiDAR de forma unívoca el éxito de la medición de distancia?
Los planos y los pasillos largos pueden dejar algunas direcciones de movimiento poco restringidas. El éxito de la medición de distancia y la observabilidad del registro son diferentes.
Comentarios
Inicia sesión para continuar.
Todavía no hay datos.