Contents — find the section you need
O sensor giratório no topo de um carro autônomo ou a pequena janela no topo de um robô aspirador — muitos deles são LiDAR (Light Detection And Ranging), um sensor que mede a distância até o ambiente ao seu redor diretamente usando luz laser. O LiDAR-SLAM é a tecnologia que realiza autolocalização e mapeamento simultaneamente, usando apenas os dados da nuvem de pontos retornados por um LiDAR (opcionalmente auxiliado por sensores como uma IMU). Enquanto o Visual-SLAM (veja "Visual-SLAM Primer") tenta recuperar indiretamente a estrutura 3D a partir de imagens 2D de uma câmera, o LiDAR-SLAM parte diretamente da informação de distância 3D — essa é a principal diferença. Este artigo parte do princípio do que um LiDAR realmente mede, aborda os dois algoritmos principais para alinhamento de nuvens de pontos — ICP e NDT — o design baseado em características que o LOAM representa, Loop Closure e Graph SLAM, e finalmente a linhagem de algoritmos marcantes e como escolher entre eles na prática. Os desenvolvimentos atuais são abordados em "Tendências Tecnológicas em LiDAR-SLAM".
Família de LiDAR Velodyne
Exemplos de LiDAR LivoxImagens: Velodyne Família de sensores LiDAR (APJarvis, CC BY-SA 4.0) / Livox Mid-40, Horizon e Tele-15 (Dllu, CC BY-SA 4.0), Wikimedia Commons. Famílias de produtos representativas, não necessariamente os modelos mais recentes mencionados no texto.
0. O que este artigo aborda
- O que um LiDAR realmente mede e por que ele obtém a distância "diretamente"
- Como o problema fundamental do SLAM se manifesta no mundo das nuvens de pontos
- Como os dois principais algoritmos de correspondência de varreduras, ICP (Iterative Closest Point) e NDT (Normal Distributions Transform), funcionam e como eles diferem
- A diferença entre os dois modos de odometria LiDAR: Varredura para Varredura e Varredura para Mapa
- Por que o LOAM extrai características (arestas e planos) e o raciocínio por trás disso
- Como o fechamento de loop e a otimização do gráfico de pose se encaixam
- As diferenças entre os principais algoritmos — ICP / NDT / LOAM / LeGO-LOAM / A-LOAM / Cartographer / LIO-SAM / FAST-LIO2 — e como escolher
1. O que é LiDAR-SLAM?
- Em resumo: LiDAR-SLAM é a tecnologia que utiliza um conjunto de medições de distância de alta precisão (uma nuvem de pontos) obtidas a partir do tempo de voo (ou defasagem) da luz laser, registrando repetidamente varreduras sucessivas umas contra as outras (correspondência de varreduras), para estimar simultaneamente a trajetória do próprio sensor e um mapa 3D do ambiente ao seu redor.
A entrada é a nuvem de pontos que um LiDAR gera em intervalos fixos (de alguns milhares a centenas de milhares de pontos por varredura), e a saída — assim como no Visual-SLAM — consiste em duas coisas: a pose do sensor com 6 graus de liberdade a cada instante (3 para posição, 3 para orientação) e um mapa 3D da nuvem de pontos do ambiente ao redor. Exemplos de aplicações incluem: um carro autônomo mantendo relações de distância precisas com veículos, pedestres e infraestrutura viária ao redor, enquanto estima sua própria posição; um robô móvel autônomo navegando com precisão entre prateleiras de armazém; Um drone voando por espaços geometricamente complexos, como túneis ou interiores de edifícios — o LiDAR-SLAM é o que está funcionando internamente em todos esses casos.
2. O que um LiDAR realmente mede?
Os princípios de medição de distância por LiDAR se dividem em duas categorias principais. Na abordagem ToF (Tempo de Voo), o sensor emite um pulso de laser e mede o tempo que a reflexão leva para retornar do alvo, derivando então a distância a partir da velocidade da luz.
Como a luz percorre o caminho de ida e volta, o tempo medido precisa ser dividido por dois para se obter o tempo de propagação unidirecional. A outra abordagem, deslocamento de fase (FMCW/AMCW), transmite um feixe de laser continuamente modulado e deriva a distância a partir da diferença de fase entre os sinais transmitido e refletido. De qualquer forma, um LiDAR não apenas detecta a presença de algo, mas também obtém a distância absoluta até o objeto em uma única observação — uma capacidade que uma câmera não possui. Como veremos na seção 4, uma única imagem de câmera monocular jamais conseguirá recuperar a escala do mundo real por si só, enquanto uma nuvem de pontos LiDAR carrega a escala métrica desde o início.
Existem também duas famílias de hardware LiDAR. O LiDAR mecânico rotativo gira um conjunto de múltiplos elementos transmissores/receptores a laser para construir uma nuvem de pontos completa de 360 graus; Velodyne e Ouster são fabricantes representativos. O LiDAR de estado sólido não possui partes mecânicas rotativas, utilizando espelhos MEMS ou matrizes de fase óptica para escanear um campo de visão limitado, resultando em tamanho e custo menores; Livox é um exemplo representativo. As unidades de estado sólido trocam um campo de visão mais estreito por, em muitos produtos, um padrão de varredura não repetitivo (escaneando o mesmo ponto ao longo de um caminho ligeiramente diferente a cada vez), o que significa que as nuvens de pontos ficam mais densas quanto mais tempo forem acumuladas. As nuvens de pontos LiDAR também possuem uma estrutura que as imagens de câmeras não têm. Um LiDAR giratório emite múltiplos lasers empilhados verticalmente (por exemplo, 16, 32 ou 128 camadas) enquanto gira horizontalmente, produzindo nuvens de pontos densas horizontalmente, mas esparsas e estratificadas verticalmente — uma distribuição anisotrópica. Essa estrutura influencia diretamente o projeto da extração de características do LOAM e a estimativa de normal do ICP, ambos os quais abordaremos a seguir.
3. O Problema Fundamental do SLAM: "Onde no Mapa a Nuvem de Pontos Atual Pertence?"
Assim como o Visual-SLAM resolve "onde a imagem atual corresponde, dentro das imagens anteriores e do mapa" por meio da correspondência de pontos de características, o LiDAR-SLAM resolve "onde a varredura atual (nuvem de pontos) corresponde, dentro das varreduras anteriores e do mapa" alinhando nuvens de pontos umas com as outras. O problema subjacente é essencialmente o mesmo, independentemente do sensor: uma única observação nunca pode determinar a posição absoluta; A única maneira de prosseguir é continuar estimando a posição atual usando a correspondência com observações passadas (o mapa) como pista.
O que difere é a essência dessa correspondência. O SLAM visual detecta "pontos salientes" (características) em uma imagem, codifica numericamente a aparência ao redor deles como um descritor e busca correspondências por similaridade de descritores. Uma nuvem de pontos LiDAR, por outro lado, quase não carrega informações de "aparência", como brilho ou cor (a intensidade de refletância está disponível, mas é muito menos discriminativa do que um descritor de imagem). Como resultado, a correspondência de nuvens de pontos é, na maioria dos casos, guiada puramente pela proximidade espacial — "qual ponto está geometricamente mais próximo". O processo geral de encontrar a transformação rígida (rotação R, translação \mathbf{t}) entre duas nuvens de pontos é chamado de Correspondência de Varredura e forma o núcleo do LiDAR-SLAM.
A principal conclusão desta seção é simples: enquanto o Visual-SLAM utiliza "correspondência de características + geometria epipolar", o LiDAR-SLAM substitui isso por "correspondência de varreduras". As duas seções seguintes abordam os dois algoritmos principais que realizam a correspondência de varreduras: ICP e NDT.
4. Compreendendo o ICP
ICP (Iterative Closest Point) é um algoritmo clássico para registro de nuvens de pontos, publicado por Besl e McKay em 1992 no periódico IEEE Transactions on Pattern Analysis and Machine Intelligence, e ainda amplamente utilizado hoje em dia. Como o nome sugere, ele se baseia em uma ideia simples: tratar o "ponto mais próximo" como o ponto correspondente e, em seguida, refiná-lo repetidamente.
O algoritmo pode ser organizado em três etapas.
- Busca de correspondência: para cada ponto p_i na nuvem de pontos que está sendo movida (a origem), encontre o ponto mais próximo q_i na nuvem de pontos fixa (o destino) — normalmente usando uma estrutura de busca espacial, como uma árvore KD.
- Estimativa de transformação: dado este conjunto de correspondências \{(p_i, q_i)\}, encontre a rotação R e a translação \mathbf{t} que minimizam a soma das distâncias entre os pontos correspondentes. A versão mais simples, o erro Ponto a Ponto, é definida da seguinte forma.
- Aplicar e iterar: aplique os resultados R e \mathbf{t} a toda a nuvem de pontos de origem e, em seguida, volte à etapa 1 e busque correspondências novamente. Este ciclo de busca de correspondência → estimativa de transformação → aplicação se repete até que o erro se torne suficientemente pequeno (ou pare de diminuir).
O erro ponto a ponto é intuitivo, mas ao alinhar dois planos amplos e planos — uma parede, por exemplo — pouco importa, da perspectiva do erro, exatamente onde os pontos correspondem ao longo desse plano (um pequeno deslizamento ao longo do plano mal altera o erro, desde que o deslocamento perpendicular seja pequeno), portanto a convergência tende a ser lenta. O erro ponto a plano resolve isso: ele estima um vetor normal n_i a partir da forma local ao redor do ponto correspondente q_i e minimiza apenas a discrepância ao longo da direção normal (a distância ponto a plano).
O método Ponto-a-Plano tolera deslocamentos ao longo do plano, penalizando estritamente apenas a discrepância perpendicular a ele, e é conhecido por convergir mais rápida e estávelmente do que o método Ponto-a-Ponto, especialmente em ambientes com muitos planos, como interiores de edifícios. Dito isso, como observado na seção 2, a nuvem de pontos de um LiDAR rotativo possui uma estrutura em camadas e verticalmente esparsa, de modo que a estimativa ingênua das normais pode produzir normais ruidosas, arrastadas pelas camadas — a própria estimativa de normais requer cuidado.
O método ICP tem duas principais fraquezas. Primeiro, como a busca por correspondência depende puramente do "vizinho geométrico mais próximo", um grande deslocamento inicial leva a correspondências incorretas e convergência para um mínimo local — uma boa estimativa inicial é necessária. Segundo, executar a busca por vizinho mais próximo repetidamente em nuvens de pontos com dezenas de milhares de pontos por quadro é computacionalmente caro, escalando com o tamanho da nuvem. O método NDT, abordado a seguir, adota uma abordagem diferente que evita completamente a busca por correspondência.
5. Compreendendo o NDT
NDT (Transformação de Distribuições Normais) é um algoritmo de correspondência de varreduras com uma abordagem fundamentalmente diferente do ICP, publicado por Biber & Straßer em 2003 na Conferência Internacional IEEE/RSJ sobre Robôs e Sistemas Inteligentes (IROS). Originalmente, foi proposto para scanners a laser 2D; posteriormente, foi estendido para lidar também com nuvens de pontos 3D.
A ideia central do NDT é representar uma nuvem de pontos não como um conjunto de pontos individuais, mas como uma distribuição de probabilidade definida por voxel em uma grade regular. A distribuição de pontos dentro de cada voxel é aproximada por uma distribuição gaussiana (normal) com média \mu e matriz de covariância \Sigma.
Tendo representado toda a nuvem de pontos alvo desta forma — como um conjunto de distribuições gaussianas por voxel formando uma função de densidade de probabilidade diferenciável e contínua por partes — não há mais necessidade de "buscar correspondências ponto a ponto" para alinhar a nuvem de origem. Em vez disso, para uma transformação T (rotação e translação) aplicada a cada ponto de origem \mathbf{x}_i, resultando em \mathbf{x}_i' = T(\mathbf{x}_i), você soma o quão "plausível" esse ponto transformado é sob a gaussiana de seu voxel correspondente, como uma função de pontuação, e encontra o T que a maximiza.
Essa otimização é resolvida com métodos baseados em gradiente, como o método de Newton. Ao contrário do ICP, não há necessidade de alternar entre "busca por correspondência" e "estimativa de transformação" como etapas separadas — basta avaliar o gradiente em relação aos parâmetros gaussianos pré-computados — evitando-se, assim, completamente o custo da busca por vizinhos mais próximos. E como o ruído em pontos individuais é absorvido pela média e covariância de cada voxel, o resultado tende a ser robusto ao ruído.
O NDT, no entanto, apresenta sua própria desvantagem: a escolha do tamanho do voxel. Voxels maiores são computacionalmente mais leves, mas suavizam pequenas diferenças de forma, prejudicando a precisão do alinhamento. Voxels menores aumentam a resolução da forma, mas deixam menos pontos por voxel, tornando a própria estimativa gaussiana instável, e o aumento no número de voxels também eleva o custo computacional. Esse parâmetro ajustável, que o usuário precisa configurar corretamente, é o que torna o NDT praticamente complicado de usar.
6. Odometria LiDAR (Scan-to-Scan / Scan-to-Map)
O processo de usar ICP ou NDT para encontrar o movimento relativo entre quadros sucessivos e acumular essas estimativas ao longo do tempo é chamado de Odometria LiDAR. Assim como na Odometria Visual em SLAM Visual, sem algum mecanismo para reconciliar com o mapa como um todo (Fechamento de Loop), a deriva se acumula ao longo do tempo e não pode ser evitada.
A Odometria LiDAR apresenta duas variantes, dependendo do que é comparado. Scan-to-Scan registra cada varredura apenas em relação à varredura imediatamente anterior; é computacionalmente barato, mas como cada erro de estimativa se propaga diretamente para a estimativa inicial da próxima varredura, a deriva tende a se acumular. Scan-to-Map registra a varredura atual não em relação a uma única varredura anterior, mas em relação a todo o mapa local acumulado; A utilização de mais observações torna o método menos sensível a ruídos e geralmente mais preciso do que o Scan-to-Scan, ao custo de maior poder computacional devido ao tamanho maior da nuvem de pontos de referência.
A maioria das implementações práticas de LiDAR-SLAM combina os dois métodos. Primeiro, obtém-se uma estimativa inicial rápida e aproximada — por meio de Scan-to-Scan, predição da IMU ou um alinhamento aproximado baseado em NDT (Ensaios Não Destrutivos) da seção 5 — e essa estimativa inicial é então refinada com um registro preciso Scan-to-Map. O fluxo de processamento abaixo ilustra um fluxo geral de processamento de LiDAR-SLAM baseado nessa ideia de duas etapas.
Figura 1 — O caminho rápido por varredura vai da correção de inclinação, passando pelo registro local, até as atualizações de pose e mapa local, alimentando a próxima estimativa inicial e o mapa de referência. Um caminho separado de taxa mais baixa verifica revisita o histórico de quadros-chave, admite restrições de loop e usa otimização de grafo para corrigir a trajetória global e o mapa.
A etapa Deskew (correção de distorção durante a varredura) mostrada no diagrama é específica para LiDAR. A varredura única de um LiDAR giratório não é capturada instantaneamente — leva dezenas a centenas de milissegundos para ser adquirida. Se o próprio sensor se mover durante esse intervalo, os pontos capturados anteriormente e os pontos capturados posteriormente na mesma varredura acabam representando observações de momentos e posições genuinamente diferentes, todos misturados em uma única varredura (Distorção de Movimento). O Deskew usa uma IMU (ou a estimativa de velocidade anterior) para corrigir esse movimento durante a varredura, reconstruindo a nuvem de pontos como se tivesse sido capturada em um único instante. Essa correção está profundamente conectada à fusão de IMU abordada no VIO/LIO (consulte "VIO/LIO Primer").
7. Compreendendo o LOAM
LOAM (Lidar Odometry and O artigo "Mapeamento em Tempo Real" (LOAM), publicado por Zhang e Singh em 2014 na revista Robotics: Science and Systems (RSS), serve de base para o projeto de muitas implementações de LiDAR-SLAM até hoje. A principal inovação do LOAM é extrair apenas pontos geometricamente distintos em vez de usar todos os pontos da nuvem de pontos**.
O LOAM avalia a suavidade local (curvatura) ao redor de cada ponto e extrai pontos com alta curvatura em relação ao seu entorno como características de borda (cantos nítidos ou contornos de objetos) e pontos com baixa curvatura como características planas (parte de uma superfície contínua e suave, como uma parede ou piso). Em vez de usar uma varredura completa com dezenas de milhares de pontos para o registro, restringir a análise apenas a essas características reduz drasticamente o custo computacional da correspondência de varreduras.
Uma vez extraídas as características, a formulação do erro ecoa as ideias do ICP da seção 4, mas o elemento geométrico comparado é uma "linha" ou um "plano" em vez de um "ponto". Uma característica de borda p_i é correspondido minimizando sua distância à linha formada por dois pontos correspondentes, p_a e p_b, na varredura anterior (ou no mapa).
Uma feição planar é correspondida minimizando sua distância ao plano formado por três pontos correspondentes (a mesma forma do erro Ponto-Plano na seção 4). Somando essas distâncias e minimizando a rotação e a translação, obtém-se o movimento relativo entre os quadros.
Outra escolha central de design do LOAM é sua estrutura de dois níveis: Odometria Lidar de alta frequência e Mapeamento Lidar de baixa frequência. A Odometria Lidar executa uma correspondência Varredura-para-Varredura baseada em feições com a varredura imediatamente anterior em alta frequência (a cada varredura), produzindo uma estimativa de pose aproximada, porém rápida. O Mapeamento Lidar usa essa estimativa aproximada como palpite inicial e executa a correspondência Varredura-para-Mapa com o mapa acumulado como um palpite. O mapeamento LiDAR, em sua totalidade, opera em uma frequência mais baixa do que a odometria LiDAR, produzindo uma pose mais precisa e um mapa mais exato. Executar os dois processos em paralelo em frequências diferentes, com o resultado do mapeamento LiDAR corrigindo a estimativa da odometria LiDAR, permite obter simultaneamente alta frequência de saída e alta precisão. Essa filosofia de projeto de "estimativa aproximada de alta frequência + correção precisa de baixa frequência" foi herdada por muitas das implementações posteriores de LiDAR-SLAM e LIO abordadas na seção 9.
8. Fechamento de Loop e Graph SLAM
A odometria LiDAR, por si só, acumula desvio ao longo do tempo, assim como a odometria visual no Visual-SLAM, e mesmo após um robô retornar ao ponto de partida, a trajetória estimada não percebe isso. O mecanismo que corrige esse erro acumulado é o Fechamento de Loop.
O Fechamento de Loop no mundo LiDAR se divide em duas etapas principais. A primeira é o Reconhecimento de Local: avaliar se a nuvem de pontos atual se assemelha a uma nuvem de pontos de um local visitado anteriormente. Como as nuvens de pontos não A nuvem de pontos carrega informações de brilho da mesma forma que as imagens, e isso depende de abordagens que codificam a distribuição da forma da própria nuvem de pontos como um descritor — por exemplo, métodos como o Scan Context, que divide uma varredura em células em forma de leque e codifica a altura máxima em cada célula como um descritor — ou de métodos que resumem as características geométricas de toda a nuvem de pontos. Em segundo lugar, temos a verificação geométrica: para os pares de varreduras propostos como candidatos pelo reconhecimento de lugar, tenta-se efetivamente a correspondência entre as varreduras com ICP ou NDT e verifica-se se elas concordam suficientemente bem. Somente após passar por ambas as etapas é que uma restrição que liga a "posição atual" à "posição quando esse lugar foi visitado anteriormente" é considerada confiável o suficiente para ser adotada.
Usar essa restrição de fechamento de loop para corrigir as poses acumuladas e mapeá-las em um todo consistente é a função da otimização do Grafo de Pose, ou, de forma mais geral, da estrutura Graph SLAM. Ela constrói um grafo cujos nós são a pose do sensor em cada instante e cujas arestas são restrições ao movimento relativo entre quadros (ou entre dois instantes distantes ligados por um loop), e então ajusta os nós (poses) por meio de Otimização não linear para que todas as restrições de aresta sejam o mais mutuamente consistentes possível. A aresta recém-adicionada pelo fechamento do loop desempenha o papel de redistribuir a Deriva — que até então se propagava apenas em uma direção — por todo o caminho que compõe o loop. Essa otimização, assim como no Visual-SLAM (veja "Visual-SLAM Primer", seção 10), geralmente depende de bibliotecas como g2o, GTSAM e Ceres Solver também em implementações de LiDAR-SLAM.
9. Algoritmos Marcantes
A história do LiDAR-SLAM é mais fácil de acompanhar em dois eixos: como as nuvens de pontos são registradas e até que ponto o projeto restringe as coisas a características explícitas.
O ICP (Besl & McKay, 1992)** é, como abordado na seção 4, o algoritmo fundamental clássico e ainda amplamente utilizado para registro de nuvens de pontos. Ele é raramente usado O método independente para SLAM em tempo real é utilizado, mas alguma forma de minimização baseada em correspondência derivada dele permanece presente em quase todos os métodos subsequentes.
NDT (Biber & Straßer, 2003) é, como abordado na seção 5, uma correspondência de varredura baseada em distribuição gaussiana que evita a busca por correspondência e, juntamente com o ICP, é outra escolha fundamental, amplamente utilizada desde SLAM 2D para robôs em ambientes internos até aplicações de direção autônoma 3D.
LOAM (Zhang & Singh, 2014) é, como abordado na seção 7, o método que introduziu a extração de características de borda/plano juntamente com o design de odometria de alta frequência em duas camadas + mapeamento de baixa frequência, que fundamenta o design de muitas implementações de LiDAR-SLAM e LIO até hoje.
LeGO-LOAM (Lightweight and Ground-Optimized Lidar Odometry and Mapping, Shan & Englot, publicado em 2018 na Conferência Internacional IEEE/RSJ sobre Robôs Inteligentes e O LOAM (IROS Systems)** estende o LOAM especificamente para veículos terrestres. Ele primeiro separa a nuvem de pontos em pontos terrestres e não terrestres, usando os pontos terrestres para estimar a rotação, inclinação e elevação, e os pontos não terrestres para estimar os graus de liberdade restantes (posição horizontal e guinada), alcançando um design leve capaz de operação em tempo real mesmo em sistemas embarcados com capacidade computacional limitada.
O A-LOAM (LoAM Avançado) é uma reimplementação simplificada e de código aberto das ideias do LOAM, construída sobre a otimização não linear baseada no Ceres Solver, lançada por grupos como o Grupo de Robótica Aérea da HKUST. Ele abandona alguns dos ajustes de engenharia detalhados do LOAM original em favor de um código mais claro e é frequentemente referenciado como uma implementação acessível para aprendizado e experimentação com a família de algoritmos LOAM.
O Cartographer (Hess, Kohler, Rapp, Andor, publicado em 2016 na Conferência Internacional de Robótica e Automação (ICRA) do IEEE, Google) realiza correspondência de varredura local baseada no Ceres Solver. uma abordagem por submapa (sendo um submapa um conjunto de várias varreduras), combinada com detecção rápida de fechamento de loop por meio de uma busca Branch-and-Bound de divisão e conquista no espaço de candidatos. Suporta mapeamento 2D e 3D e — auxiliado por implementações de código aberto amplamente disponíveis para ROS — tem sido amplamente adotado em mapeamento de interiores.
LIO-SAM (Odometria Inercial LiDAR Acoplada via Suavização e Mapeamento, Shan, Englot, Meyers, Wang, Ratti, Rus, publicado em 2020 no IROS) é um método de Odometria Inercial LiDAR (LIO) acoplado que otimiza conjuntamente fatores de pré-integração da IMU, fatores de correspondência de varredura LiDAR, fatores de GPS e fatores de fechamento de loop dentro de um Grafo de Fatores compartilhado (consulte "VIO/LIO Primer" para mais detalhes). (detalhes).
O FAST-LIO2**, publicado por Xu, Zhang e colegas do Laboratório MARS da Universidade de Hong Kong, é um LIO rápido baseado em um Filtro de Kalman Iterado de Acoplamento Estreito. Ao gerenciar a nuvem de pontos diretamente com uma estrutura de busca sequencial de vizinhos mais próximos (uma árvore k-d incremental, iKD-Tree), ele registra a nuvem de pontos diretamente no mapa sem uma etapa explícita de extração de características, e seu design prioriza a operação em tempo real em plataformas pequenas com poder computacional limitado. Os desenvolvimentos atuais, previstos para 2026, são abordados em "Tendências Tecnológicas em LiDAR-SLAM".
10. Comparando os Métodos
| Método | Princípio | Precisão | Custo computacional | Robustez | Dificuldade de implementação |
|---|---|---|---|---|---|
| ICP | Busca por vizinho mais próximo + minimização iterativa de transformação rígida | Alta precisão com uma boa estimativa inicial; caso contrário, cai em mínimos locais | Custo médio-alto (custo da busca iterativa por vizinho mais próximo) | Fraco em ambientes geometricamente sem características ou contra grandes deslocamentos iniciais | Baixo (conceitualmente simples, muitas implementações existentes) |
| NDT | Maximização do ajuste em relação a distribuições gaussianas por voxel | Depende do tamanho do voxel; comparativamente robusto ao ruído | Médio (sem busca de correspondência, mas envolve cálculo de gradiente) | Robusto ao ruído, mas requer ajuste do tamanho do voxel | Médio (o ajuste requer alguma prática) |
| LOAM | Extração de características de borda/planares + Odometria/Mapeamento de duas camadas | Alta precisão em ambientes ricos em características | Médio (mais leve do que usar toda a nuvem de pontos, graças à seleção de características) | Fraco em ambientes com poucas características (túneis, etc.) | Custo médio-alto (parâmetros e design complexos) |
| LeGO-LOAM | Separação de pontos no solo + duas camadas no estilo LOAM Otimização | Alta precisão para veículos terrestres; as premissas deixam de ser válidas para plataformas aéreas | Média (mais leve que LOAM) | Altamente dependente da presença de um plano de solo plano | Média |
| A-LOAM | Reimplementação simplificada do LOAM usando o Ceres Solver | Aproximadamente equivalente ao LOAM (varia conforme a implementação) | Média | Herda as mesmas fraquezas do LOAM | Baixa a média (fácil de usar como referência para aprendizado) |
| Cartógrafo | Correspondência de varredura por submapa + fechamento de loop Branch-and-Bound | Alta precisão em ambientes internos (2D); forte em consistência global | Média a alta (custo de gerenciamento de submapas e busca Branch-and-Bound) | Forte em ambientes internos com muitos loops | Média (fácil de adotar dentro do ecossistema ROS) |
| LIO-SAM | Otimização de grafo de fatores da pré-integração de IMU + odometria LiDAR + GPS + fechamento de loop | Alta precisão com fusão de IMU; a consistência global melhora ainda mais com GPS | Alta (custo de otimização de grafo de fatores) | IMU ajuda a combater a degeneração geométrica | Média a alta (sensor específico) Suposições, por exemplo, IMU de 9 eixos) |
| FAST-LIO2 | Registro direto via Filtro de Kalman Iterado + Árvore iKD | Alta precisão em alta frequência (especialmente pronunciada em LiDAR de estado sólido) | Baixo a médio (o método direto evita o custo de extração de características) | Depende da IMU sob degenerescência; fraco sob condições de geometria extremamente baixa | Médio (a implementação é pública, mas o ajuste interno requer conhecimento especializado) |
No geral, é útil considerar o ICP e o NDT como os "algoritmos de registro fundamentais", a família LOAM (LOAM/LeGO-LOAM/A-LOAM) como "ganhos de eficiência por meio do design de características", o Cartographer como "consistência global eficiente e fechamento de loop" e o LIO-SAM/FAST-LIO2 como "ganhos de robustez por meio do acoplamento estreito da IMU" — cada um um eixo distinto de melhoria construído sobre o que veio antes.
11. Onde o LiDAR-SLAM encontra dificuldades
Porque o LiDAR emite ativamente O LiDAR-SLAM utiliza luz laser para medir distâncias e apresenta bom desempenho em ambientes escuros e com contraluz — justamente onde o Visual-SLAM encontra dificuldades. No entanto, o LiDAR-SLAM também possui suas próprias limitações.
- Degeneração geométrica: em ambientes onde o formato da nuvem de pontos praticamente não se altera em uma determinada direção — como um túnel longo ou um amplo estacionamento plano — a correspondência de varreduras não consegue determinar com precisão a translação ou rotação nessa direção. Isso ocorre porque a otimização ICP/NDT atinge um "vale plano" onde o erro praticamente não se altera para qualquer valor nessa direção; essa limitação compartilha a mesma causa raiz da fragilidade do Visual-SLAM em paredes sem características distintivas.
-
Condições climáticas severas: chuva, neve, neblina e poeira dispersam e absorvem a luz laser, atenuando reflexos que, de outra forma, retornariam, ou gerando pontos de ruído (reflexos espúrios que aparecem em posições onde, na realidade, não há nada).
-
Espelhos e objetos transparentes: vidro e espelhos podem refletir especularmente a luz laser, gerando pontos espúrios em locais diferentes da posição real do objeto (a imagem espelhada). Localização).
-
Objetos dinâmicos: usar pontos em objetos em movimento — pedestres, veículos — como se fizessem parte de um ambiente estático durante o registro introduz erros na estimativa do próprio movimento do sensor. Detectar e excluir objetos dinâmicos, ou modelá-los explicitamente, torna-se necessário.
-
A relação entre densidade de pontos e custo computacional: nuvens de pontos de maior resolução e frequência tendem a produzir registros mais precisos, mas quanto mais pontos por quadro, maior o custo computacional da correspondência de varreduras. Em sistemas embarcados ou drones com capacidade computacional limitada, essa relação entre densidade e velocidade torna-se uma importante restrição de projeto.
-
Custo do hardware: LiDARs giratórios de alta resolução e longo alcance continuam sendo substancialmente mais caros do que câmeras, e o custo geralmente é uma barreira real à adoção.
Muitas dessas fraquezas se manifestam em uma direção diferente das fraquezas de uma câmera, o que torna a combinação de Câmera (Visual-SLAM) e LiDAR (LiDAR-SLAM) — fusão de sensores (veja "[Fusão de Sensores]") Introdução à fusão de sensores em robôs (LiDAR-SLAM) — uma maneira poderosa de compensar as limitações de cada sensor individualmente.
12. Escolhendo na Prática
A escolha entre os métodos LiDAR-SLAM depende muito dos sensores que podem ser instalados, da capacidade computacional disponível, da precisão necessária e das características geométricas do ambiente.
- Robôs de serviço e aspiradores robóticos para ambientes internos: o LiDAR 2D de baixo custo continua sendo uma opção forte e consistente, e implementações robustas de SLAM 2D, como o Cartographer, são amplamente utilizadas. Espaços internos, ricos em estruturas como paredes e móveis, raramente apresentam degeneração geométrica, tornando-os um ambiente favorável para o LiDAR-SLAM.
- Carros autônomos: o LiDAR 3D de alta resolução combinado com a fusão de múltiplos sensores, incluindo GPS, IMU e câmera, é a premissa básica. Para contornar trechos geometricamente degenerados, como túneis e viadutos, configurações com forte acoplamento de IMU, como... LIO-SAM/FAST-LIO2 têm peso significativo.
- Drones: dadas as restrições rigorosas de peso e energia, o LiDAR de estado sólido (por exemplo, Livox) combinado com um método direto computacionalmente eficiente como o FAST-LIO2 tende a ser preferido.
- AGVs/AMRs para armazéns e fábricas: ambientes com estrutura regular, semelhante a corredores, são comuns, tornando as abordagens de Scan-to-Map baseadas em LiDAR 2D (por exemplo, Cartographer) uma escolha prática. Em ambientes onde o layout das prateleiras muda frequentemente, a frequência de atualização do mapa também influencia a seleção.
- Ambientes degenerados — túneis, espaços subterrâneos, longos corredores retos: o LiDAR sozinho tende a apresentar registro instável, portanto, o acoplamento estreito com IMU (LIO-SAM/FAST-LIO2) ou a combinação com uma fonte independente, como a odometria de rodas, torna-se praticamente essencial.
- Ambientes internos vs. externos: espaços internos são ricos em estrutura com abundantes pistas geométricas, favorecendo o LiDAR-SLAM, enquanto espaços externos representam um desafio maior. A degeneração em áreas abertas e condições climáticas severas torna a fusão IMU/GNSS ainda mais importante.
Como regra prática: um método direto como o FAST-LIO2 para computação limitada e saída de alta frequência, o LIO-SAM para consistência global que também incorpora GPS, e o Cartographer por seu histórico em ambientes 2D e forte integração com o ecossistema ROS. Uma configuração sem IMU (ICP/NDT/LOAM independente) tornou-se uma escolha quase inviável hoje em dia, dada a demanda por resiliência a ambientes degenerados, e a maioria dos sistemas operacionais agora são projetados com base em um acoplamento IMU robusto como premissa básica.
13. Referências
- Besl & McKay, “A Method for Registration of 3-D Shapes” (IEEE TPAMI, 1992)
- Zhang & Singh, “LOAM: Lidar Odometry and Mapping in Real-time” (RSS, 2014)
- Xu et al., “FAST-LIO2: Fast Direct LiDAR-Inertial Odometry” (IEEE T-RO, 2022)
14. Resumo
O LiDAR-SLAM utiliza as informações de distância em escala métrica (nuvens de pontos) obtidas a partir do tempo de voo de um laser, realiza a correspondência de varreduras com ICP (registro iterativo dos pontos mais próximos) ou NDT (ajuste a distribuições gaussianas por voxel), Acumula uma trajetória por meio da Odometria LiDAR, combinando Scan-to-Scan e Scan-to-Map, e corrige continuamente o erro acumulado por meio do Loop Closure e da otimização do Pose Graph — alcançando, em conjunto, autolocalização e mapeamento simultâneos. A linhagem de algoritmos marcantes — a família LOAM (eficiência por meio da extração de características), o Cartographer (consistência global eficiente) e o LIO-SAM/FAST-LIO2 (robustez por meio do acoplamento rígido da IMU) — evoluiu como resposta a um desafio específico e, com base na necessidade de lidar com ambientes geometricamente degenerados, a maioria dos sistemas operacionais convergiu para projetos construídos em torno do acoplamento rígido da IMU como princípio básico.
O sucesso na medição de distância determina exclusivamente a pose do LiDAR?
Planos e corredores longos podem deixar algumas direções de movimento pouco restritas. O sucesso na medição de distância e a observabilidade do registro são diferentes.
Comentários
Entre na sua conta para continuar.
Ainda não há dados.