Contents — find the section you need

Nem o Visual-SLAM nem o LiDAR-SLAM funcionam em todos os lugares sozinhos. Uma câmera tem dificuldades no escuro ou em movimentos rápidos; o LiDAR tem dificuldades em ambientes com poucos detalhes e custa mais. A chave para superar essas deficiências é a IMU (Unidade de Medição Inercial), que mede a aceleração e a velocidade angular em alta frequência. VIO (Odometria Visual-Inercial) e LIO (Odometria Inercial-LiDAR) — que combinam uma câmera ou um LiDAR com uma IMU — tornaram-se a configuração padrão de fato em muitos robôs móveis autônomos, drones e dispositivos de RA/RV atualmente. Este artigo parte do princípio de por que uma IMU sozinha não consegue sustentar uma estimativa de posição, aborda a ideia de fusão de sensores, as duas filosofias de projeto de estimativa baseada em filtro e baseada em otimização e, finalmente, os algoritmos fundamentais: ROVIO, OKVIS, VINS-Mono, OpenVINS, LIO-SAM e FAST-LIO2.

IMU integrada GNSS/INS Xsens MTi-GExemplo de IMU/INS
Família de sensores LiDAR LivoxExemplo de LiDAR

Imagens: Xsens MTi-G (Kallap85, CC BY-SA 4.0) / Livox Mid-40, Horizon e Tele-15 (Dllu, CC BY-SA 4.0), Wikimedia Commons. Sensores de entrada representativos, não uma configuração de hardware VIO/LIO obrigatória.

0. O que este artigo aborda

  • O que uma IMU mede e por que uma IMU sozinha não consegue recuperar a posição ao longo do tempo
  • As limitações de uma câmera e de um LiDAR, respectivamente, e por que a combinação de qualquer um deles com uma IMU funciona tão bem
  • O que VIO e LIO significam e como diferem
  • A diferença entre as filosofias de projeto baseadas em filtro (EKF/MSCKF) e em otimização (Factor Graph)
  • O que ROVIO, OKVIS, VINS-Mono, VINS-Fusion e OpenVINS (VIO) e LIO-SAM, FAST-LIO e FAST-LIO2 (LIO) contribuem
  • Como escolher entre VIO e LIO na prática, por caso de uso

1. Resposta curta: O que são IMU, VIO e LIO

Em uma frase cada: **Uma IMU (Unidade de Medição Inercial) A Unidade de Medição Inercial (IMU) é um sensor que combina um acelerômetro e um giroscópio para medir sua própria aceleração e velocidade angular em alta frequência, sem qualquer referência a pontos de referência externos. A Odometria Visual-Inercial (VIO) é a técnica de combinar essa IMU com uma câmera para estimar a posição e a orientação do próprio objeto; a Odometria Inercial por LiDAR (LIO) faz o mesmo combinando uma IMU com um LiDAR.

Uma IMU informa, em alta frequência (tipicamente centenas de Hz até cerca de 1 kHz), "quão forte estou acelerando e quão rápido estou girando neste momento" — mas sua grandeza integrada, a posição, se desvia rapidamente com o tempo (analisaremos isso detalhadamente na Seção 3). Uma câmera ou um LiDAR, ao cruzar dados com o ambiente ao redor, podem fornecer restrições de posição relativa, mas apenas em baixa frequência (dezenas de Hz), e ambos perdem completamente sua função em certas situações — escuridão, cenas com poucos detalhes, movimento rápido. A ideia central do VIO e do LIO é combinar este "IMU de alta frequência, mas com deriva" com uma "câmera/LiDAR de baixa frequência que possui modos de falha dependentes do ambiente", de forma que cada um compense a fraqueza do outro.

2. O que um IMU realmente mede?

Dentro de um IMU, existem, em linhas gerais, dois tipos de sensores.

Um acelerômetro mede a força específica em seu sistema de coordenadas. Idealmente, \mathbf{f}_b=R_{wb}^{T}(\mathbf{a}_w-\mathbf{g}_w) , onde R_{wb} rotaciona as coordenadas do sensor para as coordenadas do mundo, \mathbf{a}_w é a aceleração no sistema de coordenadas do mundo e \mathbf{g}_w é a gravidade. Ele lê cerca de 1 g em repouso e quase zero em queda livre ideal. Antes da integração, corrige-se o viés, rotaciona-se para o sistema de coordenadas do mundo e adiciona-se a gravidade. Consulte as definições de coordenadas e viés no modelo IMU do OpenVINS. Um giroscópio mede a taxa de rotação do próprio sensor, ou seja, sua velocidade angular. Combinando três eixos simultaneamente, obtém-se a taxa de rotação em torno de inclinação, rotação em torno de um eixo horizontal (roll), inclinação vertical (pitch) e guinada (yaw).

Ao combinar esses dois tipos de sensores, uma IMU (Unidade de Medição Inercial) pode fornecer informações de movimento com 6 graus de liberdade (3 translacionais + 3 rotacionais) em alta frequência, puramente a partir do estado interno do sensor, sem qualquer referência a um ponto de referência externo (uma característica mapeada, um sinal de rádio). Essa propriedade de "nenhuma referência externa" é simultaneamente a maior força e a maior fraqueza da IMU — a força reside na robustez que se mantém inalterada na escuridão total ou dentro de uma sala com paredes de vidro; a fraqueza reside no erro acumulado que analisaremos na Seção 3.

A saída de uma IMU também sempre contém viés (bias) e ruído (ruído). O viés é um erro de offset intrínseco ao sensor — a saída não é zero mesmo quando o valor real é zero — e sofre deriva lenta ao longo do tempo devido a fatores como mudanças de temperatura (Instabilidade de Viés). O ruído é uma flutuação aleatória adicionada a cada leitura. IMUs MEMS (Sistemas Microeletromecânicos) mais baratos tendem a apresentar maior viés e ruído, e essa é a principal causa da Deriva discutida a seguir.

3. Encontrando a Posição Apenas com uma IMU (Integração e Deriva)

Recuperar a posição a partir da saída da IMU requer a integração da aceleração duas vezes: a velocidade é a integral da aceleração e a posição é a integral da velocidade.

p(t) = p_0 + v_0 t + \int_0^{t}\!\!\int_0^{\tau} a(s)\,ds\,d\tau

Aqui, p_0 é a posição inicial, v_0 a velocidade inicial e a(s) a aceleração no instante s. A fórmula em si é simples, mas a aceleração a(s) usada na prática sempre carrega o viés b discutido na Seção 2. A dupla integração de uma aceleração que inclui o viés, a(s) + b, produz um termo de erro impulsionado pelo viés da forma

\text{position error}(t) \approx \frac{1}{2} b\, t^2

que diverge em proporção ao quadrado do tempo decorrido. O viés do giroscópio, além disso, distorce gradualmente a estimativa de orientação, e esse erro de orientação contamina a direção na qual a aceleração é integrada — portanto, o erro de posição geral tende a crescer na ordem de O(t^2) a O(t^3). Esse fenômeno, em que o erro se acumula indefinidamente ao longo do tempo, é chamado de Deriva.

Um número concreto ajuda a construir a intuição aqui. Suponha que uma IMU MEMS barata tenha um viés do acelerômetro de aproximadamente 0.01\,\mathrm{m/s^2}. Após 10 segundos, o erro de posição resultante é de aproximadamente \frac{1}{2} \times 0.01 \times 10^2 = 0.5\,\mathrm{m}. Após um minuto, o valor cai para 18\,\mathrm{m}. Uma IMU sozinha só pode ser confiável para estimativas de posição em escalas de tempo muito curtas — de segundos a algumas dezenas de segundos — e essa é a razão fundamental pela qual uma IMU sozinha não pode servir como um sistema de autolocalização. Em outras palavras: uma IMU é eficiente em "mudanças de curto prazo e alta frequência" e fraca em "posição absoluta de longo prazo" — exatamente o perfil oposto de pontos fortes e fracos de uma câmera ou LiDAR.

4. Uma Câmera e um LiDAR Também Têm Limitações

Se uma IMU sozinha não consegue recuperar a posição, a solução óbvia é usar uma câmera (veja "Visual-SLAM Primer") ou um LiDAR (veja "LiDAR-SLAM Technology Trends") em vez disso. Isso é verdade até certo ponto, mas tanto uma câmera quanto um LiDAR têm suas próprias limitações.

As limitações de uma câmera são a degradação da imagem em baixa luminosidade (os pontos de referência, ou os gradientes de brilho nos quais um método direto se baseia, tornam-se impossíveis de calcular), ambientes com pouca textura (uma parede branca lisa ou um piso de cor sólida não gera nenhum ponto de correspondência) e o desfoque de movimento em situações de alta velocidade (a imagem fica borrada durante o período de exposição, desestabilizando os descritores de características). Todos esses problemas compartilham a mesma causa subjacente: a câmera não está recebendo sinal visual suficiente para funcionar.

As fragilidades do LiDAR são ambientes com poucos detalhes (em um túnel longo ou em uma planície aberta, métodos de registro de nuvem de pontos como ICP/NDT não conseguem convergir para uma solução única — o que é chamado de degeneração geométrica) e o custo do sensor. O LiDAR emite um laser ativamente para medir a distância, portanto, é robusto à escuridão e à contraluz, mas em um local onde a geometria do ambiente é escassa, ele perde a precisão de maneira muito semelhante a uma câmera.

A fragilidade da IMU, como visto na Seção 3, é a deriva ilimitada que se acumula ao longo do tempo e o fato de que ela não possui meios, por si só, de recuperar a posição absoluta.

O ponto importante é que as situações em que esses três sensores falham praticamente não se sobrepõem. Uma IMU continua funcionando sem interrupções na escuridão, mesmo quando uma câmera apresenta dificuldades, e continua fornecendo informações de movimento de alta frequência até o momento em que uma câmera ou LiDAR perde suas características. As observações de câmeras e LiDAR restringem a deriva usando a geometria do ambiente. Elas não garantem precisão absoluta de posição a longo prazo sem restrições como um mapa conhecido, GNSS ou fechamento de circuito. Essa complementaridade é o ponto de partida para a fusão de sensores discutida na próxima seção.

5. A Ideia de Fusão de Sensores

Fusão de Sensores é a estrutura que combina as características de erro e os pontos fortes distintos de vários sensores para obter uma estimativa mais precisa, de maior frequência e mais robusta do que qualquer sensor individual (para a ideia geral de fusão, veja "Introdução à Fusão de Sensores"). O esqueleto compartilhado por VIO e LIO pode ser organizado como um loop Prever-Atualizar:

Diagram 1 · Use the button to switch views
Um loop fechado que combina a previsão de alta taxa da IMU com observações de câmera ou lidar de taxa mais baixa e alimenta o estado e o viés corrigidos na próxima propagação
Diagram 2 · Use the button to switch views

Figura 1 — A IMU (alta taxa) continua prevendo o estado por meio da Propagação (integração). As observações da correspondência de características/pontos com a Câmera/LiDAR (baixa taxa) corrigem essa previsão na etapa de Atualização. O viés da IMU estimado durante essa correção é realimentado na próxima Propagação, suprimindo continuamente o acúmulo de Deriva.

Este ciclo tem dois pontos-chave. Primeiro, a Propagação controlada pela IMU é executada continuamente em alta frequência e nunca para de prever a pose, mesmo nos momentos em que nenhuma observação da Câmera/LiDAR está disponível (escuridão, baixa textura, espaço com poucas características, movimento rápido). Segundo, a etapa de Atualização — que só é acionada quando uma observação da Câmera/LiDAR chega — reduz a Deriva que, de outra forma, se acumularia indefinidamente apenas com a IMU e, simultaneamente, atualiza a estimativa do próprio viés da IMU, realimentando-a na Propagação. Essa combinação — "previsão que continua sendo executada em alta frequência" mais "correção que reduz erros em direções limitadas pela observação" — é a filosofia de projeto compartilhada pela VIO e LIO.

6. VIO (Odometria Visual-Inercial)

VIO (Odometria Visual-Inercial) é a configuração na qual uma câmera desempenha o papel de sensor de atualização dentro dessa estrutura. Combinar a previsão de alta frequência da IMU com as observações de pontos de referência da câmera resolve a ambiguidade de escala que afeta a Odometria Visual monocular (mencionada na Seção 4 — o fato de que imagens monoculares sozinhas não conseguem recuperar uma distância métrica do mundo real), usando as informações de aceleração métrica da IMU. E em movimentos rápidos, onde a câmera tem dificuldades, a IMU continua fornecendo mudanças de orientação em alta frequência, tornando o rastreamento muito menos propenso a falhas.

A VIO se divide ainda em configurações Flexivelmente Acopladas e Fortemente Acopladas, dependendo de como a câmera e a IMU estão conectadas. Um sistema fracamente acoplado calcula a estimativa de pose do lado da câmera e a estimativa de pose do lado da IMU independentemente e, em seguida, as funde. Os dois resultados são obtidos posteriormente; a implementação é simples, mas, como o lado da IMU não consegue explorar a estrutura de erro interna da estimativa do lado da câmera (cuja observação de características é mais ou menos incerta), há perda de precisão. Um sistema fortemente acoplado trata os dados brutos da IMU e as observações de características da imagem como um único problema de estado estimado conjuntamente desde o início; a implementação é mais complexa, mas cada bit de informação de ambos os sensores é utilizado, resultando em maior precisão. As implementações modernas representativas de VIO que abordamos nas Seções 8, 9 e 10 (OKVIS, VINS-Mono, OpenVINS e outras) adotam o acoplamento forte.

7. LIO (Odometria Inercial LiDAR)

LIO (Odometria Inercial LiDAR) é a mesma estrutura, com um LiDAR desempenhando o papel de atualização. As nuvens de pontos LiDAR capturam a geometria ambiental diretamente e com alta precisão, mas uma única varredura leva dezenas a centenas de milissegundos para ser concluída e, se o próprio sensor se mover... Durante esse período, a nuvem de pontos resultante sofre distorção (Distorção de Movimento). Com as informações de orientação de alta frequência da IMU disponíveis, esse movimento durante a varredura pode ser corrigido, reconstruindo uma nuvem de pontos sem distorção.

Assim como no VIO descrito na Seção 6, em ambientes geometricamente degenerados com os quais o LIO apresenta dificuldades (túneis longos, planos abertos), a previsão contínua da pose em curto prazo pela IMU torna o registro da nuvem de pontos (métodos como ICP/NDT) muito menos propenso a divergências. O LIO também é implementado predominantemente como um sistema fortemente acoplado na prática — o LIO-SAM e o FAST-LIO/FAST-LIO2, abordados na Seção 10, adotam esse design fortemente acoplado.

8. Baseado em Filtro (Filtro de Kalman / EKF / MSCKF)

O núcleo do VIO e do LIO — a fusão de previsão e observação — é implementado sob uma das duas principais filosofias de design: Baseado em Filtro, ou a abordagem baseada em filtros. A abordagem baseada em otimização será abordada na próxima seção.

A base da abordagem baseada em filtro é o Filtro de Kalman, uma estrutura que alterna entre predição e atualização orientada por observação para derivar recursivamente a estimativa de estado ideal para um sistema com dinâmica linear. Para um problema como VIO/LIO, onde a composição da integração da IMU (composição de pose) e a projeção da câmera são inerentemente não lineares, utiliza-se a extensão não linear: o EKF (Filtro de Kalman Estendido). Um EKF lineariza cada função não linear em torno da estimativa atual (uma expansão de Taylor de primeira ordem) e, em seguida, aplica as mesmas equações de atualização que um Filtro de Kalman comum.

\hat{x}_k = \hat{x}_k^{-} + K_k\left(z_k - h(\hat{x}_k^{-})\right), \qquad K_k = P_k^{-} H_k^{\top}\left(H_k P_k^{-} H_k^{\top} + R\right)^{-1}

Aqui, \hat{x}_k^{-} é o estado previsto pela propagação, z_k a observação real, h(\cdot) o modelo de observação que prevê uma observação a partir do estado, e K_k é o Ganho de Kalman — o peso que decide o quanto confiar na previsão em relação à observação. P_k^{-} é a covariância (incerteza) do estado previsto, H_k é a matriz Jacobiana que lineariza o modelo de observação e R é a covariância do ruído de observação. Intuitivamente, quanto maior a incerteza prevista P_k^{-} em relação ao ruído de observação R, maior se torna o Ganho de Kalman K_k e mais fortemente a informação da observação z_k é incorporada à correção do estado.

Implementar um VIO baseado em EKF de forma ingênua requer incluir cada ponto de característica individual da imagem no vetor de estado, e o custo computacional aumenta rapidamente à medida que o número de pontos de característica cresce. O **MSCKF O Filtro de Kalman com Restrição Multi-Estado (MSCKF), proposto por Mourikis e Roumeliotis em 2007, resolve exatamente esse problema. O MSCKF não inclui os próprios pontos de recurso no estado do filtro; em vez disso, mantém múltiplas poses da câmera (uma janela deslizante) no estado e o atualiza usando apenas a restrição geométrica de que o mesmo ponto de recurso foi observado em várias dessas poses. Ao excluir os pontos de recurso do estado, evita-se a explosão computacional com a contagem de recursos, ao mesmo tempo que se aproveita de observações que abrangem vários quadros — um design eficiente de VIO baseado em filtro que agora é amplamente utilizado.

9. Baseado em Otimização (Ajuste de Pacote / Grafo de Fatores)

A estimativa baseada em filtro atualiza recursivamente, mas métodos como o MSCKF podem reter temporariamente poses passadas clonadas. A abordagem baseada em otimização mantém o estado e as observações abrangendo uma janela deslizante ou grafo e resolve uma otimização não linear para sua consistência conjunta. É útil pensar nisso como uma extensão do Pacote do Visual-SLAM. Ajuste (consulte "Visual-SLAM Primer", Seção 10) para também incorporar informações da IMU.

As acelerações e taxas angulares da IMU são observações conhecidas, não variáveis de otimização. Adicionar um estado a cada registro de tempo da IMU ou reintegrar cada intervalo a cada relinearização aumenta o custo. A Pré-integração da IMU, proposta por Forster et al. em 2015 (arXiv:1512.02363), resume as medições entre quadros-chave como um fator de movimento relativo corrigível por viés. O estado pode incluir velocidade e vieses e, em alguns sistemas, também pontos de referência; o custo é controlado pelo projeto da janela e pela relinearização, e não simplesmente pela taxa de amostragem da IMU.

O Fator de Pré-integração da IMU resultante, juntamente com os fatores derivados das observações da câmera/LiDAR (erro de reprojeção ou erro de correspondência de varredura), são colocados em um Gráfico de Fatores comum, e todo o processo é resolvido em conjunto como um algoritmo. Problema de estimação de máxima verossimilhança (ou máxima a posteriori) — esta é a forma básica da abordagem baseada em otimização.

\mathcal{X}^{*} = \arg\min_{\mathcal{X}} \sum_{k} \left\| r_{\mathrm{IMU}}(z_{I_k}, \mathcal{X}) \right\|^2_{\Sigma_{I_k}} \; + \; \sum_{(i,j)} \left\| r_{\mathrm{C/L}}(z_{ij}, \mathcal{X}) \right\|^2_{\Sigma_{ij}}

\mathcal{X} é o conjunto de poses, velocidades, vieses e (quando necessário) pontos do mapa a serem estimados; r_{\mathrm{IMU}} é o resíduo do fator de pré-integração. A estimação baseada em filtro controla o custo por meio de atualizações sequenciais e histórico limitado; a estimação baseada em otimização pode relinearizar uma janela deslizante. A precisão e o custo dependem do comprimento da janela, inicialização, cronograma de relinearização, modelo e orçamento computacional, portanto, nenhuma é universalmente superior.

Diagram 3 · Use the button to switch views
Muitas medições IMU de alta taxa entre quadros-chave são pré-integradas em um fator de movimento relativo com correção de viés
Diagram 4 · Use the button to switch views
i Keyframe i{+}1 High-rate IMU measurements (hundreds of Hz) Integrated together over the interval → a single relative-motion Factor

Figura 2 — O grande número de medições da IMU (centenas de Hz) que chegam entre os Keyframes i e i{+}1 são integradas antecipadamente por meio de Pré-integração e tratadas no Gráfico de Fatores como um único Fator de movimento relativo. Isso mantém o número de variáveis de otimização independente da taxa de amostragem da IMU, dependendo apenas do número de quadros-chave.

10. Algoritmos Marcantes

VIO

ROVIO (Odometria Visual Inercial Robusta), apresentado por Bloesch et al. no IROS 2015, é um VIO baseado em EKF. Em vez de comparar descritores de pontos de referência, ele alimenta as informações de brilho dos patches de imagem diretamente no modelo de observação do EKF — uma abordagem no estilo do método direto que o torna um exemplo representativo da combinação de estimativa baseada em filtro com um método direto.

OKVIS (SLAM Visual-Inercial Aberto baseado em Quadros-chave), apresentado por Leutenegger et al. no IJRR 2015, é um VIO baseado em quadros-chave construído sobre otimização não linear. Combinando a pré-integração da IMU (Seção 9) com a minimização do erro de reprojeção no estilo de ajuste de feixe, esta é uma das primeiras implementações marcantes de VIO baseada em otimização.

O VINS-Mono, desenvolvido por Qin, Li e Shen na Universidade de Ciência e Tecnologia de Hong Kong, é um VIO para câmeras monoculares que se baseia na otimização não linear sobre a pré-integração da IMU (Seção 9), adiciona o fechamento de laço para correção global e oferece um design flexível que pode alternar entre operação fracamente acoplada e fortemente acoplada para cada componente. O VINS-Fusion é o sucessor que estende o VINS-Mono para suportar múltiplas configurações de sensores — câmeras estéreo, GPS — priorizando a praticidade em configurações de hardware mais diversas.

O OpenVINS, desenvolvido por Geneva, Eckenhoff, Lee, Yang, Huang e colaboradores, é uma plataforma de pesquisa de VIO de código aberto baseada em MSCKF. Baseado no design eficiente de filtro do MSCKF (Seção 8), ele é amplamente utilizado como uma implementação que prioriza a facilidade de extensão e validação para fins de pesquisa.

LIO

LIO-SAM (Odometria Inercial LiDAR Acoplada via Suavização e Mapeamento), apresentado por Shan, Englot, Meyers, Wang, Ratti, Rus e colaboradores no IROS 2020, é um LIO acoplado construído em um Grafo de Fatores. Ele unifica diversos tipos de fatores — um Fator de Pré-integração da IMU, um Fator de Odometria a partir da correspondência de varreduras LiDAR, um Fator de GPS e um Fator de Fechamento de Loop — no mesmo Grafo de Fatores, e é um exemplo representativo da aplicação da filosofia de design baseada em Otimização (Seção 9) ao LiDAR.

** FAST-LIO (Fast LiDAR-Inertial Odometry), desenvolvido por Xu, Zhang e colaboradores do Laboratório MARS da Universidade de Hong Kong, é um LIO rápido baseado em um Filtro de Kalman Iterado de Acoplamento Estreito. Em contraste com o LIO-SAM, baseado em otimização, ele é baseado em filtro, projetado para lidar diretamente com nuvens de pontos LiDAR de alta taxa e prioriza a operação em tempo real em plataformas com capacidade computacional limitada. FAST-LIO2 é seu sucessor: ao gerenciar a nuvem de pontos diretamente com uma estrutura de busca incremental de vizinhos mais próximos (uma árvore iKD), ele reduz drasticamente o custo de reconstrução do mapa, alcançando um LIO de acoplamento estreito mais rápido e preciso.

11. Comparação VIO vs. LIO

Aspecto VIO (representativo: VINS-Mono/OpenVINS) LIO (representativo: LIO-SAM/FAST-LIO2)
Sensor primário Câmera (mono/estéreo) + IMU LiDAR + IMU
Ambientes ideais Cenas internas/externas ricas em textura, onde o reconhecimento de cores e padrões é significativo Ambientes ricos em estrutura geométrica; funciona na escuridão ou contraluz
Ambientes com dificuldades Escuridão, pouca textura, contraluz/luz solar forte Espaços geometricamente degenerados -- túneis longos, planos abertos
Custo do sensor Relativamente baixo (câmera + IMU MEMS) Alto (a própria unidade LiDAR, especialmente modelos de longo alcance e alta resolução)
Características do mapa Pontos de referência esparsos ou profundidade densa com uma abordagem baseada em aprendizado Mapa de nuvem de pontos denso e geometricamente preciso
Ambiguidade de escala Presente em princípio para uma configuração monocular (resolvida pela IMU) Não presente em princípio, já que o alcance do LiDAR é inerentemente métrico
Computação Moderado (custo de extração de características e computação de descritores) O processamento de nuvem de pontos (busca por vizinho mais próximo, correspondência de varreduras) tem um custo comparável
Filosofia de projeto representativa Tanto a abordagem baseada em filtro (MSCKF) quanto a baseada em otimização (pré-integração + BA) são amplamente utilizadas Tanto a abordagem baseada em filtro (FAST-LIO2) quanto a baseada em otimização (LIO-SAM) são amplamente utilizadas

Os pontos fortes do VIO são o baixo custo do sensor e a compreensão ambiental de alto nível que o reconhecimento de cores e padrões proporciona (uma combinação natural com o reconhecimento de objetos); os pontos fortes do LIO são a precisão geométrica e a robustez à escuridão e às intempéries — essa é a divisão básica de trabalho.

12. Escolhendo na Prática

A escolha entre VIO, LIO ou uma combinação de ambos depende dos sensores que você pode transportar, do seu orçamento e do ambiente em que pretende operar.

  • Robôs de serviço/aspiradores robóticos para ambientes internos: Se o baixo custo for a prioridade, o VIO (ou uma configuração de câmera e IMU com acoplamento flexível) tende a ser a melhor opção; se a precisão e um mapa geometricamente preciso forem a prioridade, o LIO tende a ser a escolha ideal. Em um ambiente interno comum, com muitos corredores e paredes, o ganho de precisão proporcionado pelo LiDAR é mais fácil de justificar em termos de custo.

  • Drones: Com restrições rigorosas de carga útil e energia, uma configuração VIO leve, com câmera e IMU, tende a ser a mais utilizada. Em espaços abertos ao ar livre, o emparelhamento com GPS também é comum.

  • AR/VR: Um sistema VIO (Odometria Visual-Inercial) que utiliza a câmera e a IMU integradas ao headset é o padrão de fato; Com exceção de alguns modelos de ponta com LiDAR adicional, as restrições de custo e peso fazem do VIO a primeira escolha padrão.

  • Condução autônoma / robôs móveis autônomos para ambientes externos: Dada a necessidade de robustez em condições climáticas adversas, contraluz e condução noturna, o LIO geralmente é a base, combinado com VIO e GNSS (consulte "Sensor Fusion Primer").
  • Espaços geometricamente degenerados -- túneis, corredores longos e retos: O LiDAR sozinho, ou o LIO sozinho, tende a se tornar instável no registro, portanto, é importante adicionar uma fonte de informação separada -- VIO ou odometria de roda -- para compensar a degeneração.

A regra básica é a seguinte: se o orçamento e o peso do sensor permitirem e a precisão geométrica for a principal prioridade, escolha o LIO; se o custo e o baixo peso forem a prioridade e você também quiser explorar a compreensão ambiental baseada em cores/padrões, escolha o VIO. No desenvolvimento de produtos reais, raramente se escolhem os dois sensores exclusivamente; em vez disso, tendem a evoluir para uma fusão multissensorial (consulte "Sensor Fusion Primer") que pondera VIO, LIO, GNSS e odometria das rodas de acordo com a situação.

13. Resumo

Uma IMU fornece informações de movimento de alta frequência e totalmente independentes, mas a posição recuperada por integração sofre derivações rápidas, na ordem do quadrado ao cubo do tempo decorrido. Uma câmera (VIO) ou um LiDAR (LIO) corrige periodicamente esse erro acumulado, mas cada um apresenta suas próprias limitações: ambientes escuros e com pouca textura para a câmera, ambientes geometricamente degenerados para o LiDAR. VIO e LIO combinam essas fraquezas complementares por meio de um ciclo de Previsão (previsão de alta frequência da IMU) - Atualização (correção da câmera/LiDAR), implementado sob a estrutura baseada em filtro (EKF/MSCKF) ou em otimização (pré-integração da IMU + gráfico de fatores), para alcançar uma robustez e precisão que nenhum sensor individual consegue atingir sozinho.

Verifique seu entendimento
A leitura de aproximadamente 1 g em repouso deve ser integrada diretamente?

Transforme a força específica para o referencial do mundo e leve em conta a gravidade e o viés primeiro. O aumento da velocidade em repouso indica um problema de modelo ou de referencial.

What to read next

Review the backgroundPor que a fusão de sensores falha — sincronização, quadros e calibração extrínsecaContinue the seriesComo avaliar SLAM — ATE, RPE, tempo de execução e falhasExplore another aspect of this fieldPor que o ICP falha: inicialização, valores discrepantes e geometria simétrica.