Contents — find the section you need

Né il Visual-SLAM né il LiDAR-SLAM funzionano ovunque da soli. Una telecamera ha difficoltà al buio o in presenza di movimenti rapidi; il LiDAR ha difficoltà in ambienti con pochi elementi e ha un costo maggiore. La chiave per superare queste debolezze è l'IMU (Unità di Misura Inerziale), che misura l'accelerazione e la velocità angolare ad alta frequenza. VIO (Odometria Visiva-Inerziale) e LIO (Odometria LiDAR-Inerziale) – ovvero l'abbinamento di una telecamera o di un LiDAR con un'IMU – sono diventati la configurazione standard di fatto in moltissimi robot mobili autonomi, droni e dispositivi AR/VR odierni. Questo articolo parte dal principio per cui una IMU da sola non può fornire una stima di posizione, passa attraverso il concetto di fusione dei sensori, le due filosofie di progettazione della stima basata su filtri e su ottimizzazione, e infine gli algoritmi di riferimento: ROVIO, OKVIS, VINS-Mono, OpenVINS, LIO-SAM e FAST-LIO2.

IMU integrata GNSS/INS Xsens MTi-GEsempio di IMU/INS
Famiglia di sensori LiDAR LivoxEsempio di LiDAR

Immagini: Xsens MTi-G (Kallap85, CC BY-SA 4.0) / Livox Mid-40, Horizon e Tele-15 (Dllu, CC BY-SA 4.0), Wikimedia Commons. Sensori di input rappresentativi, non una configurazione hardware VIO/LIO obbligatoria.

0. Cosa tratta questo articolo

  • Cosa misura un IMU e perché un IMU da solo non può continuare a recuperare la posizione nel tempo
  • I punti deboli di una telecamera e di un LiDAR, rispettivamente, e perché la combinazione di entrambi con un IMU funziona così bene
  • A cosa si riferiscono VIO e LIO e in cosa differiscono
  • La differenza tra le filosofie di progettazione basate su filtri (EKF/MSCKF) e basate sull'ottimizzazione (grafo fattoriale)
  • Il contributo di ROVIO, OKVIS, VINS-Mono, VINS-Fusion e OpenVINS (VIO) e di LIO-SAM, FAST-LIO e FAST-LIO2 (LIO)
  • Come scegliere concretamente tra VIO e LIO in base al caso d'uso

1. Risposta breve: cosa sono un IMU, un VIO e un LIO

In una frase ciascuno: Un IMU (Unità di Misura Inerziale) è un sensore che combina Un accelerometro e un giroscopio misurano la propria accelerazione e velocità angolare ad alta frequenza, senza alcun riferimento a punti di riferimento esterni. La VIO (Odometria Visiva Inerziale) è la tecnica che combina questa IMU con una telecamera per stimare la propria posizione e orientamento; la LIO (Odometria Inerziale LiDAR) fa lo stesso combinando una IMU con un LiDAR.

Una IMU indica, ad alta frequenza (tipicamente centinaia di Hz fino a circa 1 kHz), "quanto sto accelerando e quanto sto ruotando in questo preciso istante", ma la sua grandezza integrata, la posizione, varia rapidamente nel tempo (analizzeremo questo aspetto in dettaglio nella Sezione 3). Una telecamera o un LiDAR, tramite il confronto con l'ambiente circostante, possono fornire vincoli di posizione relativa, ma solo a bassa frequenza (decine di Hz), ed entrambi perdono completamente la loro funzionalità in determinate situazioni: oscurità, scene con pochi dettagli, movimenti rapidi. L'idea centrale di VIO e LIO è quella di combinare questa "IMU ad alta frequenza ma soggetta a deriva" con una "telecamera/LiDAR a bassa frequenza con modalità di guasto dipendenti dall'ambiente", in modo che ciascuna compensi i punti deboli dell'altra.

2. Cosa misura effettivamente un'IMU?

All'interno di un'IMU si trovano, in linea generale, due tipi di sensori.

Un accelerometro misura una forza specifica nel suo sistema di riferimento. Idealmente, \mathbf{f}_b=R_{wb}^{T}(\mathbf{a}_w-\mathbf{g}_w), dove R_{wb} ruota le coordinate del sensore in coordinate del mondo, \mathbf{a}_w è l'accelerazione nel sistema di riferimento del mondo e \mathbf{g}_w è la gravità. Misura circa 1 g a riposo e quasi zero in caduta libera ideale. Prima dell'integrazione, è necessario correggere il bias, ruotare nel sistema di riferimento del mondo e aggiungere la gravità. Consultare le definizioni di coordinate e bias nel modello IMU OpenVINS.

Un giroscopio misura la velocità di rotazione del sensore stesso, ovvero la velocità angolare. Combinando simultaneamente i tre assi si ottiene la velocità di rotazione attorno a rollio, beccheggio e imbardata.

Combinando questi due tipi di sensori, un IMU può fornire informazioni sul movimento a 6 gradi di libertà (3 traslazionali + 3 rotazionali) ad alta frequenza, basandosi esclusivamente sullo stato interno del sensore, senza alcun riferimento a punti di riferimento esterni (elementi mappati, segnali radio). Questa proprietà di "assenza di riferimenti esterni" rappresenta al contempo il punto di forza e il punto debole dell'IMU: il punto di forza è la robustezza che mantiene le prestazioni inalterate anche in totale oscurità o all'interno di una stanza con pareti di vetro; il punto debole è l'errore cumulativo che analizzeremo nella Sezione 3.

L'output di un IMU contiene sempre anche bias e rumore. Il bias è un errore di offset intrinseco al sensore: l'output non è zero anche quando il valore reale è zero, e varia lentamente nel tempo a causa di fattori come le variazioni di temperatura (instabilità del bias). Il rumore è una fluttuazione casuale che si aggiunge a ogni lettura. Le IMU MEMS (Micro-Electro-Mechanical Systems) più economiche tendono ad avere un bias e un rumore maggiori, e questa è la causa principale della deriva di cui parleremo in seguito.

3. Calcolo della posizione da una IMU (integrazione e deriva)

Il recupero della posizione dall'output di una IMU richiede l'integrazione dell'accelerazione due volte: la velocità è l'integrale dell'accelerazione e la posizione è l'integrale della velocità.

p(t) = p_0 + v_0 t + \int_0^{t}\!\!\int_0^{\tau} a(s)\,ds\,d\tau

Qui p_0 è la posizione iniziale, v_0 la velocità iniziale e a(s) l'accelerazione al tempo s. La formula in sé è semplice, ma l'accelerazione a(s) effettivamente utilizzata nella pratica presenta sempre il bias b discusso nella Sezione 2. La doppia integrazione di un'accelerazione che include il bias, a(s) + b, produce un termine di errore guidato dal bias della forma

\text{position error}(t) \approx \frac{1}{2} b\, t^2

che diverge in proporzione al quadrato del tempo trascorso. A tutto ciò si aggiunge la distorsione del giroscopio, che altera gradualmente la stima dell'orientamento, e questo errore di orientamento contamina la direzione in cui viene integrata l'accelerazione: di conseguenza, l'errore di posizione complessivo tende a crescere nell'ordine di O(t^2) a O(t^3) . Questo fenomeno, in cui l'errore si accumula senza limiti nel tempo, è chiamato deriva.

Un valore numerico concreto aiuta a comprendere meglio il concetto. Supponiamo che un IMU MEMS economico abbia una distorsione dell'accelerometro di circa 0.01\,\mathrm{m/s^2} . Dopo 10 secondi, l'errore di posizione risultante è di circa \frac{1}{2} \times 0.01 \times 10^2 = 0.5\,\mathrm{m} . Dopo un minuto, il valore arriva a 18\,\mathrm{m} . Un IMU da solo può essere considerato affidabile per una stima della posizione solo su una scala temporale molto breve, da pochi secondi a qualche decina di secondi, e questa è la ragione fondamentale per cui un IMU da solo non può fungere da sistema di autolocalizzazione. In altre parole: un'IMU eccelle nel rilevare "cambiamenti a breve termine e ad alta frequenza" e ha punti deboli nel determinare "posizione assoluta a lungo termine", un profilo di punti di forza e di debolezza esattamente opposto a quello di una telecamera o di un LiDAR.

4. Anche una telecamera e un LiDAR hanno dei punti deboli

Se un'IMU da sola non è in grado di determinare la posizione, la soluzione più ovvia è utilizzare una telecamera (vedi "Guida introduttiva al Visual-SLAM") o un LiDAR (vedi "Tendenze tecnologiche del LiDAR-SLAM"). Questo è vero fino a un certo punto, ma sia una telecamera che un LiDAR presentano specifici punti deboli.

I punti deboli di una fotocamera sono il degrado dell'immagine in condizioni di scarsa illuminazione (i punti caratteristici, o i gradienti di luminosità su cui si basa un metodo diretto, diventano impossibili da calcolare), gli ambienti con scarsa texture (una parete bianca o un pavimento a tinta unita non producono alcun punto di corrispondenza) e la sfocatura da movimento in caso di movimenti rapidi (l'immagine si sfoca durante la finestra di esposizione, destabilizzando i descrittori delle caratteristiche). Tutti questi problemi condividono la stessa causa di fondo: la fotocamera non riceve un segnale visivo sufficiente su cui lavorare.

I punti deboli di un LiDAR sono gli ambienti con poche caratteristiche (in una lunga galleria o in un ampio piano aperto, i metodi di registrazione di nuvole di punti come ICP/NDT non riescono a convergere verso una soluzione univoca, fenomeno noto come degenerazione geometrica) e il costo del sensore. Il LiDAR emette attivamente un laser per misurare la distanza, quindi è robusto in condizioni di oscurità e controluce, ma in un ambiente con una geometria rada, perde la sua efficacia in modo molto simile a una fotocamera.

Come visto nella Sezione 3, il punto debole di un'IMU è la deriva illimitata che si accumula nel tempo e il fatto che non disponga, autonomamente, di alcun meccanismo per recuperare la posizione assoluta.

Il punto cruciale è che le situazioni in cui questi tre sensori smettono di funzionare si sovrappongono solo marginalmente. Un'IMU continua a funzionare imperterrita al buio, laddove una telecamera ha difficoltà, e continua a fornire informazioni di movimento ad alta frequenza fino al momento in cui una telecamera o un LiDAR perdono il segnale. Le osservazioni di telecamere e LiDAR limitano la deriva utilizzando la geometria ambientale. Tuttavia, non garantiscono una precisione di posizione assoluta a lungo termine senza vincoli quali una mappa nota, il GNSS o la chiusura del ciclo. Questa complementarietà è il punto di partenza per la fusione dei sensori discussa nella sezione successiva.

  1. Il concetto di fusione dei sensori

La fusione dei sensori è il framework che combina le caratteristiche di errore e i punti di forza di diversi sensori per ottenere una stima più accurata, ad alta frequenza e più robusta rispetto a quella ottenibile con un singolo sensore (per un'idea generale di fusione, vedere "Introduzione alla fusione dei sensori"). Lo scheletro condiviso da VIO e LIO può essere organizzato come un ciclo Predict-Update:

Diagram 1 · Use the button to switch views
Un ciclo chiuso che combina la predizione IMU ad alta frequenza con le osservazioni a bassa frequenza della telecamera o del lidar e alimenta lo stato e il bias corretti alla successiva propagazione
Diagram 2 · Use the button to switch views

Figura 1 — L'IMU (alta frequenza) continua a prevedere lo stato tramite la Propagazione (integrazione). Le osservazioni derivanti dalla corrispondenza di caratteristiche/punti con la Telecamera/LiDAR (bassa frequenza) correggono tale previsione nella fase di Aggiornamento. Il bias dell'IMU stimato durante tale correzione viene retroazionato alla successiva Propagazione, sopprimendo continuamente l'accumulo di Deriva.

Questo ciclo presenta due punti chiave. In primo luogo, la Propagazione guidata dall'IMU viene eseguita ad alta frequenza in modo continuo e non smette mai di prevedere la posa, nemmeno nei momenti in cui non è disponibile alcuna osservazione dalla Telecamera/LiDAR (oscurità, bassa texture, spazio povero di caratteristiche, movimento rapido). In secondo luogo, la fase di Aggiornamento, che si attiva solo quando arriva un'osservazione dalla Telecamera/LiDAR, riduce la Deriva che altrimenti si accumulerebbe senza limiti dalla sola IMU e, simultaneamente, aggiorna la stima della propria IMU. bias, reintroducendolo nella Propagazione. Questa combinazione – "previsione che continua a funzionare ad alta frequenza" più "correzione che riduce gli errori nelle direzioni vincolate dall'osservazione" – è la filosofia di progettazione condivisa da VIO e LIO.

6. VIO (Odometria Visiva Inerziale)

VIO (Odometria Visiva Inerziale) è la configurazione in cui una telecamera svolge il ruolo di sensore lato aggiornamento all'interno di questo framework. La combinazione della previsione ad alta frequenza dell'IMU con le osservazioni dei punti caratteristici di una telecamera risolve l'ambiguità di scala che affligge l'odometria visiva monoculare (accennato nella Sezione 4 – il fatto che le immagini monoculari da sole non possono ricostruire una distanza metrica reale), utilizzando le informazioni sull'accelerazione metrica dell'IMU. E nel movimento rapido, dove una telecamera ha difficoltà, l'IMU continua a fornire variazioni di orientamento ad alta frequenza, rendendo il tracciamento molto meno soggetto a fallimenti.

VIO si suddivide ulteriormente in Configurazioni a basso accoppiamento e ad alto accoppiamento, a seconda di come la telecamera e l'IMU sono collegate. Un sistema a basso accoppiamento calcola la stima della posa lato telecamera e la stima della posa lato IMU in modo indipendente, per poi fondere i due risultati a posteriori; è semplice da implementare, ma poiché il lato IMU non può sfruttare la struttura di errore interna della stima lato telecamera (quale osservazione della caratteristica è più o meno incerta), perde in precisione. Un sistema ad alto accoppiamento tratta i dati grezzi dell'IMU e le osservazioni delle caratteristiche dell'immagine come un unico problema di stato stimato congiuntamente fin dall'inizio; l'implementazione è più complessa, ma ogni bit di informazione proveniente da entrambi i sensori viene utilizzato, garantendo una maggiore precisione. Le implementazioni VIO moderne più rappresentative che trattiamo nelle Sezioni 8, 9 e 10 (OKVIS, VINS-Mono, OpenVINS e altre) adottano tutte l'accoppiamento stretto.

7. LIO (LiDAR-Odometria Inerziale)

LIO (LiDAR-Odometria Inerziale) è lo stesso framework con un LiDAR che svolge il ruolo di aggiornamento. Le nuvole di punti LiDAR catturano la geometria ambientale direttamente e con elevata precisione, ma una singola scansione richiede da decine a centinaia di millisecondi per essere completata e, se il sensore stesso si muove durante tale intervallo, la nuvola di punti risultante si distorce (distorsione da movimento). Grazie alle informazioni di orientamento ad alta frequenza dell'IMU, questo movimento durante la scansione può essere corretto, ricostruendo una nuvola di punti priva di distorsioni.

Come per VIO nella Sezione 6, in ambienti geometricamente degeneri con cui LIO ha difficoltà (lunghe gallerie, ampi piani aperti), la continua predizione della posa a breve termine dell'IMU rende la registrazione della nuvola di punti (metodi come ICP/NDT) molto meno soggetta a divergenze. Anche LIO, nella pratica, è prevalentemente implementato come un sistema strettamente accoppiato: LIO-SAM e FAST-LIO/FAST-LIO2, trattati nella Sezione 10, adottano entrambi questo approccio strettamente accoppiato. Progettazione.

8. Basato su filtri (Filtro di Kalman / EKF / MSCKF)

Il nucleo di VIO e LIO, ovvero la fusione tra previsione e osservazione, è implementato secondo una delle due principali filosofie di progettazione: basata su filtri o basata sull'ottimizzazione, trattata nella sezione successiva.

Il fondamento dell'approccio basato su filtri è il Filtro di Kalman, un framework che alterna la previsione e l'aggiornamento guidato dall'osservazione per derivare ricorsivamente la stima ottimale dello stato per un sistema con dinamica lineare. Per un problema come VIO/LIO, in cui la composizione dell'integrazione dell'IMU (composizione della posa) e la proiezione della telecamera sono intrinsecamente non lineari, viene utilizzata l'estensione non lineare: l'EKF (Filtro di Kalman esteso). Un EKF linearizza ciascuna funzione non lineare attorno alla stima corrente (uno sviluppo di Taylor del primo ordine) e quindi applica le stesse equazioni di aggiornamento di un normale filtro di Kalman.

\hat{x}_k = \hat{x}_k^{-} + K_k\left(z_k - h(\hat{x}_k^{-})\right), \qquad K_k = P_k^{-} H_k^{\top}\left(H_k P_k^{-} H_k^{\top} + R\right)^{-1}
Qui \hat{x}_k^{-} rappresenta lo stato previsto dalla Propagazione, z_k l'osservazione effettiva, h(\cdot) il modello di osservazione che prevede un'osservazione a partire dallo stato, e K_k il Guadagno di Kalman, ovvero il peso che determina quanto fidarsi della previsione rispetto all'osservazione. P_k^{-} è la covarianza (incertezza) dello stato previsto, H_k lo Jacobiano che linearizza il modello di osservazione, e R la covarianza del rumore di osservazione. Intuitivamente, maggiore è l'incertezza prevista P_k^{-} rispetto al rumore di osservazione R, maggiore diventa il Guadagno di Kalman K_k, e più fortemente l'osservazione Le informazioni di z_k vengono incorporate nella correzione dello stato.

Implementare un VIO basato su EKF in modo ingenuo richiede l'inclusione di ogni singolo punto caratteristico dell'immagine nel vettore di stato, e il costo computazionale aumenta rapidamente con l'aumentare del numero di punti caratteristici. Il MSCKF (Multi-State Constraint Kalman Filter), proposto da Mourikis e Roumeliotis nel 2007, risolve esattamente questo problema. MSCKF non include i punti caratteristici stessi nello stato del filtro; invece, mantiene più pose della telecamera (una finestra scorrevole) nello stato e aggiorna lo stato utilizzando solo il vincolo geometrico che lo stesso punto caratteristico sia stato osservato da più di queste pose. Escludendo i punti caratteristici dallo stato, evita l'esplosione computazionale dovuta al conteggio dei punti caratteristici, pur continuando a sfruttare le osservazioni che si estendono su più fotogrammi: un design VIO basato su filtri efficiente che è ora ampiamente utilizzato.

9. Basato sull'ottimizzazione (Bundle Adjustment / Factor Graph)

Basato su filtri L'aggiornamento della stima avviene in modo ricorsivo, ma metodi come MSCKF possono conservare temporaneamente le pose precedenti clonate. L'approccio basato sull'ottimizzazione mantiene lo stato e le osservazioni lungo una finestra o un grafico scorrevole e risolve un'ottimizzazione non lineare per la loro coerenza congiunta. È utile pensarlo come un'estensione del Bundle Adjustment di Visual-SLAM (vedi "Visual-SLAM Primer", Sezione 10) per incorporare anche le informazioni IMU.

Le accelerazioni e le velocità angolari dell'IMU sono osservazioni note, non variabili di ottimizzazione. Aggiungere uno stato a ogni timestamp IMU, o reintegrare ogni intervallo a ogni rilinearizzazione, aumenta il costo. La preintegrazione IMU, proposta da Forster et al. nel 2015 (arXiv:1512.02363), riassume le misurazioni tra i keyframe come un fattore di movimento relativo correggibile tramite bias. Lo stato può includere velocità e bias e in alcuni sistemi Anche i punti di riferimento; il costo è controllato dalla progettazione della finestra e dalla rilinearizzazione, piuttosto che semplicemente dalla frequenza di campionamento dell'IMU.

Il fattore di preintegrazione IMU risultante, insieme ai fattori derivati dalle osservazioni della telecamera/LiDAR (errore di riproiezione o errore di corrispondenza della scansione), viene posizionato su un grafo dei fattori comune e il tutto viene risolto insieme come un problema di stima di massima verosimiglianza (o massima a posteriori): questa è la forma base dell'approccio basato sull'ottimizzazione.

\mathcal{X}^{*} = \arg\min_{\mathcal{X}} \sum_{k} \left\| r_{\mathrm{IMU}}(z_{I_k}, \mathcal{X}) \right\|^2_{\Sigma_{I_k}} \; + \; \sum_{(i,j)} \left\| r_{\mathrm{C/L}}(z_{ij}, \mathcal{X}) \right\|^2_{\Sigma_{ij}}

\mathcal{X} è l'insieme di pose, velocità, bias e (ove necessario) punti della mappa da stimare; r_{\mathrm{IMU}} è il residuo del fattore di preintegrazione. La stima basata su filtri controlla il costo tramite aggiornamenti sequenziali e cronologia limitata; la stima basata sull'ottimizzazione può rilinearizzare una finestra scorrevole. L'accuratezza e il costo dipendono dalla lunghezza della finestra, dall'inizializzazione, dalla pianificazione della rilinearizzazione, modello e budget di calcolo, quindi nessuno dei due è universalmente superiore.

Diagram 3 · Use the button to switch views
Molte misurazioni IMU ad alta frequenza tra i keyframe vengono preintegrate in un fattore di movimento relativo correggibile in base al bias
Diagram 4 · Use the button to switch views
i Keyframe i{+}1 High-rate IMU measurements (hundreds of Hz) Integrated together over the interval → a single relative-motion Factor

Figura 2 — L'elevato numero di misurazioni IMU (centinaia di Hz) in arrivo I dati relativi ai keyframe i e i{+}1 vengono integrati preventivamente tramite preintegrazione e gestiti sul grafico dei fattori come un singolo fattore di movimento relativo. Questo mantiene il numero di variabili di ottimizzazione indipendente dalla frequenza di campionamento dell'IMU, dipendendo unicamente dal numero di keyframe.

10. Algoritmi di riferimento

VIO

ROVIO (Robust Visual Inertial Odometry), presentato da Bloesch et al. all'IROS 2015, è un VIO basato su EKF. Invece di abbinare i descrittori dei punti caratteristici, alimenta direttamente il modello di osservazione dell'EKF con le informazioni sulla luminosità delle patch dell'immagine: un approccio in stile metodo diretto che lo rende un esempio rappresentativo di combinazione tra stima basata su filtri e metodo diretto.

OKVIS (Open Keyframe-based Visual-Inertial SLAM), presentato da Leutenegger et al. all'IJRR 2015, è un VIO basato su keyframe e sull'ottimizzazione non lineare. Combinando la preintegrazione dell'IMU (Sezione 9) con la minimizzazione dell'errore di riproiezione in stile Bundle-Adjustment, rappresenta una delle prime implementazioni di riferimento di VIO basato sull'ottimizzazione.

VINS-Mono, sviluppato da Qin, Li e Shen presso l'Università di Scienza e Tecnologia di Hong Kong, è un VIO per telecamere monoculari che si basa sull'ottimizzazione non lineare tramite la preintegrazione dell'IMU (Sezione 9), aggiunge la chiusura del ciclo per la correzione globale e offre un design flessibile che consente di passare da un funzionamento a basso accoppiamento a uno a stretto accoppiamento per ciascun componente. VINS-Fusion è il successore che estende VINS-Mono per supportare configurazioni di sensori multiple (telecamere stereo, GPS), privilegiando la praticità su configurazioni hardware più diversificate.

OpenVINS, sviluppato da Geneva, Eckenhoff, Lee, Yang, Huang e collaboratori, è una piattaforma di ricerca VIO open-source basata su MSCKF. Basandosi sull'efficiente architettura a filtri di MSCKF (Sezione 8), è ampiamente utilizzato come implementazione che privilegia la facilità di estensione e validazione per scopi di ricerca.

LIO

LIO-SAM (Tightly-coupled Lidar Inertial Odometry via Smoothing and Mapping), presentato da Shan, Englot, Meyers, Wang, Ratti, Rus e collaboratori all'IROS 2020, è un LIO a forte accoppiamento costruito su un grafo fattoriale. Unifica diversi tipi di fattori – un fattore di preintegrazione IMU, un fattore di odometria derivante dalla corrispondenza delle scansioni LiDAR, un fattore GPS e un fattore di chiusura del ciclo – sullo stesso grafo fattoriale, ed è un esempio rappresentativo dell'applicazione della filosofia di progettazione basata sull'ottimizzazione (Sezione 9) al LiDAR.

FAST-LIO (Fast LiDAR-Inertial Odometry), sviluppato da Xu, Zhang e collaboratori del MARS Lab dell'Università di Hong Kong, è un algoritmo LIO veloce basato su un filtro di Kalman iterativo a forte accoppiamento. A differenza di LIO-SAM, basato sull'ottimizzazione, è basato su filtri, progettato per gestire direttamente nuvole di punti LiDAR ad alta frequenza e privilegia il funzionamento in tempo reale su piattaforme con risorse di calcolo limitate. FAST-LIO2 è il suo successore: gestendo direttamente la nuvola di punti con una struttura di ricerca incrementale del vicino più prossimo (un iKD-Tree), riduce drasticamente il costo di ricostruzione della mappa, ottenendo un algoritmo LIO a forte accoppiamento più veloce e preciso.

11. Confronto tra VIO e LIO

Aspetto VIO (rappresentativo: VINS-Mono/OpenVINS) LIO (rappresentativo: LIO-SAM/FAST-LIO2)

Sensore principale | Fotocamera (mono/stereo) + IMU | LiDAR + IMU |

Ambienti ottimali | Scene interne/esterne ricche di texture, dove il riconoscimento di colori e pattern ha un significato | Ambienti ricchi di struttura geometrica; funziona al buio o in controluce |

Ambienti in cui presenta difficoltà | Buio, texture poco definite, controluce/luce solare intensa | Spazi geometricamente degeneri -- lunghe gallerie, ampi spazi aperti |

Costo del sensore | Relativamente basso (fotocamera + IMU MEMS) | Elevato (l'unità LiDAR stessa, soprattutto i modelli a lungo raggio e ad alta risoluzione) |

Caratteristiche della mappa | Punti caratteristici sparsi o profondità densa con un approccio basato sull'apprendimento | Mappa di nuvole di punti densa e geometricamente accurata |

Ambiguità di scala | Presente in linea di principio per una configurazione monoculare (risolta tramite l'IMU) | Non presente in linea di principio, poiché la misurazione della distanza LiDAR è intrinsecamente metrica |

Elaborazione | Costo moderato (estrazione delle caratteristiche e calcolo dei descrittori) | L'elaborazione di nuvole di punti (ricerca del vicino più prossimo, corrispondenza delle scansioni) ha un costo comparabile |

Filosofia di progettazione rappresentativa | Sia l'approccio basato su filtri (MSCKF) che quello basato sull'ottimizzazione (preintegrazione + BA) sono ampiamente utilizzati | Sia l'approccio basato su filtri (FAST-LIO2) che quello basato sull'ottimizzazione (LIO-SAM) sono ampiamente utilizzati |

I punti di forza di VIO sono il basso costo dei sensori e l'elevata comprensione ambientale che il riconoscimento di colori e pattern offre (una naturale integrazione con il riconoscimento di oggetti); i punti di forza di LIO sono l'accuratezza geometrica e la robustezza in condizioni di scarsa illuminazione e maltempo: questa è la divisione di base del lavoro.

12. Scelta pratica

La scelta tra VIO, LIO o una combinazione di entrambi dipende dai sensori che è possibile trasportare, dal budget disponibile e dall'ambiente in cui si prevede di operare.

  • Robot di servizio per interni / robot aspirapolvere: Se il basso costo è la priorità, il VIO (o una configurazione con telecamera e IMU a basso accoppiamento) tende a essere la scelta migliore; se invece la priorità è la precisione e una mappa geometricamente accurata, si tende a optare per il LIO. In un normale ambiente interno con molti corridoi e pareti, il vantaggio in termini di precisione derivante dal costo del LiDAR è più facilmente giustificabile.

  • Droni: Con vincoli stringenti su carico utile e consumo energetico, una configurazione VIO leggera con telecamera e IMU tende a essere la soluzione dominante. Negli spazi esterni aperti, è comune anche l'accoppiamento con il GPS.

  • AR/VR: Un sistema VIO (Odometria Visiva Inerziale) che utilizza la telecamera e l'IMU integrate nel visore è lo standard di fatto; Fatta eccezione per alcuni modelli di fascia alta con LiDAR integrato, i vincoli di costo e peso rendono il VIO la prima scelta predefinita.

  • Guida autonoma / robot mobili autonomi per esterni: Data la necessità di robustezza in condizioni meteorologiche avverse, controluce e guida notturna, il LIO è in genere la base, integrato con VIO e GNSS (vedi "Introduzione alla fusione di sensori").

  • Spazi geometricamente irregolari - gallerie, lunghi corridoi rettilinei: Il solo LiDAR, o il solo LIO, tende a diventare instabile nella registrazione, quindi è importante aggiungere una fonte di informazioni separata - VIO o odometria delle ruote - per compensare l'irregolarità.

Regola generale: se il budget e il peso del sensore lo consentono e la precisione geometrica è la priorità assoluta, scegli il LIO; se il costo e la leggerezza sono la priorità e si desidera anche sfruttare la comprensione ambientale basata su colori/modelli, scegli il VIO. Nello sviluppo di un prodotto reale, i due sensori vengono raramente scelti in via esclusiva; tendono invece a evolversi in una fusione multisensore (vedi "Introduzione alla fusione di sensori") che pondera VIO, LIO, GNSS e odometria delle ruote in base alla situazione.

13. Riepilogo

Un'IMU fornisce informazioni di movimento ad alta frequenza e completamente autonome, ma la posizione recuperata tramite integrazione varia rapidamente, con un ordine di grandezza proporzionale al quadrato del tempo trascorso. Una telecamera (VIO) o un LiDAR (LIO) correggono periodicamente questo errore accumulato, ma ciascuno presenta i propri punti deboli: scarsa illuminazione e scarsa texture per la telecamera, ambienti geometricamente complessi per il LiDAR. VIO e LIO combinano queste debolezze complementari attraverso un ciclo Predizione (predizione IMU ad alta frequenza) - Aggiornamento (correzione della telecamera/LiDAR), implementato nell'ambito di un framework basato su filtri (EKF/MSCKF) o su ottimizzazione (preintegrazione IMU + grafo fattoriale), per raggiungere una robustezza e una precisione che nessun singolo sensore può eguagliare da solo.

Verifica la tua comprensione
La lettura di circa 1 g a riposo dovrebbe essere integrata direttamente?

Trasformare prima la forza specifica nel sistema di riferimento globale e tenere conto della gravità e del bias. Una velocità crescente a riposo segnala un problema nel modello o nel sistema di riferimento.

What to read next

Review the backgroundPerché la fusione dei sensori fallisce: tempistica, fotogrammi e calibrazione estrinsecaContinue the seriesCome valutare SLAM: ATE, RPE, tempo di esecuzione e guastiExplore another aspect of this fieldPerché ICP fallisce: inizializzazione, valori anomali e geometria simmetrica