Contents — find the section you need

Weder Visual-SLAM noch LiDAR-SLAM funktionieren überall allein. Eine Kamera stößt bei Dunkelheit oder schnellen Bewegungen an ihre Grenzen; LiDAR hat Schwierigkeiten in Umgebungen mit wenigen Details und ist zudem teurer. Der Schlüssel zur Überwindung dieser Schwächen ist die IMU (Inertial Measurement Unit), die Beschleunigung und Winkelgeschwindigkeit mit hoher Frequenz misst. VIO (Visual-Inertial Odometry) und LIO (LiDAR-Inertial Odometry) – die Kombination einer Kamera bzw. eines LiDAR mit einer IMU – haben sich heute als De-facto-Standardkonfiguration für viele autonome mobile Roboter, Drohnen und AR/VR-Geräte etabliert. Dieser Artikel erläutert zunächst, warum eine IMU allein keine Positionsbestimmung ermöglicht, geht dann auf die Sensorfusion ein, beschreibt die beiden Designphilosophien der filterbasierten und der optimierungsbasierten Schätzung und stellt schließlich die wichtigsten Algorithmen vor: ROVIO, OKVIS, VINS-Mono, OpenVINS, LIO-SAM und FAST-LIO2.

Xsens MTi-G GNSS/INS integrierte IMUIMU/INS Beispiel
Livox LiDAR SensorfamilieLiDAR Beispiel

Bilder: Xsens MTi-G (Kallap85, CC BY-SA 4.0) / Livox Mid-40, Horizon und Tele-15 (Dllu, CC BY-SA 4.0), Wikimedia Commons. Repräsentative Eingangssensoren, keine erforderliche VIO/LIO-Hardwarekonfiguration.

0. Inhalt dieses Artikels

  • Was eine IMU misst und warum eine IMU allein die Position nicht dauerhaft bestimmen kann
  • Die Schwächen einer Kamera bzw. eines LiDAR und warum die Kombination mit einer IMU so effektiv ist
  • Was VIO und LIO jeweils bedeuten und wie sie sich unterscheiden
  • Der Unterschied zwischen filterbasierten (EKF/MSCKF) und optimierungsbasierten (Faktorgraph) Designansätzen

Welchen Beitrag leisten ROVIO, OKVIS, VINS-Mono, VINS-Fusion und OpenVINS (VIO) sowie LIO-SAM, FAST-LIO und FAST-LIO2 (LIO)?

Wie man in der Praxis je nach Anwendungsfall zwischen VIO und LIO wählt

1. Die Kurzfassung: Was eine IMU, VIO und LIO sind

Jeweils in einem Satz: Eine IMU (Inertial Measurement Unit) ist ein Sensor Ein IMU (Inertialmesseinheit) kombiniert einen Beschleunigungsmesser und ein Gyroskop, um seine eigene Beschleunigung und Winkelgeschwindigkeit mit hoher Frequenz zu messen – ganz ohne Bezug zu externen Orientierungspunkten. VIO (Visual-Inertial Odometry) ist die Technik, diese IMU mit einer Kamera zu kombinieren, um die eigene Position und Orientierung zu bestimmen. LIO (LiDAR-Inertial Odometry) funktioniert ähnlich, indem eine IMU mit einem LiDAR kombiniert wird.

Eine IMU gibt mit hoher Frequenz (typischerweise Hunderte von Hertz bis etwa 1 kHz) an, wie stark ich gerade beschleunige und wie schnell ich mich drehe. Die Positionsbestimmung driftet jedoch mit der Zeit schnell ab (darauf gehen wir in Abschnitt 3 genauer ein). Eine Kamera oder ein LiDAR können durch die Erfassung der Umgebung relative Positionsdaten liefern, allerdings nur mit niedriger Frequenz (einige zehn Hertz). In bestimmten Situationen – Dunkelheit, unübersichtliche Szenen, schnelle Bewegungen – sind beide Systeme völlig funktionsunfähig. Die Kernidee von VIO und LIO besteht darin, diese „hochfrequente, aber driftende IMU“ mit einer „niederfrequenten Kamera/LiDAR mit umgebungsabhängigen Fehlermodi“ zu kombinieren, sodass sich die Schwächen gegenseitig ausgleichen.

2. Was misst eine IMU eigentlich?

Eine IMU enthält im Wesentlichen zwei Arten von Sensoren.

Ein Beschleunigungsmesser misst die spezifische Kraft in seinem Sensorkoordinatensystem. Idealerweise gilt: \mathbf{f}_b=R_{wb}^{T}(\mathbf{a}_w-\mathbf{g}_w), wobei R_{wb} die Sensorkoordinaten in Weltkoordinaten umwandelt, \mathbf{a}_w die Beschleunigung im Weltkoordinatensystem und \mathbf{g}_w die Schwerkraft ist. Im Ruhezustand beträgt der Wert etwa 1 g und im idealen freien Fall nahezu null. Vor der Integration werden der Bias korrigiert, die Daten in das Weltkoordinatensystem umgewandelt und die Schwerkraft addiert. Die Definitionen der Koordinaten und des Bias finden Sie im OpenVINS IMU-Modell.

Ein Gyroskop misst die Rotationsgeschwindigkeit des Sensors. Die gleichzeitige Messung der drei Achsen ermöglicht die Bestimmung der Rotationsgeschwindigkeit um Rollen, Nicken und Gieren.

Durch die Kombination dieser beiden Sensortypen kann eine IMU Bewegungsinformationen mit sechs Freiheitsgraden (drei translatorische und drei rotatorische) mit hoher Frequenz ausgeben – ausschließlich aus dem internen Zustand des Sensors und ohne jeglichen Bezug zu externen Referenzpunkten (wie etwa kartierten Objekten oder Funksignalen). Diese Unabhängigkeit von externen Referenzpunkten ist gleichzeitig die größte Stärke und die größte Schwäche der IMU: Die Stärke liegt in ihrer Robustheit, die auch in völliger Dunkelheit oder in einem Raum mit Glaswänden erhalten bleibt; die Schwäche im akkumulierten Fehler, der in Abschnitt 3 erläutert wird.

Die Ausgabe einer IMU enthält zudem stets einen Bias und Rauschen. Der Bias ist ein dem Sensor inhärenter Fehler – die Ausgabe ist selbst bei einem tatsächlichen Wert von null nicht null – und er driftet aufgrund von Faktoren wie Temperaturänderungen (Bias-Instabilität) langsam mit der Zeit. Rauschen ist eine zufällige Schwankung, die bei jeder Messung neu hinzukommt. Preisgünstigere MEMS-IMUs (Mikroelektromechanische Systeme) weisen tendenziell größere Abweichungen und mehr Rauschen auf. Dies ist die Hauptursache für die im Folgenden beschriebene Drift.

3. Positionsbestimmung mit einem IMU (Integration und Drift)

Um die Position aus den IMU-Ausgabedaten zu ermitteln, muss die Beschleunigung zweimal integriert werden: Die Geschwindigkeit ist das Integral der Beschleunigung, und die Position ist das Integral der Geschwindigkeit.

p(t) = p_0 + v_0 t + \int_0^{t}\!\!\int_0^{\tau} a(s)\,ds\,d\tau

Hierbei ist p_0 die Anfangsposition, v_0 die Anfangsgeschwindigkeit und a(s) die Beschleunigung zum Zeitpunkt s. Die Formel selbst ist einfach, doch die in der Praxis verwendete Beschleunigung a(s) weist stets die in Abschnitt 2 beschriebene systematische Abweichung b auf. Die doppelte Integration einer Beschleunigung, die diese systematische Abweichung a(s) + b enthält, führt zu einem durch die systematische Abweichung bedingten Fehlerterm der Form

\text{position error}(t) \approx \frac{1}{2} b\, t^2

der proportional zum Quadrat der verstrichenen Zeit divergiert. Zusätzlich verfälscht die systematische Abweichung des Gyroskops allmählich die Orientierungsschätzung, und dieser Orientierungsfehler beeinflusst die Integrationsrichtung der Beschleunigung – sodass der Gesamtpositionsfehler tendenziell in der Größenordnung von O(t^2) bis O(t^3) ansteigt. Dieses Phänomen, bei dem sich der Fehler unbegrenzt mit der Zeit akkumuliert, wird als Drift bezeichnet.

Ein konkretes Beispiel verdeutlicht dies. Angenommen, ein kostengünstiger MEMS-IMU weist eine systematische Abweichung des Beschleunigungsmessers von etwa 0.01\,\mathrm{m/s^2} auf. Nach 10 Sekunden beträgt der resultierende Positionsfehler etwa \frac{1}{2} \times 0.01 \times 10^2 = 0.5\,\mathrm{m}. Nach einer Minute liegt der Wert bei 18\,\mathrm{m}. Eine IMU allein ist nur für eine sehr kurze Zeit – Sekunden bis wenige zehn Sekunden – zur Positionsbestimmung zuverlässig. Dies ist der Hauptgrund, warum eine IMU allein nicht als Selbstlokalisierungssystem dienen kann. Anders ausgedrückt: Eine IMU ist stark bei kurzfristigen, hochfrequenten Änderungen und schwach bei langfristigen, absoluten Positionsbestimmungen – genau das Gegenteil der Stärken und Schwächen einer Kamera oder eines LiDAR-Systems.

4. Auch Kameras und LiDAR-Systeme haben Schwächen

Wenn eine IMU allein die Position nicht bestimmen kann, liegt es nahe, stattdessen eine Kamera (siehe „Visual-SLAM Primer“) oder ein LiDAR-System (siehe „LiDAR-SLAM Technology Trends“) zu verwenden. Das ist grundsätzlich richtig, aber sowohl Kameras als auch LiDAR-Systeme weisen spezifische Schwächen auf.

Zu den Schwächen einer Kamera gehören Bildverschlechterungen bei schlechten Lichtverhältnissen (Merkmale oder die Helligkeitsgradienten, auf denen eine direkte Methode basiert, lassen sich nicht mehr berechnen), Umgebungen mit geringer Textur (eine weiße Wand oder ein einfarbiger Boden liefern keine Korrespondenzpunkte) und Bewegungsunschärfe bei schnellen Bewegungen (das Bild verschmiert während der Belichtung, wodurch Merkmalsbeschreibungen destabilisiert werden). All diese Probleme haben dieselbe Ursache: Die Kamera erhält nicht genügend visuelles Signal.

Die Schwächen von LiDAR liegen in Umgebungen mit wenigen Strukturen (in einem langen Tunnel oder einer weiten Ebene können Punktwolken-Registrierungsverfahren wie ICP/NDT keine eindeutige Lösung finden – dies wird als geometrische Degeneration bezeichnet) und den Kosten des Sensors. LiDAR sendet aktiv einen Laser aus, um Entfernungen zu messen, und ist daher robust gegenüber Dunkelheit und Gegenlicht. In Umgebungen mit geringer Geometrie verliert es jedoch ähnlich wie eine Kamera an Genauigkeit.

Die Schwäche einer IMU, wie in Abschnitt 3 beschrieben, ist die unbegrenzte Drift, die sich mit der Zeit akkumuliert, und die Tatsache, dass sie keine Möglichkeit hat, die absolute Position selbstständig zu bestimmen.

Wichtig ist, dass sich die Situationen, in denen diese drei Sensoren versagen, kaum überschneiden. Eine IMU arbeitet auch in der Dunkelheit zuverlässig weiter, wo eine Kamera an ihre Grenzen stößt, und liefert selbst dann noch hochfrequente Bewegungsinformationen, wenn Kamera oder LiDAR ihre Merkmale verlieren. Kamera- und LiDAR-Beobachtungen begrenzen die Drift mithilfe der Umgebungsgeometrie. Sie garantieren jedoch keine langfristige absolute Positionsgenauigkeit ohne zusätzliche Einschränkungen wie eine bekannte Karte, GNSS oder Schleifenschluss. Diese Komplementarität ist der Ausgangspunkt für die im nächsten Abschnitt beschriebene Sensorfusion.

5. Das Konzept der Sensorfusion

Sensorfusion ist ein Verfahren, das die unterschiedlichen Fehlercharakteristika und Stärken mehrerer Sensoren kombiniert, um eine genauere, hochfrequentere und robustere Schätzung zu erhalten als jeder einzelne Sensor allein (für eine allgemeine Erklärung der Fusion siehe „Sensor Fusion Primer“). Das von VIO und LIO gemeinsam genutzte Grundgerüst lässt sich als Predict-Update-Schleife organisieren:

Diagram 1 · Use the button to switch views
Eine geschlossene Schleife, die hochfrequente IMU-Vorhersagen mit niederfrequenten Kamera- oder Lidar-Beobachtungen kombiniert und den korrigierten Zustand und Bias in die nächste Propagation einspeist
Diagram 2 · Use the button to switch views

Abbildung 1 – Die IMU (hohe Rate) Die Zustandsvorhersage erfolgt kontinuierlich mittels Propagation (Integration). Beobachtungen aus dem Feature-/Punktabgleich mit Kamera-/LiDAR-Daten (niedrige Rate) korrigieren diese Vorhersage im Update-Schritt. Die während dieser Korrektur geschätzte IMU-Abweichung wird in die nächste Propagation zurückgeführt und unterdrückt so kontinuierlich die Driftakkumulation.

Diese Schleife hat zwei Kernpunkte: Erstens läuft die IMU-gesteuerte Propagation kontinuierlich mit hoher Frequenz und hört nie auf, die Position vorherzusagen, selbst wenn keine Kamera-/LiDAR-Beobachtung verfügbar ist (Dunkelheit, geringe Textur, strukturarme Umgebung, schnelle Bewegung). Zweitens reduziert der Update-Schritt – der nur bei Eingang einer Kamera-/LiDAR-Beobachtung ausgelöst wird – die Drift, die sich sonst allein durch die IMU unbegrenzt ansammeln würde, und aktualisiert gleichzeitig die Schätzung der eigenen IMU-Abweichung, die in die Propagation zurückgeführt wird. Diese Kombination aus „kontinuierlicher Vorhersage mit hoher Frequenz“ und „Korrektur zur Reduzierung von Fehlern in durch die Beobachtung eingeschränkten Richtungen“ ist die gemeinsame Designphilosophie von VIO und LIO.

6. VIO (Visuell-Inertiale Odometrie)

Visuell-Inertiale Odometrie (VIO) ist die Konfiguration, bei der eine Kamera die Rolle des Aktualisierungssensors übernimmt. Die Kombination der hochfrequenten Vorhersage des IMU mit den Merkmalspunktbeobachtungen der Kamera löst die Skalenunsicherheit, die die monokulare visuelle Odometrie beeinträchtigt (siehe Abschnitt 4 – monokulare Bilder allein können keine metrische Distanz in der realen Welt erfassen), mithilfe der metrischen Beschleunigungsinformationen des IMU. Bei schnellen Bewegungen, wo eine Kamera an ihre Grenzen stößt, liefert der IMU kontinuierlich hochfrequente Orientierungsänderungen, wodurch die Wahrscheinlichkeit eines vollständigen Tracking-Abbruchs deutlich reduziert wird.

VIO lässt sich weiter in lose gekoppelte und eng gekoppelte Konfigurationen unterteilen, je nachdem, wie Kamera und IMU miteinander verbunden sind. Ein lose gekoppeltes System berechnet die kameraseitige und die IMU-seitige Positionsschätzung unabhängig voneinander und führt die beiden Ergebnisse anschließend zusammen. Die Implementierung ist zwar möglich, aber da die IMU-Seite die interne Fehlerstruktur der kameraseitigen Schätzung (deren Merkmalsbeobachtung mehr oder weniger unsicher ist) nicht ausnutzen kann, geht Präzision verloren. Ein eng gekoppeltes System behandelt die Rohdaten der IMU und die Merkmalsbeobachtungen des Bildes von Anfang an als ein einziges, gemeinsam geschätztes Zustandsproblem. Die Implementierung ist zwar komplexer, aber jede Information beider Sensoren wird genutzt, was zu höherer Präzision führt. Die repräsentativen modernen VIO-Implementierungen, die wir in den Abschnitten 8, 9 und 10 behandeln (OKVIS, VINS-Mono, OpenVINS u. a.), verwenden alle eine enge Kopplung.

7. LIO (LiDAR-Inertialodometrie)

LIO (LiDAR-Inertialodometrie) ist dasselbe Framework, wobei ein LiDAR die Aktualisierungsfunktion übernimmt. LiDAR-Punktwolken erfassen die Umgebungsgeometrie direkt und mit hoher Präzision. Ein einzelner Scan benötigt jedoch mehrere zehn bis hundert Millisekunden. Bewegt sich der Sensor währenddessen, verzerrt sich die resultierende Punktwolke (Bewegungsfehler). Verzerrung). Dank der hochfrequenten Orientierungsinformationen der IMU lässt sich diese Bewegung während des Scans korrigieren und eine verzerrungsfreie Punktwolke rekonstruieren.

Wie bei VIO in Abschnitt 6 sorgt die kontinuierliche Kurzzeit-Positionsvorhersage der IMU in geometrisch komplexen Umgebungen, mit denen LIO Schwierigkeiten hat (lange Tunnel, weite, offene Ebenen), dafür, dass die Punktwolkenregistrierung (Methoden wie ICP/NDT) deutlich weniger wahrscheinlich divergiert. Auch LIO wird in der Praxis überwiegend als eng gekoppeltes System implementiert – LIO-SAM und FAST-LIO/FAST-LIO2, die in Abschnitt 10 behandelt werden, verwenden beide dieses eng gekoppelte Design.

8. Filterbasiert (Kalman-Filter / EKF / MSCKF)

Der Kern von VIO und LIO – die Fusion von Vorhersage und Beobachtung – wird nach einer von zwei grundlegenden Designphilosophien implementiert: filterbasiert oder optimierungsbasiert, wie im nächsten Abschnitt beschrieben.

Die Grundlage des filterbasierten Ansatzes ist der Kalman-Filter, ein Framework, das Vorhersage und beobachtungsbasierte Aktualisierung abwechselnd nutzt, um rekursiv die optimale Zustandsschätzung für ein System mit linearer Dynamik zu ermitteln. Bei Problemen wie VIO/LIO, bei denen die Kombination aus IMU-Integration (Pose-Komposition) und Kameraprojektion inhärent nichtlinear ist, wird stattdessen die nichtlineare Erweiterung verwendet: der EKF (Extended Kalman Filter). Ein EKF linearisiert jede nichtlineare Funktion um die aktuelle Schätzung (eine Taylor-Entwicklung erster Ordnung) und wendet anschließend dieselben Aktualisierungsgleichungen wie ein gewöhnlicher Kalman-Filter an.

\hat{x}_k = \hat{x}_k^{-} + K_k\left(z_k - h(\hat{x}_k^{-})\right), \qquad K_k = P_k^{-} H_k^{\top}\left(H_k P_k^{-} H_k^{\top} + R\right)^{-1}

Hierbei ist \hat{x}_k^{-} der vorhergesagte Zustand aus der Propagation, z_k die tatsächliche Beobachtung, h(\cdot) das Beobachtungsmodell, das eine Beobachtung aus dem Zustand vorhersagt, und K_k der Kalman-Verstärkungsfaktor – die Gewichtung, die bestimmt, wie stark der Vorhersage im Vergleich zur Beobachtung vertraut wird. P_k^{-} ist die Kovarianz (Unsicherheit) des vorhergesagten Zustands, H_k die Jacobi-Matrix zur Linearisierung des Beobachtungsmodells und R die Kovarianz des Beobachtungsrauschens. Intuitiv gilt: Je größer die vorhergesagte Unsicherheit P_k^{-} im Verhältnis zum Beobachtungsrauschen R ist, desto größer wird der Kalman-Gewinn K_k und desto stärker fließt die Information der Beobachtung z_k in die Zustandskorrektur ein.

Die naive Implementierung eines EKF-basierten VIO erfordert die Einbeziehung jedes einzelnen Merkmalspunktes des Bildes in den Zustandsvektor, wodurch die Rechenkosten mit zunehmender Anzahl der Merkmalspunkte rapide ansteigen. Der MSCKF (Multi-State Constraint Kalman Filter), der 2007 von Mourikis & Roumeliotis vorgeschlagen wurde, löst genau dieses Problem. Der MSCKF berücksichtigt keine Merkmalspunkte. Anstatt die Punkte selbst im Filterzustand zu speichern, werden mehrere Kameraposen (ein gleitendes Fenster) im Zustand verwaltet und dieser nur anhand der geometrischen Bedingung aktualisiert, dass derselbe Merkmalspunkt aus mehreren dieser Posen beobachtet wurde. Durch den Ausschluss von Merkmalspunkten aus dem Zustand wird der mit der Merkmalsanzahl einhergehende Rechenaufwand vermieden, während gleichzeitig Beobachtungen über mehrere Frames hinweg genutzt werden – ein effizientes, filterbasiertes VIO-Design, das heute weit verbreitet ist.

9. Optimierungsbasiert (Bundle Adjustment / Faktorgraph)

Die filterbasierte Schätzung aktualisiert sich rekursiv, Methoden wie MSCKF können jedoch geklonte vergangene Posen temporär beibehalten. Der optimierungsbasierte Ansatz verwaltet Zustand und Beobachtungen in einem gleitenden Fenster oder Graphen und löst eine nichtlineare Optimierung für deren gemeinsame Konsistenz. Man kann sich dies als Erweiterung des Bundle Adjustment von Visual-SLAM vorstellen (siehe „Visual-SLAM Primer“, Abschnitt 10), um auch IMUs einzubeziehen. Information.

IMU-Beschleunigungen und Winkelgeschwindigkeiten sind bekannte Beobachtungen, keine Optimierungsvariablen. Das Hinzufügen eines Zustands zu jedem IMU-Zeitstempel oder die erneute Integration jedes Intervalls bei jeder Relinearisierung erhöht den Aufwand. Die IMU-Präintegration, vorgeschlagen von Forster et al. im Jahr 2015 (arXiv:1512.02363), fasst Messungen zwischen Keyframes als bias-korrigierbaren Relativbewegungsfaktor zusammen. Der Zustand kann Geschwindigkeit und Bias sowie in einigen Systemen auch Landmarken enthalten; der Aufwand wird durch die Fenstergestaltung und die Relinearisierung und nicht allein durch die IMU-Abtastrate bestimmt.

Der resultierende IMU-Präintegrationsfaktor wird zusammen mit Faktoren, die aus Kamera-/LiDAR-Beobachtungen abgeleitet werden (Reprojektionsfehler oder Scan-Matching-Fehler), in einem gemeinsamen Faktorgraphen dargestellt und das Ganze als Maximum-Likelihood- (oder Maximum-a-posteriori-)Schätzproblem gelöst – dies ist die Grundform des optimierungsbasierten Ansatzes.

\mathcal{X}^{*} = \arg\min_{\mathcal{X}} \sum_{k} \left\| r_{\mathrm{IMU}}(z_{I_k}, \mathcal{X}) \right\|^2_{\Sigma_{I_k}} \; + \; \sum_{(i,j)} \left\| r_{\mathrm{C/L}}(z_{ij}, \mathcal{X}) \right\|^2_{\Sigma_{ij}}

\mathcal{X} ist die Menge der zu schätzenden Posen, Geschwindigkeiten, Bias-Werte und (falls erforderlich) Kartenpunkte; r_{\mathrm{IMU}} ist das Residuum des Vorintegrationsfaktors. Filterbasierte Schätzung kontrolliert die Kosten durch sequentielle Aktualisierungen und begrenzte Historie; optimierungsbasierte Schätzung kann ein gleitendes Fenster relinearisieren. Genauigkeit und Kosten hängen von der Fensterlänge, der Initialisierung, dem Relinearisierungsplan, dem Modell und dem Rechenbudget ab, daher ist keine der beiden Methoden universell überlegen.

Diagram 3 · Use the button to switch views
Viele hochfrequente IMU-Messungen zwischen Keyframes werden zu einem bias-korrigierbaren Relativbewegungsfaktor vorintegriert
Diagram 4 · Use the button to switch views
i Keyframe i{+}1 High-rate IMU measurements (hundreds of Hz) Integrated together over the interval → a single relative-motion Factor

Abbildung 2 – Die große Anzahl an IMU-Messungen (Hunderte von Hz), die zwischen den Keyframes i und i{+}1 eintreffen, werden mittels Vorintegration zusammengeführt und im Faktorgraphen als ein einziger Relativbewegungsfaktor behandelt. Dadurch bleibt die Anzahl der Optimierungsvariablen unabhängig von der Abtastrate der IMU – sie hängt nur von der Anzahl der Keyframes ab.

10. Landmark-Algorithmen

VIO

ROVIO (Robust Visual Inertial Odometry), vorgestellt von Bloesch et al. auf der IROS 2015, ist ein EKF-basierter VIO-Algorithmus. Anstatt Merkmalspunktdeskriptoren abzugleichen, speist es die Helligkeitsinformationen von Bildausschnitten direkt in das Beobachtungsmodell des EKF ein – ein Ansatz im Stil der Direktmethode, der ihn zu einem repräsentativen Beispiel für die Kombination von filterbasierter Schätzung mit einer Direktmethode macht.

OKVIS (Open Keyframe-based Visual-Inertial SLAM), vorgestellt von Leutenegger et al. auf der IJRR 2015, ist ein Keyframe-basiertes VIO, das auf nichtlinearer Optimierung basiert. Durch die Kombination von IMU-Vorintegration (Abschnitt 9) mit einer Minimierung des Reprojektionsfehlers mittels Bundle-Adjustment zählt es zu den frühen wegweisenden Implementierungen von optimierungsbasiertem VIO.

VINS-Mono, von Qin, Li und Shen an der Hong Kong University of Science and Technology, ist ein VIO für monokulare Kameras, das auf nichtlinearer Optimierung der IMU-Vorintegration (Abschnitt 9) aufbaut, Loop Closure für globale Korrekturen hinzufügt und ein flexibles Design bietet, das für jede Komponente zwischen losem und engem Betrieb umschalten kann. VINS-Fusion ist der Nachfolger von VINS-Mono und erweitert dieses um die Unterstützung mehrerer Sensorkonfigurationen – Stereokameras, GPS – mit Fokus auf Praktikabilität in unterschiedlichsten Hardware-Setups.

OpenVINS, entwickelt von Geneva, Eckenhoff, Lee, Yang, Huang und Mitarbeitern, ist eine Open-Source-VIO-Forschungsplattform auf Basis von MSCKF. Aufbauend auf dem effizienten Filterdesign von MSCKF (Abschnitt 8) wird sie häufig als Implementierung eingesetzt, die sich durch einfache Erweiterbarkeit und Validierung für Forschungszwecke auszeichnet.

LIO

LIO-SAM (Tightly-coupled Lidar Inertial Odometry via Smoothing and Mapping), vorgestellt von Shan, Englot, Meyers, Wang, Ratti, Rus und Mitarbeitern auf der IROS 2020, ist ein eng gekoppeltes LIO-System, das auf einem Faktorgraphen basiert. Es vereint verschiedene Faktortypen – einen IMU-Vorintegrationsfaktor, einen Odometriefaktor aus dem LiDAR-Scan-Matching, einen GPS-Faktor und einen Schleifenschlussfaktor – in einem gemeinsamen Faktorgraphen und ist ein repräsentatives Beispiel für die Anwendung der optimierungsbasierten Designphilosophie (Abschnitt 9) auf LiDAR.

FAST-LIO (Fast LiDAR-Inertial Odometry), entwickelt von Xu, Zhang und ihren Mitarbeitern am MARS Lab der Universität Hongkong, ist ein schnelles LiDAR-Inertial-Odometry-Verfahren (LIO), das auf einem eng gekoppelten iterierten Kalman-Filter basiert. Im Gegensatz zum optimierungsbasierten LIO-SAM ist es filterbasiert, für die direkte Verarbeitung von LiDAR-Punktwolken mit hoher Datenrate ausgelegt und priorisiert den Echtzeitbetrieb auf Plattformen mit begrenzter Rechenleistung. FAST-LIO2 ist sein Nachfolger: Durch die direkte Verarbeitung der Punktwolke mit einer inkrementellen Nächste-Nachbarn-Suchstruktur (einem iKD-Baum) werden die Kosten für den Kartenaufbau drastisch reduziert, was zu einem schnelleren und präziseren, eng gekoppelten LIO führt.

11. VIO vs. LIO Vergleich

Aspekt VIO (repräsentativ: VINS-Mono/OpenVINS) LIO (repräsentativ: LIO-SAM/FAST-LIO2)
Primärsensor Kamera (Mono/Stereo) + IMU LiDAR + IMU
Bevorzugte Umgebungen Innen- und Außenszenen mit hoher Textur, in denen Farb- und Mustererkennung aussagekräftig ist Umgebungen mit hoher geometrischer Struktur; funktioniert bei Dunkelheit oder Gegenlicht
Schwierige Umgebungen Dunkelheit, geringe Textur, Gegenlicht/starkes Sonnenlicht Geometrisch degenerierte Räume – lange Tunnel, weite Ebenen

Sensorkosten | Relativ niedrig (Kamera + MEMS-IMU) | Hoch (LiDAR-Einheit selbst, insbesondere Modelle mit großer Reichweite und hoher Auflösung) |

Kartencharakteristik | Wenige Merkmalspunkte oder hohe Tiefendichte mit einem lernbasierten Ansatz | Dichte, geometrisch präzise Punktwolkenkarte |

Skalierungsmehrdeutigkeit | Prinzipiell vorhanden bei einer monokularen Konfiguration (aufgelöst durch die IMU) | Prinzipiell nicht vorhanden, da die LiDAR-Entfernungsmessung prinzipiell metrisch ist |

Rechenaufwand | Mittel (Kosten der Merkmalsextraktion und Deskriptorberechnung) | Die Punktwolkenverarbeitung (Nächste-Nachbarn-Suche, Scan-Matching) verursacht vergleichbare Kosten |

Repräsentative Designphilosophie | Sowohl filterbasierte (MSCKF) als auch optimierungsbasierte (Vorintegration + BA) Verfahren sind weit verbreitet | Sowohl filterbasierte (FAST-LIO2) als auch optimierungsbasierte (LIO-SAM) Verfahren sind weit verbreitet |

Die Stärken von VIO liegen in den geringen Sensorkosten und dem hohen Verständnis der Umgebung, das Farb- und Mustererkennung ermöglicht (ideal für die Objekterkennung). Die Stärken von LIO sind geometrische Genauigkeit und Robustheit gegenüber Dunkelheit und schlechtem Wetter – das ist die grundlegende Aufgabenteilung.

12. Die richtige Wahl in der Praxis

Ob man sich für VIO, LIO oder eine Kombination aus beiden entscheidet, hängt von den verfügbaren Sensoren, dem Budget und der Einsatzumgebung ab.

  • Serviceroboter für Innenräume/Saugroboter: Stehen niedrige Kosten im Vordergrund, ist VIO (oder eine lose gekoppelte Kamera-IMU-Konfiguration) meist die bessere Wahl. Sind Präzision und eine geometrisch genaue Karte wichtig, wird eher LIO eingesetzt. In typischen Innenräumen mit vielen Gängen und Wänden lässt sich der Genauigkeitsgewinn durch die höheren Kosten von LiDAR leichter rechtfertigen.

  • Drohnen: Bei begrenzter Nutzlast und geringem Stromverbrauch dominiert meist eine leichte Kamera-IMU-VIO-Konfiguration. Im Freien ist die Kopplung mit GPS ebenfalls üblich.

  • AR/VR: Visuell-inertiale Odometrie (VIO) mit der integrierten Kamera und IMU des Headsets ist der De-facto-Standard. Abgesehen von einigen High-End-Modellen mit zusätzlichem LiDAR ist VIO aufgrund von Kosten- und Gewichtsbeschränkungen die erste Wahl.

  • Autonomes Fahren / Autonome mobile Roboter im Außenbereich: Aufgrund der Anforderungen an Robustheit bei schlechtem Wetter, Gegenlicht und Nachtfahrten bildet LiDAR (LIO) typischerweise das Rückgrat, kombiniert mit VIO und GNSS (siehe „Sensor Fusion Primer“).

  • Geometrisch unstrukturierte Umgebungen – Tunnel, lange gerade Korridore: LiDAR oder LIO allein neigen zu instabilen Registrierungen. Daher ist es wichtig, eine separate Informationsquelle – VIO oder Radodometrie – hinzuzufügen, um diese Ungenauigkeiten auszugleichen.

Als Faustregel gilt: Wenn Budget und Sensorgewicht es zulassen und geometrische Präzision oberste Priorität hat, wählen Sie LIO. Wenn Kosten und geringes Gewicht im Vordergrund stehen und Sie zusätzlich farb-/musterbasierte Umgebungserkennung nutzen möchten, wählen Sie VIO. In der Produktentwicklung werden die beiden selten ausschließlich verwendet – stattdessen entwickeln sie sich meist zu einer Multisensorfusion (siehe „Sensor Fusion Primer“), die VIO, LIO, GNSS und Radodometrie situationsabhängig gewichtet.

13. Zusammenfassung

Eine IMU liefert hochfrequente, vollständig in sich geschlossene Bewegungsinformationen. Die durch Integration ermittelte Position driftet jedoch schnell, in der Größenordnung des Quadrats bis Kubus der verstrichenen Zeit. Eine Kamera (VIO) oder ein LiDAR (LIO) korrigiert diesen akkumulierten Fehler periodisch. Beide Systeme haben jedoch ihre spezifischen Schwächen: Dunkelheit und geringe Textur für die Kamera, geometrisch ungünstige Umgebungen für den LiDAR. VIO und LIO vereinen diese komplementären Schwächen durch eine Vorhersage- (hochfrequente IMU-Vorhersage) - Aktualisierungsschleife (Kamera-/LiDAR-Korrektur). Diese wird entweder im Rahmen eines filterbasierten (EKF/MSCKF) oder eines optimierungsbasierten (IMU-Vorintegration + Faktorgraph) Frameworks implementiert, um eine Robustheit und Präzision zu erreichen, die kein einzelner Sensor allein erzielen kann.

Überprüfen Sie Ihr Verständnis
Sollte der Messwert von ca. 1 g im Ruhezustand direkt integriert werden?

Transformieren Sie die spezifische Kraft zunächst in das Weltkoordinatensystem und berücksichtigen Sie dabei die Schwerkraft und die systematische Abweichung. Eine zunehmende Geschwindigkeit im Ruhezustand deutet auf ein Modell- oder Bezugssystemproblem hin.

What to read next

Review the backgroundWarum Sensorfusion fehlschlägt – Timing, Frames und extrinsische KalibrierungContinue the seriesWie man SLAM bewertet – ATE, RPE, Laufzeit und FehlerExplore another aspect of this fieldWarum ICP fehlschlägt: Initialisierung, Ausreißer und symmetrische Geometrie