Contents — find the section you need

Roboter und autonome Fahrzeuge tragen typischerweise mehrere Sensoren gleichzeitig – Kamera, LiDAR, IMU, Radar, GNSS. Doch keiner dieser Sensoren allein erfasst die Welt korrekt: Eine Kamera hat Schwierigkeiten mit der Tiefenmessung, ein LiDAR kann weder Farbe noch Textur erkennen, und die Fehler einer IMU summieren sich mit der Zeit. Sensorfusion ist die Technologie, die die Schwächen jedes Sensors mit den Stärken eines anderen Sensors ausgleicht und so aus den einzelnen, fehlerhaften Teilen ein konsistentes „Weltmodell“ erstellt. Dieser Artikel erläutert sowohl die mathematischen Grundlagen – Wahrscheinlichkeit und Optimierung – als auch die konkreten Kombinationen: VIO, LIO und Kamera×LiDAR.

Xsens MTi-G GNSS-integrierte IMUIMU/INS-Beispiel
Intel RealSense D435 TiefenkameraBeispiel für eine Tiefenkamera

Bilder: Xsens MTi-G (Kallap85, CC BY-SA 4.0) / Intel RealSense Tiefenkamera D435 (Marc Auledas, CC BY-SA 4.0), Wikimedia Commons.

0. Inhalt dieses Artikels

  • Wozu Sensorfusion dient und warum ein einzelner Sensor nie ausreicht
  • Die grundlegende Fusionspipeline (Sensor → Messung → Merkmal/Zustand → Fusion → geschätzter Zustand)
  • Der Unterschied zwischen früher, mittlerer und später Fusion
  • Wie probabilistische Fusion funktioniert – Kalman-Filter, EKF, UKF, Partikelfilter

  • Wie optimierungsbasierte Fusion funktioniert – Faktorgraphen, Posegraphen

  • Warum VIO (Kamera×IMU), LIO (LiDAR×IMU) und Kamera×LiDAR so natürliche Paarungen sind
  • Ein Beispiel für die Integration von vier Sensoren (Kamera×LiDAR×Radar×IMU) beim autonomen Fahren
  • Was Fusion in der Praxis tatsächlich schwierig macht – Zeitsynchronisation, Kalibrierung, Rauschen

Wie Sie ein Fusionssystem für Ihren Anwendungsfall entwerfen

1. Die Kurzfassung: Was ist Sensorfusion?

In einem Satz: Sensorfusion Die Fusion kombiniert mathematisch die unvollständigen, verrauschten Messwerte mehrerer Sensoren, um eine genauere und zuverlässigere Zustandsschätzung zu erzeugen, als es ein einzelner Sensor allein könnte.

Diese Definition beinhaltet drei Ideen: Erstens Komplementarität – verschiedene Sensoren weisen unterschiedliche Stärken und Schwächen auf. Durch die Kombination gleichen sie sich gegenseitig aus. Zweitens Zustandsschätzung – der statistische Rahmen, um aus beobachtbaren Größen auf nicht direkt messbare Größen (z. B. aktuelle Position, Geschwindigkeit, Ausrichtung) zu schließen. Drittens Weltmodell – das Ergebnis der Integration der fragmentarischen Informationen jedes Sensors zu einer einzigen, zeitlich und räumlich konsistenten Repräsentation. Ein Roboter agiert nicht auf Basis roher Sensordaten, sondern auf Basis dieses integrierten Weltmodells.

2. Warum reicht ein Sensor nicht aus?

Die Gegenüberstellung der Stärken und Schwächen der einzelnen Sensoren verdeutlicht, warum die Fusion unerlässlich ist.

Sensor Stärken Schwächen
Kamera Erkennt Farbe, Textur und Semantik (Objektkategorie); hohe Winkelauflösung Tiefe schwer direkt messbar; schwach bei Dunkelheit, Gegenlicht oder schlechtem Wetter; Maßstab unbestimmt (monokular)
LiDAR Präzise, direkte Messung von Entfernung und Geometrie; unabhängig von der Beleuchtung Keine Farb- oder Texturinformationen; Schwierigkeiten bei Regen, Nebel oder Staub; Punktwolken werden mit zunehmender Entfernung spärlicher und unpräziser
IMU (Inertial Measurement Unit) Hohe Abtastrate (mehrere hundert Hz); empfindlich gegenüber Lageänderungen; unabhängig von Kamerabeleuchtung und Sichtverhältnissen Beeinflusst durch Temperatur, Vibration und Montagefehler; Fehler akkumulieren sich durch Integration (Drift); liefert keine absolute Position
Radar Robust gegenüber schlechtem Wetter (Regen, Nebel, Staub); misst die relative Geschwindigkeit direkt über Doppler Geringe Winkelauflösung – grobe Erfassung der Objektform; Schwierigkeiten bei der Unterscheidung stationärer Objekte
GNSS Liefert absolute, globale Koordinaten; Fehler akkumulieren sich nicht Niedrige Aktualisierungsrate (typischerweise 1–10 Hz); verschlechtert sich oder fällt in Innenräumen, Tunneln oder in Hochhäusern (Mehrwegeempfang) aus.

Diese Tabelle zeigt, dass „hochpräziser Sensor“ und „universeller Sensor“ zwei unterschiedliche Dinge sind. LiDAR ist einer Kamera in der geometrischen Präzision überlegen, kann aber weder Farbe noch Bedeutung erfassen. GNSS liefert die absolute Position, aktualisiert sich aber langsam und ist in Innenstädten unzuverlässig. Ein IMU ist unabhängig von Beleuchtung und Sichtverhältnissen, wird aber von Temperatur, Vibrationen und Montagefehlern beeinflusst. Da der Zustand durch Integration ermittelt wird, ist eine Drift im Laufe der Zeit unvermeidbar. Sensorfusion nutzt diese komplementäre Beziehung mathematisch.

3. Die grundlegende Struktur der Fusion

Die Details einer Sensorfusionspipeline variieren je nach Art und Ebene der Fusion (siehe nächster Abschnitt), aber die grundlegende Struktur besteht immer aus denselben fünf Phasen.

Diagram 1 · Use the button to switch views
The basic Sensor Fusion pipeline Sensor Measurement Feature / State Fusion Estimated State

Abbildung 1 – Die Rohmesswerte der einzelnen Sensoren werden in Merkmale oder Teilzustände umgewandelt und in der Fusionsphase zu einem einzigen geschätzten Zustand zusammengeführt.

Die Rohmesswerte der einzelnen Sensoren sind nicht direkt vergleichbar, da sie sich in Einheiten, Koordinatensystemen und Aktualisierungsraten unterscheiden. Jeder Sensordatenstrom wird zunächst in Merkmale (Bildmerkmale, Punktwolkenkanten usw.) oder Teilzustände (Geschwindigkeit, relative Position) umgewandelt und erst dann an die Fusionsphase übergeben. In dieser Fusionsphase kommen die unten beschriebenen probabilistischen Methoden (Kalman-Filter usw.) oder optimierungsbasierten Methoden (Faktorgraphen usw.) zum Einsatz. Das Ergebnis ist der endgültige geschätzte Zustand – Position, Geschwindigkeit, Orientierung usw.

4. Drei Fusionsstufen

Die Fusion lässt sich grob in drei Stufen unterteilen, je nachdem, an welcher Stelle der Verarbeitungskette die Informationen mehrerer Sensoren kombiniert werden.

Stufe Zeitpunkt der Fusion Eigenschaften Beispiel
Frühe Fusion Nahezu Rohdaten Geringer Informationsverlust, potenziell sehr genau, erfordert jedoch eine exakte Zeitsynchronisation und Koordinatenausrichtung zwischen den Sensoren Projektion einer LiDAR-Punktwolke auf ein Kamerabild und Kombination beider zu einem Eingangswert
Fusion auf mittlerer Ebene (Merkmalsfusion) Im Stadium der Merkmalsextraktion Erfordert keine so strenge Synchronisierung wie die Rohdatenfusion; flexibler in der Implementierung BEV-Raum-Methoden, die Kamera- und LiDAR-Merkmale kombinieren (die BEV-Fusion-Familie)

Späte Fusion | Bei der unabhängigen Wahrnehmungs-/Schätzungsausgabe jedes Sensors (z. B. Detektionen) | Die Verarbeitungskette jedes Sensors bleibt unabhängig, ist einfach zu implementieren, aber zuvor verlorene Informationen können später nicht wiederhergestellt werden | Ensemble-Ansätze, die Kamera-Objekterkennungen nachträglich mit LiDAR-Objekterkennungen kombinieren |

Die Wahl der Ebene ist ein Kompromiss zwischen Genauigkeit und Implementierungskosten. Frühe Fusion nutzt prinzipiell die meisten Informationen, aber Millisekunden-Zeitabweichungen oder Millimeter-Montagefehler zwischen den Sensoren verschlechtern das Ergebnis direkt und erfordern eine sehr genaue Kalibrierung. Späte Fusion hat einen großen praktischen Vorteil – die Verarbeitungskette jedes Sensors kann unabhängig entwickelt und debuggt werden – aber was ein einzelner Sensor „verpasst“ hat, kann nicht wiederhergestellt werden, egal wie geschickt die Ergebnisse nachgelagert kombiniert werden. Die Fusion auf mittlerer Ebene, insbesondere die Fusion von Daten elektrisch betriebener Fahrzeuge (BEV) im autonomen Fahren, hat sich als zunehmend beliebter Mittelweg zwischen diesen beiden Extremen etabliert.

5. Probabilistische Fusion

Der erste von zwei mathematischen Ansätzen zur Kombination von Daten mehrerer Sensoren basiert auf der Wahrscheinlichkeitstheorie. Grundlage ist die Bayes'sche Schätzung: Die aus dem vorherigen Schritt übernommene Schätzung (die A-priori-Wahrscheinlichkeit) wird mit der neuen Beobachtung (der Likelihood-Funktion) kombiniert, um die aktuelle Schätzung (die A-posteriori-Wahrscheinlichkeit) zu aktualisieren.

p(x_t \mid z_{1:t}) \propto p(z_t \mid x_t) \int p(x_t \mid x_{t-1}) \, p(x_{t-1} \mid z_{1:t-1}) \, dx_{t-1}

Die linke Seite zeigt die A-posteriori-Verteilung des Zustands x_t gegeben alle Beobachtungen z_{1:t} vom Zeitpunkt 1 bis t. Die rechte Seite verwendet die vorherige Schätzung p(x_{t-1}\mid z_{1:t-1}), propagiert sie einen Schritt durch das Bewegungsmodell p(x_t\mid x_{t-1}) (das Integral) und gewichtet diese Vorhersage anschließend mit der Wahrscheinlichkeit der neuen Beobachtung p(z_t\mid x_t) – ein „Vorhersagen, dann Aktualisieren“-Zyklus.

Der Kalman-Filter entsteht, wenn man diese allgemeine Bayes'sche Aktualisierung annimmt und annimmt, dass sowohl Zustand als auch Beobachtung linear und gaußverteilt sind. Dadurch wird die Aktualisierung zu einem geschlossenen Ausdruck. Im Vorhersageschritt werden Zustand und Fehlerkovarianz durch das Bewegungsmodell fortgeschrieben; im Aktualisierungsschritt korrigiert die Abweichung zwischen der neuen Beobachtung und der Vorhersage (die Innovation) den Zustand, gewichtet mit dem Kalman-Gewinn.

K_t = P_t^{-} H^{\top} \left( H P_t^{-} H^{\top} + R \right)^{-1}, \qquad \hat{x}_t = \hat{x}_t^{-} + K_t \left( z_t - H \hat{x}_t^{-} \right)

P_t^{-} ist die Kovarianz des vorhergesagten Fehlers, H bildet den Zustand in den Beobachtungsraum ab und R ist die Kovarianz des Beobachtungsrauschens. Der Kalman-Verstärkungsfaktor K_t ist ein Gewicht, das angibt, wie stark der Vorhersage des Modells im Vergleich zur neuen Beobachtung vertraut wird: Je geringer das Beobachtungsrauschen R (ein zuverlässiger Sensor), desto höher wird die Beobachtung gewichtet; je geringer die Vorhersageunsicherheit P_t^{-} (ein zuverlässiges Modell), desto höher wird die Vorhersage gewichtet – die Gewichtung passt sich automatisch an.

Die Bewegungs- und Sensormodelle eines realen Roboters sind fast nie linear, daher kann ein einfacher Kalman-Filter in der Regel nicht direkt angewendet werden. Der Erweiterte Kalman-Filter (EKF) linearisiert die nichtlinearen Bewegungs- und Beobachtungsmodelle mithilfe von Jacobimatrizen um die aktuelle Schätzung und wendet anschließend dieselben Aktualisierungsgleichungen wie der gewöhnliche Kalman-Filter an. Der Unscented Kalman Filter (UKF; Julier & Uhlmann, 1997) verzichtet vollständig auf die Jacobi-Approximation. Stattdessen werden kleine Mengen repräsentativer Stichprobenpunkte (Sigma-Punkte) direkt durch die nichtlinearen Funktionen geleitet und Mittelwert und Kovarianz aus den Ergebnissen rekonstruiert. Dies kann den EKF bei starker Nichtlinearität übertreffen. Der Partikelfilter (Gordon, Salmond & Smith, 1993) beschränkt die Verteilung nicht auf Gaußsche Verteilungen; er approximiert die Wahrscheinlichkeitsverteilung selbst mit einer großen Anzahl von Partikeln (Stichproben). Dadurch kann er multimodale Verteilungen mit mehreren gleichzeitig existierenden Hypothesen darstellen – allerdings werden für höhere Genauigkeit mehr Partikel und mehr Rechenleistung benötigt. ... ## 6. Optimierungsbasierte Fusion

Während die probabilistische Fusion sequenziell, Schritt für Schritt, aktualisiert, verfolgt der zweite mathematische Ansatz – die optimierungsbasierte Fusion – einen anderen Weg: Es wird ein Beobachtungsfenster betrachtet und anschließend der Zustand ermittelt, der maximal mit allen Beobachtungen übereinstimmt.

Die wichtigste Formulierung hierfür ist der Faktorgraph. Die zu schätzenden Zustände (die Roboterposition in jedem Zeitschritt, die Positionen der beobachteten Landmarken) werden zu Knoten; die Beziehungen zwischen ihnen (was eine gegebene Sensorbeobachtung über die Beziehung zweier Zustände aussagt) werden zu Faktoren, die diese Knoten verbinden, und der gesamte Graph wird als nichtlineares Ausgleichsproblem gelöst.

\mathbf{x}^{*} = \arg\min_{\mathbf{x}} \sum_{k} \left\| \mathbf{e}_k(\mathbf{x}, \mathbf{z}_k) \right\|^{2}_{\Sigma_k^{-1}}

\mathbf{x} ist die vollständige Menge der zu schätzenden Zustände, \mathbf{z}_k die k -te Sensormessung, \mathbf{e}_k die Fehlerfunktion, die die Diskrepanz zwischen der Vorhersage dieser Messung und dem aktuellen Zustand misst, und \Sigma_k^{-1} die Gewichtung basierend auf der Konfidenz dieser Messung. Werden Landmarken-3D-Positionen zusammen mit Kameraposen optimiert, spricht man von Bündelausgleichung. Sind die Knoten Positionen entlang der Roboterbahn, nennt man es Pose-Graph-Optimierung – das Standardverfahren zur Korrektur akkumulierter Drift nach einem Schleifenschluss (Erkennung eines zuvor besuchten Ortes).

Probabilistische Fusion (insbesondere der EKF) ist effizient und gut für sequentielle Verarbeitung geeignet, kann aber eine einmal verarbeitete Messung nicht erneut betrachten – sie kann nur vom aktuellen Schätzwert aus vorwärtsgehen. Optimierungsbasierte Fusion kann die gesamte Trajektorie korrigieren, wenn eine neue Beobachtung mit einer alten Schätzung kollidiert. Dies führt in der Regel zu einer höheren Genauigkeit – allerdings steigt der Rechenaufwand mit zunehmender Größe des Graphen. Universelle Bibliotheken wie Ceres Solver, g2o und GTSAM werden häufig eingesetzt, um diese Art von spärlichen, nichtlinearen Ausgleichsproblemen (bei denen jede Beobachtung nur wenige Variablen beeinflusst) effizient zu lösen.

7. Kamera×IMU (VIO)

Die Kombination einer Kamera mit einer IMU wird als visuell-inertiale Odometrie (VIO) bezeichnet und ist eine der am weitesten verbreiteten Fusionskombinationen in der Praxis. Die beiden Komponenten ergänzen sich so gut, weil sich ihre Schwächen nahezu perfekt ausgleichen.

Eine Kamera kann ihre eigene Bewegung anhand der Bewegung von Merkmalspunkten in Bildern schätzen. Eine monokulare Kamera kann jedoch prinzipiell keine absolute Skala (Entfernungseinheiten in der realen Welt) bestimmen, und schnelle Rotationen führen tendenziell zu Bildunschärfe und beeinträchtigen die Merkmalsverfolgung. Eine IMU ist das Spiegelbild: Sie misst Beschleunigung und Winkelgeschwindigkeit direkt mit Hunderten von Hertz und ist daher robust gegenüber schnellen Bewegungen. Die Integration der Beschleunigung liefert Geschwindigkeits- und Positionsänderungen im Originalmaßstab. Diese Integration führt jedoch dazu, dass sich Fehler mit der Zeit akkumulieren (Drift), und die absolute Position kann nie bestimmt werden.

v_{t+\Delta t} = v_t + a_t \, \Delta t, \qquad p_{t+\Delta t} = p_t + v_t \, \Delta t + \tfrac{1}{2} a_t \, \Delta t^{2}

Wie diese Gleichung zeigt, leitet eine IMU die Position durch zweifache Integration der Beschleunigung ab. Daher führt selbst eine geringe Abweichung des Beschleunigungsmessers zu einem Positionsfehler, der quadratisch mit der verstrichenen Zeit anwächst. VIO kann visuelle Merkmalsbeobachtungen nutzen, um diese Drift einzuschränken. Bei ausreichender Bewegungsanregung und Beobachtbarkeit kann die IMU eine Schätzung im metrischen Maßstab unterstützen, beseitigt aber nicht unter allen Bedingungen die Skalenmehrdeutigkeit. MSCKF (Mourikis & Roumeliotis, 2007, EKF-basiert), OKVIS (Leutenegger et al., 2015, nichtlineare Optimierung) und VINS-Mono (Qin et al., 2018, monokular + IMU) sind wegweisende Implementierungen von VIO in diesen beiden Frameworks.

8. LiDAR×IMU (LIO)

Die Kombination eines LiDAR-Sensors mit einer IMU wird als LiDAR-Inertialodometrie (LIO) bezeichnet und findet breite Anwendung in der Robotik im Außenbereich und im autonomen Fahren. LiDAR misst die umgebende Geometrie direkt und präzise als Punktwolke. Ein einzelner Scan dauert jedoch einige zehn bis hundert Millisekunden. Bewegt sich der Sensor währenddessen, werden die Punkte innerhalb eines Scans verzerrt (Bewegungsverzerrung).

Auch hier erweist sich die hohe Abtastrate der IMU als entscheidend: Die Interpolation der während eines Scans erfassten, feinen Orientierungsänderungen korrigiert diese Verzerrung. Die reine Punktwolken-zu-Punktwolken-Zuordnung (ICP o. Ä.) neigt in geometrisch strukturarmen Umgebungen – wie langen, strukturlosen Korridoren oder offenen Feldern – zu Abweichungen. Die Trägheitsdaten der IMU füllen diese Lücke und stabilisieren die Schätzung.

Das frühe LOAM (Zhang & Singh, 2014) leistete Pionierarbeit in der LiDAR-Odometrie, indem es Kanten- und Flächenmerkmale aus der Punktwolke extrahierte und diese zuordnete. LIO-SAM (Shan et al., 2020) integrierte LiDAR- und IMU-Informationen eng in einen Faktorgraphen, der so konzipiert ist, dass GPS- und Schleifenschlussbedingungen in denselben Graphen integriert werden können. FAST-LIO / FAST-LIO2 (Xu et al., 2021 / 2022) verwenden eine eng gekoppelte LiDAR-IMU-Integration mittels eines iterierten Kalman-Filters. Insbesondere FAST-LIO2 verarbeitet die Punktwolke direkt anstatt durch Extraktion spärlicher Merkmale. Die enge Kopplung kann gemeinsame Informationen nutzen, Genauigkeit und Kosten hängen jedoch von Initialisierung, Degeneration, Implementierung und Sensor-Timing ab; sie ist nicht generell besser als eine lose Kopplung.

9. Kamera × LiDAR

Die Kombination von Kamera und LiDAR ist die intuitiv komplementärste Fusionskombination – „Kennt die Bedeutung, aber nicht die Entfernung“ trifft auf „Kennt die Entfernung, aber nicht die Bedeutung“. Diese Kombination birgt jedoch eine Schwierigkeit, die bei anderen nicht auftritt: Die Koordinatensysteme der beiden Sensoren sind grundlegend verschieden (die 2D-Bildebene einer Kamera versus die 3D-Punktwolke eines LiDAR), sodass die Beziehung zwischen beiden ein explizites Kalibrierungs- und Projektionsverfahren erfordert.

Die Kalibrierung berechnet die intrinsischen Kameraparameter (Brennweite, Linsenverzeichnung, intrinsische Matrix K) und die relative Position zwischen Kamera und LiDAR (extrinsische Parameter: Rotation R, Translation t). Mit diesen Werten kann ein vom LiDAR gemessener 3D-Punkt \mathbf{X} in Kamerapixelkoordinaten \mathbf{u} projiziert werden.

\mathbf{e} = \mathbf{u} - \pi\left( K \, [R \mid t] \, \mathbf{X} \right)

\pi(\cdot) ist die Perspektivprojektionsfunktion, die homogene Koordinaten auf die 2D-Bildebene abbildet, und [R\mid t] ist die Transformation von LiDAR-Koordinaten in Kamerakoordinaten. Die Kalibrierung ist der Prozess der Berechnung von R und t, die diesen Fehler \mathbf{e} minimieren. Sobald dies geschehen ist, bestimmt dieselbe Projektion, welcher LiDAR-Punkt welchem Bildpixel entspricht (Punkt-Pixel-Zuordnung). Diese Zuordnung ermöglicht es, LiDAR-Punkten Farb- oder Klasseninformationen einer Kamera zuzuordnen oder einem von der Kamera erfassten Objekt die genaue Entfernung per LiDAR zuzuweisen.

Der vorherrschende Ansatz beim modernen autonomen Fahren führt diese Projektion auf Merkmalsebene statt punktweise durch: BEV-Fusion (Bird's-Eye View Fusion). BEVFusion (Liang et al., 2022, und separat Liu et al., 2022) transformiert Kamerabildmerkmale und LiDAR-Punktwolkenmerkmale unabhängig voneinander in den BEV-Raum (2D-Draufsicht) und kombiniert sie dort. BEVFusion gilt weithin als Paradebeispiel für die Fusion von Kamera- und LiDAR-Daten auf mittlerer Ebene.

10. Kamera × LiDAR × Radar × IMU

Nehmen wir das Beispiel des autonomen Fahrens. In der Praxis geht die Fusion weit über ein einzelnes Paar hinaus: Kamera, LiDAR, Radar und IMU (plus GNSS) werden gleichzeitig integriert, wobei jedes System eine klar definierte Rolle hat.

  • Kamera: Erfasst Informationen, die die reine Geometrie nicht liefern kann – Ampelfarbe, Schildertext, Fahrspurtyp.

LiDAR: Misst die präzise 3D-Form und Entfernung von Objekten in der Umgebung, unabhängig von der Beleuchtung.

Radar: Funktioniert auch bei Regen, Nebel oder Gegenlicht, die Kameras und LiDAR beeinträchtigen, und misst die relative Geschwindigkeit direkt per Doppler-Effekt.

IMU: Erfasst die Lageänderung und Beschleunigung des Fahrzeugs mit hoher Frequenz und interpoliert die Messwerte der anderen Sensoren.

GNSS: Liefert die Referenz für die globale Ausrichtung an einer Karte (in der Regel nach hochpräziser Korrektur, z. B. RTK, in die IMU integriert).

Diese vier oder fünf Sensortypen gleichen gegenseitig ihre Schwächen aus, sodass fast jeder einzelne Fehler von einem anderen Sensor erkannt wird: Dichter Nebel beeinträchtigt die Genauigkeit von Kamera und LiDAR, aber das Radar funktioniert weiterhin; ein Tunnel blockiert GPS, aber die Odometrie von IMU und LiDAR ermöglicht die Selbstlokalisierung. Dieses Design zur Redundanz – die Verringerung der Wahrscheinlichkeit, dass mehrere Sensoren gleichzeitig unter denselben Bedingungen ausfallen – ist der Hauptgrund dafür, dass die Multisensorfusion in Anwendungsfällen wie dem autonomen Fahren, wo Ausfälle inakzeptabel sind, als unverzichtbar gilt.

11. Was die Fusion erschwert

So elegant die Sensorfusion auf dem Papier auch erscheinen mag, ihre Implementierung stößt auf eine Reihe realer praktischer Schwierigkeiten.

  • Zeitsynchronisation: Jeder Sensor gibt Daten mit unterschiedlicher Rate und Latenz aus. Um sie als „denselben Moment“ zu behandeln, ist daher eine präzise Zeitausrichtung erforderlich – entweder durch Hardware-Triggersynchronisation oder durch Zeitstempelinterpolation.

  • Kalibrierung: Die relative Position und Orientierung zwischen den Sensoren (extrinsische Parameter) sowie die internen Parameter jedes Sensors (intrinsische Parameter) müssen präzise bekannt sein. Bereits eine geringfügige Montageabweichung führt zu einem systematischen Fehler im gesamten Fusionsergebnis.

  • Koordinatentransformation: Jeder Sensor befindet sich in seinem eigenen Koordinatensystem (Kamera-, LiDAR-, Fahrzeug- oder globales Koordinatensystem), und diese müssen konsistent und kontinuierlich transformiert werden.

  • Sensorrauschen: Die Rauscheigenschaften jedes Sensors (Gaußsch oder nicht, verzerrt oder nicht) unterscheiden sich. Eine fehlerhafte Modellierung führt zu einer falschen Gewichtung (z. B. des Kalman-Verstärkungsfaktors) in der probabilistischen Fusion.

  • Ausreißer: Falsche Detektionen oder durch dynamische Objekte verursachte Abweichungen führen zu Rauschen, das das Modell nicht vorhergesehen hat. Ein einfaches statistisches Modell kann dies nicht allein bewältigen, daher sind robuste Schätzverfahren wie RANSAC oder die explizite Ausreißererkennung notwendig.

  • Unsicherheitsfortpflanzung: Wird die individuelle Unsicherheit (Kovarianz) jedes Sensors nicht korrekt durch den gesamten Fusionsprozess fortgepflanzt, wird die tatsächliche Zuverlässigkeit der endgültigen Schätzung falsch eingeschätzt – und entweder übertriebenes Selbstvertrauen oder übermäßige Vorsicht führen zu Fehlentscheidungen in den nachfolgenden Schritten.

Keines dieser Probleme lässt sich allein durch die Anwendung der Standardgleichungen des Kalman-Filters lösen – sie alle fallen eindeutig in den Bereich des System-Engineerings.

12. Das finale Weltmodell

Alle bisher behandelten Aspekte – die einzelnen Sensoren, die einzelnen Fusionsmethoden – vereinen sich zu einem „Weltmodell“, das ein Roboter oder autonomes Fahrzeug letztendlich nutzt. Dieses Modell integriert die jeweiligen Spezialgebiete der Sensoren.

Diagram 2 · Use the button to switch views
How multiple sensors integrate into one World Model Camera → Semantics LiDAR → Geometry IMU → Motion Radar → Velocity GNSS → Global Position Sensor Fusion (Filter / Optimization) World Model (position, geometry, semantics, velocity)

Abbildung 2 – Kamera, LiDAR, IMU, Radar und GNSS liefern jeweils unterschiedliche Informationen, die die Fusionsschicht zu einem konsistenten Weltmodell integriert.

Das Weltmodell beschreibt nicht nur die Position des Fahrzeugs, sondern enthält die Geometrie der umgebenden Objekte (vom LiDAR), deren Art (von der Kamera), deren relative Geschwindigkeiten (vom Radar), die Lageänderungen des Fahrzeugs (von der IMU) und die globale Position auf der Karte (von GNSS). All diese Informationen sind widerspruchsfrei über Zeit und Raum integriert. Die Pfadplanung eines Roboters oder die Fahrentscheidungen eines autonomen Fahrzeugs basieren auf diesem Weltmodell – niemals auf rohen Sensordaten. Sensorfusion ist in diesem Sinne die Brücke zwischen Wahrnehmung und Handlung: Sie wandelt die individuellen Wahrnehmungsfähigkeiten jedes Sensors in eine kohärente Repräsentation um, mit der das System tatsächlich arbeiten kann.

13. Entwurf eines Fusionssystems in der Praxis

Beim Entwurf eines Sensorfusionssystems erleichtern vier Fragen die Entscheidungsfindung.

Entwurfsentscheidung Gewichtung
Welche Sensoren sollen fusioniert werden? Zuerst muss entschieden werden, welche Sensorschwächen die Anwendung tatsächlich abdecken muss (Radar, wenn Schlechtwetterstabilität erforderlich ist, GNSS, wenn absolute Positionsbestimmung benötigt wird usw.).
In welcher Phase soll die Fusion erfolgen? Frühe/mittlere Phase, wenn Genauigkeit Priorität hat; späte Fusion, wenn Entwicklungsunabhängigkeit und Wartbarkeit wichtiger sind.
Filter vs. Optimierung Ein Filter (EKF usw.) ist geeignet, wenn die Anforderungen sequenziell, latenzarm und rechenintensiv sind; ein optimierungsbasierter Ansatz (Faktorgraph usw.) ist sinnvoll, wenn Genauigkeit im Vordergrund steht, ausreichend Rechenleistung vorhanden ist und frühere Schätzungen revidiert werden können.
Genauigkeit vs. Rechenkosten Eine enge Kopplung ist in der Regel genauer, aber teurer in der Implementierung und im Betrieb. Lose Kopplung (Schätzung pro Sensor, anschließende Datenfusion) ist einfacher und kostengünstiger zu implementieren, geht jedoch mit einem gewissen Genauigkeitsverlust einher.

Diese Entscheidungen sind nicht unabhängig voneinander – sie beeinflussen sich gegenseitig. So ist beispielsweise ein in Serie gefertigtes Automobilsystem aufgrund von Rechenbeschränkungen oft auf filterbasierte, lose gekoppelte Designs angewiesen, während Forschungsanwendungen oder die Offline-Kartenerstellung optimierungsbasierte, eng gekoppelte Designs mit maximaler Genauigkeit ermöglichen. Es gibt keine „perfekte Fusionsmethode“ – die Essenz praktischer Sensorfusion besteht darin, die sinnvollste Kombination unter Berücksichtigung der vorhandenen Sensoren, der verfügbaren Rechenleistung und der geforderten Genauigkeit und Latenz zu wählen.

14. Zusammenfassung

Sensorfusion kombiniert mathematisch Beobachtungen von Kamera, LiDAR, IMU, Radar und GNSS – die jeweils an unterschiedlichen Stellen Stärken und Schwächen aufweisen – mithilfe probabilistischer Methoden (Kalman-Filter/EKF/UKF/Partikelfilter) oder optimierungsbasierter Verfahren (Faktorgraph/Bündelausgleich). Ziel ist eine genauere und zuverlässigere Zustandsschätzung als mit jedem einzelnen Sensor möglich wäre. Konkrete Kombinationen wie VIO (Kamera × IMU), LIO (LiDAR × IMU) und BEV-Fusion (Kamera × LiDAR) basieren alle auf demselben Prinzip: der Übersetzung von Komplementarität in Gleichungen. Die Designentscheidungen hinsichtlich Ort und Art der Fusion bestimmen letztendlich die resultierende Genauigkeit, den Rechenaufwand und die Implementierungskomplexität.

Prüfungen vor der Messungsfusion

Die Behandlung von Position und Geschwindigkeit, die aus derselben Beobachtung abgeleitet wurden, als unabhängige Messungen kann zu einer zu hohen Schätzung führen. Überprüfen Sie daher Zeitstempel, Koordinatensysteme, externe Parameter und Fehlerkorrelationen, bevor Sie Sensoren hinzufügen. Evaluieren Sie die Fusion im Vergleich zu Einzelsensor-Baselines unter gleichen Bedingungen, einschließlich Ausfällen.

Überprüfen Sie Ihr Verständnis
Was passiert, wenn dieselben Informationen zweimal in die Fusion einfließen?

Die Behandlung korrelierter Informationen als unabhängig kann zu übermäßigem Vertrauen führen. Überprüfen Sie Informationsquellen und Korrelationen, anstatt Sensoren zu zählen.

Related reading

Explore another aspect of this fieldWarum ICP fehlschlägt: Initialisierung, Ausreißer und symmetrische GeometrieExplore another aspect of this fieldVon der Kartierung zur Navigation in ROS 2 – ein minimales Jazzy- und Nav2-VerfahrenExplore another aspect of this fieldRoboterkoordinatentransformationen: Matrizen, Quaternionen und TF