Contents — find the section you need

SLAM (Simultaneous Localization and Mapping) ist die Technologie, die es ermöglicht, mithilfe von Sensoren gleichzeitig den eigenen Standort und die Umgebung zu bestimmen. Dieser Artikel gibt einen Überblick über die technischen Entwicklungen im Bereich SLAM; die Besonderheiten einzelner Bereiche (Visual-SLAM, LiDAR-SLAM) werden in separaten Artikeln behandelt.

Konzeptionelle Darstellung eines mobilen Roboters, der Lidar zur Schätzung seiner Trajektorie und zum Erstellen einer Innenraumkarte nutzt
Bei SLAM unterstützen sich Lokalisierung und Kartierung gegenseitig. Dies ist eine konzeptionelle Darstellung, keine gemessene Sensorausgabe.

Kernidee: SLAM ist keine Einweg-Pipeline, die den Roboter zuerst lokalisiert und dann kartiert. Es handelt sich um ein gekoppeltes Schätzproblem: Eine ungenaue Karte hilft bei der Positionsschätzung, und diese Position wird dann zur Aktualisierung der Karte verwendet.

ROS 2ROS 2

Bild: Robot Betriebssystem Logo, Wikimedia Commons (CC BY-SA) 4.0)

Ein SLAM-System im Überblick

Diagram 1 · Use the button to switch views
Ein repräsentatives SLAM-System, in dem das Frontend lokale Beschränkungen bildet, die Schleifenschlusserkennung eine verifizierte Langstreckenbeschränkung hinzufügt und das Graph-Backend die Trajektorie und die Karte optimiert

Diagramm: Duskcoil. Ein repräsentatives graphbasiertes SLAM-System ist vereinfacht dargestellt. Der Schleifenschluss erkennt einen erneuten Besuch und fügt eine Beschränkung hinzu; das Graph-Backend korrigiert die Trajektorie und die Karte. Die Komponentengrenzen variieren je nach Implementierung.

Auch wenn sich SLAM-Methoden ändern, bleiben ihre Vergleichsachsen erkennbar. Das Frontend bildet Korrespondenzen und Relativbewegungsbeschränkungen; das Backend gleicht Beschränkungen über die Zeit ab; und der Schleifenschluss fügt eine Langstreckenbeschränkung hinzu, wenn ein Ort erneut besucht wird. Lernbasierte Methoden ersetzen einen Teil oder alle dieser Komponenten, während 3DGS und NeRF primär die Kartendarstellung erweitern. Die folgende Geschichte lässt sich am besten als Erzählung darüber verstehen, wie sich die einzelnen Teile entwickelt haben. geändert.

Erste Strömung: Ausgehend von filterbasierten Methoden

Diagram 2 · Use the button to switch views
Zwei Achsen in der SLAM-Entwicklung: Die Schätzungs-Backends erweiterten sich von sequenzieller Filterung hin zu Glättung und Graphen, während gelernte Merkmale, neuronale Kartenrepräsentationen und semantische Karten verschiedene Komponenten erweitern

Diagramm: Duskcoil. Änderungen in der Schätzung und orthogonale Erweiterungen durch Lernen, Kartenrepräsentation und Semantik sind getrennt dargestellt. Ältere und neuere Methoden existieren weiterhin nebeneinander und werden je nach Anwendung kombiniert.

Frühes SLAM wurde von der sequenziellen Schätzung mittels des erweiterten Kalman-Filters (EKF) oder Partikelfiltern dominiert – der Zustand wurde jedes Mal aktualisiert, wenn eine neue Sensorbeobachtung eintraf. Rechentechnisch günstig, aber mit einer Schwäche: Fehler akkumulieren sich leicht, und der Ansatz neigt dazu, bei großen Karten zu versagen.

Zweite Strömung: Der Übergang zur Graphoptimierung

Was danach dominant wurde, war die Pose-Graph-Optimierung (Graph-SLAM). Sie erstellt einen Graph SLAM erstellt einen Graphen, in dem jeder Knoten die Position des Roboters zu einem bestimmten Zeitpunkt entlang seiner Trajektorie und jede Kante die relative Positionsbeziehung aus Sensormessungen darstellt. Dieser Graph wird als nichtlineares Ausgleichsproblem optimiert. In Kombination mit Schleifenschluss (Erkennen eines bereits besuchten Ortes und nachträgliches Korrigieren akkumulierter Fehler) ermöglicht dies die Erstellung von Karten, die auch in großen Umgebungen zuverlässig funktionieren. Die in newbot verwendete slam_toolbox gehört zu dieser Technologie. FAST-LIO hingegen nutzt eine eng gekoppelte LiDAR-IMU-Odometrie mit einem iterierten Kalman-Filter anstelle eines Positionsgraphen.

Was steckt hinter der Graphoptimierung: Formulierung als nichtlineares Ausgleichsproblem

Betrachten wir das Problem, das Graph SLAM intern löst, genauer: Es erstellt einen Graphen, in dem jeder Knoten die Position des Roboters zu einem bestimmten Zeitpunkt entlang seiner Trajektorie und jede Kante die relative Positionsbeziehung aus Sensormessungen darstellt. Das Problem wird als nichtlineares Ausgleichsproblem formuliert, das jeden Knoten anpasst. Die Platzierung der Knoten soll so erfolgen, dass sie maximal mit den Randbedingungen jeder Kante übereinstimmt. Da Sensormessungen verrauscht sind, widersprechen sich die Randbedingungen zwischen den Kanten zwangsläufig. Die Optimierung zielt darauf ab, diesen Konflikt so „am wenigsten unvernünftig“ wie möglich zu verteilen.

Formal besteht das Problem für die vollständige Menge der zu bestimmenden Positionen, \mathbf{x} = (\mathbf{x}_1, \dots, \mathbf{x}_n), darin, die folgende Zielfunktion zu minimieren:

\mathbf{x}^{*} = \arg\min_{\mathbf{x}} \sum_{(i,j) \in \mathcal{C}} \left\| \mathbf{e}_{ij}(\mathbf{x}_i, \mathbf{x}_j) \right\|^2_{\Sigma_{ij}^{-1}}

Dabei ist \mathcal{C} die Menge der durch eine Sensormessung eingeschränkten Knotenpaare (Kanten), \mathbf{e}_{ij} die Fehlerfunktion, die die Diskrepanz zwischen den geschätzten Positionen der Knoten i und j und der Sensormessung beschreibt, und \Sigma_{ij}^{-1} die Gewichtung anhand der Konfidenz dieser Messung (die inverse Kovarianz).

Iterative Verfahren wie Gauss-Newton oder Levenberg-Marquardt werden verwendet. Um das Problem zu lösen, wird die Fehlerfunktion um die aktuelle Schätzung linearisiert ( \mathbf{e}_{ij}(\mathbf{x} + \Delta\mathbf{x}) \approx \mathbf{e}_{ij}(\mathbf{x}) + \mathbf{J}_{ij}\Delta\mathbf{x} ), und die Normalengleichung \mathbf{J}^\top \mathbf{J} \, \Delta\mathbf{x} = -\mathbf{J}^\top \mathbf{e} wird für die Aktualisierung \Delta\mathbf{x} gelöst. Dieser Vorgang wird bis zur Konvergenz wiederholt. Werden die 3D-Positionen beobachteter Merkmalspunkte (Landmarken) neben den Kameraposen als Optimierungsziele einbezogen, spricht man von Bündelausgleichung. SLAM-Probleme weisen eine große Anzahl von Variablen (Posen, Landmarken) auf, aber jede einzelne Beobachtung berührt nur wenige davon, sodass die resultierenden Matrizen (Jacobi-Matrix, Hesse-Matrix) dünnbesetzt sind. Die effiziente Lösung durch Ausnutzung dieser Dünnbesetzung ist hier der praktische Schlüssel, und universelle Optimierungsframeworks wie Ceres Solver, g2o und GTSAM werden häufig als Bibliotheken für genau diese Art von dünnbesetzten nichtlinearen Ausgleichsproblemen verwendet.

Der dritte Trend: Lernbasiertes, KI-natives SLAM

Derzeit wird Deep Learning in die KI-basierte SLAM-Technologie integriert. SLAM-Pipeline. Die Ersetzung expliziter Merkmalsextraktion und -zuordnung durch Deep Learning ist ein aktives Forschungsgebiet mit dem Ziel, die Robustheit gegenüber Lichtveränderungen und texturarmen Umgebungen zu verbessern. In jüngster Zeit hat sich auch der Ansatz des „KI-nativen“ oder „semantischen SLAM“ etabliert – die Integration von Graph-Neuronalen Netzen oder sogar großer Sprachmodelle (LLMs) und Vision-Language-Action-Modellen (VLA) in die SLAM-Pipeline. Das Ziel ist nicht mehr nur die Positionsbestimmung („Wo bin ich?“), sondern die Erstellung einer semantischen Karte, die gleichzeitig versteht, „Was ist da?“.

Ein Wandel in der Kartendarstellung selbst

Die auffälligste Veränderung der letzten Zeit ist die Neuerfindung des Darstellungsformats der Karte selbst. Jenseits der traditionellen Punktwolke und des Belegungsrasters gewinnen Kartendarstellungen, die auf Neural Radiance Fields (NeRF) und 3D Gaussian Splatting (3DGS) basieren, rasant an Bedeutung. Diese übertreffen traditionelle Methoden zunehmend hinsichtlich Kartierungsgenauigkeit, Rendering-Qualität und Recheneffizienz. 3DGS/NeRF-basierte Verfahren – MHED-SLAM, GTS-SLAM, MTE-SLAM, HL-SLAM, PMET-SLAM und weitere – wurden auch 2026 weiterhin auf wichtigen Konferenzen und in Fachzeitschriften vorgestellt. Details dazu finden Sie im separaten Artikel „Technologietrends in Visual-SLAM“.

Momentaufnahme Ende 2026: Diversifizierung von 3DGS-SLAM nach Anwendungsbereich

Betrachtet man die oben genannten 3DGS/NeRF-basierten Verfahren bis einschließlich der Veröffentlichungen im August 2026, fällt die starke Diversifizierung der Zielbereiche auf. RoSe-SLAM erstellt semantisch annotierte 3D-Gauß-Karten aus monokularen Videos in dynamischen Szenen (angenommen für IROS 2026); Stipple aus dem Labor von Daniel Cremers erstellt inkrementell eine Karte in Echtzeit und verknüpft dabei visuelle und inertiale Daten eng miteinander; GLAM-SLAM skaliert durch Flow-Analyse auf Umgebungen von der Größe eines Stadtblocks. Verdichtung und räumliche Zerlegung (ebenfalls für IROS 2026 angenommen); und Echtzeit-LiDAR-Gaussian-Splatting-SLAM kombiniert LiDAR-Punktwolken direkt mit 3D-Gaußverteilungen. Die Spezialisierung schreitet entlang verschiedener Achsen voran – Innen- vs. Außenbereich, dynamische Szenen, großflächige Umgebungen. Der Ansatz breitet sich auch über die Robotik hinaus in die Medizin aus: EndoMD-SLAM zielt auf endoskopisches SLAM ab, und Track2Map (für MICCAI 2026 angenommen) zielt auf laparoskopische Chirurgie ab.

Integration semantischen Verständnisses: SLAM mit offenem Vokabular und Foundation-Model-Kopplung

Ein genauerer Blick auf den aktuellen Stand von „lernbasiertem, KI-nativem SLAM“: 2026 war das Jahr, in dem mehrere Methoden entstanden, die Merkmale von Bildverarbeitungs-Foundation-Modellen direkt in die SLAM-Pipeline einbinden. RADIO-ViPE (April 2026) koppelt multimodale Einbettungen aus einem agglomerativen Bildverarbeitungs-Foundation-Modell online eng zusammen und erreicht so semantisches SLAM mit offenem Vokabular. FeatureSLAM (Januar 2026) kann beliebige, textbasierte Kategorien auf der Karte lokalisieren, selbst in dynamischen Umgebungen. Es rastert Merkmale, die mit einem visuellen Basismodell ausgerichtet sind, auf jedes Gaußsche Objekt einer 3D-Gaussian-Splatting-Karte und erstellt so eine semantisch durchsuchbare Karte bei gleichzeitiger Echtzeitfähigkeit. Diese Richtung wird systematisch in der Studie „Semantic Visual SLAM: A Survey on State of the Art, Challenges, and Future Directions“ vom Oktober 2025 dargelegt, die den Fokus bis zur Integration großer Sprachmodelle erweitert und damit unterstreicht, wie sich SLAM von rein geometrischer Schätzung hin zu Systemen mit semantischem Verständnis entwickelt.

Erweiterung der Sensormodalitäten: 4D-Radar als Option

Neben LiDAR und Kameras wird die Forschung mit 4D-Radar (Millimeterwellenradar, das Entfernung, Azimut, Elevation und Dopplergeschwindigkeit liefert) als dritte Sensormodalität – geschätzt für seine Robustheit gegenüber schlechtem Wetter – kontinuierlich weiterentwickelt. Radar-Inertial-Odometrie, die 3D-Gaußsche Modellierung mit Multi-Hypothesen-Scan-Matching kombiniert, zielt auf eine verbesserte Odometriegenauigkeit bei Nebel, Regen und Staub ab, wo Kameras und LiDAR gleichermaßen an ihre Grenzen stoßen. Die erstmals Ende 2024 veröffentlichte Methode erhielt erst im März 2026 eine überarbeitete Version. Auch Benchmark-Datensätze entwickeln sich in Richtung realistischerer Betriebsbedingungen, wie beispielsweise der Hilti-Trimble-Oxford-Datensatz (Juli 2026), der eine 360°-Kamera plus IMU nutzt und Grundrissinformationen einbezieht.

Regionale Muster in Industrie und Forschung

Die Analyse von SLAM-bezogenen Patenten und Publikationen zeigt, dass China im Bereich LiDAR-zentrierter 2D-SLAM, ROS-basierter Implementierungen, Graphoptimierung und Multi-Roboter-/Edge-Computing-Forschung überproportional stark vertreten ist. Die Nachfrage aus praktischen Anwendungen – Drohnen, Serviceroboter – scheint die Forschungsrichtung maßgeblich zu bestimmen.

Zusammenfassung: Die drei Strömungen Schließen sich nicht gegenseitig aus

Sequenzielle Filterung und Graphoptimierung sind Optionen für das Schätzungs-Backend. Gelernte Merkmalsextraktion, 3DGS/NeRF-Kartendarstellungen und semantische Integration bilden separate Achsen, die sich jeweils kombinieren lassen. FAST-LIO, beispielsweise in newbot verwendet, basiert auf einem iterierten Kalman-Filter; FAST-LIO2 registriert Rohpunkte ebenfalls direkt auf der Karte, ohne separate Merkmalsextraktionsphase. Welche Kombination gewählt wird, hängt von der verfügbaren Rechenleistung, der Sensorkonfiguration und dem tatsächlichen Verwendungszweck der Karte ab – das ist die praktische Schlussfolgerung zum jetzigen Zeitpunkt.

Überprüfen Sie Ihr Verständnis
Löst eine neue Kartendarstellung jedes SLAM-Problem?

Erscheinungsbild, Lokalisierung, Schleifenschluss und Berechnung sind separate Dimensionen. Identifizieren Sie die spezifische Komponente, die ein Beitrag verbessert.

Referenzen

What to read next

Continue the seriesTechnologische Trends bei LiDAR-SLAMExplore another aspect of this fieldTechnologietrends bei humanoiden RoboternExplore another aspect of this fieldTechnologietrends bei Weltmodellen