Contents — find the section you need

Le SLAM (localisation et cartographie simultanées) est la technologie qui permet d'estimer simultanément « où je me trouve » et « à quoi ressemble mon environnement », à l'aide uniquement de capteurs. Cet article présente un panorama des grandes tendances techniques du SLAM ; les spécificités de chaque domaine (SLAM visuel, SLAM LiDAR) sont traitées dans des articles dédiés.

Vue conceptuelle d'un robot mobile utilisant un lidar pour estimer sa trajectoire tout en construisant une carte intérieure
En SLAM, la localisation et la cartographie sont complémentaires. Ceci est une illustration conceptuelle, et non une mesure réelle de capteur.

Idée clé : Le SLAM n'est pas un processus linéaire qui localise d'abord le robot puis cartographie. Il s'agit d'un problème d'estimation couplée : une carte incertaine permet d'estimer la position, et cette position est ensuite utilisée pour mettre à jour la carte.

ROS 2ROS 2

Image : Robot Operating System logo, Wikimedia Commons (CC BY-SA) 4.0)

Aperçu d'un système SLAM

Diagram 1 · Use the button to switch views
Un système SLAM représentatif où le module frontal établit des contraintes locales, la détection de fermeture de boucle ajoute une contrainte à longue portée vérifiée, et le module dorsal (graphe) optimise la trajectoire et la carte

Diagramme : Duskcoil. Un système SLAM représentatif basé sur un graphe est simplifié. La fermeture de boucle détecte une revisite et ajoute une contrainte ; le module dorsal (graphe) corrige la trajectoire et la carte. Les limites des composants varient selon l'implémentation.

Même si les méthodes SLAM évoluent, leurs axes de comparaison restent lisibles. Le module frontal établit des correspondances et des contraintes de mouvement relatif ; le module dorsal concilie les contraintes dans le temps ; et la fermeture de boucle ajoute une contrainte à longue portée lorsqu'un lieu est revisité. Les méthodes d'apprentissage remplacent tout ou partie de ces composants, tandis que 3DGS et NeRF étendent principalement la représentation cartographique. L'historique ci-dessous est plus facile à suivre comme une histoire de la façon dont chacune de ces parties a Évolution.

Premier courant : À partir des méthodes de filtrage

Diagram 2 · Use the button to switch views
Deux axes dans le développement du SLAM : les modules d’estimation se sont élargis, passant du filtrage séquentiel au lissage et aux graphes, tandis que les caractéristiques apprises, les représentations de cartes neuronales et les cartes sémantiques étendent différents composants

Schéma : Duskcoil. Les changements dans l’estimation et les extensions orthogonales par l’apprentissage, la représentation de cartes et la sémantique sont dissociés. Les méthodes anciennes et nouvelles coexistent et se combinent selon l’application.

Les premiers SLAM étaient dominés par l’estimation séquentielle via le filtre de Kalman étendu (EKF) ou les filtres particulaires — mise à jour de l’état à chaque nouvelle observation d’un capteur. Peu coûteux en calcul, mais avec un inconvénient : les erreurs s’accumulent facilement et l’approche tend à échouer pour les cartes à grande échelle.

Deuxième courant : Le passage à l’optimisation par graphes

Ce qui est devenu dominant par la suite, c’est l’optimisation par graphes de pose (SLAM par graphes). Elle construit un graphe. Chaque nœud représente la pose du robot à un instant donné de sa trajectoire, et chaque arête une relation relative déduite des observations des capteurs. L'ensemble est ensuite optimisé simultanément comme un problème de moindres carrés non linéaires. Combiné à la fermeture de boucle (reconnaissance d'un lieu déjà visité et correction rétroactive des erreurs accumulées), ce procédé permet de construire des cartes robustes même dans des environnements à grande échelle. slam_toolbox, utilisé dans newbot, appartient à cette lignée. FAST-LIO, quant à lui, effectue une odométrie LiDAR-IMU étroitement couplée avec un filtre de Kalman itéré, plutôt qu'avec un graphe de poses.

Optimisation de graphe : Formulation par moindres carrés non linéaires

Concrètement, le graphe du problème que SLAM résout en interne est le suivant : il construit un graphe où chaque nœud représente la pose du robot à un instant donné de sa trajectoire, et chaque arête la relation de position relative déduite des observations des capteurs. Ce problème est formulé comme un problème de moindres carrés non linéaires qui ajuste chaque nœud. Le placement des nœuds doit être aussi cohérent que possible avec les contraintes de chaque arête. Les observations des capteurs étant bruitées, les contraintes entre les arêtes sont nécessairement conflictuelles. L'objectif de cette optimisation est de répartir ces conflits de la manière la moins problématique possible.

Formellement, pour l'ensemble complet des poses à déterminer, \mathbf{x} = (\mathbf{x}_1, \dots, \mathbf{x}_n), le problème consiste à minimiser l'objectif suivant :

\mathbf{x}^{*} = \arg\min_{\mathbf{x}} \sum_{(i,j) \in \mathcal{C}} \left\| \mathbf{e}_{ij}(\mathbf{x}_i, \mathbf{x}_j) \right\|^2_{\Sigma_{ij}^{-1}}

Ici, \mathcal{C} représente l'ensemble des paires de nœuds (arêtes) contraintes par une observation de capteur, \mathbf{e}_{ij} est la fonction d'erreur exprimant l'écart entre les poses estimées des nœuds i et j et l'observation du capteur, et \Sigma_{ij}^{-1} est la pondération par la confiance de cette observation (l'inverse de la covariance).

Des méthodes itératives telles que Gauss-Newton ou Levenberg-Marquardt sont utilisées. Pour résoudre ce problème, la fonction d'erreur est linéarisée autour de l'estimation courante (\mathbf{e}_{ij}(\mathbf{x} + \Delta\mathbf{x}) \approx \mathbf{e}_{ij}(\mathbf{x}) + \mathbf{J}_{ij}\Delta\mathbf{x}), et l'équation normale \mathbf{J}^\top \mathbf{J} \, \Delta\mathbf{x} = -\mathbf{J}^\top \mathbf{e} est résolue pour la mise à jour \Delta\mathbf{x}, et ce jusqu'à convergence. Lorsque les positions 3D des points caractéristiques observés (repères) sont incluses comme cibles d'optimisation, en plus des poses de la caméra, ce processus est appelé ajustement de faisceaux. Les problèmes SLAM comportent un grand nombre de variables (poses, repères), mais chaque observation individuelle n'en affecte qu'un petit nombre. Les matrices résultantes (jacobienne, hessienne) sont donc creuses. Exploiter cette creux est essentiel pour une résolution efficace, et des frameworks d'optimisation généralistes comme Ceres Solver, g2o et GTSAM sont largement utilisés comme bibliothèques pour ce type de problème de moindres carrés non linéaires creux.

Troisième tendance : SLAM basé sur l'apprentissage et natif de l'IA

La tendance actuelle consiste à intégrer l'apprentissage profond au SLAM. Pipeline SLAM. Le remplacement de l'extraction et de la mise en correspondance explicites de caractéristiques par l'apprentissage profond est un domaine de recherche actif visant à améliorer la robustesse face aux variations d'éclairage et aux environnements pauvres en textures. Plus récemment, une approche appelée « SLAM natif de l'IA » ou « SLAM sémantique » a également émergé : elle intègre des réseaux neuronaux graphiques, voire de grands modèles de langage (LLM) et des modèles Vision-Langage-Action (VLA), au pipeline SLAM. L'objectif n'est plus seulement de déterminer « où suis-je ? », mais de construire une carte sémantique qui comprenne simultanément « ce qui s'y trouve ».

Une évolution dans la représentation cartographique elle-même

Le changement récent le plus marquant est la refonte du format de représentation cartographique lui-même. Au-delà du nuage de points et de la grille d'occupation traditionnels, les représentations cartographiques basées sur les champs de radiance neuronaux (NeRF) et le splatting gaussien 3D (3DGS) gagnent rapidement du terrain. Elles surpassent de plus en plus les méthodes traditionnelles en termes de précision cartographique, de qualité de rendu et d'efficacité de calcul, et de nouvelles méthodes basées sur 3DGS/NeRF… MHED-SLAM, GTS-SLAM, MTE-SLAM, HL-SLAM, PMET-SLAM, et d'autres encore, ont continué d'être présentés dans les principales conférences et revues scientifiques jusqu'en 2026. Pour plus de détails, consultez l'article « Tendances technologiques en SLAM visuel ».

Aperçu fin 2026 : Diversification des domaines d'application du 3DGS-SLAM

En examinant concrètement les méthodes basées sur 3DGS/NeRF mentionnées ci-dessus jusqu'aux publications d'août 2026, on constate une diversification importante des domaines cibles. RoSe-SLAM construit des cartes gaussiennes 3D sémantiquement étiquetées à partir de vidéos monoculaires dans des scènes dynamiques (accepté à IROS 2026) ; Stipple, du laboratoire de Daniel Cremers, construit une carte de manière incrémentale en temps réel en couplant étroitement les données visuelles et inertielles ; GLAM-SLAM s'adapte à des environnements de la taille d'un pâté de maisons grâce à la densification du flux et à la décomposition spatiale (également accepté à IROS). 2026) ; et le SLAM par projection gaussienne LiDAR en temps réel combine directement les nuages de points LiDAR avec des gaussiennes 3D. La spécialisation progresse selon différents axes : intérieur/extérieur, scènes dynamiques, environnements à grande échelle. Cette approche s'étend également au-delà de la robotique pour s'appliquer à la médecine : EndoMD-SLAM cible le SLAM endoscopique, et Track2Map (accepté à MICCAI 2026) cible la chirurgie laparoscopique.

Intégration de la compréhension sémantique : SLAM couplé à un vocabulaire ouvert et à un modèle de base

Approfondissement du SLAM « basé sur l'apprentissage et natif de l'IA » : 2026 a été l'année où plusieurs méthodes ont émergé, intégrant directement les fonctionnalités d'un modèle de base de vision dans le pipeline SLAM. RADIO-ViPE (avril 2026) couple étroitement des plongements multimodaux issus d'un modèle de base de vision agglomératif en ligne, réalisant un SLAM sémantique à vocabulaire ouvert capable de localiser des catégories textuelles arbitraires sur la carte. Même dans des environnements dynamiques, FeatureSLAM (janvier 2026) rasterise les caractéristiques alignées sur un modèle de vision de base sur chaque gaussienne d'une carte de splatting gaussien 3D, créant ainsi une carte sémantiquement interrogeable tout en préservant les performances en temps réel. Cette approche est exposée de manière systématique dans l'étude d'octobre 2025 intitulée « SLAM visuel sémantique : État de l'art, défis et perspectives », qui étend son champ d'application jusqu'à l'intégration de grands modèles de langage, soulignant ainsi l'évolution du SLAM, passant d'une simple estimation géométrique à des systèmes intégrant également une compréhension sémantique.

Élargissement des modalités de capteurs : Le radar 4D comme option

Parallèlement aux LiDAR et aux caméras, la recherche utilisant le radar 4D (radar à ondes millimétriques fournissant la distance, l'azimut, l'élévation et la vitesse Doppler) comme troisième modalité de capteur – prisée pour sa robustesse aux intempéries – continue d'être activement mise à jour. L'odométrie inertielle radar 4D, qui combine la modélisation gaussienne 3D… Grâce à la mise en correspondance de scans multi-hypothèses, l'objectif est d'améliorer la précision de l'odométrie dans des conditions de brouillard, de pluie et de poussière où les caméras et les LiDAR rencontrent des difficultés. Publiée initialement fin 2024, cette méthode a fait l'objet d'une version révisée en mars 2026. Les jeux de données de référence évoluent également vers des conditions d'utilisation plus réalistes, comme le jeu de données Hilti-Trimble-Oxford (juillet 2026), qui utilise une caméra à 360 degrés et une centrale inertielle (IMU) et intègre des informations a priori sur le plan d'étage.

Tendances régionales dans l'industrie et la recherche

L'analyse des brevets et articles relatifs au SLAM a révélé que la Chine joue un rôle prépondérant dans le SLAM 2D centré sur le LiDAR, les implémentations basées sur ROS, l'optimisation de graphes et la recherche sur les robots multiples et le calcul en périphérie. La demande émanant d'applications pratiques (drones, robots de service) semble fortement orienter la recherche.

Résumé : Les trois courants ne sont pas incompatibles

Le filtrage séquentiel et l'optimisation de graphes sont des options pour l'estimation. Côté back-end. L'extraction de caractéristiques apprises, les représentations cartographiques 3DGS/NeRF et l'intégration sémantique constituent des axes distincts, mais combinables. FAST-LIO, utilisé par exemple dans newbot, repose sur un filtre de Kalman itéré ; FAST-LIO2 enregistre également les points bruts directement sur la carte, sans étape d'extraction de caractéristiques préalable. Le choix de la combinaison dépend de la puissance de calcul disponible, de la configuration des capteurs et des besoins réels de la carte ; c'est la conclusion pratique à ce jour.

Vérifiez votre compréhension
Une nouvelle représentation cartographique résout-elle tous les problèmes SLAM ?

Apparence, localisation, fermeture de boucle et calcul sont des dimensions distinctes. Identifiez le composant spécifique amélioré par une contribution.

Références

What to read next

Continue the seriesTendances technologiques en LiDAR-SLAMExplore another aspect of this fieldTendances technologiques en matière de robots humanoïdesExplore another aspect of this fieldTendances technologiques dans les modèles mondiaux