Contents — find the section you need
Le capteur rotatif sur le toit d'une voiture autonome, ou la petite fenêtre sur le dessus d'un aspirateur robot : nombre de ces dispositifs utilisent la technologie LiDAR (Light Detection And Ranging), un capteur qui mesure directement les distances avec son environnement grâce à un faisceau laser. La technologie LiDAR-SLAM permet d'effectuer simultanément l'autolocalisation et la cartographie à partir des seules données du nuage de points renvoyées par un LiDAR (éventuellement complétées par des capteurs comme une centrale inertielle). Alors que le Visual-SLAM (voir « Introduction au Visual-SLAM ») tente de reconstruire indirectement la structure 3D à partir d'images 2D d'une caméra, le LiDAR-SLAM dispose directement d'informations de distance 3D : c'est là la principale différence. Cet article part du principe de ce que mesure un LiDAR, aborde les deux algorithmes fondamentaux d'alignement des nuages de points (ICP et NDT), la conception basée sur les caractéristiques (LOAM), la fermeture de boucle et le SLAM graphique, et enfin l'historique des algorithmes de points de repère et comment les choisir en pratique. Les développements actuels sont traités dans « Tendances technologiques en LiDAR-SLAM ».
Famille LiDAR Velodyne
Exemples de capteurs LiDAR LivoxImages : Velodyne Famille de capteurs LiDAR (APJarvis, CC BY-SA 4.0) / Livox Mid-40, Horizon et Tele-15 (Dllu, CC BY-SA 4.0), Wikimedia Commons. Familles de produits représentatives, pas nécessairement les derniers modèles mentionnés dans le texte.
0. Contenu de cet article
-
Ce que mesure un LiDAR et pourquoi il obtient la distance « directement »
-
Comment le problème fondamental du SLAM se manifeste dans le monde des nuages de points
-
Fonctionnement et différences des deux principaux algorithmes de correspondance de scans : ICP (Iterative Closest Point) et NDT (Normal Distributions Transform)
-
Différence entre les deux modes d’odométrie LiDAR : Scan-to-Scan et Scan-to-Map
Pourquoi LOAM extrait des caractéristiques (contours et plans) et la logique de conception sous-jacente
Comment la fermeture de boucle et l’optimisation du graphe de pose s’articulent
- Différences entre les algorithmes de points de repère — ICP / NDT / LOAM / LeGO-LOAM / A-LOAM / Cartographer / LIO-SAM / FAST-LIO2 — et comment choisir
1. Qu’est-ce que le LiDAR-SLAM ?
En résumé : Le LiDAR-SLAM est une technologie qui utilise un ensemble de mesures de distance de haute précision (un nuage de points) obtenues grâce au temps de vol (ou déphasage) d'un faisceau laser. En enregistrant et en comparant de manière répétée les scans successifs (mise en correspondance des scans), on estime simultanément la trajectoire du capteur et une carte 3D de son environnement.
L'entrée est le nuage de points produit par un LiDAR à intervalles réguliers (de quelques milliers à plusieurs centaines de milliers de points par scan). La sortie, comme pour le Visual-SLAM, comprend deux éléments : la pose du capteur (six degrés de liberté) à chaque instant (trois pour la position, trois pour l'orientation) et une carte 3D du nuage de points de l'environnement. Cette technologie permet, par exemple, à une voiture autonome de maintenir des distances précises avec les véhicules, les piétons et les infrastructures routières environnants tout en estimant sa propre position ; à un robot mobile autonome de se déplacer avec précision entre les rayonnages d'un entrepôt. Lorsqu'un drone survole des espaces géométriquement complexes comme des tunnels ou des bâtiments, la technologie LiDAR-SLAM est sous-jacente à tous ces cas.
2. Que mesure réellement un LiDAR ?
Les principes de télémétrie LiDAR se répartissent en deux grandes catégories. Dans l'approche ToF (Temps de Vol), le capteur émet une impulsion laser et mesure le temps T que met la réflexion sur la cible pour revenir, puis en déduit la distance D à partir de la vitesse de la lumière c.
Comme la lumière effectue un aller-retour, le temps mesuré T doit être divisé par deux pour obtenir le temps de propagation aller simple. L'autre approche, à déphasage (FMCW/AMCW), émet un faisceau laser modulé en continu et déduit la distance à partir de la différence de phase entre les signaux émis et réfléchis. Dans tous les cas, un LiDAR ne se contente pas de détecter la présence d'un objet, mais détermine la distance exacte et absolue qui le sépare de cet objet en une seule observation – une capacité totalement absente des appareils photo. Comme nous le verrons dans la section 4, une image prise par une caméra monoculaire ne peut jamais, à elle seule, restituer l'échelle réelle, tandis qu'un nuage de points LiDAR est gradué dès le départ.
Il existe deux grandes familles de LiDAR. Le LiDAR mécanique rotatif utilise la rotation d'un assemblage de plusieurs éléments émetteurs/récepteurs laser pour construire un nuage de points complet à 360 degrés ; Velodyne et Ouster sont des fabricants représentatifs. Le LiDAR à semi-conducteurs, quant à lui, ne comporte aucune pièce mécanique rotative. Il utilise des miroirs MEMS ou des réseaux optiques à commande de phase pour balayer un champ de vision limité, ce qui permet de réduire la taille et le coût ; Livox en est un exemple. Les unités à semi-conducteurs sacrifient un champ de vision plus étroit au profit, pour de nombreux produits, d'un balayage non répétitif (le même point est balayé selon un parcours légèrement différent à chaque fois), ce qui signifie que les nuages de points deviennent plus denses au fil du temps.
Les nuages de points LiDAR possèdent une structure que les images de caméra n'ont pas. Un LiDAR en rotation émet plusieurs lasers superposés verticalement (par exemple, 16, 32 ou 128 couches) tout en tournant horizontalement, produisant des nuages de points denses horizontalement mais clairsemés et stratifiés verticalement – une distribution anisotrope. Cette structure influence directement la conception de l'extraction de caractéristiques du LOAM et l'estimation de la normale de l'ICP, deux aspects que nous aborderons plus loin.
3. Le problème fondamental du SLAM : « Où se situe le nuage de points actuel sur la carte ? »
De même que le Visual-SLAM résout le problème de la correspondance entre l'image actuelle et les images précédentes sur la carte en faisant correspondre les points caractéristiques, le LiDAR-SLAM résout le problème de la correspondance entre le scan actuel (nuage de points) et les scans précédents sur la carte en alignant les nuages de points les uns par rapport aux autres. Le problème sous-jacent est fondamentalement le même quel que soit le capteur : une seule observation ne peut jamais déterminer une position absolue. La seule solution consiste à estimer en continu la position actuelle en utilisant la correspondance avec les observations passées (la carte) comme indice.
Ce qui diffère, c'est la nature de cette correspondance. Le SLAM visuel détecte les « points saillants » (caractéristiques) d'une image, encode numériquement l'apparence environnante sous forme de descripteur et recherche les correspondances par similarité de descripteurs. Un nuage de points LiDAR, en revanche, ne contient quasiment aucune information d'« apparence » telle que la luminosité ou la couleur (l'intensité de réflectance est disponible, mais elle est beaucoup moins discriminante qu'un descripteur d'image). Par conséquent, la mise en correspondance des nuages de points est, dans la plupart des cas, uniquement guidée par la proximité spatiale : « quel point est géométriquement le plus proche ». Le processus global de recherche de la transformation rigide (rotation R , translation \mathbf{t} ) entre deux nuages de points est appelé Mise en correspondance de scans, et il constitue le cœur du LiDAR-SLAM.
L'idée principale de cette section est simple : là où le Visual-SLAM utilise la « mise en correspondance de caractéristiques + géométrie épipolaire », le LiDAR-SLAM la remplace par la « mise en correspondance de scans ». Les deux sections suivantes présentent les deux algorithmes fondamentaux qui réalisent cette mise en correspondance : ICP et NDT.
4. Comprendre ICP
ICP (Iterative Closest Point) est un algorithme classique d'alignement de nuages de points, publié par Besl et McKay en 1992 dans IEEE Transactions on Pattern Analysis and Machine Intelligence, et encore largement utilisé aujourd'hui. Comme son nom l'indique, il repose sur une idée simple : considérer le « point le plus proche » comme le point correspondant, puis affiner cette correspondance de manière itérative.
L'algorithme se décompose en trois étapes.
- Recherche de correspondance : pour chaque point p_i du nuage de points déplacé (la source), trouver le point le plus proche q_i du nuage de points fixe (la cible) — généralement à l'aide d'une structure de recherche spatiale telle qu'un arbre KD. 2. Estimation de la transformation : étant donné l’ensemble de correspondances \{(p_i, q_i)\}, trouvez la rotation R et la translation \mathbf{t} qui minimisent la somme des distances entre les points correspondants. La version la plus simple, l’erreur point à point, est définie comme suit.
- Application et itération : appliquez les transformations R et \mathbf{t} obtenues à l’ensemble du nuage de points source, puis retournez à l’étape 1 et recherchez à nouveau les correspondances. Ce cycle de recherche de correspondances → estimation de la transformation → application se répète jusqu’à ce que l’erreur devienne suffisamment petite (ou cesse de diminuer).
L'erreur point à point est intuitive, mais lors de l'alignement de deux plans larges et plats (un mur, par exemple), la position exacte des points correspondants sur ce plan importe peu, du point de vue de l'erreur (un léger décalage le long du plan ne modifie que très peu l'erreur, tant que le décalage perpendiculaire reste faible). La convergence est donc généralement lente. L'erreur point à plan résout ce problème : elle estime un vecteur normal n_i à partir de la forme locale autour du point correspondant q_i, et minimise uniquement le décalage le long de la direction normale (la distance point-plan).
L'erreur point à plan tolère les décalages le long du plan tout en pénalisant strictement le décalage perpendiculaire à celui-ci. Elle est reconnue pour converger plus rapidement et de manière plus stable que l'erreur point à point, notamment dans les environnements riches en plans, comme les intérieurs de bâtiments. Cela dit, comme indiqué dans la section 2, le nuage de points d'un LiDAR rotatif présente une structure stratifiée et verticalement clairsemée. Par conséquent, une estimation naïve des normales peut produire des normales bruitées, déformées par la stratification ; l'estimation des normales elle-même requiert donc une attention particulière.
L'algorithme ICP présente deux faiblesses majeures. Premièrement, la recherche de correspondance reposant uniquement sur le « plus proche voisin géométrique », un décalage initial important conduit à des correspondances incorrectes et à la convergence vers un minimum local ; une bonne estimation initiale est donc indispensable. Deuxièmement, l'exécution répétée de la recherche du plus proche voisin sur des nuages de points comportant des dizaines de milliers de points par image est coûteuse en calcul, et ce coût augmente proportionnellement à la taille du nuage. L'algorithme NDT, présenté ci-après, adopte une approche différente qui s'affranchit complètement de la recherche de correspondance.
5. Comprendre NDT
NDT (Normal Distributions Transform) est un algorithme de correspondance de scans dont l'approche est fondamentalement différente de celle de l'ICP. Il a été publié par Biber et Straßer en 2003 lors de la conférence internationale IEEE/RSJ sur les robots et systèmes intelligents (IROS). Initialement conçue pour les scanners laser 2D, la méthode a ensuite été étendue aux nuages de points 3D.
L'idée fondamentale de la méthode NDT est de représenter un nuage de points non pas comme un ensemble de points individuels, mais comme une distribution de probabilité définie par voxel sur une grille régulière. La distribution des points au sein de chaque voxel est approximée par une gaussienne (distribution normale) de moyenne \mu et de matrice de covariance \Sigma.
Ayant ainsi représenté l'ensemble du nuage de points cible — comme un ensemble de distributions gaussiennes par voxel formant une fonction de densité de probabilité continue par morceaux et différentiable — il n'est plus nécessaire de rechercher des correspondances point à point pour aligner le nuage source. Au lieu de cela, pour une transformation T (rotation et translation) appliquée à chaque point source \mathbf{x}_i, donnant \mathbf{x}_i' = T(\mathbf{x}_i), on évalue la « plausibilité » de ce point transformé par rapport à la gaussienne de son voxel correspondant, sous forme de fonction de score, et on trouve le T qui la maximise.
Cette optimisation est résolue par des méthodes basées sur le gradient, telles que la méthode de Newton. Contrairement à ICP, il n'est pas nécessaire d'alterner entre la « recherche de correspondance » et l'« estimation de transformation » comme étapes distinctes : on évalue simplement le gradient par rapport aux paramètres gaussiens précalculés, ce qui évite complètement le coût de la recherche du plus proche voisin. De plus, comme le bruit dans les points individuels est absorbé par une moyenne et une covariance par voxel, le résultat tend à être robuste au bruit.
L'analyse non paramétrique (NDT) présente toutefois un compromis : le choix de la taille des voxels. Des voxels plus grands sont moins gourmands en ressources de calcul, mais lissent les fines différences de forme, ce qui nuit à la précision de l'alignement. Des voxels plus petits augmentent la résolution de forme, mais réduisent le nombre de points par voxel, ce qui rend l'estimation gaussienne instable. De plus, l'augmentation du nombre de voxels accroît le coût de calcul. Ce paramètre ajustable, que l'utilisateur doit optimiser, rend l'utilisation de la NDT délicate.
6. Odométrie LiDAR (Scan-to-Scan / Scan-to-Map)
Le processus utilisant l'ICP ou la NDT pour déterminer le mouvement relatif entre des images successives et accumuler ces estimations au fil du temps est appelé odométrie LiDAR. Comme pour l'odométrie visuelle dans le SLAM visuel, sans mécanisme de rééquilibrage avec la carte globale (boucle de fermeture), la dérive s'accumule et est inévitable.
L'odométrie LiDAR se décline en deux variantes selon le point de comparaison. Scan-to-Scan aligne chaque scan uniquement avec le scan immédiatement précédent ; cette méthode est peu coûteuse en calcul, mais comme chaque erreur d'estimation se répercute directement sur l'estimation initiale du scan suivant, la dérive a tendance à s'accumuler. Scan-to-Map aligne le scan actuel non pas avec un seul scan précédent, mais avec l'ensemble de la carte locale accumulée ; s'appuyant sur un plus grand nombre d'observations, cette méthode est moins sensible au bruit et généralement plus précise que Scan-to-Scan, au prix d'une charge de calcul plus importante due à la taille plus grande du nuage de points de référence.
La plupart des implémentations LiDAR-SLAM pratiques combinent les deux méthodes. Une estimation initiale rapide et grossière est d'abord obtenue — par Scan-to-Scan, prédiction IMU ou un alignement approximatif basé sur des essais non destructifs (END) (voir section 5) — puis cette estimation initiale est affinée par un alignement Scan-to-Map précis. Le schéma ci-dessous illustre un flux de traitement LiDAR-SLAM général basé sur ce principe en deux étapes.
Figure 1 — Le chemin rapide par scan s'étend de la correction de la distorsion à l'enregistrement local, puis aux mises à jour de la pose et de la carte locale, alimentant ainsi la prochaine estimation initiale et la carte de référence. Un chemin distinct, à débit plus faible, vérifie les revisites à partir de l'historique des images clés, prend en compte les contraintes de boucle et utilise l'optimisation du graphe pour corriger la trajectoire et la carte globales.
L'étape de correction de la distorsion (correction de la distorsion pendant le scan) illustrée dans le diagramme est spécifique au LiDAR. Un LiDAR rotatif effectue un seul scan. L'acquisition n'est pas instantanée ; elle prend de quelques dizaines à une centaine de millisecondes. Si le capteur se déplace pendant ce laps de temps, les points acquis plus tôt et ceux acquis plus tard lors du même balayage représentent des observations provenant de moments et de positions réellement différents, le tout étant mélangé au sein d'un seul balayage (distorsion de mouvement). Deskew utilise une centrale inertielle (ou l'estimation de vitesse précédente) pour corriger ce mouvement pendant le balayage, reconstruisant le nuage de points comme s'il avait été acquis à un instant précis. Cette correction est étroitement liée à la fusion de points par centrale inertielle, abordée dans VIO/LIO (voir « Introduction à VIO/LIO »).
7. Comprendre LOAM
LOAM (Lidar Odometry and Mapping in Real-time), publié par Zhang et Singh en 2014 lors de la conférence Robotics: Science and Systems (RSS), est à la base de la conception de nombreuses implémentations LiDAR-SLAM encore aujourd'hui. L'innovation majeure de LOAM est d'extraire uniquement les points géométriquement distinctifs. LOAM évalue la régularité locale (courbure) autour de chaque point et extrait les points présentant une forte courbure par rapport à leur environnement comme contours (angles vifs ou contours d'objets), et les points présentant une faible courbure comme éléments plans (partie d'une surface continue et lisse, comme un mur ou un sol). Au lieu d'utiliser un scan complet avec des dizaines de milliers de points pour l'alignement, le fait de se concentrer sur ces seuls éléments réduit considérablement le coût de calcul de la mise en correspondance des scans.
Une fois les éléments extraits, la formulation de l'erreur reprend les principes de l'ICP de la section 4, mais l'élément géométrique de référence est une « ligne » ou un « plan » plutôt qu'un « point ». Un contour p_i est mis en correspondance en minimisant sa distance à la ligne formée par deux points correspondants p_a et p_b dans le scan précédent (ou la carte).
Une caractéristique plane est appariée en minimisant sa distance au plan défini par trois points correspondants (formule identique à l'erreur point-plan de la section 4). La somme de ces distances, minimisée par rotation et translation, donne le mouvement relatif entre les images.
L'autre choix de conception fondamental de LOAM réside dans sa structure à deux niveaux : odométrie lidar haute fréquence et cartographie lidar basse fréquence. L'odométrie lidar effectue un appariement scan-à-scan basé sur les caractéristiques avec le scan précédent à haute fréquence (à chaque scan), produisant une estimation de pose grossière mais rapide. La cartographie lidar utilise cette estimation grossière comme approximation initiale et effectue un appariement scan-à-carte avec la carte cumulée, à une fréquence inférieure à celle de l'odométrie lidar, produisant une pose et une carte plus précises. L'exécution parallèle des deux processus à des fréquences différentes, le résultat de la cartographie lidar corrigeant finalement l'estimation de l'odométrie lidar, permet d'obtenir simultanément une sortie haute fréquence et une grande précision. Ce procédé d'« odométrie haute fréquence grossière » La philosophie de conception « estimation + correction précise basse fréquence » a été reprise par de nombreuses implémentations LiDAR-SLAM et LIO ultérieures, présentées dans la section 9.
8. Fermeture de boucle et SLAM graphique
L’odométrie LiDAR seule accumule une dérive au fil du temps, tout comme l’odométrie visuelle en SLAM visuel. Même après le retour d’un robot à son point de départ, la trajectoire estimée ne se corrige pas. Le mécanisme qui corrige cette erreur accumulée est la fermeture de boucle.
Dans le contexte LiDAR, la fermeture de boucle se décompose en deux grandes étapes. La première est la reconnaissance de lieu : déterminer si le nuage de points actuel ressemble à un nuage de points d’un lieu précédemment visité. Comme les nuages de points ne contiennent pas d’informations de luminosité comme les images, cette étape repose sur des approches qui encodent la distribution des formes du nuage de points lui-même comme descripteur — par exemple, des méthodes comme Scan Context, qui divisent un scan en cellules en forme d’éventail et encodent la hauteur maximale de chaque cellule comme descripteur — ou sur des méthodes qui résument les caractéristiques géométriques de l’ensemble du nuage de points. La seconde étape est la vérification géométrique : Pour les paires de scans proposées comme candidates par la reconnaissance de lieux, une tentative de correspondance est effectuée avec ICP ou NDT afin de vérifier leur concordance. Ce n'est qu'après avoir franchi ces deux étapes qu'une contrainte liant la « position actuelle » et la « position lors de la précédente visite du lieu » est jugée suffisamment fiable pour être adoptée.
L'utilisation de cette contrainte de fermeture de boucle pour corriger les poses accumulées et les assembler en un ensemble cohérent est le rôle de l'optimisation par graphe de poses, ou plus généralement, du cadre SLAM par graphes. Ce cadre construit un graphe dont les nœuds représentent la pose du capteur à chaque instant, et dont les arêtes représentent les contraintes de mouvement relatif entre les images (ou entre deux instants éloignés liés par une boucle). Les nœuds (poses) sont ensuite ajustés par optimisation non linéaire afin que toutes les contraintes des arêtes soient aussi cohérentes que possible. L'arête ajoutée par la fermeture de boucle redistribue la dérive — qui, jusqu'alors, ne se propageait que dans une seule direction — sur l'ensemble du chemin constituant la boucle. Cette optimisation, tout comme dans le SLAM visuel (voir « SLAM visuel »), permet de corriger les erreurs de positionnement. Primer, section 10), s'appuie généralement sur des bibliothèques telles que g2o, GTSAM et Ceres Solver dans les implémentations LiDAR-SLAM.
9. Algorithmes de points de repère
L'histoire du LiDAR-SLAM se comprend plus facilement selon deux axes : l'enregistrement des nuages de points et la précision avec laquelle la conception réduit les points de repère à des caractéristiques explicites.
ICP (Besl & McKay, 1992), comme expliqué dans la section 4, est l'algorithme classique et toujours largement utilisé pour l'enregistrement de nuages de points. Il est rarement utilisé seul pour le SLAM en temps réel, mais une forme de minimisation basée sur la correspondance, qui en découle, est présente dans presque toutes les méthodes ultérieures.
NDT (Biber & Straßer, 2003), comme expliqué dans la section 5, est une méthode de correspondance de scans basée sur la distribution gaussienne qui évite la recherche de correspondance et se situe au même niveau que l'ICP. L'autre choix fondamental, largement utilisé, est applicable aussi bien au SLAM pour robots d'intérieur 2D qu'aux applications de conduite autonome 3D.
LOAM (Zhang & Singh, 2014), comme expliqué dans la section 7, est la méthode qui a introduit l'extraction de caractéristiques de contours/plans, ainsi que la conception à deux niveaux (odométrie haute fréquence + cartographie basse fréquence), sous-tendant la conception de nombreuses implémentations LiDAR-SLAM et LIO encore aujourd'hui.
LeGO-LOAM (Lightweight and Ground-Optimized Lidar Odometry and Mapping, Shan & Englot, publié en 2018 à la conférence internationale IEEE/RSJ sur les robots et systèmes intelligents (IROS)) étend LOAM spécifiquement pour les véhicules terrestres. Il sépare d'abord le nuage de points en points au sol et points hors sol, utilisant les points au sol pour estimer le roulis, le tangage et l'élévation, et les points hors sol pour estimer les degrés de liberté restants (position horizontale et lacet), aboutissant à une conception légère capable de fonctionner en temps réel, même sur des systèmes embarqués aux ressources limitées. Calcul.
A-LOAM (Advanced LOAM) est une réimplémentation simplifiée et open source des concepts de LOAM, basée sur l'optimisation non linéaire avec Ceres Solver et développée par des groupes comme le HKUST Aerial Robotics Group. Elle abandonne certains réglages techniques précis de LOAM au profit d'un code plus clair et est fréquemment citée comme une implémentation accessible pour apprendre et expérimenter avec la famille d'algorithmes LOAM.
Cartographer (Hess, Kohler, Rapp, Andor, publié en 2016 à la conférence IEEE International Conference on Robotics and Automation (ICRA), Google) effectue une mise en correspondance locale des scans basée sur Ceres Solver, par sous-carte (une sous-carte étant un ensemble de plusieurs scans), combinée à une détection rapide de fermeture de boucle via une recherche par séparation et évaluation (Branch-and-Bound) de type « diviser pour régner » dans l'espace des candidats. Il prend en charge les environnements 2D et 3D et, grâce aux nombreuses implémentations open source disponibles pour ROS, a été largement adopté dans les environnements intérieurs. Cartographie.
LIO-SAM (Odométrie inertielle LiDAR étroitement couplée par lissage et cartographie, Shan, Englot, Meyers, Wang, Ratti, Rus, publié en 2020 à IROS) est une méthode d'odométrie inertielle LiDAR (LIO) étroitement couplée qui optimise conjointement les facteurs de préintégration de l'IMU, les facteurs d'odométrie de correspondance des scans LiDAR, les facteurs GPS et les facteurs de fermeture de boucle au sein d'un graphe de facteurs partagé (voir « VIO/LIO Primer » pour plus de détails).
FAST-LIO2, publié par Xu, Zhang et leurs collègues du laboratoire MARS de l'Université de Hong Kong, est une méthode LIO rapide basée sur un filtre de Kalman itéré étroitement couplé. En gérant directement le nuage de points avec une structure de recherche séquentielle du plus proche voisin (un arbre k-d incrémental, iKD-Tree), Il enregistre directement le nuage de points sur la carte sans étape d'extraction de caractéristiques explicite, et sa conception privilégie un fonctionnement en temps réel sur des plateformes de petite taille aux capacités de calcul limitées. Les développements actuels (année 2026) sont présentés dans « Tendances technologiques en LiDAR-SLAM ».
10. Comparaison des méthodes
| Méthode | Principe | Précision | Coût de calcul | Robustesse | Difficulté d'implémentation |
|---|---|---|---|---|---|
| ICP | Recherche du plus proche voisin + minimisation itérative par transformation rigide | Haute précision avec une bonne estimation initiale ; risque de convergence vers des minima locaux sinon | Moyenne à élevée (coût de la recherche itérative du plus proche voisin) | Faible dans les environnements géométriquement uniformes ou face à des décalages initiaux importants | Faible (conceptuellement simple, nombreuses implémentations existantes) |
| NDT | Maximisation de l'ajustement par rapport à une gaussienne par voxel Distributions | Dépend de la taille des voxels ; relativement robuste au bruit | Moyenne (pas de recherche de correspondance, mais calcul de gradient inclus) | Robuste au bruit, mais nécessite un réglage de la taille des voxels | Moyenne (le réglage requiert une certaine expertise) |
| LOAM | Extraction de caractéristiques de bord/planaires + odométrie/cartographie à deux niveaux | Haute précision dans les environnements riches en caractéristiques | Moyenne (plus léger que l'utilisation de l'ensemble du nuage de points, grâce à la sélection de caractéristiques) | Faible dans les environnements pauvres en caractéristiques (tunnels, etc.) | Moyenne à élevée (paramètres et conception complexes) |
| LeGO-LOAM | Séparation des points au sol + optimisation à deux niveaux de type LOAM | Haute précision pour les véhicules terrestres ; les hypothèses ne sont plus valables pour les plateformes aériennes | Moyenne (plus léger que LOAM) | Fortement dépendant de la présence d'un plan au sol plat | Moyenne |
| A-LOAM | Réimplémentation simplifiée de LOAM utilisant Ceres Solver | Approximativement équivalent à LOAM (varie selon l'implémentation) | Moyenne | Hérite des mêmes faiblesses que LOAM | Faible à moyenne (facile) (à titre de référence pour l'apprentissage) |
| Cartographer | Appariement des scans par sous-carte + fermeture de boucle par séparation et évaluation | Haute précision en intérieur (2D) ; forte cohérence globale | Coût moyen à élevé (gestion des sous-cartes et coût de recherche par séparation et évaluation) | Performant dans les environnements intérieurs riches en boucles | Moyen (facile à intégrer à l'écosystème ROS) |
| LIO-SAM | Optimisation par graphe factoriel de la préintégration IMU + odométrie LiDAR + GPS + fermeture de boucle | Haute précision avec fusion IMU ; la cohérence globale est encore améliorée par le GPS | Élevé (coût d'optimisation par graphe factoriel) | L'IMU contribue à compenser la dégénérescence géométrique | Moyen à élevé (hypothèses spécifiques sur les capteurs, par exemple IMU à 9 axes) |
| FAST-LIO2 | Enregistrement direct via filtre de Kalman itéré + iKD-Tree | Haute précision à haute fréquence (particulièrement prononcée sur LiDAR à semi-conducteurs) | Faible à moyen (la méthode directe évite le coût d'extraction des caractéristiques) | Dépend de l'IMU en cas de dégénérescence ; faible dans des conditions de géométrie extrêmement basse | Niveau de détail moyen (l'implémentation est publique, mais le réglage interne requiert une expertise) |
De manière générale, il est utile de considérer ICP et NDT comme les « algorithmes d'enregistrement fondamentaux », la famille LOAM (LOAM/LeGO-LOAM/A-LOAM) comme des « gains d'efficacité grâce à la conception des caractéristiques », Cartographer comme une « cohérence globale efficace et une fermeture de boucle », et LIO-SAM/FAST-LIO2 comme des « gains de robustesse grâce à un couplage IMU étroit » — chacun représentant un axe d'amélioration distinct s'appuyant sur les précédents.
11. Les limites du LiDAR-SLAM
Comme le LiDAR émet activement un faisceau laser pour mesurer les distances, il fonctionne bien dans l'obscurité et en contre-jour — des environnements où le Visual-SLAM rencontre des difficultés. Cependant, le LiDAR-SLAM présente ses propres faiblesses.
-
Dégénérescence géométrique : dans les environnements où la forme du nuage de points varie peu selon une direction particulière — un long tunnel ou un vaste parking plat —, la mise en correspondance des scans ne peut pas déterminer de manière univoque la translation ou la rotation selon cette direction. L'optimisation ICP/NDT se situe dans une zone de faible erreur, quelle que soit la valeur dans cette direction. Ce problème partage la même cause sous-jacente que la faiblesse de Visual-SLAM face aux murs sans relief.
-
Conditions météorologiques extrêmes : la pluie, la neige, le brouillard et la poussière diffusent et absorbent la lumière laser, atténuant les réflexions qui seraient normalement renvoyées ou générant des points parasites (réflexions parasites apparaissant à des endroits où il n'y a rien).
-
Miroirs et objets transparents : le verre et les miroirs peuvent réfléchir la lumière laser de manière spéculaire, générant des points parasites à un emplacement différent de celui de l'objet réel (l'image dans le miroir).
-
Objets dynamiques : l'utilisation de points sur des objets en mouvement (piétons, véhicules) comme s'ils faisaient partie d'un environnement statique lors de l'enregistrement introduit une erreur dans l'estimation du mouvement du capteur. Il devient nécessaire de détecter et d'exclure les objets dynamiques, ou de les modéliser explicitement.
-
Compromis densité de points/coût de calcul : une résolution plus élevée implique une fréquence de points plus élevée. Les nuages de points permettent généralement un enregistrement plus précis, mais plus le nombre de points par image est élevé, plus le coût de calcul de la mise en correspondance des scans est important. Dans les systèmes embarqués ou les drones à puissance de calcul limitée, ce compromis entre densité et vitesse devient une contrainte de conception majeure.
-
Coût du matériel : les LiDAR rotatifs haute résolution et longue portée restent nettement plus chers que les caméras, et le coût constitue souvent un véritable frein à leur adoption.
Nombre de ces faiblesses sont différentes de celles des caméras, ce qui fait de la combinaison caméra (SLAM visuel) et LiDAR (LiDAR-SLAM) — fusion de capteurs (voir « Introduction à la fusion de capteurs ») — une méthode efficace pour compenser les limites de chaque capteur pris individuellement.
12. Choix en pratique
Le choix des méthodes LiDAR-SLAM dépend fortement des capteurs pouvant être installés, de la puissance de calcul disponible, de la précision requise et des caractéristiques géométriques de l'environnement.
-
Robots de service intérieurs et aspirateurs robots : Le LiDAR 2D à bas coût demeure une solution performante et fiable, et les implémentations SLAM 2D robustes telles que Cartographer sont largement utilisées. Les espaces intérieurs, riches en structures comme les murs et le mobilier, présentent rarement de dégénérescence géométrique, ce qui en fait un environnement favorable au LiDAR-SLAM.
-
Véhicules autonomes : l’utilisation d’un LiDAR 3D haute résolution combiné à la fusion multisensorielle (GPS, IMU et caméra) constitue le scénario de base. Pour pallier les zones géométriquement dégénérées comme les tunnels et les ponts, les configurations à couplage IMU étroit, telles que LIO-SAM/FAST-LIO2, sont essentielles.
-
Drones : compte tenu des contraintes strictes de poids et de consommation énergétique, le LiDAR à semi-conducteurs (par exemple, Livox) associé à une méthode directe à faible consommation de calcul comme FAST-LIO2 est généralement privilégié.
-
AGV/AMR d’entrepôt et d’usine : les environnements à structure régulière, de type couloir, sont fréquents, ce qui rend le LiDAR 2D adapté. Les méthodes de numérisation vers cartographie (par exemple, Cartographer) constituent un choix judicieux. Dans les environnements où l'agencement des rayonnages change fréquemment, la fréquence de mise à jour des cartes est également un facteur déterminant.
-
Environnements complexes — tunnels, espaces souterrains, longs couloirs rectilignes : le LiDAR seul a tendance à produire un enregistrement instable ; un couplage IMU étroit (LIO-SAM/FAST-LIO2) ou une combinaison avec une source indépendante comme l'odométrie des roues devient donc pratiquement indispensable.
-
Intérieur vs. extérieur : les espaces intérieurs, riches en structures et en repères géométriques, favorisent le LiDAR-SLAM, tandis que les espaces extérieurs, en raison de la complexité des zones ouvertes et des conditions météorologiques difficiles, rendent la fusion IMU/GNSS plus importante.
En règle générale : une méthode directe comme FAST-LIO2 pour une puissance de calcul limitée et une fréquence de sortie élevée, LIO-SAM pour une cohérence globale intégrant également le GPS, et Cartographer pour son expérience éprouvée dans les environnements 2D et son intégration étroite avec l'écosystème ROS. Une configuration sans aucune centrale inertielle (ICU/NDT/LOAM autonome) est devenue aujourd'hui un choix quasiment impraticable compte tenu des exigences de résilience face aux environnements dégradés, et la plupart des systèmes opérationnels sont désormais conçus autour d'un couplage étroit avec une centrale inertielle comme hypothèse de base.
13. Références
- Besl & McKay, « A Method for Registration of 3-D Shapes » (IEEE TPAMI, 1992)
- Zhang & Singh, « LOAM: Lidar Odometry and Mapping in Real-time » (RSS, 2014)
- Xu et al., « FAST-LIO2: Fast Direct LiDAR-Inertial Odometry » (IEEE T-RO, 2022)
14. Résumé
LiDAR-SLAM exploite les informations de distance à l'échelle métrique (nuages de points) obtenues par le temps de vol d'un laser, effectue une mise en correspondance des scans par ICP (enregistrement itératif des points les plus proches) ou NDT (ajustement à des distributions gaussiennes par voxel), et construit une trajectoire. L'odométrie LiDAR combine les techniques de balayage et de cartographie, et corrige en continu les erreurs accumulées grâce à la fermeture de boucle et à l'optimisation du graphe de pose, permettant ainsi une autolocalisation et une cartographie simultanées. La lignée des algorithmes de points de repère — la famille LOAM (efficacité grâce à l'extraction de caractéristiques), Cartographer (cohérence globale efficace) et LIO-SAM/FAST-LIO2 (robustesse grâce à un couplage IMU étroit) — a évolué pour répondre à un défi spécifique. Face à la nécessité de gérer des environnements géométriquement complexes, la plupart des systèmes opérationnels ont convergé vers des conceptions reposant sur un couplage IMU étroit.
La réussite de la mesure de distance détermine-t-elle à elle seule la pose LiDAR ?
Les plans et les longs couloirs peuvent laisser certaines directions de mouvement peu contraintes. La réussite de la mesure de distance et l'observabilité de l'enregistrement sont deux choses différentes.
Commentaires
Veuillez vous connecter.
Aucune entrée pour le moment.