Contents — find the section you need
Les robots et les véhicules autonomes embarquent généralement plusieurs capteurs simultanément : caméra, LiDAR, centrale inertielle (IMU), radar et GNSS. Pourtant, aucun de ces capteurs, pris individuellement, ne permet une compréhension complète du monde : une caméra peine à appréhender la profondeur, un LiDAR ne peut déterminer ni la couleur ni la texture, et les erreurs d’une IMU s’accumulent avec le temps. La fusion de capteurs est la technologie qui comble les lacunes de chaque capteur en s’appuyant sur les points forts des autres, assemblant ainsi un « modèle du monde » cohérent à partir d’éléments individuellement imparfaits. Cet article aborde les fondements mathématiques de cette technologie (probabilités et optimisation), puis les combinaisons concrètes : VIO, LIO et caméra × LiDAR.
Exemple IMU/INS
Exemple de caméra de profondeurImages : Xsens MTi-G (Kallap85, CC BY-SA 4.0) / Intel RealSense depth camera D435 (Marc Auledas, CC BY-SA 4.0), Wikimedia Commons.
0. Contenu de cet article
-
À quoi sert la fusion de capteurs et pourquoi un seul capteur ne suffit jamais
-
Le pipeline de fusion de base (capteur → mesure → caractéristique/état → fusion → état estimé)
-
La différence entre la fusion précoce, intermédiaire et tardive
-
Fonctionnement de la fusion probabiliste : filtre de Kalman, EKF, UKF, filtre particulaire
-
Fonctionnement de la fusion basée sur l’optimisation : graphes de facteurs, graphes de pose
Pourquoi les combinaisons VIO (caméra × IMU), LIO (LiDAR × IMU) et caméra × LiDAR sont si naturelles
Un exemple d’intégration de quatre capteurs (caméra × LiDAR × radar × IMU) pour la conduite autonome
Les difficultés pratiques de la fusion : synchronisation temporelle, étalonnage, bruit
Comment concevoir un système de fusion adapté à votre cas d’utilisation
1. En bref : Qu’est-ce que la fusion de capteurs ?
En un La fusion de capteurs combine mathématiquement les observations incomplètes et bruitées de plusieurs capteurs pour produire une estimation de l'« état » plus précise et plus fiable que celle fournie par un seul capteur.
Cette définition englobe trois concepts. Premièrement, la complémentarité : chaque capteur a ses forces et ses faiblesses, et leur combinaison permet de compenser les faiblesses des autres. Deuxièmement, l'estimation d'état : le cadre statistique permettant de déduire une grandeur non observable directement (où suis-je actuellement, à quelle vitesse, dans quelle orientation) à partir de grandeurs observables. Troisièmement, le modèle du monde : le résultat de l'intégration des informations fragmentaires de chaque capteur en une représentation unique, cohérente dans le temps et l'espace. Un robot n'agit pas en fonction des données brutes des capteurs, mais en fonction de ce modèle du monde intégré.
2. Pourquoi un seul capteur ne suffit-il pas ?
Comparer les forces et les faiblesses de chaque capteur permet de comprendre pourquoi la fusion est quasiment indispensable.
| Capteur | Forces | Faiblesses |
|---|---|---|
| Caméra | Reconnaît la couleur, la texture et la sémantique (catégorie d'objet) ; haute résolution angulaire | La profondeur est difficile à mesurer directement ; faible en cas de faible luminosité, de contre-jour ou de mauvaises conditions météorologiques ; l'échelle est indéterminée (monoculaire) |
| LiDAR | Mesure précise et directe de la distance et de la géométrie ; indépendant de l'éclairage | Aucune information de couleur ou de texture ; performances médiocres sous la pluie, le brouillard ou la poussière ; les nuages de points deviennent clairsemés — et moins précis — à distance |
| IMU (Centrale de Mesure Inertielle) | Fréquence d'échantillonnage élevée (plusieurs centaines de Hz) ; sensible aux changements d'orientation ; indépendant de l'éclairage et de la visibilité de la caméra | Affecté par la température, les vibrations et les erreurs de montage ; les erreurs s'accumulent par intégration (dérive) ; ne fournit pas de position absolue |
| Radar | Résistant aux intempéries (pluie, brouillard, poussière) ; mesure directement la vitesse relative par effet Doppler | Faible résolution angulaire — perception grossière de la forme de l'objet ; peut avoir des difficultés à distinguer les objets stationnaires |
| GNSS | Fournit des coordonnées absolues et globales ; Les erreurs ne s'accumulent pas | Faible fréquence de mise à jour (généralement 1 à 10 Hz) ; dégradation ou interruption du signal en intérieur, dans les tunnels ou au milieu des immeubles de grande hauteur (trajets multiples) |
Ce tableau révèle que « capteur haute précision » et « capteur universel » sont deux choses différentes. Le LiDAR surpasse une caméra en termes de précision géométrique, mais ne fournit ni couleur ni signification. Le GNSS donne une position absolue, mais sa mise à jour est lente et sa fiabilité est limitée en centre-ville. Une centrale inertielle (IMU) est indépendante de l'éclairage et de la visibilité, mais sensible à la température, aux vibrations et aux erreurs de montage ; son état étant calculé par intégration, une dérive est inévitable avec le temps. La fusion de capteurs exploite mathématiquement cette complémentarité.
3. Structure de base de la fusion
Les détails d'un pipeline de fusion de capteurs varient selon les données fusionnées et le niveau de fusion (voir la section suivante), mais sa structure générale reste la même : cinq étapes.
Figure 1 — Les mesures brutes de chaque capteur sont converties en caractéristiques ou en états partiels, puis l'étape de fusion les intègre en un seul état estimé.
Les mesures brutes issues directement de chaque capteur ne sont pas comparables : elles diffèrent par leurs unités, leurs systèmes de coordonnées et leurs fréquences de mise à jour. Chaque flux de données de capteurs est d'abord converti en caractéristiques (points clés de l'image, contours du nuage de points, etc.) ou en état partiel (vitesse, pose relative), avant d'être transmis à l'étape de fusion. C'est à cette étape que les méthodes probabilistes (filtres de Kalman, etc.) ou les méthodes d'optimisation (graphes de facteurs, etc.) décrites ci-dessous sont mises en œuvre, et que le résultat est l'état final estimé : position, vitesse, orientation, etc.
4. Trois niveaux de fusion
La fusion se divise en trois niveaux principaux, selon l'étape du processus où les informations des différents capteurs sont combinées.
| Niveau | Moment de la fusion | Caractéristiques | Exemple |
|---|---|---|---|
| Fusion précoce | Données quasi brutes | Faible perte d'information, précision potentiellement très élevée, mais exige une synchronisation temporelle et un alignement des coordonnées stricts entre les capteurs | Projection d'un nuage de points LiDAR sur une image de caméra et combinaison des deux en une seule entrée |
| Fusion intermédiaire (caractéristiques) | Au stade de l'extraction des caractéristiques | Nécessite une synchronisation moins stricte que la fusion de données brutes ; plus flexible à implémenter | Méthodes BEV-space combinant les caractéristiques des caméras et du LiDAR (famille BEV Fusion) |
Fusion tardive | À la sortie de perception/estimation indépendante de chaque capteur (ex. : détections) | Le pipeline de chaque capteur reste indépendant, facile à implémenter, mais les informations perdues précédemment ne peuvent être récupérées ultérieurement | Approches d'ensemble combinant a posteriori les détections d'objets par caméra et par LiDAR |
Le choix du niveau de fusion résulte d'un compromis entre précision et coût d'implémentation. La fusion précoce exploite en principe le maximum d'informations, mais des décalages temporels de l'ordre de la milliseconde ou des erreurs de montage de l'ordre du millimètre entre les capteurs dégradent directement le résultat, exigeant un étalonnage très précis. La fusion tardive présente un avantage pratique majeur : le pipeline de traitement de chaque capteur peut être développé et débogué indépendamment. Cependant, les informations « manquées » par un capteur individuel ne peuvent être récupérées, même avec une combinaison optimale des résultats en aval. La fusion de niveau intermédiaire, notamment la fusion des données des véhicules électriques à batterie (VEB) dans le cadre de la conduite autonome, est devenue une solution de plus en plus populaire, un juste milieu entre ces deux extrêmes.
5. Fusion probabiliste
Le premier des deux cadres mathématiques permettant de combiner les observations de plusieurs capteurs repose sur la théorie des probabilités. Son principe fondamental est l'estimation bayésienne : combiner « l'estimation reportée de l'étape précédente » (la distribution a priori) avec « la nouvelle observation » (la vraisemblance) afin de mettre à jour « l'estimation actuelle » (la distribution a posteriori).
Le membre de gauche représente la distribution a posteriori sur l'état x_t étant donné chaque observation z_{1:t} de l'instant 1 à l'instant t. Le membre de droite reprend l'estimation précédente p(x_{t-1}\mid z_{1:t-1}), la propage d'une étape à travers le modèle de mouvement p(x_t\mid x_{t-1}) (l'intégrale), puis pondère cette prédiction par la vraisemblance de la nouvelle observation p(z_t\mid x_t) — un cycle « prédire, puis mettre à jour ».
Le filtre de Kalman est obtenu en prenant cette mise à jour bayésienne générale et en supposant que tout — état et observation confondus — est linéaire et gaussien, ce qui transforme la mise à jour en une expression analytique. Lors de l'étape de prédiction, l'état et la covariance des erreurs sont propagés à travers le modèle de mouvement ; lors de l'étape de mise à jour, l'écart entre la nouvelle observation et la prédiction (l'innovation) corrige l'état, pondéré par le gain de Kalman.
P_t^{-} représente la matrice de covariance de l'erreur prédite, H projette l'état dans l'espace d'observation et R représente la matrice de covariance du bruit d'observation. Le gain de Kalman K_t pondère la confiance accordée à la prédiction du modèle par rapport à la nouvelle observation : plus le bruit d'observation R est faible (capteur fiable), plus l'observation est pondérée ; plus l'incertitude de prédiction P_t^{-} est faible (modèle fiable), plus la prédiction est pondérée – l'équilibre s'ajuste automatiquement.
Les modèles de mouvement et de capteurs d'un robot réel sont presque toujours non linéaires ; un filtre de Kalman classique ne peut donc généralement pas être appliqué directement. Le filtre de Kalman étendu (EKF) linéarise les modèles non linéaires de mouvement et d'observation autour de l'estimation courante à l'aide des jacobiennes, puis applique les mêmes équations de mise à jour que le filtre de Kalman classique. Le filtre de Kalman non parfumé (UKF ; Julier & Uhlmann, 1997) s'affranchit de l'approximation du jacobien. Il traite directement les fonctions non linéaires à l'aide d'un petit ensemble de points d'échantillonnage représentatifs (points sigma), puis reconstruit la moyenne et la covariance à partir des résultats. Cette approche peut surpasser le filtre de Kalman étendu (EKF) en présence d'une forte non-linéarité. Le filtre particulaire (Gordon, Salmond & Smith, 1993) ne restreint pas la distribution à une loi gaussienne ; il approxime la distribution de probabilité elle-même par un grand nombre de particules (échantillons), ce qui lui permet de représenter des distributions multimodales où plusieurs hypothèses coexistent. Toutefois, une plus grande précision requiert un plus grand nombre de particules et donc une puissance de calcul accrue.
6. Fusion basée sur l'optimisation
Alors que la fusion probabiliste effectue des mises à jour séquentielles, étape par étape, le second cadre mathématique – la fusion basée sur l'optimisation – adopte une approche différente : il conserve une fenêtre d'observations, puis recalcule l'état qui est le plus cohérent avec l'ensemble de ces observations.
Sa formulation phare est le graphe de facteurs. Les états à estimer (la pose du robot à chaque pas de temps, les positions des points de repère observés) deviennent des nœuds ; les contraintes entre eux (ce qu'une observation de capteur donnée nous apprend sur la relation entre deux états) deviennent des facteurs reliant ces nœuds, et le graphe entier est résolu comme un problème de moindres carrés non linéaires.
\mathbf{x} représente l'ensemble des états à estimer, \mathbf{z}_k la k-ième observation du capteur, \mathbf{e}_k la fonction d'erreur mesurant l'écart entre la prédiction de cette observation et l'état actuel, et \Sigma_k^{-1} le poids issu de la confiance de cette observation. Lorsque les positions 3D des points de repère sont optimisées conjointement aux poses de la caméra, ce processus est appelé ajustement de faisceau. Lorsque les nœuds représentent des poses le long de la trajectoire d'un robot, on parle d'optimisation du graphe de poses — le cadre standard pour corriger la dérive accumulée après la fermeture d'une boucle (reconnaissance d'un lieu déjà visité).
La fusion probabiliste (en particulier le filtre de Kalman étendu) est peu coûteuse et bien adaptée au traitement séquentiel, mais elle ne peut pas réexaminer une observation une fois qu'elle a été intégrée ; elle ne progresse qu'à partir de l'estimation actuelle. La fusion basée sur l'optimisation permet de corriger la trajectoire complète lorsqu'une nouvelle observation contredit une estimation précédente, ce qui améliore généralement la précision, au prix d'une augmentation de la charge de calcul à mesure que le graphe s'agrandit. Des bibliothèques généralistes comme Ceres Solver, g2o et GTSAM sont largement utilisées pour résoudre efficacement ce type de problème de moindres carrés non linéaires parcimonieux (où chaque observation n'affecte qu'un petit nombre de variables).
7. Caméra × IMU (VIO)
L'association d'une caméra à une centrale inertielle (IMU) est appelée odométrie visuelle-inertielle (VIO) et constitue l'une des associations de fusion les plus répandues en pratique. Leur parfaite complémentarité s'explique par leurs faiblesses respectives.
Une caméra peut estimer son propre mouvement à partir du déplacement des points caractéristiques dans les images, mais une caméra monoculaire ne peut pas, par principe, déterminer l'échelle absolue (unités de distance réelles), et une rotation rapide tend à flouter l'image et à interrompre le suivi des points caractéristiques. Une centrale inertielle (IMU) est l'image inversée : elle mesure directement l'accélération et la vitesse angulaire à des centaines de hertz, ce qui la rend robuste aux mouvements rapides. L'intégration de l'accélération permet d'obtenir la variation de vitesse et de position à l'échelle réelle. Cependant, cette même intégration entraîne une accumulation d'erreurs (dérive) au fil du temps, et l'IMU ne connaît jamais la position absolue.
Comme le montre cette équation, une IMU calcule la position en intégrant l'accélération a_t deux fois. Ainsi, même un faible biais de l'accéléromètre se traduit par une erreur de position qui croît avec le carré du temps écoulé. VIO peut utiliser des observations de caractéristiques visuelles pour limiter cette dérive. Avec une excitation et une observabilité du mouvement suffisantes, l'IMU peut permettre une estimation à l'échelle métrique, mais elle ne supprime pas l'ambiguïté d'échelle dans toutes les conditions. MSCKF (Mourikis & Roumeliotis, 2007, basé sur EKF), OKVIS (Leutenegger et al., 2015, basé sur l'optimisation non linéaire) et VINS-Mono (Qin et al., 2018, monoculaire + IMU) sont des implémentations de référence de l'odométrie vectorielle (VIO) dans ces deux contextes.
8. LiDAR×IMU (LIO)
L'association d'un LiDAR à une centrale inertielle (IMU) est appelée odométrie LiDAR-inertielle (LIO). Cette technique est largement utilisée dans les robots d'extérieur et la conduite autonome. Le LiDAR mesure la géométrie environnante directement et précisément sous forme de nuage de points. Cependant, une acquisition prend de quelques dizaines à une centaine de millisecondes. Si le capteur se déplace pendant ce laps de temps, les points acquis sont déformés (distorsion de mouvement).
Ici encore, la fréquence d'échantillonnage élevée de l'IMU permet de pallier ce problème : l'interpolation des variations d'orientation fines capturées lors d'une acquisition corrige cette distorsion. Le recours exclusif à la mise en correspondance de nuages de points (ICP et méthodes similaires) tend à engendrer des dérives dans les environnements géométriquement pauvres en détails – un long couloir sans relief, un champ ouvert – où les informations inertielles de l'IMU comblent le manque et stabilisent l'estimation.
La première version de LOAM (Zhang & Singh, 2014) a été pionnière en odométrie LiDAR, en extrayant les points caractéristiques de bord et de plan du nuage de points et en les faisant correspondre. LIO-SAM (Shan et al., 2020) a intégré étroitement les informations LiDAR et IMU sur un graphe factoriel, conçu pour que les contraintes GPS et de fermeture de boucle puissent être combinées dans un même graphe. FAST-LIO / FAST-LIO2 (Xu et al., 2021 / 2022) a adopté une intégration LiDAR-IMU étroitement couplée via un filtre de Kalman itéré. FAST-LIO2, en particulier, traite directement le nuage de points, sans extraction de caractéristiques éparses. Le couplage fort permet d'exploiter les informations conjointes, mais sa précision et son coût dépendent de l'initialisation, de la dégénérescence, de l'implémentation et de la synchronisation des capteurs ; il n'est pas systématiquement supérieur au couplage faible.
9. Caméra × LiDAR
L'association d'une caméra et d'un LiDAR est la combinaison de fusion la plus intuitivement complémentaire qui soit : « connaître le sens mais pas la distance » rencontre « connaître la distance mais pas le sens ». Cependant, cette association présente une difficulté que les autres n'ont pas : les systèmes de coordonnées des deux capteurs sont fondamentalement différents (le plan image 2D d'une caméra contre le nuage de points 3D d'un LiDAR). Leur mise en relation nécessite donc une procédure explicite d'étalonnage et de projection.
L'étalonnage détermine les paramètres intrinsèques de la caméra (focale, distorsion de l'objectif, matrice intrinsèque K) et la pose relative entre la caméra et le LiDAR (paramètres extrinsèques : rotation R, translation t). Grâce à ces données, un point 3D \mathbf{X} mesuré par LiDAR peut être projeté en coordonnées de pixels de la caméra \mathbf{u}.
\pi(\cdot) est la fonction de projection perspective qui transforme les coordonnées homogènes en coordonnées de pixels de la caméra, et [R\mid t] est la transformation des coordonnées LiDAR en coordonnées de la caméra. L'étalonnage consiste à déterminer les valeurs de R et t qui minimisent l'erreur \mathbf{e}. Une fois cette opération effectuée, la même projection détermine la correspondance entre chaque point LiDAR et chaque pixel de l'image (association point-pixel). Cette correspondance permet d'associer les informations de couleur ou de classe de la caméra aux points LiDAR, ou de fournir à un objet détecté par la caméra la distance précise du LiDAR.
L'approche dominante en conduite autonome moderne effectue cette projection au niveau des caractéristiques plutôt que point par point : la fusion BEV (Bird's-Eye View Fusion). BEVFusion (Liang et al., 2022, et séparément Liu et al., 2022) convertit indépendamment les caractéristiques des images de la caméra et les caractéristiques du nuage de points LiDAR dans l'espace BEV (vue de dessus 2D), puis les combine. Cette méthode est largement citée comme l'exemple phare de fusion de niveau intermédiaire pour les systèmes Caméra×LiDAR.
10. Caméra×LiDAR×Radar×IMU
Prenons l'exemple de la conduite autonome : en pratique, la fusion va bien au-delà d'une simple paire de données. Caméra, LiDAR, radar et IMU (ainsi que GNSS) sont intégrés simultanément, chacun avec un rôle clairement défini.
-
Caméra : interprète des informations que la géométrie seule ne peut fournir (couleur des feux de circulation, texte des panneaux, type de voie).
-
LiDAR : mesure avec précision la forme 3D et la distance des objets environnants, indépendamment de la luminosité.
-
Radar : fonctionne même sous la pluie, dans le brouillard ou en contre-jour, conditions qui perturbent les caméras et le LiDAR, et mesure directement la vitesse relative par effet Doppler.
-
Centrale inertielle (IMU) : enregistre les variations d'orientation et l'accélération du véhicule à haute fréquence, en interpolant les données des autres capteurs.
-
GNSS : fournit la référence pour l'alignement global sur une carte (généralement intégré à l'IMU après une correction de haute précision, par exemple RTK).
Ces quatre ou cinq types de capteurs se complètent, permettant ainsi de compenser presque toutes les défaillances : un brouillard épais dégrade la précision des caméras et du LiDAR, mais le radar reste opérationnel ; un tunnel bloque le GPS, mais l'odométrie de l'IMU et du LiDAR assure la géolocalisation. Cette conception axée sur la redondance — réduisant le risque de défaillance simultanée de plusieurs capteurs dans les mêmes conditions — est la principale raison pour laquelle la fusion multi-capteurs est considérée comme incontournable dans un cas d'utilisation tel que la conduite autonome, où la défaillance est inacceptable.
11. Les difficultés de la fusion
Aussi élégante que puisse paraître la fusion de capteurs sur le papier, sa mise en œuvre se heurte à de réelles difficultés pratiques.
-
Synchronisation temporelle : chaque capteur émet des données à une fréquence et avec une latence différentes. Les considérer comme « au même instant » exige donc un alignement temporel précis : synchronisation matérielle des déclencheurs ou interpolation d'horodatage.
-
Calibrage : la position et l'orientation relatives entre les capteurs (paramètres extrinsèques), ainsi que les paramètres internes de chaque capteur (paramètres intrinsèques), doivent être connus avec précision. Un léger décalage de montage introduit une erreur systématique sur l'ensemble du résultat fusionné.
-
Transformation de coordonnées : chaque capteur est défini dans son propre repère (repère caméra, repère LiDAR, repère véhicule, repère global), et ces repères doivent être transformés de manière cohérente et continue. - Bruit des capteurs : les caractéristiques de bruit de chaque capteur (gaussien ou non, biaisé ou non) diffèrent, et une modélisation incorrecte de ce bruit fausse la pondération (par exemple, le gain de Kalman) dans la fusion probabiliste.
-
Valeurs aberrantes : les fausses détections ou les discordances causées par des objets dynamiques introduisent un bruit imprévu par le modèle. Un modèle statistique simple ne peut pas gérer ce problème à lui seul ; des techniques d'estimation robustes comme RANSAC, ou le rejet explicite des valeurs aberrantes, deviennent donc nécessaires.
-
Propagation de l'incertitude : si l'incertitude individuelle (covariance) de chaque capteur n'est pas correctement propagée tout au long du processus de fusion, la fiabilité réelle de l'estimation finale est mal évaluée, et un excès de confiance ou une prudence excessive peuvent induire en erreur les décisions ultérieures.
Aucun de ces problèmes ne se résout par la simple implémentation des équations classiques du filtre de Kalman ; ils relèvent tous du domaine de l'ingénierie des systèmes.
12. Le modèle du monde final
En rassemblant tous les éléments abordés jusqu'à présent — les capteurs individuels, les méthodes de fusion individuelles —, on obtient ce qu'un robot ou un véhicule autonome embarque en définitive : un « modèle du monde » du type de celui présenté ci-dessous, qui intègre les spécificités de chaque capteur.
Figure 2 — Caméra, LiDAR, IMU, radar et GNSS fournissent chacun des informations différentes, et la couche de fusion les intègre dans un modèle du monde cohérent.
Le modèle du monde ne se limite pas à la simple localisation (« où suis-je ? ») ; il contient la géométrie des objets environnants (données LiDAR), leur nature (données caméra), leurs vitesses relatives (données radar), les changements d'orientation du véhicule (données IMU) et sa position globale sur la carte (données GNSS), le tout intégré de manière cohérente dans le temps et l'espace. La planification de trajectoire d'un robot ou les décisions de conduite d'un véhicule autonome sont basées sur ce modèle du monde, et jamais sur les données brutes des capteurs. La fusion de capteurs est, en ce sens, le pont entre la perception et l'action : elle convertit les capacités perceptives individuelles de chaque capteur en une représentation cohérente sur laquelle le système peut agir.
13. Conception pratique d'un système de fusion
Lors de la conception d'un système de fusion de capteurs, quatre questions facilitent généralement la prise de décision.
| Décision de conception | Éléments à prendre en compte |
|---|---|
| Éléments à fusionner | Déterminer d'abord les faiblesses des capteurs que l'application doit impérativement compenser (radar si la résistance aux intempéries est essentielle, GNSS si la position absolue est requise, etc.) |
| À quelle étape fusionner les données | Fusion précoce/intermédiaire si la précision est prioritaire ; fusion tardive si l'indépendance de développement et la maintenabilité sont plus importantes |
| Filtrage vs optimisation | Un filtre (EKF, etc.) si l'exigence est séquentielle, à faible latence et peu gourmande en ressources de calcul ; une approche basée sur l'optimisation (graphe de facteurs, etc.) si la précision est primordiale, si la marge de calcul est suffisante et si les estimations précédentes doivent être révisables |
| Précision vs coût de calcul | Un couplage fort est généralement plus précis, mais plus coûteux à mettre en œuvre et à exploiter ; un couplage faible (estimation par capteur, puis fusion) est plus facile à mettre en œuvre et moins coûteux, au détriment de la précision |
Ces décisions sont interdépendantes. Par exemple, les systèmes automobiles produits en série sont souvent contraints, par les limitations de calcul, à privilégier des architectures à filtrage et à couplage faible. En revanche, la recherche ou la cartographie hors ligne peuvent s'appuyer sur des architectures à couplage fort et optimisées, visant une précision maximale. Il n'existe pas de méthode de fusion parfaite : la conception pratique de la fusion de capteurs repose essentiellement sur le choix de la combinaison la plus judicieuse compte tenu des capteurs embarqués, de la puissance de calcul disponible et des exigences de précision et de latence de l'application.
14. Résumé
La fusion de capteurs combine mathématiquement les observations issues de caméras, LiDAR, centrales inertielles (IMU), radars et systèmes GNSS – chacun présentant des forces et des faiblesses spécifiques – à l'aide de méthodes probabilistes (filtre de Kalman, EKF, UKF, filtre particulaire) ou de méthodes d'optimisation (graphe de facteurs, ajustement par faisceaux), afin de produire une estimation d'état plus précise et fiable que celle fournie par un capteur unique. Les systèmes de couplage concrets tels que VIO (Caméra×IMU), LIO (LiDAR×IMU) et BEV Fusion (Caméra×LiDAR) reposent tous sur le même principe : traduire la complémentarité en équations. Les choix de conception concernant le lieu et la méthode de fusion déterminent en définitive la précision, le coût de calcul et la complexité de mise en œuvre.
Vérifications avant la fusion des mesures
Considérer la position et la vitesse issues d'une même observation comme des mesures indépendantes peut conduire à une estimation trop optimiste. Avant d'ajouter des capteurs, vérifiez les horodatages, les repères, les facteurs extrinsèques et les corrélations d'erreur. Évaluez la fusion par rapport à des mesures de référence effectuées avec un seul capteur dans les mêmes conditions, y compris en cas de panne.
Que se passe-t-il si la même information est fusionnée deux fois ?
Considérer des informations corrélées comme indépendantes peut engendrer un excès de confiance. Privilégiez l'analyse des sources d'information et des corrélations plutôt que le comptage des capteurs.
Commentaires
Veuillez vous connecter.
Aucune entrée pour le moment.