Contents — find the section you need

I robot e i veicoli autonomi in genere integrano diversi sensori contemporaneamente: telecamera, LiDAR, IMU, radar, GNSS. Tuttavia, nessuno di essi, da solo, è in grado di comprendere correttamente il mondo: una telecamera ha difficoltà a rilevare la profondità, un LiDAR non può fornire informazioni su colore o consistenza, e gli errori di un IMU si accumulano nel tempo. La fusione dei sensori è la tecnologia che colma i punti ciechi di ciascun sensore con i punti di forza degli altri, assemblando un "modello del mondo" coerente a partire da singoli elementi imperfetti. Questo articolo analizza sia i fondamenti matematici – probabilità e ottimizzazione – sia le combinazioni concrete: VIO, LIO e Camera×LiDAR.

IMU integrata GNSS Xsens MTi-GEsempio di IMU/INS
Telecamera di profondità Intel RealSense D435Esempio di telecamera di profondità

Immagini: Xsens MTi-G (Kallap85, CC BY-SA 4.0) / Intel Telecamera di profondità RealSense D435 (Marc Auledas, CC BY-SA 4.0), Wikimedia Commons.

0. Cosa tratta questo articolo

  • A cosa serve la fusione di sensori e perché un singolo sensore non è mai sufficiente
  • La pipeline di base della fusione (sensore → misurazione → caratteristica/stato → fusione → stato stimato)
  • La differenza tra fusione precoce, intermedia e tardiva
  • Come funziona la fusione probabilistica: filtro di Kalman, EKF, UKF, filtro particellare
  • Come funziona la fusione basata sull'ottimizzazione: grafi fattoriali, grafi di posa
  • Perché VIO (telecamera×IMU), LIO (LiDAR×IMU) e telecamera×LiDAR sono abbinamenti così naturali
  • Un esempio di integrazione di quattro sensori (telecamera×LiDAR×Radar×IMU) con la guida autonoma
  • Cosa rende effettivamente difficile la fusione nella pratica: sincronizzazione temporale, calibrazione, rumore
  • Come pensare alla progettazione di un sistema di fusione per il tuo caso d'uso

1. La risposta breve: cos'è la fusione di sensori In una frase: La fusione dei sensori combina matematicamente le osservazioni incomplete e rumorose provenienti da più sensori per produrre una stima dello "stato" più accurata e affidabile di quella che qualsiasi singolo sensore potrebbe fornire da solo.

Questa definizione racchiude tre concetti. Primo, complementarietà: sensori diversi sono più o meno efficaci in ambiti diversi, quindi la loro combinazione permette a ciascuno di compensare le debolezze dell'altro. Secondo, Stima dello stato: il quadro statistico per inferire una quantità non osservabile direttamente (dove mi trovo in questo momento, a quale velocità, in quale orientamento) a partire da quantità osservabili. Terzo, Modello del mondo: il risultato dell'integrazione delle informazioni frammentarie di ciascun sensore in un'unica rappresentazione coerente sia nel tempo che nello spazio. Un robot non agisce in base ai dati grezzi dei sensori, ma in base a questo modello del mondo integrato.

2. Perché un solo sensore non è sufficiente?

Mettendo a confronto i punti di forza e di debolezza di ciascun sensore, diventa chiaro perché la fusione sia praticamente indispensabile.

Sensore Punti di forza Punti deboli

Fotocamera | Riconosce colore, texture e semantica (categoria di oggetto); elevata risoluzione angolare | La profondità è difficile da misurare direttamente; debole in condizioni di oscurità, controluce o maltempo; la scala non è determinata (monoculare) |

LiDAR | Misurazione precisa e diretta di distanza e geometria; indipendente dall'illuminazione | Nessuna informazione su colore o texture; difficoltà in caso di pioggia, nebbia o polvere; le nuvole di punti diventano rade e meno precise a distanza |

IMU (Unità di Misura Inerziale) | Elevata frequenza di campionamento (centinaia di Hz+); sensibile ai cambiamenti di orientamento; indipendente dall'illuminazione e dalla visibilità della telecamera | Influenzata da temperatura, vibrazioni ed errori di montaggio; gli errori si accumulano tramite integrazione (deriva); non fornisce la posizione assoluta |

Radar | Resistente alle intemperie (pioggia, nebbia, polvere); misura la velocità relativa direttamente tramite Doppler | Bassa risoluzione angolare: percezione approssimativa della forma dell'oggetto; può avere difficoltà a distinguere oggetti stazionari |

GNSS | Fornisce coordinate assolute e globali; gli errori non si accumulano | Bassa frequenza di aggiornamento (tipicamente 1-10 Hz); si degrada o si interrompe in ambienti chiusi, in galleria o tra i grattacieli urbani (multipath) |

Questa tabella rivela che "sensore ad alta precisione" e "sensore universale" sono due cose diverse. Il LiDAR supera una telecamera in termini di precisione geometrica, ma non può fornire informazioni sul colore o sul significato. Il GNSS fornisce la posizione assoluta, ma si aggiorna lentamente e non è affidabile in centro città. Un'IMU non dipende dall'illuminazione o dalla visibilità, ma è influenzata da temperatura, vibrazioni ed errori di montaggio; poiché deriva lo stato tramite integrazione, la deriva è inevitabile nel tempo. La fusione dei sensori sfrutta matematicamente questa relazione complementare.

3. La struttura di base della fusione

I dettagli di una pipeline di fusione dei sensori variano a seconda di cosa viene fuso e a quale livello (la sezione successiva), ma la struttura generale è sempre la stessa, composta da cinque fasi.

Diagram 1 · Use the button to switch views
The basic Sensor Fusion pipeline Sensor Measurement Feature / State Fusion Estimated State

Figura 1 — Le misurazioni grezze di ciascun sensore vengono convertite in caratteristiche o stato parziale e la fase di fusione le integra in un singolo stato stimato.

Le misurazioni grezze direttamente da ciascun sensore non possono essere confrontate direttamente: differiscono nelle unità, sistemi di coordinate e frequenze di aggiornamento. Ogni flusso di dati del sensore viene prima convertito in caratteristiche (punti chiave dell'immagine, bordi della nuvola di punti e così via) o in uno stato parziale (velocità, posizione relativa), e solo successivamente viene passato alla fase di fusione. In questa fase di fusione vengono effettivamente applicati i metodi probabilistici (filtri di Kalman, ecc.) o i metodi basati sull'ottimizzazione (grafi fattoriali, ecc.) descritti di seguito, e il suo output è lo stato finale stimato: posizione, velocità, orientamento e altro.

4. Tre livelli di fusione

La fusione si suddivide in tre livelli principali, a seconda di dove nella pipeline vengono combinate le informazioni provenienti da più sensori.

Livello Quando avviene la fusione Caratteristiche Esempio
Fusione iniziale Quasi dati grezzi Poca perdita di informazioni, potenzialmente molto precisa, ma richiede una rigorosa sincronizzazione temporale e allineamento delle coordinate tra i sensori Proiezione di una nuvola di punti LiDAR su un'immagine della telecamera e combinazione di entrambe in un unico input

Fusione di livello intermedio (delle caratteristiche) | Nella fase di estrazione delle caratteristiche | Non richiede una sincronizzazione così rigida come la fusione dei dati grezzi; più flessibile da implementare | Metodi nello spazio BEV che combinano le caratteristiche di telecamere e LiDAR (la famiglia BEV Fusion) |

Fusione tardiva | All'uscita di percezione/stima indipendente di ciascun sensore (ad es. rilevamenti) | La pipeline di ciascun sensore rimane indipendente, facile da implementare, ma le informazioni perse in precedenza non possono essere recuperate in seguito | Approcci di tipo ensemble che combinano i rilevamenti di oggetti da telecamere con i rilevamenti di oggetti da LiDAR a posteriori |

La scelta del livello rappresenta un compromesso tra precisione e costi di implementazione. La fusione precoce, in linea di principio, sfrutta la maggior quantità di informazioni, ma scostamenti temporali dell'ordine dei millisecondi o errori di montaggio dell'ordine dei millimetri tra i sensori degradano direttamente il risultato, richiedendo una calibrazione molto precisa. La fusione tardiva ha un grande vantaggio pratico: la pipeline di elaborazione di ciascun sensore può essere sviluppata e debuggata in modo indipendente, ma qualsiasi informazione "persa" da un singolo sensore non può essere recuperata, indipendentemente da quanto abilmente i risultati vengano combinati a valle. La fusione di livello intermedio, in particolare la fusione BEV nella guida autonoma, è diventata la via di mezzo sempre più diffusa tra questi due estremi.

5. Fusione probabilistica

Il primo dei due modelli matematici per combinare le osservazioni di più sensori si basa sulla teoria della probabilità. Il suo fondamento è la stima bayesiana: combinare "la stima riportata dal passo precedente" (la distribuzione a priori) con "la nuova osservazione" (la verosimiglianza) per aggiornare "la stima corrente" (la distribuzione a posteriori).

p(x_t \mid z_{1:t}) \propto p(z_t \mid x_t) \int p(x_t \mid x_{t-1}) \, p(x_{t-1} \mid z_{1:t-1}) \, dx_{t-1}

Il lato sinistro rappresenta la distribuzione a posteriori sullo stato x_t dato ogni osservazione z_{1:t} dal tempo 1 al tempo t. Il lato destro prende la stima precedente p(x_{t-1}\mid z_{1:t-1}), la propaga in avanti di un passo attraverso il modello di movimento p(x_t\mid x_{t-1}) (l'integrale) e poi pondera tale previsione con la verosimiglianza della nuova osservazione p(z_t\mid x_t) — un ciclo "prevedi e aggiorna".

Il filtro di Kalman è ciò che si ottiene prendendo questo aggiornamento bayesiano generale e assumendo che tutto — sia lo stato che l'osservazione — siano lineari e gaussiani, il che trasforma l'aggiornamento in un'espressione in forma chiusa. Nella fase di predizione, lo stato e la covarianza dell'errore vengono propagati attraverso il modello di movimento; nella fase di aggiornamento, la discrepanza tra la nuova osservazione e la predizione (l'innovazione) corregge lo stato, ponderata dal guadagno di Kalman.

K_t = P_t^{-} H^{\top} \left( H P_t^{-} H^{\top} + R \right)^{-1}, \qquad \hat{x}_t = \hat{x}_t^{-} + K_t \left( z_t - H \hat{x}_t^{-} \right)

P_t^{-} rappresenta la covarianza dell'errore previsto, H mappa lo stato nello spazio delle osservazioni e R rappresenta la covarianza del rumore di osservazione. Il guadagno di Kalman K_t è un peso che esprime quanto fidarsi della "previsione del modello" rispetto alla "nuova osservazione": minore è il rumore di osservazione R (un sensore affidabile), maggiore è il peso attribuito all'osservazione; minore è l'incertezza della previsione P_t^{-} (un modello affidabile), maggiore è il peso attribuito alla previsione: l'equilibrio si regola automaticamente.

I modelli di movimento e dei sensori di un robot reale non sono quasi mai lineari, quindi un semplice filtro di Kalman di solito non può essere applicato direttamente. Il Filtro di Kalman esteso (EKF) linearizza i modelli non lineari di moto e osservazione attorno alla stima corrente utilizzando le matrici jacobiane, quindi applica le stesse equazioni di aggiornamento del filtro di Kalman ordinario. Il Filtro di Kalman non lineare (UKF; Julier & Uhlmann, 1997) omette completamente l'approssimazione jacobiana, passando invece un piccolo insieme di punti campione rappresentativi (punti sigma) direttamente attraverso le funzioni non lineari e ricostruendo la media e la covarianza dai risultati, il che può superare le prestazioni dell'EKF in presenza di forte non linearità. Il Filtro a particelle (Gordon, Salmond & Smith, 1993) non limita affatto la distribuzione alla gaussiana; approssima la distribuzione di probabilità stessa con un gran numero di particelle (campioni), il che gli consente di rappresentare distribuzioni multimodali in cui coesistono diverse ipotesi, a costo di richiedere un maggior numero di particelle e una maggiore potenza di calcolo per una maggiore precisione.

  1. Fusione basata sull'ottimizzazione

Mentre la Fusione probabilistica si aggiorna sequenzialmente, un passo alla volta, il secondo framework matematico – la Fusione basata sull'ottimizzazione – adotta un approccio diverso: mantiene una finestra di osservazioni, quindi risolve per trovare lo stato che è massimamente coerente con tutte le osservazioni contemporaneamente.

La sua formulazione principale è il Grafo dei Fattori. Gli stati da stimare (la posizione del robot a ogni passo temporale, le posizioni dei punti di riferimento osservati) diventano nodi; i vincoli tra di essi (ciò che una data osservazione del sensore ci dice su come due stati devono essere correlati) diventano Fattori che collegano questi nodi, e l'intero grafo viene risolto come un problema di minimi quadrati non lineari.

\mathbf{x}^{*} = \arg\min_{\mathbf{x}} \sum_{k} \left\| \mathbf{e}_k(\mathbf{x}, \mathbf{z}_k) \right\|^{2}_{\Sigma_k^{-1}}

\mathbf{x} rappresenta l'insieme completo degli stati da stimare, \mathbf{z}_k l'osservazione del sensore k -esima, \mathbf{e}_k la funzione di errore che misura la discrepanza tra ciò che tale osservazione prevede e lo stato attuale, e \Sigma_k^{-1} il peso derivante dalla confidenza di tale osservazione. Quando le posizioni 3D dei punti di riferimento vengono ottimizzate insieme alle pose della telecamera, questo processo è specificamente chiamato Bundle Adjustment. Quando i nodi sono le pose lungo la traiettoria di un robot, si parla di ottimizzazione del Pose Graph, il framework standard per correggere la deriva accumulata dopo la chiusura di un ciclo (riconoscimento di un luogo precedentemente visitato).

La fusione probabilistica (in particolare l'EKF) è economica e adatta all'elaborazione sequenziale, ma non può rivisitare un'osservazione una volta che è stata elaborata: si sposta solo in avanti rispetto alla stima corrente. La fusione basata sull'ottimizzazione può tornare indietro e correggere l'intera traiettoria quando una nuova osservazione è in conflitto con una stima precedente, il che generalmente la rende più accurata, a costo di un aumento della potenza di calcolo man mano che il grafo cresce. Librerie generiche come Ceres Solver, g2o e GTSAM sono ampiamente utilizzate per risolvere in modo efficiente questo tipo di problema di minimi quadrati non lineari sparsi (in cui ogni singola osservazione influenza solo un piccolo numero di variabili).

7. Camera×IMU (VIO)

L'abbinamento di una telecamera con un'IMU è chiamato odometria visiva inerziale (VIO) ed è una delle combinazioni di fusione più diffuse nella pratica. Il motivo per cui i due funzionano così bene è che i loro punti deboli si compensano quasi perfettamente.

Una telecamera può stimare il proprio movimento in base a come i punti caratteristici si muovono nelle immagini, ma una telecamera monoculare non può determinare la scala assoluta (unità di distanza del mondo reale) in linea di principio, e le rotazioni rapide tendono a sfocare l'immagine e a interrompere il tracciamento dei punti caratteristici. Un'IMU è l'immagine speculare: misura direttamente l'accelerazione e la velocità angolare a centinaia di Hz, quindi è robusta ai movimenti rapidi e l'integrazione dell'accelerazione fornisce la variazione di velocità e posizione in scala reale, ma la stessa integrazione implica che gli errori si accumulino (deriva) nel tempo e non conosce mai la posizione assoluta.

Come mostra questa equazione, un'IMU ricava la posizione integrando l'accelerazione due volte, quindi anche un piccolo errore sistematico dell'accelerometro si accumula in un errore di posizione che cresce con il quadrato del tempo trascorso. Il VIO può utilizzare le osservazioni visive per limitare questa deriva; con un'adeguata eccitazione del movimento e osservabilità, l'IMU può supportare la stima della scala metrica, ma non elimina l'ambiguità di scala in tutte le condizioni. MSCKF (Mourikis & Roumeliotis, 2007, basato su EKF), OKVIS (Leutenegger et al., 2015, basato su ottimizzazione non lineare) e VINS-Mono (Qin et al., 2018, monoculare + IMU) sono implementazioni di riferimento di VIO nell'ambito di questi due framework.

8. LiDAR×IMU (LIO)

L'accoppiamento di un LiDAR con un IMU è chiamato LiDAR-Odometria Inerziale (LIO), ampiamente utilizzato nei robot per esterni e nella guida autonoma. Il LiDAR misura la geometria circostante in modo diretto e preciso come una nuvola di punti, ma una singola scansione richiede da decine a centinaia di millisecondi per essere completata e, se il sensore stesso si muove durante tale intervallo, i punti all'interno di una scansione vengono distorti (distorsione da movimento).

Anche in questo caso, l'elevata frequenza di campionamento dell'IMU è ciò che risolve il problema: l'interpolazione delle variazioni di orientamento precise catturate durante una scansione corregge tale distorsione. Inoltre, affidarsi esclusivamente alla corrispondenza tra nuvole di punti (ICP e simili) tende a presentare derive in ambienti geometricamente poveri di caratteristiche – un lungo corridoio senza punti di riferimento, un campo aperto – dove le informazioni inerziali dell'IMU colmano la lacuna e mantengono stabile la stima.

Il primo LOAM (Zhang & Singh, 2014) è stato un pioniere dell'odometria LiDAR estraendo punti caratteristici di bordo e planari dalla nuvola di punti e confrontandoli. LIO-SAM (Shan et al., 2020) ha integrato strettamente le informazioni LiDAR e IMU su un grafo fattoriale, progettato in modo che i vincoli GPS e di chiusura del ciclo potessero essere incorporati nello stesso grafo. FAST-LIO / FAST-LIO2 (Xu et al., 2021 / 2022) hanno adottato un'integrazione LiDAR-IMU strettamente accoppiata tramite un filtro di Kalman iterativo, e FAST-LIO2 in particolare elabora la nuvola di punti direttamente anziché tramite l'estrazione di caratteristiche sparse. L'accoppiamento stretto può sfruttare le informazioni congiunte, ma l'accuratezza e il costo dipendono dall'inizializzazione, dalla degenerazione, dall'implementazione e dalla temporizzazione dei sensori; non è universalmente superiore all'accoppiamento lasco.

9. Fotocamera×LiDAR

L'accoppiamento di una fotocamera e di un LiDAR è la combinazione di fusione più intuitivamente complementare che esista: "conosce il significato ma non la distanza" incontra "conosce la distanza ma non il significato". Tuttavia, questo accoppiamento presenta una difficoltà che gli altri non hanno: i sistemi di coordinate dei due sensori sono fondamentalmente diversi (il piano immagine 2D di una fotocamera rispetto alla nuvola di punti 3D del LiDAR), quindi la correlazione tra i due richiede una procedura esplicita di calibrazione e proiezione.

La calibrazione calcola i parametri intrinseci della telecamera (lunghezza focale, distorsione dell'obiettivo, matrice intrinseca K) e la posizione relativa tra la telecamera e il LiDAR (parametri estrinseci: rotazione R, traslazione t). Con questi dati a disposizione, un punto 3D \mathbf{X} misurato dal LiDAR può essere proiettato nelle coordinate pixel della telecamera \mathbf{u}.

\mathbf{e} = \mathbf{u} - \pi\left( K \, [R \mid t] \, \mathbf{X} \right)

\pi(\cdot) è la funzione di proiezione prospettica che mappa le coordinate omogenee sul piano immagine 2D, e [R\mid t] è la trasformazione dalle coordinate LiDAR alle coordinate della telecamera. La calibrazione è il processo di risoluzione dei problemi relativi a R e t che minimizzano l'errore \mathbf{e}; una volta completata questa fase, la stessa proiezione determina "quale punto LiDAR corrisponde a quale pixel dell'immagine" (Associazione Punto-Pixel). Tale corrispondenza consente di associare le informazioni di colore o di classe di una telecamera ai punti LiDAR, oppure di fornire a un oggetto rilevato dalla telecamera la distanza precisa del LiDAR.

L'approccio dominante nella guida autonoma moderna esegue questa proiezione a livello di feature anziché punto per punto: la fusione BEV (Bird's-Eye View Fusion). BEVFusion (Liang et al., 2022, e separatamente Liu et al., 2022) converte le feature dell'immagine della telecamera e le feature della nuvola di punti LiDAR nello spazio BEV (2D dall'alto verso il basso) in modo indipendente, per poi combinarle in tale spazio; è ampiamente citato come l'esempio di punta della fusione di livello intermedio per la combinazione telecamera-LiDAR. ## 10. Telecamera×LiDAR×Radar×IMU

Prendiamo come esempio la guida autonoma: in pratica, la fusione va ben oltre una singola coppia di sensori. Telecamera, LiDAR, radar e IMU (oltre al GNSS) vengono integrati simultaneamente, ciascuno con un ruolo ben definito.

  • Telecamera: riconosce il "significato" che la pura geometria non può fornire, come il colore del semaforo, il testo dei segnali stradali e il tipo di corsia.
  • LiDAR: misura la forma 3D precisa e la distanza degli oggetti circostanti, senza essere influenzato dall'illuminazione.
  • Radar: continua a funzionare in caso di pioggia, nebbia o controluce, condizioni che possono interferire con telecamere e LiDAR, e misura la velocità relativa direttamente tramite effetto Doppler.
  • IMU: rileva ad alta frequenza il cambiamento di orientamento e l'accelerazione del veicolo, interpolando i dati tra le letture degli altri sensori.
  • GNSS: fornisce il riferimento per l'allineamento globale con una mappa (solitamente integrato con l'IMU dopo una correzione ad alta precisione, ad esempio RTK).

Questi quattro o cinque tipi di sensori si compensano a vicenda, in modo che quasi ogni singolo guasto venga rilevato da un altro sistema: la nebbia fitta degrada la precisione di telecamere e LiDAR, ma il radar continua a funzionare; una galleria blocca il GPS, ma l'IMU e l'odometria LiDAR mantengono attivo il sistema di localizzazione. Questa progettazione per la ridondanza – che riduce la probabilità che più sensori si guastino simultaneamente nelle stesse condizioni – è il motivo principale per cui la fusione multisensore è considerata imprescindibile in un caso d'uso come la guida autonoma, dove un guasto non è un'opzione.

11. Cosa rende difficile la fusione

Per quanto elegante possa sembrare la fusione di sensori sulla carta, la sua implementazione si scontra con una serie di difficoltà pratiche molto concrete.

  • Sincronizzazione temporale: ogni sensore emette dati a una frequenza e con una latenza diverse, quindi trattarli come "lo stesso istante" richiede un allineamento temporale preciso, ovvero la sincronizzazione del trigger a livello hardware o l'interpolazione del timestamp.

  • Calibrazione: la posizione e l'orientamento relativi tra i sensori (estrinseci) e i parametri interni di ciascun sensore (intrinseci) devono essere noti con precisione. Un leggero disallineamento di montaggio introduce un errore sistematico nell'intero risultato della fusione.

  • Trasformazione delle coordinate: ogni sensore opera nel proprio sistema di riferimento (sistema di riferimento della telecamera, sistema di riferimento del LiDAR, sistema di riferimento del veicolo, sistema di riferimento globale) e questi devono essere trasformati in modo coerente e continuo.

  • Rumore del sensore: le caratteristiche di rumore di ciascun sensore (gaussiano o meno, con o senza bias) sono diverse e una modellazione errata di questo aspetto compromette la ponderazione (ad esempio, il guadagno di Kalman) nella fusione probabilistica.

  • Valori anomali: i falsi rilevamenti o le discrepanze causate da oggetti dinamici introducono un rumore che il modello non aveva previsto: un semplice modello statistico non è in grado di gestirlo da solo, pertanto diventano necessarie tecniche di stima robusta come RANSAC o l'esplicita esclusione dei valori anomali.

  • Propagazione dell'incertezza: a meno che l'incertezza (covarianza) di ciascun sensore non venga propagata correttamente attraverso l'intero processo di fusione, l'affidabilità effettiva della stima finale viene valutata in modo errato, e un'eccessiva sicurezza o una cautela eccessiva portano a decisioni successive fuorvianti.

Nessuno di questi problemi si risolve semplicemente applicando le equazioni del filtro di Kalman standard: rientrano tutti a pieno titolo nel campo dell'ingegneria dei sistemi.

12. Il modello del mondo finale

Mettendo insieme tutto ciò che abbiamo visto finora – i singoli sensori, i singoli metodi di fusione – ciò che un robot o un veicolo autonomo trasporta in definitiva è il tipo di "modello del mondo" mostrato di seguito, che unisce le specificità di ciascun sensore in un unico modello.

Diagram 2 · Use the button to switch views
How multiple sensors integrate into one World Model Camera → Semantics LiDAR → Geometry IMU → Motion Radar → Velocity GNSS → Global Position Sensor Fusion (Filter / Optimization) World Model (position, geometry, semantics, velocity)

Figura 2 — Telecamera, LiDAR, IMU, Radar e GNSS forniscono ciascuno informazioni diverse e il livello Fusion le integra in un unico Modello del Mondo coerente.

Il Modello del Mondo non si limita a indicare "dove mi trovo", ma contiene la geometria degli oggetti circostanti (dal LiDAR), la natura di tali oggetti (dalla telecamera), le loro velocità relative (dal radar), le variazioni di orientamento del veicolo (dall'IMU) e la posizione globale sulla mappa (dal GNSS), il tutto integrato senza contraddizioni nel tempo e nello spazio. La pianificazione del percorso di un robot o le decisioni di guida di un veicolo autonomo vengono prese in base a questo Modello del Mondo, mai in base ai dati grezzi dei sensori. In questo senso, la fusione dei sensori rappresenta il ponte tra percezione e azione: converte la capacità percettiva individuale di ciascun sensore in una rappresentazione coerente su cui il sistema può effettivamente agire.

13. Progettazione di un sistema di fusione nella pratica

Quando si progetta un sistema di fusione dei sensori, quattro domande tendono a semplificare il processo decisionale.

Decisioni di progettazione Cosa valutare
Cosa fondere Decidere innanzitutto quali punti deboli dei sensori l'applicazione deve effettivamente coprire (radar se la resistenza alle condizioni meteorologiche avverse è fondamentale, GNSS se è richiesta la posizione assoluta, ecc.)
In quale fase effettuare la fusione Fase iniziale/intermedia se la precisione è la priorità; Fusione avanzata se l'indipendenza dallo sviluppo e la manutenibilità sono più importanti
Filtro vs. ottimizzazione Un filtro (EKF, ecc.) se il requisito è sequenziale, a bassa latenza e a basso carico computazionale; Un approccio basato sull'ottimizzazione (Factor Graph, ecc.) se la precisione è la priorità, se la potenza di calcolo è sufficiente e se le stime precedenti sono modificabili.

Precisione vs. costo computazionale: l'accoppiamento stretto è generalmente più preciso, ma costa di più in termini di implementazione ed esecuzione; l'accoppiamento lasco (stima per sensore, seguita dalla fusione) è più facile da implementare e più economico, a scapito della precisione.

Queste decisioni non sono indipendenti, ma si influenzano a vicenda. Un sistema automobilistico prodotto in serie, ad esempio, è spesso vincolato da limiti di calcolo a progetti basati su filtri e ad accoppiamento lasco, mentre i casi d'uso di ricerca o la creazione di mappe offline possono permettersi progetti basati sull'ottimizzazione e ad accoppiamento stretto, che puntano alla massima precisione. Non esiste un "metodo di fusione perfetto": l'essenza della progettazione pratica della fusione di sensori consiste nello scegliere la combinazione più sensata in base ai sensori presenti, alla potenza di calcolo disponibile e alla precisione e latenza richieste dall'applicazione.

14. Riepilogo

La fusione di sensori combina matematicamente le osservazioni provenienti da telecamera, LiDAR, IMU, radar e GNSS — ognuno con punti di forza e di debolezza diversi — utilizzando metodi probabilistici (filtro di Kalman/EKF/UKF/filtro particellare) o metodi basati sull'ottimizzazione (grafo fattoriale/aggiustamento a bundle), per produrre una stima dello stato più accurata e affidabile di quella che qualsiasi singolo sensore potrebbe fornire. Abbinamenti concreti come VIO (telecamera×IMU), LIO (LiDAR×IMU) e BEV Fusion (telecamera×LiDAR) si basano tutti sulla stessa idea — tradurre la complementarità in equazioni — e le scelte progettuali su dove e come fondere i dati determinano in ultima analisi l'accuratezza risultante, il costo computazionale e la complessità di implementazione.

Controlli prima della fusione delle misurazioni

Trattare la posizione e la velocità derivate dalla stessa osservazione come misurazioni indipendenti può portare a una stima eccessivamente sicura. Verificare i timestamp, i sistemi di coordinate, le variabili estrinseche e le correlazioni degli errori prima di aggiungere i sensori. Valutare la fusione rispetto a parametri di riferimento ottenuti con un singolo sensore nelle stesse condizioni, inclusi eventuali guasti.

Verifica la tua comprensione
Cosa succede se le stesse informazioni vengono utilizzate per la fusione due volte?

Trattare informazioni correlate come indipendenti può generare eccessiva sicurezza. Verifica le fonti di informazione e le correlazioni anziché contare i sensori.

Related reading

Explore another aspect of this fieldPerché ICP fallisce: inizializzazione, valori anomali e geometria simmetricaExplore another aspect of this fieldDalla mappatura alla navigazione in ROS 2: una procedura minimale con Jazzy e Nav2.Explore another aspect of this fieldTrasformazioni di coordinate robotiche: matrici, quaternioni e TF