Contents — find the section you need
SLAM (Simultaneous Localization and Mapping) è la tecnologia che permette di stimare simultaneamente "dove mi trovo" e "che aspetto ha l'ambiente circostante", utilizzando esclusivamente sensori. Questo articolo offre una panoramica delle principali tendenze tecniche nel campo SLAM; le specificità dei singoli settori (SLAM visivo, SLAM basato su LiDAR) sono trattate in articoli dedicati.
Idea chiave: Il SLAM non è un processo unidirezionale che localizza prima il robot e poi mappa. È un problema di stima accoppiata: una mappa incerta aiuta a stimare la posizione, e tale posizione viene poi utilizzata per aggiornare la mappa.
Immagine: Robot Operating System Logo, Wikimedia Commons (CC BY-SA 4.0)
Un sistema SLAM in sintesi
Diagramma: Duskcoil. Un sistema SLAM rappresentativo basato su grafi è semplificato. La chiusura del ciclo rileva una rivisitazione e aggiunge un vincolo; il back-end a grafo corregge la traiettoria e la mappa. I confini dei componenti variano a seconda dell'implementazione.
Anche se i metodi SLAM cambiano, i loro assi di confronto rimangono leggibili. Il front-end crea corrispondenze e vincoli di movimento relativo; il back-end concilia i vincoli nel tempo; e la chiusura del ciclo aggiunge un vincolo a lungo raggio quando un luogo viene rivisitato. I metodi basati sull'apprendimento sostituiscono in parte o completamente questi componenti, mentre 3DGS e NeRF estendono principalmente la rappresentazione della mappa. La storia che segue è più facile da seguire come una narrazione di come ciascuna di queste parti si è evoluta.
La prima corrente: a partire dai metodi basati sui filtri
Diagramma: Duskcoil. I cambiamenti nella stima e le estensioni ortogonali attraverso l'apprendimento, la rappresentazione della mappa e la semantica sono separati. I metodi più vecchi e più nuovi coesistono e si combinano a seconda dell'applicazione.
Lo SLAM iniziale era dominato dalla stima sequenziale tramite il filtro di Kalman esteso (EKF) o filtri particellari, che aggiornavano lo stato ogni volta che arrivava una nuova osservazione dal sensore. Computazionalmente economico, ma con una debolezza: l'errore si accumula facilmente e l'approccio tende a fallire con mappe di grandi dimensioni.
La seconda corrente: il passaggio ai grafi Ottimizzazione
Successivamente, l'approccio dominante è diventato l'ottimizzazione del grafo delle pose (graph SLAM). Questo metodo costruisce un grafo in cui ogni nodo rappresenta la posa del robot in un determinato punto lungo la sua traiettoria, e ogni arco è una relazione relativa derivata dalle osservazioni dei sensori. Successivamente, ottimizza il tutto simultaneamente come un problema di minimi quadrati non lineari. In combinazione con la chiusura del ciclo (riconoscimento di un luogo precedentemente visitato e correzione retroattiva dell'errore accumulato), questo ha permesso di costruire mappe valide anche in ambienti di grandi dimensioni. slam_toolbox, utilizzato in newbot, appartiene a questa linea evolutiva. FAST-LIO, invece, esegue un'odometria LiDAR-IMU strettamente accoppiata con un filtro di Kalman iterativo, anziché un grafo delle pose.
Cosa c'è all'interno dell'ottimizzazione del grafo: formulata come minimi quadrati non lineari
Osservando più concretamente il problema che il graph SLAM risolve internamente: costruisce un grafo in cui ogni nodo rappresenta la posa del robot in un determinato momento lungo la sua traiettoria, e ogni arco è la relazione relativa derivata dalle osservazioni dei sensori. La relazione posizionale deriva dalle osservazioni dei sensori ed è formulata come un problema di minimi quadrati non lineari che regola il posizionamento di ogni nodo per essere il più coerente possibile con il vincolo di ogni arco. Poiché le osservazioni dei sensori sono soggette a rumore, i vincoli tra gli archi sono destinati a entrare in conflitto tra loro in una certa misura, e il ruolo di questa ottimizzazione è quello di distribuire tale conflitto nel modo "meno irragionevole" possibile.
Formalmente, per l'insieme completo delle pose da risolvere, \mathbf{x} = (\mathbf{x}_1, \dots, \mathbf{x}_n), il problema consiste nel minimizzare la seguente funzione obiettivo:
Dove \mathcal{C} è l'insieme delle coppie di nodi (archi) vincolate da un'osservazione del sensore, \mathbf{e}_{ij} è la funzione di errore che esprime la discrepanza tra le pose stimate dei nodi i e j e l'osservazione del sensore, e \Sigma_{ij}^{-1} rappresenta il peso derivante dalla confidenza di quell'osservazione (la covarianza inversa).
Per risolverlo si utilizzano metodi iterativi come Gauss-Newton o Levenberg-Marquardt. La funzione di errore viene linearizzata attorno alla stima corrente (\mathbf{e}_{ij}(\mathbf{x} + \Delta\mathbf{x}) \approx \mathbf{e}_{ij}(\mathbf{x}) + \mathbf{J}_{ij}\Delta\mathbf{x}), e l'equazione normale \mathbf{J}^\top \mathbf{J} \, \Delta\mathbf{x} = -\mathbf{J}^\top \mathbf{e} viene risolta per l'aggiornamento \Delta\mathbf{x}, ripetendo il processo fino alla convergenza. Quando le posizioni 3D dei punti caratteristici osservati (landmark) vengono incluse come obiettivi di ottimizzazione insieme alle pose della telecamera, questo processo prende il nome specifico di Bundle Adjustment. I problemi SLAM hanno un gran numero di variabili (pose, landmark), ma ogni singola osservazione ne influenza solo un piccolo numero, quindi le matrici risultanti (Jacobiana, Hessiana) sono sparse. Risolvere in modo efficiente sfruttando questa sparsità è la chiave pratica in questo caso, e framework di ottimizzazione generici come Ceres Solver, g2o e GTSAM sono ampiamente utilizzati. come librerie per questo tipo di problema di minimi quadrati non lineari sparsi.
La terza corrente: SLAM basato sull'apprendimento e nativo dell'IA
La corrente attualmente in corso è l'integrazione del deep learning nella pipeline SLAM. La sostituzione dell'estrazione e della corrispondenza esplicita delle caratteristiche con il deep learning è un'area di ricerca attiva volta a migliorare la robustezza ai cambiamenti di illuminazione e agli ambienti poveri di texture. Più recentemente, è emersa anche una direzione chiamata "AI-native" o "SLAM semantico", che integra reti neurali a grafo, o persino modelli linguistici di grandi dimensioni (LLM) e modelli Vision-Language-Action (VLA), nella pipeline SLAM. L'obiettivo non è più solo "dove mi trovo", ma costruire una mappa semantica che comprenda simultaneamente "cosa c'è".
Un cambiamento nella rappresentazione stessa della mappa
Il cambiamento più evidente di recente è una reinvenzione del "formato di rappresentazione" della mappa stessa. Oltre alla tradizionale nuvola di punti e alla griglia di occupazione, le rappresentazioni cartografiche basate su Neural Radiance Fields (NeRF) e Le tecniche di Gaussian Splatting 3D (3DGS) stanno rapidamente guadagnando terreno. Queste tecniche superano sempre più i metodi tradizionali in termini di accuratezza della mappatura, qualità del rendering ed efficienza computazionale, e nuovi metodi basati su 3DGS/NeRF — MHED-SLAM, GTS-SLAM, MTE-SLAM, HL-SLAM, PMET-SLAM e altri — hanno continuato a comparire in importanti conferenze e riviste anche nel 2026. Per maggiori dettagli, si veda l'articolo separato "Tendenze tecnologiche nel Visual-SLAM".
Panoramica di fine 2026: Diversificazione del 3DGS-SLAM per dominio
Osservando concretamente i metodi basati su 3DGS/NeRF menzionati sopra, fino alle pubblicazioni di agosto 2026, ciò che emerge è la diversificazione dei domini di destinazione. RoSe-SLAM crea mappe gaussiane 3D con tag semantici da video monoculari in scene dinamiche (accettato a IROS 2026); Stipple, di Daniel Cremers Il laboratorio costruisce in modo incrementale una mappa in tempo reale, accoppiando strettamente dati visivi e inerziali; GLAM-SLAM si estende ad ambienti delle dimensioni di un isolato cittadino attraverso la densificazione del flusso e la decomposizione spaziale (anch'esso accettato per IROS 2026); e Real-Time LiDAR Gaussian Splatting SLAM combina nuvole di punti LiDAR direttamente con gaussiane 3D. La specializzazione sta procedendo lungo assi distinti: interni vs. esterni, scene dinamiche, ambienti su larga scala. L'approccio si sta diffondendo anche dalla robotica alla medicina: EndoMD-SLAM si rivolge allo SLAM endoscopico e Track2Map (accettato per MICCAI 2026) si rivolge alla chirurgia laparoscopica.
Integrazione della comprensione semantica: SLAM con vocabolario aperto e accoppiamento con modelli di base
Approfondendo la corrente dello SLAM "basato sull'apprendimento e nativo dell'IA": il 2026 è stato l'anno in cui sono emersi diversi metodi che integrano direttamente le caratteristiche del modello di base della visione nella pipeline SLAM. RADIO-ViPE (aprile 2026) accoppia strettamente embedding multimodali da un modello di base di visione agglomerativo online, realizzando un SLAM semantico a vocabolario aperto in grado di localizzare categorie arbitrarie specificate da testo sulla mappa anche in ambienti dinamici. FeatureSLAM (gennaio 2026) rasterizza le caratteristiche allineate con un modello di base di visione su ciascuna gaussiana in una mappa 3D Gaussian Splatting, costruendo una mappa semanticamente ricercabile preservando al contempo le prestazioni in tempo reale. Questa direzione è delineata sistematicamente nell'indagine di ottobre 2025 "Semantic Visual SLAM: A Survey on State of the Art, Challenges, and Future Directions", che estende il suo ambito fino all'integrazione di modelli linguistici di grandi dimensioni, sottolineando come lo SLAM si stia spostando dalla pura stima geometrica verso sistemi che veicolano anche la comprensione semantica.
Ampliamento delle modalità di rilevamento: il radar 4D come opzione
Oltre al LiDAR e alle telecamere, la ricerca utilizza il radar 4D (radar a onde millimetriche che fornisce distanza, azimut, elevazione e velocità Doppler) come terza modalità di sensore, apprezzata per la sua resistenza alle intemperie, continua ad essere attivamente aggiornata. L'odometria radar-inerziale 4D, che combina la modellazione gaussiana 3D con la corrispondenza di scansioni multi-ipotesi, mira a migliorare la precisione dell'odometria in condizioni di nebbia, pioggia e polvere, dove sia le telecamere che il LiDAR faticano; pubblicata per la prima volta alla fine del 2024, ha ricevuto una versione rivista a marzo 2026. Anche i dataset di riferimento stanno maturando verso condizioni operative più realistiche, come nel caso del dataset Hilti-Trimble-Oxford (luglio 2026), che utilizza una telecamera a 360 gradi più IMU e incorpora informazioni a priori sulla planimetria.
Modelli regionali nell'industria e nella ricerca
L'analisi di brevetti e articoli relativi allo SLAM ha evidenziato che la Cina detiene un peso sproporzionato nello SLAM 2D incentrato sul LiDAR, Implementazioni basate su ROS, ottimizzazione dei grafi e ricerca su sistemi multi-robot/edge computing. La domanda proveniente da applicazioni pratiche – droni, robot di servizio – sembra orientare fortemente la direzione della ricerca.
Riepilogo: Le tre correnti non si escludono a vicenda
Il filtraggio sequenziale e l'ottimizzazione dei grafi sono opzioni per il back-end di stima. L'estrazione di caratteristiche apprese, le rappresentazioni di mappe 3DGS/NeRF e l'integrazione semantica costituiscono assi separati che possono combinarsi con entrambi. FAST-LIO, utilizzato ad esempio in newbot, si basa su un filtro di Kalman iterativo; FAST-LIO2 registra anche i punti grezzi direttamente sulla mappa senza una fase separata di estrazione delle caratteristiche. La combinazione da scegliere dipende dalla potenza di calcolo disponibile, dalla configurazione dei sensori e dallo scopo effettivo della mappa: questa è la conclusione pratica al momento.
Commenti
Accedi per continuare.
Nessun dato disponibile.