Contents — find the section you need
La navigazione robotica è la tecnologia che permette di pianificare un percorso dalla posizione attuale a una meta su una mappa, per poi seguirlo evitando gli ostacoli. Un approccio classico come Nav2 – quello utilizzato da newbot – rimane la scelta più diffusa nella pratica, mentre la ricerca su approcci end-to-end basati sull'apprendimento per rinforzo e sui modelli di visione artificiale e linguaggio (VL) si sta espandendo rapidamente.
Immagine: Robot Operating System logo, Wikimedia Commons (CC BY-SA 4.0)
Navigazione autonoma in sintesi
Diagramma: Duskcoil. La divisione delle responsabilità in uno stack di navigazione gerarchico come Nav2 è semplificata.
La navigazione è più che calcolare una volta il percorso più breve. Un pianificatore globale analizza la mappa, un controllore locale converte il percorso in comandi di velocità tenendo conto degli ostacoli vicini e dei vincoli del veicolo, e le osservazioni successive al movimento aggiornano la decisione successiva. Anche l'arresto, la ripianificazione e il recupero fanno parte del sistema. Le sezioni seguenti possono quindi essere interpretate chiedendosi dove la pianificazione, il controllo, l'apprendimento e le istruzioni linguistiche entrano in questo ciclo chiuso comune.
La pipeline classica: separare la mappa dei costi dalla pianificazione del percorso
Un classico sistema di navigazione, esemplificato da Nav2, crea una mappa dei costi (una mappa 2D che rappresenta il rischio di ostacoli) a partire dai dati dei sensori, quindi esegue la pianificazione globale del percorso e il tracciamento locale della traiettoria come moduli separati al di sopra di essa. Il ruolo di ciascun modulo è chiaro e il comportamento risultante è facile da comprendere e configurare per una persona, ma la sua capacità di adattarsi a un ambiente imprevisto (una forma di ostacolo insolita, una folla densa) ha dei limiti reali. Anche newbot utilizza questa pipeline classica: per i dettagli di implementazione, consultare "Come funzionano la mappatura e la navigazione autonoma".
La cinematica di base: conversione della velocità a trazione differenziale
Qualunque sia il metodo di navigazione utilizzato, ciò che un controller produce in definitiva si riduce a una coppia di valori: velocità di traslazione v e velocità angolare \omega. Per un robot a trazione differenziale come newbot (due ruote, sinistra e destra), il fondamento è il modello cinematico che converte questa coppia in velocità delle ruote sinistra/destra v_l, v_r.
L è la distanza tra le ruote sinistra e destra (la larghezza della carreggiata). La trasformazione inversa viene utilizzata per procedere nella direzione opposta: da una velocità pianificata di (v, \omega) a una velocità target per ciascuna ruota. Questa semplice coppia di equazioni cattura il vincolo fondamentale della trazione differenziale stessa (nessun movimento laterale; la sterzata richiede sempre una differenza di velocità tra le ruote): non importa quanto sofisticata sia la mappa dei costi o la pianificazione del percorso, i motori sono in definitiva azionati tramite questo modello cinematico. L'implementazione di newbot è descritta anche in "Come funziona il controllo sicuro della velocità".
All'interno di Nav2: Mappa dei costi, Controller, Albero comportamentale
Analizzando più concretamente come i moduli all'interno della pipeline classica cooperano: Nav2 costruisce la sua mappa dei costi (una mappa 2D che rappresenta il rischio di ostacoli) sovrapponendo più "livelli". Un livello che riflette i dati statici della mappa, un livello che rileva e traccia gli ostacoli dinamici dai dati della telecamera o del sensore di profondità, un livello che riscrive la mappa dei costi in base a delle regole: sovrapporre livelli con ruoli diversi in questo modo permette di integrare una varietà di fonti di informazione, più di quante un singolo algoritmo potrebbe rappresentare da solo, in un'unica rappresentazione cartografica.
Il controller_server, responsabile del percorso, guida il robot lungo il percorso globale pianificato più di recente, facendo riferimento alla mappa dei costi locale e interagendo con i plugin di supporto: un sistema di verifica dell'avanzamento e un sistema di verifica dell'obiettivo. Il behavior_server, che gestisce i comportamenti di recupero (rotazione sul posto, retromarcia), è progettato per fare riferimento alla stessa mappa dei costi locale del controller_server in tempo reale, una configurazione efficiente che evita di mantenere un oggetto di rappresentazione dell'ambiente duplicato in più posizioni.
Ciò che controlla l'ordine e le condizioni in base alle quali questi singoli server vengono richiamati è l'albero comportamentale. Nav2 utilizza una libreria chiamata BehaviorTree.CPP, in cui un nodo strutturato ad albero, ogni volta che viene "attivato" (iniziato a essere eseguito), richiama un server di azioni: il pianificatore, il controllore e un server di comportamento. Questa architettura consente di riorganizzare logiche di ramificazione complesse, come ad esempio "se la pianificazione del percorso fallisce, riprova fino a N volte prima di passare a un diverso comportamento di recupero", semplicemente tramite la configurazione dell'albero comportamentale, senza dover modificare il codice di alcun singolo server.
La diffusione della navigazione end-to-end basata sull'apprendimento
L'alternativa attuale alla pipeline classica è la navigazione end-to-end basata sull'apprendimento, che genera azioni direttamente dagli input grezzi dei sensori. In scenari cooperativi realistici, come l'attraversamento di una porta, alcuni studi dimostrano che i metodi basati sull'apprendimento superano quelli basati su modelli, e il deep reinforcement learning (DRL) è diventato una delle principali tendenze nella ricerca sulla navigazione basata su ROS. Algoritmi come TD3 (Twin-Delayed DDPG), DDPG e DQN sono stati applicati al rilevamento, al tracciamento e alla navigazione di oggetti in tempo reale, e sono emersi anche metodi ibridi che combinano l'apprendimento per imitazione (apprendimento di una politica iniziale da dimostrazioni di esperti) con l'apprendimento per rinforzo (miglioramento continuo di tale politica).
La direzione dei modelli di base per la navigazione
Una corrente di ricerca più recente è il tentativo di addestrare la navigazione stessa come un "modello di base". Un framework che combina il pre-addestramento offline tramite video con il post-addestramento tramite apprendimento per rinforzo in simulazione (S2E: Seeing-to-Experiencing) è progettato per rafforzare l'interattività preservando al contempo le prestazioni di generalizzazione. Anche la ricerca che integra modelli di visione e linguaggio nella navigazione (Navi2Gaze, ad esempio) sta progredendo, esplorando una direzione in cui l'obiettivo di navigazione non è specificato da coordinate su una mappa, ma dal linguaggio naturale o da un'immagine di riferimento (questo si sovrappone anche al campo della VLA - vedi "Tendenze tecnologiche nella VLA" per i dettagli).
Navigazione sociale
Per un robot che opera in ambienti interni frequentati da persone, seguire un percorso "simile a quello umano" - e non solo evitare gli ostacoli - è diventato un tema di ricerca importante a sé stante. Nel campo della navigazione sociale, tre sfide sono generalmente identificate come i principali problemi di ricerca: modelli in grado di prevedere con precisione il movimento umano, ambienti di apprendimento che simulino realisticamente contesti affollati e metriche di valutazione in grado di cogliere la complessità del mondo reale. La ricerca attiva combina diverse famiglie di algoritmi di apprendimento per rinforzo - basati sul valore, basati sulle politiche, attore-critico - con una gamma di architetture di reti neurali - feedforward, ricorrenti, convoluzionali, a grafo, transformer. ## Risultati concreti dalla navigazione basata sull'apprendimento: i numeri del 2026
La ricerca fino al 2026 ha supportato sempre più le affermazioni con dati concreti, anziché con vaghe "prestazioni migliorate". CORE Planner (giugno 2026), che esplora ambienti sconosciuti senza una mappa predefinita, combina una rappresentazione sparsa del grafo di visibilità con un trasformatore e riporta una riduzione del 13% della distanza percorsa rispetto al tradizionale FAR Planner e fino al 48% rispetto ad altri modelli di riferimento basati sull'apprendimento, raggiungendo al contempo un trasferimento zero-shot dalla simulazione alla realtà senza addestramento aggiuntivo. FlashNav (giugno 2026), che riduce drasticamente i tempi di addestramento, elimina il rendering non necessario e la fisica ad alta fedeltà dalla simulazione ed esegue una pipeline di addestramento residente sulla GPU, raggiungendo un tasso di successo del 100% con l'addestramento delle policy completato in meno di 20 secondi su una RTX 5090, e trasferisce con successo la policy addestrata ai robot fisici.
I progressi quantitativi si stanno manifestando anche nella navigazione sociale. HUMA (luglio 2026), un approccio ibrido che attiva selettivamente il ragionamento VLM (Vision-Language Model) solo quando ci sono persone nelle vicinanze, affidandosi altrimenti all'efficienza computazionale di una politica di apprendimento per rinforzo, riporta miglioramenti nel successo dei compiti del 20% e del 3% rispettivamente sui benchmark Social-MP3D e Social-HM3D. La decisione progettuale chiave non è "eseguire sempre il costoso ragionamento" ma "eseguirlo solo quando è effettivamente necessario": una scelta che concilia il compromesso tra accuratezza e costo computazionale.
Modelli di base per la navigazione: esempi di implementazione VLN
La direzione dei "modelli di base per la navigazione" (S2E e simili) si è concretizzata in implementazioni più tangibili entro il 2026. SuperMap (agosto 2026, accettato alla RSS 2026) integra SLAM geometrico ad alta frequenza con percezione asincrona a vocabolario aperto per costruire un grafo di scena 4D (spazio più tempo) che supporta query compositive sulla semantica e sulle relazioni degli oggetti. È progettato per mantenere un'identità stabile degli oggetti, abbinando e riconoscendo nuovamente gli oggetti nello spazio 3D, anche in ambienti dinamici, e funge da base per la navigazione robotica guidata da istruzioni in linguaggio naturale.
Un esempio più semplice è GemNav (luglio 2026), che adatta un LLM multimodale pre-addestrato e "congelato" per gestire la navigazione tramite waypoint utilizzando token discreti. Non necessita di un codificatore visivo dedicato ed è posizionato come un'alternativa "efficiente in termini di dati", in quanto consente il trasferimento zero-shot ad ambienti interni ed esterni non visti in precedenza a partire da una piccola quantità di dati di addestramento, senza la necessità di un fine-tuning completo di un modello di base di grandi dimensioni. Esiste anche un approccio di navigazione visione-linguaggio offline (luglio 2026) che funziona interamente sul dispositivo senza dipendenze dal cloud, combinando il rilevamento di oggetti a vocabolario aperto, la segmentazione basata su prompt e la geometria LiDAR per stimare la posizione degli obiettivi esterni utilizzando solo un piccolo modello linguistico. Nel complesso, questi elementi indicano che la "navigazione guidata in linguaggio naturale" sta passando da argomento di ricerca a qualcosa di effettivamente implementato.
Stato attuale delle cose nella pratica
Al momento, nessuno di questi approcci è in grado di sostituire una pipeline classica come Nav2. I metodi basati sull'apprendimento mostrano risultati promettenti in ambito di ricerca, ma il costo della verifica della riproducibilità e della sicurezza su hardware reale è elevato e l'implementazione in produzione e l'uso di massa rimangono limitati. Il design di newbot, che combina un pianificatore di traiettoria classico con un livello di supervisione della sicurezza indipendente, incluso un interruttore di sicurezza fisico (per i dettagli, consultare "Come funziona il controllo sicuro della velocità"), può essere interpretato come un riflesso dello stato dell'arte pratico del settore. Anche se i metodi basati sull'apprendimento si stanno avvicinando all'applicazione pratica, la scelta più realistica, almeno nel prossimo futuro, sembra essere un sistema ibrido basato sui classici meccanismi di sicurezza.
Una localizzazione accurata garantisce il raggiungimento dell'obiettivo?
Anche la mappatura, la gestione degli ostacoli, la pianificazione e il controllo devono avere successo.
La precisione della localizzazione è solo una parte delle prestazioni di navigazione.Riferimenti
- Navigazione dei robot sociali: una revisione e un benchmarking dei metodi basati sull'apprendimento
- Dalla visione all'esperienza: scalabilità dei modelli di base di navigazione con l'apprendimento per rinforzo (arXiv)
- Nav2 GitHub (ros-navigation)
- Concetti di navigazione — Documentazione ufficiale di Nav2
- Dettaglio sull'albero comportamentale — Documentazione ufficiale di Nav2
- Documento CORE Planner (arXiv)
- Documento FlashNav (arXiv)
- Articolo Think When It Matters (HUMA) (arXiv)
- Articolo SuperMap (RSS 2026, arXiv)
- Articolo GemNav (arXiv)
- L'implementazione di newbot è trattata anche in "Come funzionano la mappatura e la navigazione autonoma" e "Come funziona il controllo sicuro della velocità"
Commenti
Accedi per continuare.
Nessun dato disponibile.