Contents — find the section you need

La navegación robótica es la tecnología que permite planificar una ruta desde la posición actual hasta un destino en un mapa, y luego seguirla evitando obstáculos. Un sistema clásico como Nav2 —el que utiliza Newbot— sigue siendo la opción más común en la práctica, mientras que la investigación sobre enfoques integrales basados en aprendizaje por refuerzo y modelos de visión-lenguaje está creciendo rápidamente.

ROS 2ROS 2 / Nav2

Imagen: Robot Operating System logo, Wikimedia Commons (CC BY-SA 4.0)

Navegación Autónoma en Resumen

Diagram 1 · Use the button to switch views
Navegación autónoma de bucle cerrado en la que el mapa, la posición actual y el objetivo generan una ruta global, el control local genera comandos de velocidad y las nuevas observaciones retroalimentan la siguiente decisión

Diagrama: Duskcoil. La división de responsabilidades en una pila de navegación jerárquica como Nav2 se simplifica.

La navegación es más que calcular la ruta más corta una sola vez. Un planificador global analiza el mapa, un controlador local convierte la trayectoria en comandos de velocidad teniendo en cuenta los obstáculos cercanos y las limitaciones del vehículo, y las observaciones posteriores al movimiento actualizan la siguiente decisión. La detención, la replanificación y la recuperación también forman parte del sistema. Por lo tanto, las secciones siguientes pueden interpretarse preguntándose dónde se integran la planificación, el control, el aprendizaje y las instrucciones lingüísticas en este ciclo cerrado común.

El Pipeline Clásico: Separando el Mapa de Costos de la Planificación de Trayectorias

Un sistema de navegación clásico, ejemplificado por Nav2, crea un mapa de costos (un mapa 2D que representa el riesgo de obstáculos) a partir de datos de sensores, y luego ejecuta la planificación global de la trayectoria y el seguimiento de la trayectoria local como módulos separados. La función de cada módulo es clara, y el comportamiento resultante es fácil de comprender y ajustar, pero su capacidad de adaptación a un entorno imprevisto (un obstáculo con una forma desconocida, una multitud densa) tiene limitaciones reales. newbot también utiliza este método clásico; consulte "Cómo funcionan el mapeo y la navegación autónoma" para obtener detalles sobre la implementación.

Cinemática subyacente: Conversión de velocidad en tracción diferencial

Independientemente del método de navegación utilizado, la salida final de un controlador se reduce a un par de valores: velocidad de traslación v y velocidad angular \omega. Para un robot de tracción diferencial como newbot (dos ruedas, izquierda y derecha), la base es el modelo cinemático que convierte este par en velocidades de rueda izquierda/derecha v_l, v_r.

v = \frac{v_r + v_l}{2}, \qquad \omega = \frac{v_r - v_l}{L}

L es la distancia entre las ruedas izquierda y derecha (el ancho de la banda de rodadura). La transformación inversa se utiliza para ir en sentido contrario: de una velocidad planificada (v, \omega) a una velocidad objetivo para cada rueda. Este sencillo par de ecuaciones captura la restricción fundamental de la tracción diferencial (sin movimiento lateral; girar siempre requiere una diferencia de velocidad entre las ruedas). Por muy sofisticado que sea el mapa de costes o la planificación de la trayectoria, los motores se rigen en última instancia por este modelo cinemático. La implementación de newbot también se describe en "Cómo funciona el control de velocidad seguro".

Dentro de Nav2: Mapa de costes, controlador, árbol de comportamiento

Analizando con más detalle cómo cooperan los módulos dentro del flujo de trabajo clásico: Nav2 construye su mapa de costes (un mapa 2D que representa el riesgo de obstáculos) apilando múltiples capas. Una capa refleja datos estáticos del mapa, otra detecta y rastrea obstáculos dinámicos a partir de datos de la cámara o del sensor de profundidad, y otra reescribe el mapa de costes según reglas. Apilar capas con diferentes funciones permite integrar diversas fuentes de información, más de las que cualquier algoritmo podría representar por sí solo, en una única representación del mapa.

El servidor controlador, responsable de seguir la ruta, dirige al robot a lo largo de la ruta global planificada más recientemente, consultando el mapa de costos local y trabajando simultáneamente con complementos de apoyo: un verificador de progreso y un verificador de objetivos. El servidor de comportamiento, que gestiona los comportamientos de recuperación (rotación sobre el sitio, retroceso), está diseñado para consultar el mismo mapa de costos local que el servidor controlador en tiempo real. Esta configuración eficiente evita mantener un objeto de representación del entorno duplicado en más de un lugar.

El orden y las condiciones bajo las cuales se llaman estos servidores individuales son controlados por el Árbol de Comportamiento. Nav2 utiliza una biblioteca llamada BehaviorTree.CPP, donde un nodo con estructura de árbol, cada vez que se activa (se ejecuta), llama a un servidor de acciones: el planificador, el controlador y un servidor de comportamiento. Este diseño permite que la lógica de ramificación compleja —«si la planificación de la ruta falla, reintentar hasta N veces antes de cambiar a un comportamiento de recuperación diferente»— se reorganice únicamente a través de la configuración del Árbol de Comportamiento, sin modificar el código de ningún servidor individual.

La expansión de la navegación de extremo a extremo basada en aprendizaje

La alternativa actual al enfoque clásico es la navegación de extremo a extremo basada en aprendizaje, que genera acciones directamente a partir de la información bruta de los sensores. En escenas cooperativas realistas, como el paso por una puerta, algunos estudios demuestran que los métodos basados en aprendizaje superan a los basados en modelos, y el aprendizaje profundo por refuerzo (DRL) se ha convertido en una de las principales tendencias en la investigación de navegación basada en ROS. Algoritmos como TD3 (Twin-Delayed DDPG), DDPG y DQN se han aplicado a la detección, el seguimiento y la navegación de objetos en tiempo real, y también han surgido métodos híbridos que combinan el aprendizaje por imitación (aprender una política inicial a partir de demostraciones de expertos) con el aprendizaje por refuerzo (mejorar continuamente dicha política).

La dirección de los modelos fundamentales de navegación

Una tendencia más reciente es el intento de entrenar la navegación misma como un "modelo fundamental". Un marco que combina el preentrenamiento de vídeo offline con el postentrenamiento mediante aprendizaje por refuerzo en simulación (S2E: Seeing-to-Experiencing) está diseñado para potenciar la interactividad sin comprometer la generalización. La investigación que integra modelos de Visión-Lenguaje en la navegación (Navi2Gaze, por ejemplo) también avanza, explorando una dirección en la que el objetivo de navegación se especifica no mediante coordenadas en un mapa, sino mediante lenguaje natural o una imagen objetivo (esto también se solapa con el campo de la Visión-Lenguaje; véase «Tendencias Tecnológicas en Visión-Lenguaje» para más detalles).

Navegación Social

Para un robot de interior que opera en un entorno con personas en movimiento, seguir una trayectoria «similar a la humana» —y no solo evitar obstáculos— se ha convertido en un tema de investigación importante por derecho propio. En el campo de la navegación social, se suelen identificar tres retos como los principales problemas de investigación: modelos que puedan predecir con precisión el movimiento humano, entornos de aprendizaje que simulen de forma realista situaciones concurridas y métricas de evaluación que puedan capturar la complejidad del mundo real. La investigación activa combina diversas familias de algoritmos de aprendizaje por refuerzo —basados en valores, basados en políticas y actor-crítico— con una variedad de arquitecturas de redes neuronales —de propagación directa, recurrentes, convolucionales, gráficas y transformadoras—.

Resultados concretos de la navegación basada en aprendizaje: 2026 en cifras

Hasta 2026, la investigación ha respaldado cada vez más las afirmaciones con cifras concretas, en lugar de la vaga descripción de una "mejora del rendimiento". CORE Planner (junio de 2026), que explora entornos desconocidos sin mapa previo, combina una representación gráfica de visibilidad dispersa con un transformador y reporta una reducción del 13 % en la distancia recorrida con respecto al FAR Planner tradicional y hasta un 48 % con respecto a otros sistemas de referencia basados en aprendizaje, logrando además una transferencia de simulación a realidad sin entrenamiento adicional. FlashNav (junio de 2026), que reduce drásticamente el tiempo de entrenamiento, elimina la renderización innecesaria y la física de alta fidelidad de la simulación y ejecuta un proceso de entrenamiento en la GPU, alcanzando una tasa de éxito del 100 % con el entrenamiento de políticas completado en menos de 20 segundos en una RTX 5090, y transfiere con éxito la política entrenada a robots físicos.

También se observan avances cuantitativos en la navegación social. HUMA (julio de 2026), un enfoque híbrido que activa selectivamente el razonamiento VLM (Modelo de Visión-Lenguaje) solo cuando hay personas cerca, mientras que en otros casos se basa en la eficiencia computacional de una política de aprendizaje por refuerzo, reporta mejoras en el éxito de la tarea del 20 % y el 3 % en los benchmarks Social-MP3D y Social-HM3D, respectivamente. La decisión clave de diseño no es "ejecutar siempre el razonamiento costoso", sino "ejecutarlo solo cuando sea realmente necesario", una elección que concilia el equilibrio entre precisión y coste computacional.

Modelos de Fundamentos de Navegación: Ejemplos de Implementación de VLN

La dirección de los "modelos de fundamentos de navegación" (S2E y similares) se ha cristalizado en implementaciones más concretas hasta 2026. SuperMap (agosto de 2026, aceptado en RSS 2026) integra SLAM geométrico de alta frecuencia con percepción asíncrona de vocabulario abierto para construir un grafo de escena 4D (espacio más tiempo) que admite consultas compositivas sobre la semántica y las relaciones de los objetos. Está diseñado para mantener una identidad de objeto estable —coincidiendo y reconociendo objetos en el espacio 3D— incluso en entornos dinámicos, y funciona como base para la navegación robótica guiada por instrucciones en lenguaje natural.

Un ejemplo más sencillo es GemNav (julio de 2026), que adapta un modelo LLM multimodal preentrenado y congelado para gestionar la navegación por puntos de referencia mediante tokens discretos. No requiere un codificador visual dedicado y se posiciona como una "alternativa eficiente en datos", logrando una transferencia de datos sin entrenamiento previo a entornos interiores y exteriores desconocidos a partir de una pequeña cantidad de datos de entrenamiento, sin necesidad de ajustar completamente un modelo base extenso. También existe un enfoque de navegación visual-lingüística sin conexión (julio de 2026) que se ejecuta completamente en el dispositivo sin depender de la nube, combinando detección de objetos con vocabulario abierto, segmentación basada en indicaciones y geometría LiDAR para estimar la ubicación de objetivos en exteriores utilizando únicamente un pequeño modelo de lenguaje. En conjunto, estas innovaciones apuntan a que la "navegación guiada en lenguaje natural" está pasando de ser un tema de investigación a una implementación real.

Situación actual

Por el momento, ninguna de estas tecnologías está en condiciones de reemplazar un sistema clásico como Nav2. Los métodos basados en aprendizaje automático muestran resultados sólidos en entornos de investigación, pero el costo de verificar la reproducibilidad y la seguridad en hardware real es elevado, y su implementación en producción y uso masivo sigue siendo limitada. El diseño propio de newbot —un planificador de rutas clásico combinado con una capa de supervisión de seguridad independiente, que incluye un interruptor de parada de emergencia físico (véase «Cómo funciona el control de velocidad seguro» para más detalles)— puede interpretarse como un reflejo del estado actual de la técnica en este campo. Si bien los métodos basados en aprendizaje se acercan a su uso práctico, la opción más realista, al menos en un futuro previsible, parece ser un sistema híbrido basado en mecanismos de seguridad clásicos.

Comprueba tu comprensión
¿Garantiza la localización precisa alcanzar el objetivo?

El mapeo, la gestión de obstáculos, la planificación y el control también deben tener éxito.

La precisión de la localización es solo una parte del rendimiento de la navegación. ## Referencias - [Navegación de robots sociales: una revisión y evaluación comparativa de métodos basados en aprendizaje](https://www.ncbi.nlm.nih.gov/pmc/articles/PMC12739477/) - [De la visión a la experiencia: escalando modelos de fundamentos de navegación con aprendizaje por refuerzo (arXiv)](https://arxiv.org/abs/2507.22028) - [Nav2 GitHub (ros-navigation)](https://github.com/ros-navigation/navigation2) - [Conceptos de navegación: documentación oficial de Nav2](https://docs.nav2.org/concepts/index.html) - [Recorrido detallado por el árbol de comportamiento: documentación oficial de Nav2](https://docs.nav2.org/behavior_trees/overview/detailed_behavior_tree_walkthrough.html) - [Artículo sobre CORE Planner (arXiv)](https://arxiv.org/abs/2606.29222) - [Artículo sobre FlashNav (arXiv)](https://arxiv.org/abs/2606.15846) - [Piensa cuando [Artículo sobre It Matters (HUMA) (arXiv)](https://arxiv.org/abs/2607.10991) - [Artículo sobre SuperMap (RSS 2026, arXiv)](https://arxiv.org/abs/2608.22896) - [Artículo sobre GemNav (arXiv)](https://arxiv.org/abs/2607.06882) - La implementación de newbot también se describe en "[Cómo funcionan el mapeo y la navegación autónoma](/en/project/newbot/newbot-slam-nav.html)" y "[Cómo funciona el control seguro de la velocidad](/en/project/newbot/newbot-velocity-control.html)"

What to read next

Review the backgroundTendencias tecnológicas en Visual-SLAMContinue the seriesTendencias tecnológicas en la detección de objetosExplore another aspect of this fieldTendencias tecnológicas en robots humanoides