Contents — find the section you need

SLAM (Localización y Mapeo Simultáneos) es la tecnología que permite estimar simultáneamente la ubicación y el entorno, utilizando únicamente sensores. Este artículo ofrece una visión general de las principales tendencias técnicas de SLAM; los detalles de cada campo (SLAM visual, SLAM LiDAR) se abordan en artículos específicos.

Vista conceptual de un robot móvil que utiliza lidar para estimar su trayectoria mientras crea un mapa interior
En SLAM, la localización y el mapeo se complementan. Esta es una ilustración conceptual, no una medición de la salida del sensor.

Idea clave: SLAM no es un proceso unidireccional que localiza primero al robot y luego realiza el mapeo. Es un problema de estimación acoplada: un mapa incierto ayuda a estimar la posición, y esa posición se utiliza para actualizar el mapa.

ROS 2ROS 2

Imagen: logotipo de Robot Operating System, Wikimedia Commons (CC BY-SA) 4.0)

Un Sistema SLAM en Vista Previa

Diagram 1 · Use the button to switch views
Un sistema SLAM representativo en el que el front-end establece restricciones locales, la detección de cierre de bucle añade una restricción de largo alcance verificada y el back-end basado en grafos optimiza la trayectoria y el mapa

Diagrama: Duskcoil. Un sistema SLAM representativo basado en grafos, simplificado. El cierre de bucle detecta una visita repetida y añade una restricción; el back-end basado en grafos corrige la trayectoria y el mapa. Los límites de los componentes varían según la implementación.

Aunque los métodos SLAM cambian, sus ejes de comparación siguen siendo legibles. El front-end establece correspondencias y restricciones de movimiento relativo; el back-end concilia las restricciones a lo largo del tiempo; y el cierre de bucle añade una restricción de largo alcance cuando se vuelve a visitar un lugar. Los métodos basados en aprendizaje reemplazan parte o la totalidad de estos componentes, mientras que 3DGS y NeRF extienden principalmente la representación del mapa. La historia que se presenta a continuación se entiende mejor como un relato de cómo cada una de estas partes evolucionó. ha cambiado.

La primera tendencia: Partiendo de los métodos basados en filtros

Diagram 2 · Use the button to switch views
Dos ejes en el desarrollo de SLAM: los sistemas de estimación se ampliaron desde el filtrado secuencial hacia el suavizado y los grafos, mientras que las características aprendidas, las representaciones de mapas neuronales y los mapas semánticos extienden diferentes componentes

Diagrama: Duskcoil. Se muestran por separado los cambios en la estimación y las extensiones ortogonales mediante el aprendizaje, la representación de mapas y la semántica. Los métodos antiguos y nuevos aún coexisten y se combinan según la aplicación.

En sus inicios, SLAM se basaba en la estimación secuencial mediante el Filtro de Kalman Extendido (EKF) o filtros de partículas, actualizando el estado cada vez que llegaba una nueva observación del sensor. Computacionalmente económico, pero con una debilidad: el error se acumula fácilmente y el enfoque tiende a fallar en mapas a gran escala.

La segunda tendencia: El cambio a la optimización de grafos

Lo que se convirtió en dominante después fue la optimización de grafos de pose (SLAM de grafos). Esta construye un grafo donde cada Cada nodo representa la pose del robot en un punto de su trayectoria, y cada arista es una relación relativa derivada de las observaciones de los sensores. El sistema optimiza todo el conjunto como un problema de mínimos cuadrados no lineales. Combinado con el cierre de bucle (que reconoce un lugar visitado previamente y corrige retroactivamente el error acumulado), esto permite construir mapas que se mantienen incluso en entornos a gran escala. slam_toolbox, utilizado en newbot, pertenece a esta línea de desarrollo. FAST-LIO, en cambio, realiza una odometría LiDAR-IMU estrechamente acoplada con un filtro de Kalman iterativo, en lugar de un grafo de poses.

¿Qué hay dentro de la optimización de grafos?: Formulada como mínimos cuadrados no lineales

Analizando con más detalle el problema que SLAM resuelve internamente: construye un grafo donde cada nodo representa la pose del robot en un punto de su trayectoria, y cada arista es la relación posicional relativa derivada de las observaciones de los sensores. Se formula como un problema de mínimos cuadrados no lineales que ajusta la posición de cada nodo. Para lograr la máxima coherencia con la restricción de cada arista. Dado que las observaciones del sensor contienen ruido, las restricciones entre las aristas inevitablemente entrarán en conflicto en cierta medida, y el objetivo de esta optimización es distribuir dicho conflicto de la forma menos irrazonable posible.

Formalmente, para el conjunto completo de poses a resolver, \mathbf{x} = (\mathbf{x}_1, \dots, \mathbf{x}_n), el problema consiste en minimizar la siguiente función objetivo:

\mathbf{x}^{*} = \arg\min_{\mathbf{x}} \sum_{(i,j) \in \mathcal{C}} \left\| \mathbf{e}_{ij}(\mathbf{x}_i, \mathbf{x}_j) \right\|^2_{\Sigma_{ij}^{-1}}

Aquí, \mathcal{C} es el conjunto de pares de nodos (aristas) restringidos por una observación del sensor, \mathbf{e}_{ij} es la función de error que expresa la discrepancia entre las poses estimadas de los nodos i y j y la observación del sensor, y \Sigma_{ij}^{-1} es la ponderación de la confianza de dicha observación (la covarianza inversa).

Se utilizan métodos iterativos como Gauss-Newton o Levenberg-Marquardt para Resuélvalo. La función de error se linealiza alrededor de la estimación actual (\mathbf{e}_{ij}(\mathbf{x} + \Delta\mathbf{x}) \approx \mathbf{e}_{ij}(\mathbf{x}) + \mathbf{J}_{ij}\Delta\mathbf{x}), y la ecuación normal (\mathbf{J}^\top \mathbf{J} \, \Delta\mathbf{x} = -\mathbf{J}^\top \mathbf{e}) se resuelve para la actualización (\Delta\mathbf{x}), repitiéndose hasta la convergencia. Cuando las posiciones 3D de los puntos característicos observados (puntos de referencia) se incluyen como objetivos de optimización junto con las poses de la cámara, este proceso se denomina específicamente Ajuste de Paquetes (Bundle Adjustment). Los problemas SLAM tienen un gran número de variables (poses, puntos de referencia), pero cada observación individual solo afecta a un pequeño número de ellas, por lo que las matrices resultantes (Jacobiana, Hessiana) son dispersas. Resolver de forma eficiente aprovechando esa dispersión es la clave práctica, y los marcos de optimización de propósito general como Ceres Solver, g2o y GTSAM se utilizan ampliamente como bibliotecas para este tipo de problema de mínimos cuadrados no lineales dispersos.

La Tercera Corriente: SLAM basado en aprendizaje y nativo de IA

La corriente actual consiste en integrar el aprendizaje profundo en el pipeline SLAM. Reemplazar la detección explícita de características. La extracción y el emparejamiento mediante aprendizaje profundo constituyen un área de investigación activa que busca mejorar la robustez ante cambios de iluminación y entornos con poca textura. Más recientemente, ha surgido una tendencia denominada "SLAM nativo de IA" o "SLAM semántico", que integra redes neuronales gráficas, e incluso grandes modelos de lenguaje (LLM) y modelos de Visión-Lenguaje-Acción (VLA), en el proceso SLAM. El objetivo ya no es simplemente "dónde estoy", sino construir un mapa semántico que comprenda simultáneamente "qué hay ahí".

Un cambio en la representación del mapa

El cambio reciente más notable es la reinvención del formato de representación del mapa. Más allá de la tradicional nube de puntos y la cuadrícula de ocupación, las representaciones de mapas basadas en campos de radiancia neuronal (NeRF) y dispersión gaussiana 3D (3DGS) están ganando terreno rápidamente. Estas superan cada vez más a los métodos tradicionales en precisión de mapeo, calidad de renderizado y eficiencia computacional, y los nuevos métodos basados en 3DGS/NeRF... MHED-SLAM, GTS-SLAM, MTE-SLAM, HL-SLAM, PMET-SLAM y otros métodos han seguido apareciendo en importantes congresos y revistas hasta bien entrado 2026. Consulte el artículo aparte «Tendencias tecnológicas en Visual-SLAM» para obtener más detalles.

Panorama de finales de 2026: Diversificación de 3DGS-SLAM por dominio

Al analizar concretamente los métodos basados en 3DGS/NeRF mencionados anteriormente, publicados hasta agosto de 2026, destaca la gran diversificación de los dominios objetivo. RoSe-SLAM crea mapas gaussianos 3D con etiquetas semánticas a partir de vídeo monocular en escenas dinámicas (aceptado en IROS 2026); Stipple, del laboratorio de Daniel Cremers, construye un mapa incrementalmente en tiempo real acoplando estrechamente datos visuales e inerciales; GLAM-SLAM se adapta a entornos del tamaño de una manzana mediante la densificación de flujo y la descomposición espacial (también aceptado en IROS 2026). IROS 2026); y Real-Time LiDAR Gaussian Splatting SLAM combina nubes de puntos LiDAR directamente con gaussianas 3D. La especialización avanza en distintos ejes: interiores frente a exteriores, escenas dinámicas, entornos a gran escala. El enfoque también se está extendiendo más allá de la robótica, hacia la medicina: EndoMD-SLAM se centra en SLAM endoscópico, y Track2Map (aceptado en MICCAI 2026) en cirugía laparoscópica.

Integración de la comprensión semántica: SLAM acoplado a modelo de base y vocabulario abierto

Profundizando en la actualidad del "SLAM nativo de IA basado en aprendizaje": 2026 fue el año en que surgieron múltiples métodos que integran características de modelos de base de visión directamente en el flujo de trabajo SLAM. RADIO-ViPE (abril de 2026) acopla estrechamente incrustaciones multimodales de un modelo de base de visión aglomerativo en línea, logrando un SLAM semántico de vocabulario abierto que puede localizar categorías arbitrarias especificadas en texto. Mapas incluso en entornos dinámicos. FeatureSLAM (enero de 2026) rasteriza características alineadas con un modelo de visión base sobre cada Gaussiana en un mapa de dispersión gaussiana 3D, creando un mapa con capacidad de búsqueda semántica y manteniendo el rendimiento en tiempo real. Esta dirección se expone sistemáticamente en el estudio de octubre de 2025 «SLAM visual semántico: un estudio sobre el estado del arte, los desafíos y las direcciones futuras», que amplía su alcance hasta la integración de grandes modelos de lenguaje, lo que subraya cómo SLAM está pasando de la estimación geométrica pura a sistemas que también incorporan comprensión semántica.

Ampliación de las modalidades de sensores: el radar 4D como opción

Junto con LiDAR y cámaras, la investigación que utiliza el radar 4D (radar de ondas milimétricas que proporciona alcance, acimut, elevación y velocidad Doppler) como tercera modalidad de sensor —valorada por su resistencia a las inclemencias del tiempo— continúa actualizándose activamente. Odometría inercial por radar 4D, que combina 3D El modelado gaussiano con coincidencia de escaneo de múltiples hipótesis busca mejorar la precisión de la odometría en condiciones de niebla, lluvia y polvo, donde tanto las cámaras como el LiDAR presentan dificultades. Publicado inicialmente a finales de 2024, recibió una versión revisada en marzo de 2026. Los conjuntos de datos de referencia también están evolucionando hacia condiciones operativas más realistas, como el conjunto de datos Hilti-Trimble-Oxford (julio de 2026), que utiliza una cámara de 360 grados más una IMU e incorpora información previa sobre el plano de planta.

Patrones regionales en la industria y la investigación

El análisis de patentes y artículos relacionados con SLAM ha señalado que China tiene un peso desproporcionado en SLAM 2D centrado en LiDAR, implementaciones basadas en ROS, optimización de grafos e investigación en multirobots/computación de borde. La demanda de aplicaciones prácticas —drones, robots de servicio— parece estar marcando la dirección de la investigación.

Resumen: Las tres corrientes no son mutuamente excluyentes

Filtrado secuencial y grafos La optimización son opciones para el backend de estimación. La extracción de características aprendidas, las representaciones de mapas 3DGS/NeRF y la integración semántica forman ejes separados que pueden combinarse entre sí. FAST-LIO, utilizado en newbot, por ejemplo, se basa en un filtro de Kalman iterativo; FAST-LIO2 también registra puntos brutos directamente en el mapa sin una etapa de extracción de características separada. La combinación a elegir depende de la capacidad de cómputo disponible, la configuración del sensor y la finalidad del mapa; esa es la conclusión práctica en este momento.

Comprueba tu comprensión
¿Una nueva representación de mapa resuelve todos los problemas de SLAM?

La apariencia, la localización, el cierre de bucle y el cálculo son dimensiones separadas. Identifica el componente específico que mejora una contribución.

Referencias

Funcionamiento](/en/project/newbot/newbot-slam-nav.html)

What to read next

Continue the seriesTendencias tecnológicas en LiDAR-SLAMExplore another aspect of this fieldTendencias tecnológicas en robots humanoidesExplore another aspect of this fieldTendencias tecnológicas en los modelos mundiales