Contents — find the section you need
SLAM(即时定位与地图构建)技术仅利用传感器即可同时估计“我在哪里”和“我周围的环境是什么样子”。本文概述了SLAM技术的整体发展趋势;各个子领域(视觉SLAM、激光雷达SLAM)的具体细节将在各自的文章中进行介绍。
关键思想: SLAM 不是一个先定位机器人再建图的单向流程。它是一个耦合估计问题:不确定的地图有助于估计位置,然后该位置用于更新地图。
图片:Robot Operating System logo,Wikimedia Commons (CC) BY-SA 4.0)
SLAM 系统概览
图:Duskcoil。一个典型的基于图的 SLAM 系统(已简化)。回环检测重访并添加约束;图后端修正轨迹和地图。组件边界因实现方式而异。
即使 SLAM 方法不断变化,它们的比较轴仍然清晰易懂。前端形成对应关系和相对运动约束;后端协调跨时间的约束;回环检测在重访某个地点时添加远程约束。基于学习的方法取代了部分或全部这些组件,而 3DGS 和 NeRF 主要扩展地图表示。以下历史以故事的形式呈现更容易理解。了解这些部分各自的变化。
第一种趋势:从基于滤波器的方法开始
图:Duskcoil。估计的变化以及通过学习、地图表示和语义进行的正交扩展是分开的。新旧方法仍然共存,并根据应用进行组合。
早期的 SLAM 主要采用扩展卡尔曼滤波器 (EKF) 或粒子滤波器进行顺序估计——每次收到新的传感器观测值时更新状态。计算成本低,但存在一个缺点:误差容易累积,并且在大规模地图中容易失效。
第二种趋势:转向图优化
此后,位姿图优化(图 SLAM)成为主流。它构建一个图。其中每个节点代表机器人沿其轨迹上某一点的位姿,每条边代表基于传感器观测数据得到的相对位置关系,然后通过非线性最小二乘法问题对整个图进行一次性优化。结合闭环检测(识别先前访问过的位置并追溯性地纠正累积误差),这使得构建即使在大规模环境中也能保持有效性的地图成为可能。newbot 中使用的 slam_toolbox 就属于这一范畴。FAST-LIO 则使用迭代卡尔曼滤波器执行紧耦合的 LiDAR-IMU 里程计,而不是位姿图。
图优化内部原理:非线性最小二乘法
更具体地来看 SLAM 内部实际求解的问题图:它构建了一个图,其中每个节点代表机器人沿其轨迹上某一点的位姿,每条边代表基于传感器观测数据得到的相对位置关系,并且它被建模为一个非线性最小二乘法问题,通过调整每个节点来优化位姿。节点的放置需尽可能与每条边的约束条件保持一致。由于传感器观测值会携带噪声,边之间的约束条件必然会存在一定程度的冲突,而此优化的目标是以尽可能“合理”的方式分散这种冲突。
形式上,对于待求解的全部姿态集 \mathbf{x} = (\mathbf{x}_1, \dots, \mathbf{x}_n),问题在于最小化以下目标函数:
其中,\mathcal{C} 是受传感器观测值约束的节点对(边)集合,\mathbf{e}_{ij} 是误差函数,表示节点 i 和 j 的估计姿态与传感器观测值之间的偏差,\Sigma_{ij}^{-1} 是该观测值置信度的权重(逆协方差)。
可以使用高斯-牛顿法或莱文伯格-马夸特法等迭代方法。用于求解该问题。误差函数围绕当前估计值(\mathbf{e}_{ij}(\mathbf{x} + \Delta\mathbf{x}) \approx \mathbf{e}_{ij}(\mathbf{x}) + \mathbf{J}_{ij}\Delta\mathbf{x})进行线性化,并求解法方程\mathbf{J}^\top \mathbf{J} \, \Delta\mathbf{x} = -\mathbf{J}^\top \mathbf{e}以获得更新值\Delta\mathbf{x},重复此过程直至收敛。当观测特征点(地标)的3D位置与相机位姿一起作为优化目标时,此过程被称为捆绑调整。SLAM问题具有大量变量(位姿、地标),但每次观测仅涉及其中的一小部分,因此生成的矩阵(雅可比矩阵、Hessian矩阵)是稀疏的。利用这种稀疏性高效求解是关键所在,而像Ceres Solver、g2o和GTSAM这样的通用优化框架被广泛用作解决此类稀疏非线性最小二乘问题的库。
第三方向:基于学习的AI原生SLAM
目前正在进行的方向是将深度学习融入到…… SLAM流程。用深度学习取代显式特征提取和匹配是目前的研究热点,旨在提高对光照变化和纹理稀疏环境的鲁棒性。最近,一种被称为“AI原生”或“语义SLAM”的方向也应运而生——将图神经网络,甚至是大型语言模型(LLM)和视觉-语言-动作(VLA)模型集成到SLAM流程中。其目标不再仅仅是“我在哪里”,而是构建一张能够同时理解“那里有什么”的语义地图。
地图表示方式的转变
近期最显著的变化是对地图自身“表示格式”的重新发明。除了传统的点云和占用网格之外,基于神经辐射场(NeRF)和3D高斯散射(3DGS)的地图表示方法正在迅速发展。这些方法在地图精度、渲染质量和计算效率方面都越来越优于传统方法,并且具有新的优势。基于 3DGS/NeRF 的方法——例如 MHED-SLAM、GTS-SLAM、MTE-SLAM、HL-SLAM、PMET-SLAM 等——在 2026 年及以后持续出现在各大会议和期刊上。详情请参阅另一篇文章“视觉 SLAM 的技术趋势”。
2026 年末概览:3DGS-SLAM 的应用领域日益多元化
具体来看,截至 2026 年 8 月,上述基于 3DGS/NeRF 的方法发表的论文中,最引人注目的是其目标领域的多元化程度。RoSe-SLAM 能够从动态场景中的单目视频构建语义标注的 3D 高斯地图(已被 IROS 2026 接收);Daniel Cremers 实验室开发的 Stipple 方法能够实时增量构建地图,同时紧密耦合视觉数据和惯性数据;GLAM-SLAM 则通过流式处理扩展到城市街区大小的环境。密度化和空间分解(已被 IROS 2026 接收);以及实时激光雷达高斯喷射 SLAM,它将激光雷达点云直接与 3D 高斯分布相结合。专业化正沿着不同的方向发展——室内与室外、动态场景、大规模环境。该方法也正从机器人领域扩展到医学领域:EndoMD-SLAM 的目标是内窥镜 SLAM,而 Track2Map(已被 MICCAI 2026 接收)的目标是腹腔镜手术。
集成语义理解:开放词汇和基础模型耦合的 SLAM
深入探讨“基于学习的 AI 原生 SLAM”的现状:2026 年涌现出多种方法,将视觉基础模型特征直接集成到 SLAM 流程中。RADIO-ViPE(2026 年 4 月)将来自凝聚视觉基础模型的多模态嵌入紧密耦合到 SLAM 流程中。实现开放词汇语义SLAM,即使在动态环境中也能在地图上定位任意文本指定的类别。FeatureSLAM(2026年1月)将与视觉基础模型对齐的特征栅格化到3D高斯散射地图中的每个高斯面上,从而构建语义可搜索的地图,同时保持实时性能。这一方向在2025年10月发布的调查报告《语义视觉SLAM:现状、挑战与未来方向综述》中得到了系统阐述,该报告将范围扩展到大型语言模型集成——强调了SLAM如何从纯粹的几何估计转向同时具备语义理解能力的系统。
拓展传感器模态:4D雷达作为一种选择
除了激光雷达和摄像头之外,使用4D雷达(一种提供距离、方位角、仰角和多普勒速度的毫米波雷达)作为第三种传感器模态的研究正在兴起——4D雷达因其对恶劣天气的适应能力而备受青睐——该技术持续积极更新。4D雷达惯性里程计结合了3D高斯建模和多假设扫描匹配,旨在提高相机和激光雷达在雾、雨、沙尘等条件下的里程计精度;该技术最初于2024年底发布,最近一次修订是在2026年3月。基准数据集也在不断完善,以适应更真实的运行条件,例如Hilti-Trimble-Oxford数据集(2026年7月发布),该数据集使用360度相机和惯性测量单元(IMU),并结合了平面图先验信息。
产业和研究的区域格局
对SLAM相关专利和论文的分析表明,中国在以激光雷达为中心的2D SLAM、基于ROS的实现、图优化以及多机器人/边缘计算研究领域占据了不成比例的份额。来自实际应用(例如无人机、服务机器人)的需求似乎正在有力地引导着该技术的发展方向。研究。
总结:三种方法并非互斥
序列滤波和图优化是估计后端的两种选择。学习特征提取、3DGS/NeRF 地图表示和语义集成构成独立的维度,可以与序列滤波或图优化结合使用。例如,newbot 中使用的 FAST-LIO 基于迭代卡尔曼滤波器;FAST-LIO2 也直接将原始点注册到地图上,无需单独的特征提取阶段。选择哪种组合取决于可用的计算资源、传感器配置以及地图的实际用途——这是目前阶段的实际结论。
新的地图表示是否能解决所有 SLAM 问题?
外观、定位、回环检测和计算是不同的维度。请指出改进的具体组件。
评论
请先登录。
暂无数据。