目标检测通过绘制方框来框选物体;语义分割则根据图像含义为每个像素着色。本文将从两者的区别入手,探讨实例分割和全景分割,追溯 R-CNN、YOLO、DETR 和 DINO 的发展历程,直至它们对应的 3D 点云模型——系统地介绍场景理解的基本原理。