文章
制作、测试并拆解技术。通过实现、实验和调研,记录技术背后的原理。
← 学习指南

计算机视觉 — 学习指南

计算机视觉 — 按照清晰的学习路径,从基础原理走向实际应用。

按照清晰的学习路径,从基础原理走向实际应用。

  1. Fundamentals · 12 分钟阅读

    相机标定入门——恢复镜头畸变和内参

    相机标定是恢复将像素坐标映射到三维空间所需的相机固有参数和镜头畸变的过程。本文从重新审视针孔模型、径向和切向畸变模型、张氏平面图案法、重投影误差优化入手,探讨了标定漂移时视觉SLAM和VO中下游算法的失效原因——通过公式和图表进行了系统的讲解。

  2. Fundamentals · 20 分钟阅读

    特征检测入门

    特征检测选取图像中“可以再次找到的位置”,并将其用于匹配。本文将角点、斑点、DoG、FAST、ORB 和 SIFT 等特征检测原理与鲁棒性、评估方法、现有工具以及基于学习的方法联系起来,形成一个连贯的整体。

  3. Hands-on · 3 分钟阅读

    图像亮度 Lab — 曝光、伽马与裁剪

    使用合成灰度图像、直方图和梯度比较线性曝光与编码像素值调整。

  4. Hands-on · 3 分钟阅读

    特征点提取实验 — 对比 Harris 与 Shi–Tomasi

    旋转、缩放并调整合成图像的亮度,对比检测到的角点与已知变换得到的参考位置。

  5. Hands-on · 3 分钟阅读

    特征点匹配实验 — 区分描述子筛选、几何内点与真值

    比较图像块并筛选对应关系,观察为什么几何一致并不保证匹配正确。

  6. Fundamentals · 8 分钟阅读

    特征跟踪入门——如何避免帧与帧之间丢失同一特征点

    特征跟踪是指在视频序列中跨帧匹配同一物理点的过程。本文系统地整理了模板跟踪、Lucas-Kanade光流、描述符匹配、RANSAC算法、异常值剔除和卡尔曼预测等技术,并给出了相应的公式和实现步骤。此外,本文还解释了视觉里程计和SLAM失效的条件以及相应的缓解措施。

  7. Hands-on · 3 分钟阅读

    光流 Lab:跟踪两帧之间的运动

    估计图像特征点的位移,并与已知合成变换比较。观察亮度变化、遮挡和孔径问题导致的失败。

  8. Fundamentals · 7 分钟阅读

    光流入门——从图像运动中读取速度和结构

    光流是一个矢量场,用于描述图像序列中每个像素的移动方向。本文探讨了亮度恒常性约束、Lucas-Kanade 和 Horn-Schunck 函数、金字塔、密集流与稀疏特征跟踪、基于学习的方法(例如 RAFT)、相机运动、动态物体以及评估方法,并阐述了其背后的数学原理。

  9. Fundamentals · 11 分钟阅读

    单应性入门——用单个3x3矩阵描述平面对应关系

    单应性关系是一种利用单个 3x3 投影变换将同一平面上(或纯旋转相机视角下)的点联系起来的关系。本文涵盖了基于 DLT 的估计、使用 RANSAC 进行鲁棒性增强、旋转、平移和平面法线分解,以及何时使用单应性关系而非极线几何,并结合图像拼接和 AR 平面跟踪等应用,辅以公式和图示。

  10. Fundamentals · 23 分钟阅读

    极线几何——从两幅图像中读取深度和相机运动

    极线几何理论约束了同一个三维点在两个图像上的投影方式。本文系统地解释了基本矩阵和本质矩阵、8点和5点算法、RANSAC算法、三角剖分、极线几何和单应性矩阵的选择、标定、OpenCV/COLMAP实现、失效条件以及最新的基于学习的估计方法,并辅以公式和图表。

  11. Fundamentals · 7 分钟阅读

    PnP入门——仅从3D点和图像恢复相机姿态

    透视n点(PnP)问题是指利用已知的3D点及其对应的图像点来估计相机位置和姿态的几何问题。本文将深入探讨投影方程、P3P/AP3P、EPnP、迭代优化算法、RANSAC算法、平面退化问题,以及PnP在视觉SLAM、AR和测绘中的应用,并提供相应的数学原理和实现清单。

  12. Fundamentals · 14 分钟阅读

    运动结构重建入门——从无序照片集中同时恢复3D结构和相机位置

    运动结构重建(SfM)能够从一组顺序和拍摄位置未知的照片中同时恢复场景的三维结构和每个相机的位姿。本文系统地介绍了特征匹配、几何验证、增量式和全局式两种重建策略、三角测量、与光束法平差的关系以及与视觉SLAM的区别,并介绍了COLMAP等现有实现方法。

  13. Fundamentals · 15 分钟阅读

    捆绑调整入门——非线性最小二乘法联合修正相机姿态和三维点

    光束法平差是一个非线性最小二乘问题,它同时移动多个相机位姿和三维点,以最小化所有观测值的重投影误差。本文系统地阐述了雅可比矩阵稀疏性的原因、舒尔补矩阵如何使大规模问题可解、莱文伯格-马夸特方法的作用、规范自由度以及光束法平差与位姿图优化和运动学(SfM)的关系,并辅以公式和图表进行解释。

  14. Fundamentals · 15 分钟阅读

    多视图立体建模入门——将稀疏点云填充为密集三维形状

    多视图立体视觉(MVS)利用已知的相机位姿,从多张图像中恢复密集的3D形状。本文系统地阐述了照片一致性这一核心原理,以及平面扫描和基于图像块的两种经典方法(PMVS),以MVSNet为代表的深度学习方法,以及通过深度图融合进行网格划分的方法,并结合公式和图表,探讨了这些方法与立体相机和深度相机的关系。

  15. Fundamentals · 23 分钟阅读

    VO/VIO入门——利用摄像头和IMU估计运动的实用基础

    视觉里程计 (VO) 和视觉惯性里程计 (VIO) 通过一系列图像和惯性测量数据来估计机器人或相机的相对运动。本文结合数学公式和图表,探讨了单目尺度模糊、IMU 预积分、初始化、滤波与优化、VINS-Mono 和 OpenVINS 等实现方法、评估指标以及故障情况等问题。

  16. Fundamentals · 7 分钟阅读

    环路闭合入门——一次性修复SLAM系统环路漂移

    闭环检测是指识别机器人是否返回到之前访问过的位置,并将累积的自定位误差分散到整个地图上的过程。本文系统地阐述了位置识别、图像检索、几何验证、姿态图优化、误报防御以及当前SLAM的实现和研究。

  17. Fundamentals · 22 分钟阅读

    视觉SLAM入门——摄像头如何学习“我在哪里”"

    即使没有GPS和地图,机器人也能仅凭摄像头图像确定自身位置并构建周围环境地图。本文将从特征跟踪和极线几何的角度,系统地讲解视觉里程计和SLAM的区别,地标算法从ORB-SLAM到LSD-SLAM和DSO的演变,以及光束法平差,深入剖析视觉SLAM的实际工作原理。

  18. 学习指南 · 3 分钟阅读

    单目深度估计——从相对顺序到度量距离

    单眼深度入门:相对深度与公制深度、尺度模糊性、评估方案和失效条件。

  19. 学习指南 · 3 分钟阅读

    神经3D——新颖视角合成与独立的视觉/几何评估

    神经场景表征、新视角合成、保留视角以及独立的视觉和几何评估入门。

Search this field →