Contents — find the section you need
이미지에서 두 지점이 동일한 대상을 나타내는지 판단할 때, 이미지 전체를 비교하는 것보다 작고 반복적으로 찾을 수 있는 특징점들을 비교하는 것이 더 효율적입니다. 이러한 특징점을 선택하는 과정이 바로 특징점 검출입니다. 특징점 검출은 카메라 움직임 추정, 파노라마 이미지 합성, 3D 재구성, 이미지 검색, 시각적 검사 등 이미지 간의 대응 관계가 필요한 모든 과정의 시작점에 있습니다. 이 글에서는 "어디에서 특징을 선택할 것인가"와 "선택된 특징점들을 어떻게 일치시킬 것인가"를 구분하고, 고전적인 알고리즘의 원리를 공식과 구현 관점에서 모두 살펴봅니다.
Intel RealSense D435이미지: Intel RealSense 심도 카메라 D435 (Marc Auledas, CC BY-SA 4.0), Wikimedia Commons. 특징점 검출 전용 장치가 아닌 대표적인 카메라 이미지입니다.
30초 요약
-
특징점은 평평한 벽이 아닌 여러 방향으로 밝기 변화가 있는 모서리나 주변과 밝기가 다른 영역에 배치하세요. 작은 이미지 변환 후에도 같은 위치에서 다시 검출되는 것(반복성)이 중요합니다.
-
코너 검출은 국부적인 그래디언트의 양방향성을 포착하고, 블롭 검출은 특정 스케일에서 국부적으로 뚜렷하게 구분되는 밝기 영역을 포착합니다. DoG(Domain-Oriented Gradient)는 여러 개의 흐릿한 이미지의 차이를 이용하여 블롭 후보를 빠르게 탐색합니다.
-
FAST는 원형 영역의 픽셀만을 비교하여 코너를 빠르게 판별합니다. ORB는 FAST에 이미지 피라미드, 방향 추정, 회전된 BRIEF 이진 디스크립터를 결합하여 실시간 사용에 적합합니다.
-
SIFT는 DoG를 통해 스케일을 선택하고, 그래디언트 방향 히스토그램으로 방향을 정규화한 후 128차원 디스크립터를 구축합니다. 연산 및 메모리 비용이 증가하지만, 스케일 및 회전 변화에 강건합니다.
-
검출만으로는 대응 관계를 판단할 수 없습니다. 디스크립터 거리, 비율 테스트, RANSAC 기반 기하학적 검증을 하나의 파이프라인으로 함께 평가해야 합니다. 최근에는 SuperPoint, ALIKED, LightGlue와 같은 학습 기반 검출 및 매칭 기법도 실용화되고 있습니다.
특징점이란 무엇인가 — "눈에 띄는 점"이 아니라 "다시 찾을 수 있는 점"
픽셀 좌표를 \mathbf{x}=(x,y)^\mathsf{T}, 이미지를 I(\mathbf{x})이라고 합시다. 특징점이란, 약간의 이동, 회전 또는 크기 조정 후에도 인접한 패치가 동일한 물리적 위치로 안정적으로 감지되고, 주변 패턴을 통해 다른 점들과 구별될 수 있는 지점입니다. 이러한 특징을 나타내는 것을 검출기라고 하고, 주변 패턴을 숫자 벡터 또는 비트 문자열로 변환하는 것을 기술자라고 합니다.
이 둘은 서로 다릅니다. FAST는 원칙적으로 검출기이고, BRIEF는 기술자이며, ORB는 검출기와 기술자를 결합한 방식입니다. SIFT는 DoG 검출기와 그래디언트 히스토그램 기술자를 결합한 것입니다. 이름만으로는 혼동을 일으킬 수 있으므로, 앞으로는 이 과정을 "점 선택", "주변 환경 표현", "점 매칭"의 세 단계로 나누어 설명하겠습니다.
그림: Duskcoil 제작. 시스템 품질은 탐지된 점의 개수가 아니라 기하학적으로 일치하는 대응점의 개수에 의해 결정됩니다.
코너: 두 방향으로 변화하는 지점 선택
가장 직관적인 특징은 코너입니다. 이미지 패치 W가 아주 작은 변위 \mathbf{u}=(u,v)^\mathsf{T}만큼 이동했을 때 나타나는 변화를 SSD(제곱 차이 합)로 나타내면 다음과 같습니다.
1차 테일러 근사에서 지역 구조(2차 모멘트) 행렬 \mathbf{M}는 다음과 같습니다.
여기서 I_x,I_y는 이미지 그래디언트이고 w는 가우시안 윈도우와 같은 가중치입니다. \mathbf{M}의 고유값을 \lambda_1,\lambda_2이라고 할 때, 가장 작은 고유값조차 큰 지점이 코너입니다. 기울기가 한 방향으로만 큰 가장자리에서는 하나의 고유값이 작게 유지됩니다. 평평한 영역에서는 두 고유값 모두 작게 유지됩니다. 해리스 검출기는 모든 픽셀에서 고유값을 명시적으로 계산하지 않고, 대신 다음 응답 값의 국부 최대값을 선택합니다.
k는 일반적으로 0.04~0.06 정도입니다. 해리스 검출기는 회전에 비교적 강건하지만, 고정된 크기의 윈도우를 통해 관찰하기 때문에 피사체가 크게 확대되거나 축소될 때 동일한 지점을 선택하는 메커니즘이 없습니다. 시-토마시 검출기의 \min(\lambda_1,\lambda_2) 또한 추적에 적합한 모서리를 선택하는 실용적인 기준으로 널리 사용됩니다.
블롭: 모서리가 없더라도 "블롭"은 유용한 단서입니다
모서리만으로는 둥근 로고, 점, 어두운 구멍 또는 밝은 반사의 중심을 제대로 포착할 수 없습니다. 따라서 블롭 검출기는 주변부에 비해 상대적으로 밝은 국부적인 영역을 찾습니다. 주변 환경을 특정 스케일에서 관찰합니다. 가우스 함수 G(\mathbf{x};\sigma)로 평활화된 스케일 공간을 다음과 같이 나타냅니다.
여기서 *는 컨볼루션이고 \sigma는 "관찰 대상의 크기"를 나타냅니다. 가우스 라플라시안(LoG)의 스케일 정규화 응답은 다음과 같습니다.
밝은 배경 위의 어두운 원 또는 어두운 배경 위의 밝은 원에 강하게 반응합니다. 위치뿐만 아니라 (x,y,\sigma) 공간과 \sigma 방향을 포함한 모든 차원에서 극값을 찾으면 블롭의 중심과 특징적인 크기를 동시에 파악할 수 있습니다. 이는 반지름이 대략 \sqrt{2}\sigma인 원형 블롭에 해당하는 스케일로 해석할 수도 있습니다.
LoG는 훌륭한 아이디어이지만, 모든 스케일에서 정확한 2차 미분을 계산하는 것은 비용이 많이 듭니다. 따라서 이 방법은 근사화 및 속도 향상을 통해 DoG가 개발되었고, 여기서 SIFT로 발전했습니다.
DoG: 블러 차이에서 스케일 불변 후보 찾기
DoG(Difference of Gaussians)는 인접한 두 블러 이미지의 차이입니다.
여기서 k>1는 인접한 이미지의 스케일 비율입니다. 상수 계수까지 DoG는 스케일 정규화된 LoG를 근사하므로, 추가 컨볼루션 한 번만으로 블롭 후보를 찾을 수 있습니다. 구현에서는 이미지를 점진적으로 블러 처리하여 가우시안 피라미드를 구축하고, 각 DoG 픽셀을 동일한 스케일의 이웃 8개 픽셀과 위아래 스케일의 이웃 9개 픽셀(총 26개)과 비교합니다. 최댓값 또는 최솟값을 가지는 픽셀이 후보가 됩니다.
후보는 그대로 사용되지 않습니다. 약한 극값은 노이즈로 간주되어 제거되며, 길쭉한 가장자리를 따라 나타나는 극값도 마찬가지입니다. DoG 주변에 3D 2차 함수를 보간하는 방법이 있습니다. 극값은 서브픽셀의 위치와 크기를 나타냅니다. 헤시안 행렬의 경우
큰 \mathrm{Tr}(\mathbf{H})^2/\det(\mathbf{H}) 값은 하나의 주곡률만 강한 에지 응답을 나타내며, 이러한 점은 제외됩니다. 이는 코너 검출과 동일한 문제를 해결합니다. 에지 위의 점은 에지를 따라 이동하더라도 비슷하게 보이므로, 그 대응점을 고유하게 특정할 수 없습니다.
FAST: 원형 영역만으로 코너를 빠르게 판별하기
FAST(Accelerated Segment Test)는 픽셀 p 주변의 반지름 3인 브레젠햄 원 위의 16개 픽셀을 사용합니다. 임계값 t이 주어졌을 때, n개의 연속된 픽셀(일반적으로 9개 또는 12개)이 모두 I_p+t보다 밝거나, 모두 I_p-t보다 어두우면 코너로 판별합니다. p는 코너로 판단됩니다.
이 알고리즘은 그래디언트나 행렬을 계산하지 않고, 소수의 픽셀 비교와 조기 거부만으로 매우 빠른 속도를 자랑합니다. 원형의 1시, 5시, 9시, 13시 방향 픽셀을 먼저 확인하고, 밝은 픽셀과 어두운 픽셀이 연속적으로 나타날 수 없는 경우 즉시 중지하는 설계가 속도의 핵심입니다. 반면, 일반 FAST는 스케일이나 방향 정보를 제공하지 않으며, 가장자리의 여러 지점에 반응하는 경향이 있습니다. 주변과의 강도 차이를 계산하고, 비최대 억제(NMS)를 적용하고, 이미지 피라미드와 결합한 후에야 비로소 실용적인 다중 스케일 검출기가 됩니다.
ORB: FAST를 "빠르지만 사용하기 어려운" 알고리즘에서 벗어나다
ORB(Oriented FAST and Rotated BRIEF)는 실시간 이미지 매칭을 목표로 FAST와 BRIEF를 강화한 알고리즘입니다. 먼저, 각 축소 비율(s)에서 이미지 피라미드를 빠르게 순회하며 각 레벨의 최상위 점들을 유지합니다. 이를 통해 스케일 변화에 대해 정확하지는 않더라도 견고성을 확보합니다.
다음으로, 점(p) 주변 패치의 강도 중심을 계산합니다.
중심(p)에서 중심점(\mathbf{c})까지의 각도(\theta=\operatorname{atan2}(m_{01},m_{10}))가 주요 방향이 됩니다. BRIEF 디스크립터는 패치 내 픽셀 쌍((\mathbf{a}_i,\mathbf{b}_i))을 비교하는 비트 문자열입니다.
이 비트 문자열은 약 256번 반복됩니다. ORB에서는 점 쌍 좌표를 비교하기 전에 \theta만큼 회전시키므로 회전 후에도 동일한 비트 패턴이 나타나는 경향이 있습니다. rBRIEF는 낮은 상관관계를 선택하도록 학습합니다. 비교 쌍을 사용하는 것은 비트의 정보 내용을 보존하는 또 다른 방법입니다. 이진 문자열 간의 거리는 XOR 연산 후 설정된 비트 수인 해밍 거리로 빠르게 계산할 수 있습니다.
ORB는 CPU 및 임베디드 장치에서 속도와 메모리 효율성이 뛰어나며, 비주얼 SLAM에 널리 사용됩니다. 그러나 큰 규모의 차이, 심한 흐림 현상 또는 상당한 시점 변화가 있는 경우, SIFT 또는 더 풍부한 그래디언트 설명을 제공하는 학습 기반 특징이 유리할 수 있습니다.
SIFT: 스케일, 방향 및 설명을 일관되게 정규화
SIFT(Scale-Invariant Feature Transform)는 DoG(Domain-Orientation)를 통해 (x,y,\sigma)의 극값을 감지하고 저대비 점과 에지 응답을 제거합니다. 각 점 주변에서 그래디언트 크기와 방향을 계산하고 가우스 가중 방향 히스토그램을 생성합니다. 가장 큰 피크는 패치의 회전을 정규화하는 데 사용되는 주요 방향이 되며, 최대값의 80%를 초과하는 두 번째 피크에도 각각 고유한 방향이 할당됩니다. 방향. 이것이 회전에 대한 견고성의 핵심입니다.
디스크립터의 경우, 대략 16\times16 크기의 정규화된 윈도우가 4\times4개의 셀로 나뉘고, 각 셀에는 8방향 그래디언트 히스토그램이 부여됩니다. 따라서 차원은 4\times4\times8=128입니다. 벡터 \mathbf{d}는 L2 정규화되고, 0.2를 초과하는 요소는 잘린 후 다시 정규화되어 국부적인 조명 변화에 대한 민감도를 억제합니다.
즉, SIFT의 "불변성"은 마법이 아닙니다. 이미지 피라미드를 통한 스케일 선택, 주요 방향으로 좌표계 회전, 정규화를 통한 대비 감소 등 각 변동 요인을 개별적으로 처리하는 명시적인 설계입니다. 아핀 변형이나 큰 시점 차이에 대해서는 완벽하지 않으며, 이러한 경우에는 후속 RANSAC 또는 다중 시점 기하학이 필요합니다.
최소 구현 의사 코드
특징점 처리는 추출에서 멈추지 않고 대응점 검증까지 구현되어야 합니다. 아래는 ORB 또는 SIFT에 모두 적용 가능한 기본 구조입니다.
function match_images(imageA, imageB, method):
grayA, grayB = to_gray(imageA), to_gray(imageB)
detector = create(method) # ORB: FAST+pyramid+rBRIEF / SIFT: DoG+gradient
keyA, descA = detector.detect_and_compute(grayA)
keyB, descB = detector.detect_and_compute(grayB)
metric = HAMMING if method == ORB else L2
tentative = []
for each descriptor a in descA:
b1, b2 = two_nearest(a, descB, metric)
if distance(a, b1) < 0.75 * distance(a, b2):
tentative.append((a.keypoint, b1.keypoint))
H, inlier_mask = RANSAC_HOMOGRAPHY(tentative, reproj_threshold=3px)
return tentative[inlier_mask], H
가장 가까운 이웃 하나만 선택하면 창틀, 격자, 반복 패턴과 같은 모호한 점들이 결과에 남게 됩니다. 로우의 비율 검정은 최적 거리 d_1와 차선 거리 d_2의 비율을 사용하며, 차선 거리와의 차이가 충분히 크지 않은 후보는 제외합니다. RANSAC은 대응점의 작은 무작위 부분집합에서 호모그래피 \mathbf{H} 또는 기본 행렬을 가설로 추정하고, 재투영 오차가 작은 상태에서 가장 많은 대응점(인라이어)을 설명하는 가설을 선택합니다. 객체가 평면이거나 카메라가 제자리에서 회전만 한 경우, 호모그래피를 사용하여 일관성을 확인할 수 있습니다.
For 일반적인 3D 장면에서는 기본/필수 행렬이 사용됩니다. 이 시점까지 살아남은 인라이어 개수와 비율이 실제로 사용 가능한 특징의 양입니다.
조명, 크기 및 회전에 대한 강건성 및 그 정도
조명 변화에 대해서는 간단한 밝기 오프셋(I'(x,y)=I(x,y)+b)이 픽셀 차이를 없애지만, 그라디언트 또는 이진 비교에서의 상대적 관계에는 거의 영향을 미치지 않습니다. 균일한 대비 변화(I'=aI+b) 또한 SIFT의 디스크립터 정규화를 통해 비교적 잘 처리됩니다. 그러나 노출 포화, 그림자 경계, 반사, 주야 등 로컬 구조 자체가 변할 때는 기존 방법만으로는 완벽한 결과를 보장할 수 없습니다. 촬영 시 노출을 고정하거나 엄격하게 관리하고, 필요한 경우 CLAHE와 같은 로컬 대비 보정을 동일한 조건에서 두 이미지 모두에 적용해야 합니다. 과도한 보정은 노이즈를 허위 특징으로 변환할 위험이 있으므로 주의해야 합니다.
단일 해상도 Harris 또는 FAST는 본질적으로 크기 변화에 취약합니다. ORB는 이미지 전체에서 후보를 탐색합니다. 피라미드는 실질적인 허용 오차를 가지지만, DoG(Gradient Direction)를 통해 연속적인 스케일 극값을 선택하는 SIFT와 같은 정규화 방식은 아닙니다. 축소된 스케일에서 텍스처가 사라지면 어떤 방법으로도 대응점을 찾을 수 없습니다. 입력 해상도, 피라미드 깊이, 최소 패치 크기는 캡처 거리 변화의 예상 범위를 고려하여 결정해야 합니다.
회전에 대해 Harris 응답 자체는 비교적 안정적이지만, 매칭을 위해서는 디스크립터의 좌표계도 회전해야 합니다. ORB는 강도 중심을 통해 방향을 할당하고, SIFT는 기울기 방향 히스토그램을 통해 방향을 할당합니다. 이러한 연속 각도 정규화는 90도 회전 단계만 처리하는 디스크립터보다 더 효과적입니다. 한편, 강한 경사 뷰는 회전 및 스케일링이 아니라 아핀/투영 변형이므로, 다중 뷰 데이터, 아핀 공변 특징, 또는 기하학적 검증과 결합된 학습 기반 특징이 필요합니다.
평가 지표: 포인트 개수가 아닌 사용 가능한 대응점 측정
호모그래피가 알려진 이미지 쌍의 경우 H, 이미지 A에서 B로 투영점 \mathbf{x}_i을 찾고, 거리 \epsilon 이내에 있는 점이 검출된 점 집합 K_B에 존재하면 재검출 성공으로 간주합니다. 반복성은 개념적으로
하지만 디스크립터가 위치를 구별할 수 없다면 동일한 위치를 찾는 것은 무의미합니다. 따라서 매칭 정밀도(정확한 대응점 비율), 정확한 대응점 개수, RANSAC 후 인라이어 비율, 추정된 포즈의 회전/변환 오차, 처리 시간 및 메모리 사용량도 보고해야 합니다. HPatches는 패치 매칭, 검출기 및 호모그래피 추정을 평가하기 위해 조명 변화와 시점 변화를 분리하는 대표적인 벤치마크입니다. 응용 프로그램의 기하학적 구조(평면 또는 넓은 베이스라인 3D)와 일치하는 데이터로 측정하지 않는 한, 단일 점수의 순위를 그대로 채택해서는 안 됩니다.
| 방법 | 검출 핵심 | 디스크립터 | 크기/회전 | 매칭 거리 | 장점 | 주요 주의사항 |
|---|---|---|---|---|---|---|
| 해리스 + 패치 | 구조 행렬 | 원시 패치 등 | 크기 ✕, 회전 분리 | SSD/NCC | 명확한 원리 | 조명/크기에 취약 |
| LoG / DoG | 크기 공간 블롭 극값 | 별도의 디스크립터 필요 | 크기 ◎, 회전 분리 | 디스크립터에 따라 달라짐 | 블롭과 크기를 얻음 | 피라미드 계산 필요 |
| 빠르고 간결함 | 원형의 연속적인 밝기 | 이진 비교 | 둘 중 하나만 사용 불가 | 해밍 | 매우 빠름 | 시점/크기에 취약 |
| ORB | 피라미드 빠름 | 회전된 r간편 | 크기 ○, 회전 ○ | 해밍 | 가볍고 실시간에 적합 | 제한적 큰 변형 |
| SIFT | DoG 극값 | 128차원 그래디언트 히스토그램 | 스케일 ◎, 회전 ◎ | L2 | 견고하고 검증 완료 | CPU/메모리 부담 높음 |
| 학습 기반 | 네트워크 학습 | 학습된 벡터 | 데이터를 통한 강화 | L2/학습 | 어려운 조건에서도 높은 대응률 | 모델, GPU, 재현성 관리 필요 |
표의 ○와 ◎는 절대적인 등급이 아니라 일반적인 구현 및 예상 범위에 대한 상대적인 벤치마크입니다. 동일한 그리드 패턴이 프레임을 가득 채울 경우 SIFT조차도 모호해질 수 있으며, ORB조차도 적당한 조건에서 충분한 인라이어를 얻을 수 있습니다.
현재 라이브러리 및 실제 제품에서의 위치
첫 번째 프로토타입의 경우 OpenCV의 cv::ORB::create(), cv::SIFT::create(), cv::FastFeatureDetector::create()를 사용하기 쉽습니다. ORB는 다음과 함께 사용됩니다. BFMatcher(NORM_HAMMING) ; L2 거리 BFMatcher 또는 FLANN 기반 매처를 사용하는 SIFT. 검출기와 디스크립터를 분리하고 싶더라도 OpenCV의 Feature2D API를 사용하면 동일한 흐름을 유지할 수 있습니다. 학습 기반 실험 및 GPU 처리를 위해 PyTorch의 Kornia는 SIFT, ORB, DISK, KeyNet/HardNet, LightGlue 등을 구성 요소로 제공합니다.
사진측량 및 3D 재구성 분야에서 COLMAP은 대표적인 도구입니다. 현재 공식 문서는 ONNX를 활성화하여 빌드할 경우 표준 SIFT와 ALIKED를 지원합니다. SIFT와 ALIKED 모두 무차별 대입 매칭 또는 LightGlue 매칭에 연결할 수 있으므로 재구성 진입점에서 기존 방식과 학습 기반 방식을 쉽게 비교할 수 있습니다. 제품이나 라이브러리를 선택할 때는 CPU 전용 실행 여부, 지연 시간 허용 범위, 오프라인 매칭 작업 허용 여부, 재현 가능한 버전 제공 여부 등을 먼저 고려하는 것이 좋습니다. 모델 이름이 새로워 보이는지 여부보다는 고정(pinning)이 중요합니다.
최근 연구: 탐지, 설명 및 매칭의 공동 최적화
학습 기반 접근 방식의 전환점 중 하나는 SuperPoint였습니다. 완전 컨볼루션 네트워크는 동형 적응(Homographic Adaptation)을 통해 기하학적 변환 전반에 걸쳐 점을 재현하도록 자기 지도 학습을 수행하여 관심점 확률 맵과 특징 기술자 맵을 동시에 출력합니다. 이는 단순히 수동으로 설계된 "코너" 개념에 의존하는 대신, 대응에 유용한 위치가 있는 데이터를 기반으로 학습하는 아이디어입니다.
DISK는 정책 경사(policy gradient)를 사용하여 정확한 대응 횟수에 보상을 제공함으로써 탐지 및 설명을 엔드 투 엔드로 최적화하여 희소한 점을 선택하고 매칭하는 것이 이산적이고 구별하기 어렵다는 문제를 해결합니다. ALIKED는 희소 변형 특징 기술자 헤드(Sparse Deformable Descriptor Head)를 사용하여 각 특징점 주변의 변형 가능한 지원 위치를 학습하고, 전체 밀집 특징 맵이 아닌 희소한 점에서 특징 기술자를 추출하여 표현력과 효율성의 균형을 맞추는 것을 목표로 합니다.
매처 또한 변화하고 있습니다. 독립적인 최근접 이웃 검색 방식에서 벗어나, LightGlue는 어텐션 메커니즘을 사용하여 두 개의 로컬 특징 집합 간의 대응 관계를 추정합니다. 이 메커니즘은 이미지 쌍을 쉽게 찾을 수 있을 때 조기에 계산을 중지하는 적응형 연산을 사용합니다. LightGlue 자체는 특징 검출기가 아니지만, 검출기와 디스크립터 사이의 거리가 좋다고 해서 최종 대응 관계가 항상 좋은 것은 아니라는 점을 상기시켜 줍니다. 현재로서는 동일한 RANSAC 설정 조건에서 기존 특징 추출 방식과 경량 매처를 사용하는 설정과 SuperPoint/ALIKED와 같은 학습된 특징 추출 방식을 LightGlue를 사용하여 비교하는 것이 가능합니다.
선택 및 튜닝 체크리스트
-
먼저, 실제 이미지 쌍에서 검출 횟수, 비율 테스트 통과 횟수, RANSAC 인라이어 개수, 인라이어 비율, 처리 시간을 기록합니다. 검출 횟수만 늘리면 오매칭이 함께 증가할 수 있으므로 주의해야 합니다.
-
고정 카메라 근처에서 단시간 추적을 할 경우, FAST/ORB 알고리즘으로 시작하여
nfeatures, FAST 임계값, 피라미드 레벨을 튜닝합니다. 텍스처가 적은 환경에서는 블러, 노출, 초점을 먼저 확인합니다. 임계값을 낮추는 것. - 캡처 거리나 회전이 크게 변하는 스틸 이미지 매칭에는 SIFT를 기준선으로 사용하십시오. 더 빠른 방법이 SIFT보다 우수한지 여부는 항상 동일한 데이터와 동일한 기하학적 검증을 사용하여 확인해야 합니다.
- 야간, 강한 역광, 계절 변화, 또는 시점 차이가 큰 경우에는 학습 기반 특징 추출도 고려하십시오. 하지만 성능 평가 시 훈련 데이터와 목표 환경 간의 차이, 모델 업데이트, GPU 가용성을 포함해야 합니다.
- 반복 패턴, 반사면, 움직이는 물체, 극심한 모션 블러는 특징 추출 문제라기보다는 관측 모호성에 가깝습니다. 마스킹, 시간 추적, 센서 융합, 캡처 계획을 통해 보정하십시오.
특징 추출은 이미지를 이해하는 데 있어 만능 분류기는 아닙니다. 하지만 적은 연산량으로 어떤 픽셀이 기하학적 정보를 지원할 수 있는지 선택하는 데 효과적인 기초 기술입니다. 코너, 블롭, 스케일 공간, 방향 정규화 개념을 이해하면 기존 ORB/SIFT를 튜닝하든 학습 기반 특징을 평가하든 관계없이 수치 뒤에 숨겨진 실패 원인을 추적할 수 있습니다. 특징.
강한 모서리의 모든 점을 추적하기 쉽습니까?
단일 모서리를 따라 움직이는 것은 모호합니다. 모서리는 다양한 방향으로 강도 변화를 제공하여 2차원 움직임을 더 쉽게 식별할 수 있도록 합니다.
참고 문헌
- SIFT 원본 논문, IJCV 2004
- Rublee 외, ORB: SIFT 또는 SURF의 효율적인 대안 (ICCV 2011)
- OpenCV Feature2D / ORB 클래스 참조
- OpenCV SIFT 클래스 참조
- OpenCV FAST 특징 검출기 튜토리얼
- HPatches: 수작업 및 학습된 지역 디스크립터의 벤치마크 및 평가 (CVPR 2017)
- SuperPoint (CVPR 워크샵 2018)
- DISK (NeurIPS 2020)
- ALIKED (arXiv 2023)
- LightGlue (ICCV 2023)
- COLMAP 특징 추출 및 매칭 문서
- Kornia 특징 모듈 문서
댓글
먼저 로그인해 주세요.
아직 데이터가 없습니다.