로봇이 "테이블 위의 컵을 집거나" "앞의 보행자를 피하는" 등의 동작을 하기 전에, 먼저 카메라 이미지에서 무엇이 있고 어디에 있는지를 파악해야 합니다. 이러한 파악은 객체 탐지(Object Detection)와 의미론적 분할(Semantic Segmentation)의 역할입니다. 이 두 기술은 종종 함께 언급되지만, 출력의 정밀도와 문제 해결 방식 자체에서 근본적인 차이가 있습니다. 이 글에서는 두 기술의 기초부터 시작하여 3D 구현 방식과 명확한 비교 분석을 제시합니다.
차량 인식 카메라
이미지: Car Mobileye 시스템의 창문 카메라 (Ranbar, CC BY-SA 4.0), Wikimedia Commons. 이 이미지는 대표적인 입력 카메라 예시이며, 최신 제품 사양에 대한 주장이 아닙니다.
0. 이 글에서 다루는 내용
객체 탐지 및 의미론적 분할의 실제 출력 결과
탐지 파이프라인 (특징 추출 → 탐지 헤드)
R-CNN부터 YOLO, DETR, DINO에 이르는 랜드마크 알고리즘의 계보와 설계 철학의 차이점
2단계 vs. 1단계 탐지의 장단점 비교 및 트랜스포머 기반 탐지기의 활용 분야
FCN에서 Mask2Former로 발전해 온 분할 알고리즘의 진화
탐지, 의미론적 분할, 인스턴스 분할, 파노라마 분할의 차이점을 한눈에 보여주는 표
포인트 클라우드 기반 3D 객체 탐지 및 3D 의미론적 분할의 기본 원리
로봇 공학, 자율 주행, 감시, AR에 적합한 기술 선택 방법
1. 간단히 말해, 탐지와 분할이란 무엇인가
한 문장으로 요약하면: 객체 탐지는 이미지에서 "객체가 어디에 있는지"를 판별하는 기술입니다. 사각형(경계 상자)을 사용하여 픽셀을 구분하는 반면, 의미론적 분할**은 이미지에 색을 입혀 "각 픽셀이 무엇인지"를 나타냅니다. 둘 다 이미지를 이해한다는 동일한 목표를 공유하지만, 완전히 다른 해상도로 결과를 도출합니다.
이러한 쌍을 기반으로 두 가지 작업이 더 있습니다. 인스턴스 분할은 의미론적 분할처럼 픽셀에 색을 입히는 것 외에도 동일한 클래스에 속하는 개별 객체(예: 프레임 내 세 명의 사람)를 구분합니다. 파놉틱 분할은 인스턴스 분할과 도로 또는 하늘과 같이 "셀 수 없이 많은" 배경 요소에 필요한 의미론적 분할을 통합하여 최대한 완벽한 단일 결과물을 생성합니다. 아래 9절에서 이 네 가지 작업의 관계를 표로 정리했습니다.
Diagram 1 · Use the button to switch views
그림 1 — 탐지는 인스턴스별 박스를 반환합니다. 의미론적 분할은 모든 픽셀에 대한 클래스를 반환합니다. 인스턴스 분할은 셀 수 있는 각 객체에 대한 마스크를 반환합니다. 패놉틱 분할은 객체 ID와 객체 클래스를 결합합니다. Open 전체 크기 그림
그림: Duskcoil. 하나의 개략적인 장면과 공유된 형상에서 생성되었으며, 측정된 모델 출력이 아닙니다.
2. 객체 탐지란 무엇인가? (클래스 / 경계 상자 / 신뢰도)
객체 탐지는 단일 이미지에서 객체별로 다음과 같은 세 가지 요소로 구성된 트리플을 출력합니다.
클래스: 객체의 종류 (미리 정의된 범주 중 하나 - "사람", "자동차", "의자" 등)
경계 상자: 객체를 둘러싸는 직사각형. 일반적으로 중심점과 너비 및 높이((x, y, w, h)) 또는 좌측 상단/우측 하단 모서리((x_1, y_1, x_2, y_2))로 지정됩니다.
신뢰도: 모델이 특정 경계 상자와 클래스 쌍에 대해 얼마나 확신하는지를 나타내는 점수(0~1)
이미지 분류는 "이 그림은 무엇인가?"라는 단일한 답을 반환하지만, 객체 탐지는 "객체의 개수, 위치, 종류"와 같은 여러 정보를 동시에 파악해야 합니다. "객체의 개수 자체는 알 수 없다"는 속성 때문에 객체 탐지가 이미지 분류보다 근본적으로 어렵습니다. 주어진 이미지에는 객체가 하나도 없을 수도 있고, 백 개가 있을 수도 있습니다. 출력 개수가 가변적이라는 사실 자체가 아래에서 논의할 모든 기법의 근본적인 설계 제약 조건입니다.
3. 실제 객체 탐지는 어떻게 이루어질까요?
가변적인 출력 개수 문제를 해결하기 위해, 거의 모든 최신 객체 탐지 알고리즘은 동일한 2단계 파이프라인을 따릅니다. 먼저 전체 이미지에서 특징 맵을 추출하고, 그 특징 맵에 수많은 후보 위치(앵커 박스 또는 나중에 설명할 트랜스포머 "쿼리")를 배치합니다. 그리고 각 후보 위치에 대해 "객체 또는 배경"을 판별하고, 객체인 경우 "어떤 클래스인지, 정확한 위치는 어디인지"를 판별합니다.
Diagram 2 · Use the button to switch views
그림 2 — 특징 추출기(백본)는 이미지를 특징 맵으로 압축하고, 검출 헤드는 그 위에 분류와 박스 회귀를 동시에 수행합니다.
검출 헤드 내부에서는 두 가지 회귀/분류 문제가 동시에 효과적으로 해결됩니다. "이 후보 위치에 객체가 있는가? 있다면 어떤 클래스인가?" 그리고 "이 후보(앵커)를 실제 객체와 정렬하기 위해 얼마나 이동시켜야 하는가?" 이 두 가지를 가중합 손실로 결합한 것이 Fast R-CNN 이후 널리 사용되는 멀티태스크 손실입니다.
여기서 p은 예측된 클래스 확률이고, p^{*}은 실제 클래스, t은 예측된 박스 보정값, 그리고 t^{*}은 실제 박스에서 도출된 목표 보정값입니다. \mathbb{1}[p^{*} > 0] 지표는 "배경이 아닌 실제 객체를 포함하는 후보에 대해서만 위치 회귀 오류를 계산한다"는 의미입니다. 배경 후보는 회귀할 실제 박스가 없으므로 이러한 제한은 자연스럽습니다. \lambda는 분류에 대한 회귀 항의 가중치를 조정합니다.
4. 랜드마크 검출 알고리즘
검출 알고리즘의 계보는 "후보 영역을 어떻게 좁혀나가는가"와 "박스 자체를 어떻게 예측하는가"라는 두 가지 축을 따라 추적하는 것이 가장 쉽습니다.
R-CNN(Girshick 외, 2014)은 고전적인 이미지 처리 알고리즘인 선택적 탐색(Selective Search)을 사용하여 이미지에서 약 2,000개의 후보 영역을 추출한 다음, 각 영역을 개별적으로 CNN에 입력하여 분류했습니다. 정확도는 높았지만, CNN이 후보 영역마다 한 번씩 실행되어야 했기 때문에 속도가 매우 느렸습니다.
Fast R-CNN(Girshick, 2015)은 전체 이미지를 CNN에 한 번만 입력하여 단일 특징 맵을 생성한 다음, 해당 특징 맵에서 후보 영역을 추출하는 방식(RoI 풀링)을 사용하여 영역별 중복 계산을 제거했습니다.
Faster R-CNN(Ren, He, Girshick, Sun, 2015)은 한 단계 더 나아가 후보 영역 생성 자체를 소형 영역 제안 네트워크(RPN)로 대체하여 제안 생성, 분류 및 회귀를 단일 네트워크에 통합했습니다. 이 세 가지 세대의 알고리즘이 바로 2단계 검출기의 계보를 이룹니다.
SSD(Liu et al., 2016)와 YOLO(Redmon et al., 2015–2016)는 후보 영역 단계를 완전히 생략하고 특징 맵의 각 위치에서 클래스와 바운딩 박스를 직접 예측하는 원스테이지 검출기를 개척했습니다. 속도는 비약적으로 향상되었지만, 초기 YOLO는 작은 객체 처리 정확도에서 투스테이지 검출기에 비해 뒤처졌습니다.
RetinaNet(Lin et al., 2017)은 원스테이지 검출기의 고질적인 문제였던 클래스 불균형, 즉 배경 후보의 수가 객체 후보보다 훨씬 많아 학습이 배경 후보에 의해 지배되는 문제를 새로운 손실 함수인 Focal Loss를 통해 해결하여 원스테이지 검출기도 투스테이지 검출기와 동등한 정확도를 달성할 수 있음을 보여주었습니다.
FCOS(Tian et al., 2019)는 앵커 박스를 아예 사용하지 않는 방식을 채택했습니다. 다양한 크기와 종횡비의 앵커 박스 세트를 미리 정의하는 대신, 각 특징 맵 픽셀에서 객체 경계까지의 거리를 직접 회귀 분석하여 앵커 설계에 필요한 하이퍼파라미터 조정을 생략했습니다.
DETR, Deformable DETR, DINO는 트랜스포머를 이용한 객체 탐지를 집합 예측 문제로 재구성했습니다. 이는 다음 섹션에서 자세히 다룹니다.
5. 2단계 vs. 1단계
2단계 및 1단계 객체 탐지기는 단 하나의 질문에서 차이를 보입니다. 바로 후보 영역 축소가 독립적인 단계로 존재하는가 하는 것입니다.
| 종횡비 | 2단계 (예: Faster R-CNN) | 1단계 (예: YOLO) |
|---|---|
| 흐름 | 제안 생성(RPN) → 영역별 분류 및 회귀 | 특징 맵의 모든 위치에서 직접 분류 및 회귀 |
| 정확도 | 일반적으로 높음, 특히 작고 밀집된 객체에서 | 최근 세대는 대부분의 격차를 줄임 |
| 추론 속도 | 상대적으로 느림(후보별 작업 유지) | 빠름, 실시간에 적합 |
| 계산 비용 | 후보 개수에 비례 | 이미지 크기에 대략 비례, 예측 가능 |
| 구현/튜닝 난이도 | 단계가 많을수록 더 복잡함 | 파이프라인이 더 간단함 |
| 적용 분야 | 오프라인 처리, 정확도 우선 검사/분석 | 차량 및 로봇의 실시간 인식 |
두 계열 모두 오랫동안 중복되는 후보를 제거하기 위한 후처리로 비최대 억제(NMS)에 의존해 왔습니다. 하나의 객체에 대해 생성된 여러 후보 박스 중에서, 다른 박스와의 겹침(IoU: Intersection over Union, 교차 영역/합집합)이 임계값을 초과하는 박스는 다음 정의에 따라 제거됩니다.
\text{IoU}(A, B) = \frac{|A \cap B|}{|A \cup B|}
A와 B는 두 박스가 차지하는 영역입니다. 이 두 박스의 겹치는 영역을 합집합 영역으로 나누면 0에서 1 사이의 점수가 나옵니다. IoU 값이 높을수록 두 박스가 동일한 객체를 가리킬 가능성이 높으므로, 신뢰도가 낮은 박스는 제거됩니다. NMS는 작동하지만, 밀집된 객체에서는 오작동할 수 있습니다. 다음에 설명할 DETR 계열은 이러한 약점을 완전히 해결했습니다.
DETR(Carion et al., 2020, Facebook AI)은 객체 탐지의 핵심적인 공식을 바꾸어 놓았습니다. 앵커나 NMS 없이, 이미지 특징을 트랜스포머 인코더를 통해 처리하고, 고정된 개수의 "쿼리"(후보 객체를 나타내는 학습 가능한 벡터)를 디코더에 통과시켜 정확히 그 개수만큼의 박스-클래스 쌍을 직접 출력합니다. 학습 과정에서 예측 집합과 실제 집합은 헝가리안 알고리즘을 통해 일대일로 매칭되고, 손실은 이 매칭에 대해 계산됩니다.
y_i은 i번째 실제 객체이고, \hat{y}_{\sigma(i)}은 순열 \sigma에 따라 해당 객체에 할당된 예측이며, \mathfrak{S}_N은 N개 요소의 모든 순열 집합입니다. 이는 최소 총비용으로 예측값을 실제값에 일대일로 할당하는 순열 \hat{\sigma}을 찾으라는 의미입니다. 이 할당이 완료된 후에야 일반적인 분류 및 회귀 손실을 계산할 수 있습니다. 어떤 객체도 두 개 이상의 예측값을 할당받을 수 없으므로, NMS(Non-Machine Selection)는 구조적으로 불필요합니다.
DETR에는 단점이 있었습니다. 전체 이미지에 대한 완전한 셀프 어텐션은 비용이 많이 들고, 모델이 수렴하는 데 엄청난 수의 학습 에포크가 필요했습니다. 변형 가능한 DETR(Zhu et al., 2020)은 각 쿼리가 전체 이미지가 아닌 학습된 작은 샘플링 포인트 집합에만 집중하는 변형 가능한 어텐션 메커니즘을 도입하여 계산 비용을 줄이고 수렴 속도를 크게 향상시켰습니다. DINO(Zhang et al., 2022; "개선된 노이즈 제거 앵커 박스를 사용한 DETR")는 학습 안정성을 위한 대조 노이즈 제거 쿼리와 특징 맵에서 쿼리 초기화를 위한 혼합 쿼리 선택과 같은 기법을 추가하여 당시 DETR 계열 검출기 중 최고의 정확도를 달성했습니다. 트랜스포머 기반 검출기는 이제 YOLO 계열과 함께 실제 운영 환경에서 사용되는 두 가지 주요 방향 중 하나로 자리매김했습니다.
7. 시맨틱 분할이란 무엇인가?
시맨틱 분할은 이미지의 모든 픽셀에 대해 해당 픽셀이 어떤 클래스에 속하는지 예측합니다. 출력은 바운딩 박스가 아니라 입력 이미지와 동일한 해상도의 "클래스 맵"이며, 모든 픽셀은 클래스 ID를 가집니다.
객체 검출이 객체를 대략적인 직사각형으로 표현하는 반면, 시맨틱 분할은 픽셀 해상도로 객체의 실제 윤곽선을 표현할 수 있습니다. 이는 도로 경계석처럼 가늘고 길쭉한 모양이나 나뭇가지처럼 복잡한 윤곽선을 처리하는 데 매우 효과적입니다. 단점은 다음과 같습니다. 동일한 클래스의 객체가 프레임에 여러 개 나타나더라도 의미 분할(Semantic Segmentation)은 이들을 구분하지 못합니다. 모든 "사람" 픽셀이 같은 색으로 칠해지기 때문에 개체 수를 셀 수 없습니다. 이러한 문제를 해결하기 위해 인스턴스 분할(Instance Segmentation)이 개발되었으며, 이에 대해서는 아래에서 자세히 설명합니다.
8. 랜드마크 분할 알고리즘
FCN(완전 합성곱 네트워크; Long, Shelhamer, Darrell, 2015)은 이미지 분류 CNN에서 완전 연결 계층을 제거하고 합성곱 계층만 남겨, 입력 크기에 관계없이 픽셀 단위 예측을 직접 수행할 수 있도록 했습니다. 이는 의미 분할을 단일의 엔드투엔드 학습 가능한 네트워크로 구현한 최초의 설계로, 이 분야의 출발점입니다.
U-Net(Ronneberger 외, 2015)은 의료 영상 분할을 위해 제안되었으며, 인코더(특징 추출 시 다운샘플링)와 디코더(복원 시 업샘플링)를 대칭적으로 배치하고, 해상도가 같은 인코더와 디코더 레이어를 "스킵 연결"을 통해 직접 연결합니다. 이러한 설계는 미세한 경계 디테일을 보존하면서도 고해상도 출력을 생성하며, 의료 분야를 넘어 다양한 분야로 널리 보급된 표준 아키텍처가 되었습니다.
SegNet(Badrinarayanan 외)은 인코더 풀링 과정에서 최대값을 갖는 위치("풀링 인덱스")를 기억하고, 디코더 업샘플링 과정에서 해당 기록을 재사용하여 경계를 효율적으로 복원합니다. PSPNet(Zhao 외, 2017)은 피라미드 풀링 모듈을 도입하여 여러 스케일의 영역에 걸쳐 특징을 평균화함으로써, 좁은 수용 영역만으로는 놓칠 수 있는 전체 이미지 컨텍스트를 포착합니다.
DeepLab 시리즈(Chen et al.)는 커널 탭 사이의 간격을 넓혀 해상도를 희생하지 않고 수용 영역을 확장하는 확장형(atrous) 컨볼루션을 핵심으로 삼았으며, v1부터 v3+ (2018)까지 발전해 왔습니다. HRNet(Wang et al., 2019)은 기존 접근 방식을 뒤집어, 다운샘플링 후 해상도를 복원하는 대신, 고해상도 특징 스트림을 네트워크 전체에 걸쳐 병렬로 유지하고 해상도 간 정보를 지속적으로 교환합니다.
SegFormer(Xie et al., 2021)는 계층적 Transformer 인코더와 경량 MLP 전용 디코더를 결합하여 놀랍도록 단순한 설계로 높은 정확도와 효율성을 달성했습니다. Mask2Former(Cheng et al., 2022)는 분할을 "각각 하나의 마스크와 하나의 클래스를 예측하는 고정된 수의 쿼리"로 재구성하고, "마스크 어텐션"을 통해 각 쿼리의 관심을 이전 레이어에서 예측된 마스크 영역으로 제한함으로써 빠른 수렴과 시맨틱, 인스턴스, 파놉틱 분할을 모두 처리하는 단일 아키텍처를 제공합니다.
9. 객체 탐지/시맨틱/인스턴스/파놉틱 비교
지금까지 소개한 네 가지 작업은 두 가지 축, 즉 동일 클래스의 개별 인스턴스를 구별하는지 여부와 도로, 하늘, 벽과 같이 무수히 많은 "배경"을 처리하는지 여부를 기준으로 정리하면 명확해집니다.
작업
출력 단위
인스턴스 구별 여부
배경 처리 여부
랜드마크 알고리즘
주요 지표
객체 탐지
바운딩 박스
예 (인스턴스당 하나의 박스)
아니오
Faster R-CNN, YOLO, DETR
mAP
의미론적 분할
픽셀별 클래스 레이블
아니오 (동일 클래스는 하나의 색상으로 병합)
예
FCN, DeepLab, SegFormer
mIoU
인스턴스 분할
픽셀별 마스크
예 (인스턴스별 별도 마스크)
아니오
Mask R-CNN, Mask2Former
AP (마스크-IoU 기반)
파놉틱 분할
픽셀별 클래스 + 인스턴스 ID
예 (전경만)
예 (클래스만, 인스턴스 ID 없음)
Panoptic FPN, Mask2Former
PQ (파놉틱 품질)
표에서 알 수 있듯이, 파놉틱 분할(Kirillov 외, 2019년 제안)은 인스턴스 분할과 의미론적 분할의 장점을 모두 결합한 방식입니다. 전경 객체(사람이나 자동차와 같은 셀 수 있는 사물)는 인스턴스 분할에서처럼 인스턴스별로 구분됩니다. 배경(도로, 하늘 등 셀 수 없이 많은 요소)은 의미 분할(Semantic Segmentation)에서처럼 클래스 레이블만 부여받습니다. 단일 이미지를 완벽하고 철저하게 설명하려는 경우, 결국 이 파노라마 형태에 도달하게 되는데, 이는 네 가지 작업이 어떻게 연관되는지 파악하는 데 유용한 방법입니다.
평가 지표인 mIoU(평균 교차합)는 각 클래스 c에 대해 실제 영역 G_c과 예측 영역 P_c 간의 교차합 비율을 계산한 후 모든 클래스에 걸쳐 평균을 냅니다.
탐지 작업의 mAP가 박스 수준에서의 일치도를 평가하는 반면, mIoU는 픽셀 수준에서의 일치도를 평가합니다. 이러한 지표의 차이는 각 작업이 "정확"하다고 간주하는 기준의 차이를 정확히 반영합니다.
10. 3D 객체 탐지
자율주행 차량과 로봇은 2D 이미지뿐 아니라 LiDAR 포인트 클라우드에서 객체의 3D 위치, 크기, 방향을 직접 탐지해야 하는 경우가 많습니다. 포인트 클라우드는 2D 이미지처럼 격자 구조를 가지고 있지 않기 때문에 CNN이 그대로 처리할 수 없습니다. 이러한 불규칙한 데이터를 규칙적인 형태로 변환하는 것이 3D 객체 탐지의 핵심 설계 과제입니다.
SECOND(Yan et al., 2018)는 포인트 클라우드를 3D 복셀(입방체 셀)로 나누고 희소 컨볼루션을 사용하여 포인트가 없는 복셀을 건너뛰어 3D CNN의 연산 비용을 크게 줄였습니다. PointPillars(Lang et al., 2019)는 이를 더욱 간소화하여 포인트를 복셀 대신 수직 "기둥"으로 집계함으로써 네트워크가 3D 컨볼루션이 아닌 일반 2D 컨볼루션으로 처리할 수 있도록 하여 속도를 크게 향상시켰습니다.
PV-RCNN(Shi et al., 2020)은 복셀 기반 처리의 효율성과 포인트를 직접 처리하여 얻는 정밀한 위치 파악 능력(PointNet 방식)을 결합한 하이브리드 포인트-복셀 설계를 제시했습니다. CenterPoint(Yin et al., 2021)는 앵커를 사용하지 않는 3D 객체 탐지 방식을 도입했습니다. 객체를 단일 중심점으로 탐지한 후, 거기에서 너비, 높이, 깊이, 방향을 회귀 분석하여 PointPillars 또는 VoxelNet 방식의 백본과 결합하여 높은 정확도를 구현했습니다.
이러한 방법들은 공통적으로 한 가지 설계 아이디어를 공유합니다. 바로 탐지 헤드를 실행하기 전에 포인트 클라우드 정보를 조감도(BEV, Bird's-Eye View)로 투영하는 것입니다. 조감도는 위에서 내려다본 2D 특징 맵입니다. 높이 정보를 압축하여 제거함으로써 세부 묘사는 다소 손실되지만, 일반적인 2D 탐지기와 동일한 프레임워크 내에서 "도로 표면 어디에 객체가 있는지"와 같은 운전에 가장 중요한 관계 정보를 처리할 수 있습니다.
11. 3D 시맨틱 분할
3D 시맨틱 분할은 포인트 클라우드(또는 LiDAR에서 반사된 모든 레이저 신호)의 모든 점에 클래스 레이블을 할당합니다. 불규칙한 포인트 클라우드 데이터를 처리하는 방식이 주요 접근 방식들을 구분하는 핵심입니다.
PointNet++(Qi et al., 2017)는 점들을 복셀화나 다른 변환 과정 없이 그대로 네트워크에 입력하여, 인접한 점들을 그룹화하고 특징을 계층적으로 집계함으로써 포인트 기반 방법의 토대를 마련했습니다. RandLA-Net(Hu et al., 2020)은 대규모 포인트 클라우드 처리의 주요 문제점이었던 이웃 검색 병목 현상을 해결하기 위해, 무작위 샘플링과 무작위 샘플링으로 인해 손실될 수 있는 정보를 보완하는 로컬 특징 집계 모듈을 결합하여 도시 규모의 포인트 클라우드에서도 실용적인 속도를 달성했습니다.
RangeNet++(Milioto 외, 2019)는 3D 처리를 완전히 생략합니다. LiDAR 자체의 스캔 순서를 사용하여 포인트 클라우드를 2D "거리 이미지"로 투영하고, 일반적인 2D CNN을 실행한 다음 결과를 다시 3D로 투영합니다. 이를 통해 2D CNN 툴링의 성숙도를 활용하여 속도를 향상시킵니다. Cylinder3D(Zhu 외, 2021)는 실외 LiDAR 포인트 클라우드가 센서에서 바깥쪽으로 방사되는 특성을 파악하고, 거리에 따른 밀도 감소를 처리하기 위해 직교 좌표계가 아닌 원통 좌표계로 복셀화했습니다. SPVNAS(Tang 외, 2020)는 희소 포인트-복셀 컨볼루션을 통해 포인트 기반 처리와 복셀 기반 처리를 융합한 다음, 신경 아키텍처 검색(NAS)을 적용하여 정확도와 속도 간의 균형이 우수한 구성을 자동으로 찾습니다.
2D의 경우와 마찬가지로, 3D 시맨틱 분할의 역사는 "점을 그대로 유지하는 방식"(점 기반)과 "규칙적인 격자로 변환하는 방식"(복셀 또는 범위 이미지 기반) 사이에서 끊임없이 변화해 왔으며, 각 방식은 정확도, 속도, 메모리 사용량 측면에서 서로 다른 장단점을 가지고 있습니다.
12. 실제 적용에서 적절한 접근 방식 선택
어떤 객체 탐지 또는 분할 방식을 사용할지, 그리고 어떤 특정 알고리즘을 사용할지는 사용 사례에 따라 크게 달라집니다.
로봇 팔/물건 집기: 잡아야 할 대상의 정확한 윤곽을 아는 것이 중요하므로 인스턴스 분할(예: Mask2Former)이 가장 적합합니다. 경계 상자만으로는 객체의 실제 모양이나 적절한 파지 지점을 파악할 수 없습니다.
자율 주행: 실시간 성능은 필수적이므로 2D에서는 YOLO 제품군과 같은 단일 단계 검출기를, 3D에서는 PointPillars 또는 CenterPoint와 같이 효율성에 초점을 맞춘 전기차 기반 3D 검출기를 사용합니다. 주행 가능 영역을 파악하기 위해 의미론적/파놉틱 분할 기술이 추가적으로 활용됩니다.
감시/보안 카메라: 감지 대상(사람, 차량)은 일반적으로 제한적이며, 검출 실패가 속도보다 중요하기 때문에 이중 단계 검출기 또는 고정밀 트랜스포머 기반 검출기가 사용됩니다.
AR/VR: 현실 세계에서 가상 객체를 어디에 배치할지 결정할 때는 일반적으로 의미론적 분할을 사용하여 평면과 객체 영역을 식별한 다음, 센서 융합(관련 기사 참조)을 적용하여 진정한 3D 정렬을 수행합니다.
리소스가 제한된 엣지 디바이스에서는 일반적으로 정확도보다 속도와 메모리 사용량이 우선시됩니다. 따라서 경량 YOLO 변형이나 간소화된 SegFormer가 적합합니다. 정밀한 오프라인 분석(의료 영상, 위성 영상)에서는 정확도가 최우선이므로 2단계 검출기 또는 Mask2Former 계열 모델이 선호됩니다. 실제로 실시간 성능과 정확도 사이의 절충점이 선택에 있어 가장 중요한 요소입니다.
최신 개발 동향(NMS 없는 아키텍처, 개방형 어휘 검출, Segment Anything 제품군의 기본 모델)은 객체 검출 기술 동향 및 시맨틱 분할 기술 동향을 참조하십시오.
13. 요약
객체 검출은 객체를 사각형으로 포착하고, 시맨틱 분할은 픽셀 단위로 포착합니다. 이 두 가지는 서로 다른 해상도에서 작동하는 이미지 이해 작업입니다. 객체 검출의 계보는 2단계 검출(Faster R-CNN)에서 1단계 검출(YOLO)을 거쳐 앵커와 NMS를 완전히 제거한 트랜스포머 기반 검출기(DETR/DINO)로 이어집니다. 객체 분할의 계보는 FCN에서 U-Net, DeepLab을 거쳐 트랜스포머 기반 SegFormer/Mask2Former로 이어집니다. 이러한 기반 위에 객체별 구분을 추가하는 인스턴스 분할, 두 가지를 모두 통합하는 파노라마 분할, 그리고 3D 포인트 클라우드 기반 분할 방식이 있습니다. 어떤 방식을 선택할지는 정확성이 중요한지 속도가 중요한지에 따라 결정됩니다.
댓글
먼저 로그인해 주세요.
아직 데이터가 없습니다.