Contents — find the section you need

객체 탐지는 이미지에서 객체의 위치(바운딩 박스)와 범주를 동시에 추정하는 작업입니다. YOLO 계열 탐지기는 오랫동안 상용 환경에서 널리 사용되어 왔지만, 2026년에는 트랜스포머 기반 탐지기가 그 자리를 진정으로 위협할 정도로 발전할 것으로 예상됩니다.

이 글에서는 연구 동향을 살펴보고 먼저 핵심 개념을 간략하게 소개합니다.

객체 탐지 그림객체 탐지

YOLO/Ultralytics의 공식 로고를 라이선스 없이 사용할 수 없어 바운딩 박스 탐지를 나타내는 간단한 아이콘을 대신 사용했습니다.

탐지기 설계 분할 개요

Diagram 1 · Use the button to switch views
많은 밀집 후보 박스를 생성하고 필터링하는 탐지기 계보와 일대일 객체 쿼리를 사용하는 DETR 계보 비교. 두 계보 모두 박스, 클래스 및 신뢰도를 생성합니다.

다이어그램: Duskcoil. 밀집 예측과 집합 예측 간의 대표적인 설계 분할을 보여줍니다.

모든 객체 탐지기는 입력 이미지를 특징으로 변환하고 최종적으로 위치, 범주 및 신뢰도를 반환합니다. 주요 차이점은 많은 후보 박스를 생성하는지 여부입니다. 중복을 나중에 제거하거나, 학습된 객체 쿼리를 정답과 일대일로 매칭하여 중복이 적은 집합을 직접 예측합니다. 이러한 선택은 NMS(비최대 억제)의 필요성, 학습 목표, 속도 및 혼잡한 장면에서의 동작에 영향을 미칩니다.

YOLO 제품군의 현황: NMS 없는 아키텍처

기존의 NMS는 동일한 객체에 대해 생성된 여러 후보 박스 중에서 최종적으로 하나의 박스만 남기는 후처리 단계입니다. 이 과정에서 다른 박스와의 겹침(IoU: Intersection over Union, 두 박스의 겹치는 영역을 합집합 영역으로 나눈 값)이 임계값을 초과하는 박스는 제거합니다.

\text{IoU}(A, B) = \frac{|A \cap B|}{|A \cup B|}

이 후처리는 네트워크 외부에서 독립적으로 실행되며, 임계값 설정에 대한 경험적 조정이 필요하고, 밀집된 실제 객체를 잘못 제거하는 경향이 있다는 단점이 있습니다. YOLO의 최신 세대인 YOLO26은 NMS가 필요 없는 아키텍처를 채택하여 후처리 단계인 NMS를 더 이상 사용하지 않습니다. 이는 수년간 표준으로 사용되어 왔습니다. NMS는 추론 파이프라인에서 컴퓨팅 비용과 지연 시간 모두에 병목 현상을 일으키는 경향이 있으며, 이를 제거함으로써 추론 속도와 구현 단순성을 모두 향상시킬 수 있습니다. 순수 처리량 측면에서도 경량 고속 모델은 여전히 풍부합니다. 예를 들어 RTMDet은 300FPS를 넘습니다.

트랜스포머 기반 검출기의 부상: RF-DETR 및 RT-DETRv2

또 다른 중요한 흐름은 DETR(DEtection TRansformer) 계열이 실용적인 성숙 단계에 접어들었다는 것입니다. RT-DETR/RT-DETRv2는 CNN과 트랜스포머를 결합한 모델로, YOLO 계열처럼 NMS 없이 최종 검출 결과를 직접 출력하도록 설계되었습니다.

2026년의 가장 큰 사건은 ICLR 2026에서 발표된 RF-DETR의 등장입니다. 이 모델은 COCO 벤치마크에서 60mAP를 돌파한 최초의 실시간 모델로 알려져 있으며, RF100-VL 벤치마크에서도 선두를 달리고 있습니다. 도메인 전송을 평가합니다. 라이선스는 상업적 사용에 관대한 Apache 2.0으로, AGPL 라이선스를 사용하는 YOLO26/YOLOv12와는 대조적입니다.

텍스트 프롬프트를 통한 개방형 어휘 탐지

또 다른 중요한 발전은 "개방형 어휘 탐지"입니다. 이는 모델이 학습하지 않은 범주를 탐지하는 것을 의미합니다. YOLO-World와 Grounding DINO는 추가 학습 데이터 없이 텍스트 프롬프트만으로 임의의 범주를 탐지할 수 있습니다. 이는 고정된 클래스 목록에 국한된 탐지 방식에서 벗어난 사고방식의 전환이며, 실제 세계의 범주를 사전에 완전히 열거할 수 없는 사용 사례에 적합합니다. 예를 들어 범용 로봇의 객체 인식에 유용합니다.

NMS(Non-Machine System)를 사용하지 않는 기술적 메커니즘

YOLO26이 NMS를 사용하지 않는 탐지 방식을 채택한 것은 단순히 후처리 단계를 생략한 것이 아니라, 학습 방법 자체를 변경한 데서 비롯됩니다. 기존 YOLO 설계는 학습 과정에서 객체당 여러 개의 예측 박스를 허용했습니다. (일대다 할당) 방식은 NMS(Non-Mixed System)가 추론 후 중복을 제거한다는 가정 하에 구현되었습니다. YOLO26은 예측 헤드를 재설계하여 일대일 할당 방식으로 전환했습니다. 이를 통해 학습 단계부터 객체 인스턴스당 하나의 명확한 바운딩 박스를 출력합니다. 또한 바운딩 박스 회귀에 사용되는 분포 기반 접근 방식(Distribution Focal Loss)을 더 가볍고 하드웨어 친화적인 파라미터화 방식으로 대체하여 컴파일러와 런타임에 따라 불안정한 경향이 있는 연산을 줄였습니다. 결과적으로 CPU에서 추론 속도가 최대 43% 향상되었으며, 전반적인 후처리 구현도 간소화되었습니다.

RF-DETR 역시 NMS를 사용하지 않지만, YOLO26과는 다른 메커니즘을 사용합니다. RF-DETR은 사전 학습된 Vision Transformer인 DINOv2를 백본으로 사용하여 다중 해상도 특징을 추출하고, 학습 가능한 쿼리(후보 객체를 나타내는 추상적 표현)와 함께 작동하는 디코더를 통과시킵니다. 각 디코더 레이어는 셀프 어텐션(쿼리 간의 관계 포착), 변형 가능한 객체로 구성됩니다. 크로스 어텐션(이미지 특징 내에서 학습된 소수의 샘플링 포인트에만 집중)과 예측을 개선하는 피드포워드 네트워크가 결합된 형태입니다. 이러한 "학습된 소수의 포인트만 살펴보는" 변형 가능한 어텐션은 표준 트랜스포머 크로스 어텐션보다 계산 비용을 낮추면서도 고유하고 집합 기반의 예측을 생성합니다. 바로 이러한 이유로 NMS(Non-Mechanical Score)가 불필요해지는 것입니다.

세대 간 비교 실제 결과: YOLOv8/v11/v26

또한 "새로운 세대가 항상 더 높은 정확도를 보장한다"는 가정에 반하는 데이터가 나타났습니다. 2026년 8월에 실시된 벤치마크 테스트는 3개의 YOLO 세대와 5개의 모델 스케일을 대상으로 과수원 탐지 및 인스턴스 분할에서 미세 구조(가지, 과일, 기타 작은 물체)를 목표로 진행되었으며, 50분 95초 동안 가장 높은 mAP를 기록한 것은 YOLOv26이 아니라 YOLOv11s-960(0.402 마스크 mAP@50분 95)이었습니다. 0.426 박스 mAP@50:95). 한편, YOLOv26s-960은 약 1,037만 개의 파라미터만으로도 거의 비슷한 정확도를 달성했습니다. 따라서 드러나는 것은 각 세대마다 정확도 향상이 균일하게 나타나는 것은 아니지만, 파라미터 효율성(훨씬 적은 연산량으로 높은 정확도를 달성하는 것)은 꾸준히 발전하고 있다는 점입니다.

소형 객체 탐지는 여전히 해결되지 않은 과제입니다. 2026년 8월, 군용 차량 탐지를 위해 6개의 YOLO 변형과 2개의 DETR 변형을 비교한 평가에서 일관된 패턴이 발견되었습니다. 대형 모델의 성능이 더 우수하고, DETR 기반 접근 방식이 유망하며, 미세 조정을 통해 공대지(A2G) 성능이 향상되지만, 모든 모델은 여전히 A2G 시나리오에서 소형 객체 탐지에 어려움을 겪습니다. YOLO26의 NMS(Noise-Machine System) 없는 설계나 RF-DETR의 높은 mAP도 이 "작고 멀리 있는 객체" 문제를 완전히 해결하지 못했습니다.

개방형 어휘 탐지의 발전: 구체적인 AP 수치

세대 YOLO-World/Grounding DINO 이후의 개방형 어휘 탐지기들은 2026년까지 꾸준히 정확도를 향상시켜 왔습니다. 텍스트에 구애받지 않는 쿼리를 텍스트 기반 쿼리로 변환하는 생성적 정류 흐름을 사용하는 FlowOVD(2026년 5월)는 COCO에서 49.5 AP, LVIS에서 31.5 AP를 기록했는데, 이는 Grounding DINO 대비 각각 +1.2 AP(상대적으로 +2.5%)와 +4.1 AP(상대적으로 +15.0%) 향상된 수치입니다. 2026년 8월에 발표된 OPUS는 텍스트, 시각(대화형/일반), 혼합형 등 다양한 프롬프트 유형을 단일 통합 프레임워크 내에서 처리하며, 복잡한 교차 모달 융합을 피하는 단순한 설계에도 불구하고 COCO, LVIS-minival, ODinW35 벤치마크에서 각각 68.1/69.2/54.7 AP라는 최첨단 수준의 성능을 보여주었습니다. 이제 개방형 어휘 탐지는 더 이상 어려운 과제가 아닙니다. 단순히 질적인 승리, 즉 미지의 범주를 처리할 수 있는 능력만으로도 이미 고정 클래스 검출기와 양적으로 경쟁력을 갖추기 시작했습니다.

2026년의 전망

오늘날 객체 검출은 크게 두 축으로 나뉩니다. 하나는 단일 단계, NMS(Non-Machine System)가 없는 트랜스포머 아키텍처이고, 다른 하나는 잘 구축된 생태계를 가진 YOLO 제품군입니다. 트랜스포머 쪽은 빠르게 발전하고 있지만, YOLO 제품군은 풍부한 생산 실적과 강력한 툴링을 바탕으로 실시간 프로덕션 환경의 핵심으로 자리 잡고 있습니다. 사용 사례별로 살펴보면 다음과 같습니다.

  • 가장 중요한 정확도: RF-DETR
  • 생산 실적 및 생태계가 가장 중요: YOLO26/YOLOv12
  • 순수 속도: RTMDet
  • 미지의 범주 처리 필요: YOLO-World / Grounding DINO

이것이 현재의 역할 분담입니다.

이해도 확인
mAP만으로 실시간 객체 탐지기를 선택할 수 있을까요?

동일한 해상도, 데이터 및 하드웨어에서 지연 시간과 품질을 비교하세요. 사전 및 사후 처리를 제외한 추론 시간은 엔드 투 엔드 지연 시간이 아닙니다.

참고 자료

What to read next

Review the background내비게이션 기술 동향Continue the series의미론적 분할의 기술 동향Explore another aspect of this field휴머노이드 로봇 기술 동향