Contents — find the section you need
YOLO 제품군은 실용적인 객체 탐지에 가장 널리 사용되는 접근 방식 중 하나로, 2023년 YOLOv8 출시 이후 지속적인 개발이 이루어졌습니다. 2024년 9월 10일 Ultralytics에서 출시된 YOLO11은 YOLOv8과 동일한 "백본 → 넥 → 헤드" 구조를 유지하면서 내부 블록을 재설계했습니다. 이 글에서는 공식 문서와 모델 정의 YAML 파일, 그리고 관련 방정식과 다이어그램을 바탕으로 YOLO11에서 변경된 부분과 유지된 부분을 검증합니다.
본 문서는 Ultralytics 공식 문서(docs.ultralytics.com), 공식 GitHub 저장소의 설정 파일, 그리고 사전 공개 논문 "YOLOv11 Demystified"(arXiv:2604.03349)를 기반으로 작성되었습니다.
0. 학습 내용
- YOLO11이 YOLOv8에서 구체적으로 변경된 사항(C3k2 및 C2PSA 포함)
- 앵커 없는 객체 탐지 헤드의 좌표 예측 방식(DFL 포함)
- 학습에 사용되는 손실 함수 및 데이터 증강 방법
- 공식 측정값을 사용하여 n/s/m/l/x의 다섯 가지 크기에 따른 정확도, 파라미터 개수 및 속도 변화
- YOLO11을 선택해야 하는 경우와 다른 옵션을 고려해야 하는 경우
1. YOLO11이란 무엇인가?
YOLO11은 Ultralytics에서 개발 및 출시한 차세대 실시간 객체 탐지 모델입니다. YOLOv8의 3단계 "백본, 넥, 헤드" 설계를 유지하면서, 특징 추출 블록을 새롭게 설계된 C3k2로 교체하고, 백본 끝에 C2PSA 공간 어텐션 블록을 추가했습니다. 동일한 기본 아키텍처를 통해 객체 검출, 분할, 자세 추정, 분류, 방향성 바운딩 박스(OBB) 생성, 추적을 하나의 프레임워크 내에서 수행할 수 있습니다.
2. 왜 이러한 재설계가 필요했을까요?
당시 YOLOv8은 정확도와 속도의 균형이 뛰어난 단일 단계 객체 검출기로 널리 사용되었지만, 두 가지 개선점이 있었습니다. 첫 번째는 매개변수 효율성이었습니다. 더 적은 매개변수와 FLOPs로 동일한 정확도를 달성할 수 있다면, 엣지 디바이스나 배터리 구동 로봇에 적용하는 것이 더욱 실용적이게 됩니다. 두 번째는 특징 맵에서 어디에 초점을 맞춰야 할지 학습하는 명확한 메커니즘의 부재였습니다. YOLOv8의 백본은 컨볼루션을 통해 특징을 생성하지만, 중요한 영역을 배경에서 분리하는 전용 메커니즘이 없었습니다. C3k2와 C2PSA는 각각 이 두 가지 문제를 해결합니다.
3. 입력은 무엇인가요?
다른 많은 YOLO 검출기와 마찬가지로 YOLO11은 고정 크기(기본값 640 × 640 픽셀)의 크기 조정 및 패딩된 RGB 이미지를 입력으로 받습니다. 학습 및 추론 과정에서 입력은 배치 처리된 [B, 3, H, W] 텐서로 처리됩니다. 독자적인 정규화나 패치 분할과 같은 특별한 전처리는 필요하지 않습니다. Mosaic과 같은 표준 증강을 거친 이미지는 백본에 직접 전달됩니다.
4. 무엇을 예측하나요?
이미지의 각 객체에 대해 클래스, 바운딩 박스 좌표 및 신뢰도 점수가 출력됩니다. YOLO11은 분류 및 박스 회귀 분기를 분리하는 분리형 헤드를 사용합니다. 또한 앵커 프리 방식이므로 미리 정의된 앵커 박스 없이 좌표를 직접 회귀합니다. 각 그리드 위치에서 객체 경계까지의 거리를 예측하는 아이디어는 YOLO11을 앵커리스 검출기 계열인 FCOS 계열과 연결합니다. 여러 종횡비와 크기에 대해 미리 정의된 박스를 제거함으로써 하이퍼파라미터 튜닝을 줄이고 극단적인 종횡비를 가진 객체에 대한 일반화 성능을 향상시킬 수 있습니다.
5. 기본 아키텍처
YOLOv8과 마찬가지로 YOLO11은 "백본 → 넥 → 헤드"의 3단계 구조를 따릅니다. 차이점은 이러한 단계의 내용에 있습니다.
그림 1 — YOLO11의 백본, 넥, 헤드. 파란색으로 강조된 부분은 YOLOv8에서 변경된 부분입니다. C3k2는 백본과 넥 모두에서 기본 블록을 대체하고, C2PSA는 백본의 끝, SPPF 바로 뒤에 추가되었습니다.
백본은 P3, P4, P5의 세 가지 해상도로 특징 맵을 출력합니다. 넥(PAN-FPN: 경로 집계 네트워크 + 특징 피라미드 네트워크)은 고해상도 및 저해상도 특징을 양방향으로 융합하여 동일한 네트워크가 크고 작은 객체를 모두 감지할 수 있도록 합니다. 이 다중 스케일 융합 골격은 YOLOv8에서 변경되지 않았습니다. 변경된 사항은 기본 블록인 C2f가 C3k2로 대체되었고, 백본 출력에 C2PSA가 추가되었다는 점입니다.
6. 구성 요소의 기술적 세부 사항
C3k2 — C2f의 일반화
YOLOv8은 CSP(Cross Stage Partial) 구조를 가진 C2f 블록을 기본 단위로 사용했습니다. C2f는 입력 채널을 두 경로로 분할하여 하나는 여러 Bottleneck 블록을 통과시키고, 다른 하나는 단축 경로로 남겨둔 다음, 두 출력과 각 Bottleneck의 중간 출력을 모두 연결하고 1×1 컨볼루션으로 병합합니다.
YOLO11은 내부 블록을 반복하는 개념을 유지하면서 내부 블록 유형을 구성 가능하게 만들었습니다. 공식 모델 정의(YAML)에서 C3k2 내부의 각 블록은 생성자 플래그에 따라 다음 중 하나가 될 수 있습니다.
- 일반적인
Bottleneck(작은 n 모델에서 사용) C3k블록 (구성 가능한 커널 크기를 가진 C3 구조체로, 중간 및 큰 m/l/x 모델에서c3k=True과 함께 사용)Bottleneck + PSABlock쌍 (백본 끝의 C2PSA 내부에서 사용)
즉, C3k2는 일반화된 블록입니다. C2f의 개념을 유지하면서 내부 병목 현상이 모델 크기와 배치에 따라 경량 블록부터 어텐션 기능을 갖춘 블록까지 다양하게 나타날 수 있도록 합니다. 구현 세부 사항은 이러한 내부 구성 요소를 전환하여 하나의 YAML 설정으로 n/s/m/l/x의 다섯 가지 크기를 모두 처리할 수 있다는 것입니다.
C2PSA — 백본에 공간 어텐션 추가
C2PSA(Cross Stage Partial with Spatial Attention)는 SPPF(Spatial Pyramid Pooling - Fast, 수용 영역을 여러 풀링 크기로 확장하는 모듈) 바로 뒤에 삽입된 새로운 YOLO11 블록입니다. C2PSA 또한 CSP 구조를 따르며, 하나의 경로가 여러 PSABlock을 통과합니다. 각 PSABlock은 멀티 헤드 셀프 어텐션(MHSA)과 2층 피드포워드 네트워크(FFN)를 결합하고, 잔여 경로로 연결합니다.
여기서 x은 입력 특징, \text{MHSA}은 멀티 헤드 셀프 어텐션, \text{FFN}은 2층 피드포워드 네트워크입니다. YOLOv8의 컨볼루션 전용 백본과 비교하여, C2PSA는 셀프 어텐션을 사용하여 특징 맵에서 멀리 떨어진 위치 간의 관계를 직접 학습합니다. 컨볼루션의 로컬 수용 영역을 보완하여 이미지의 중요한 영역에 가중치를 집중시키는 데 도움을 줍니다.
앵커 없는 객체 검출 헤드 및 DFL
YOLO11의 객체 검출 헤드는 분류와 박스 회귀를 분리된 분기로 나눕니다. 미리 정의된 앵커 박스를 사용하지 않고, 특징 맵의 각 그리드 포인트가 객체 경계까지의 거리를 직접 예측합니다. 네 방향 각각에 대해 박스 회귀 분기는 \text{reg\_max}=16개의 이산 빈에 대한 확률 분포를 출력하고, 그 기대값을 연속적인 거리로 사용합니다. 이는 YOLOv8에서 계승되어 Li 등이 "Generalized Focal Loss"(NeurIPS 2020)에서 제안한 분포 초점 손실(DFL)의 기본 개념입니다.
모델은 경계까지의 거리에 대한 단일 실수 값을 직접 회귀하는 대신, 가능성이 높은 빈에 대한 이산 분포를 학습합니다. 이를 통해 학습 안정성을 높이는 동시에, 윤곽선이 모호하거나 가려진 객체에 대한 불확실성을 분포에 반영할 수 있습니다. YOLO11은 또한 분류 분기에서 깊이별 분리 컨볼루션(depthwise-separable convolution)을 사용하여 일반 컨볼루션에 비해 파라미터 개수와 계산량을 줄였습니다.
손실 함수 및 학습 방법
YOLO11의 학습 손실은 박스 회귀의 경우 CIoU(Complete IoU) 손실, 좌표 분포의 경우 DFL 손실, 분류의 경우 BCE(binary cross-entropy) 손실의 가중 합입니다.
CIoU 손실은 IoU(겹침 비율)뿐만 아니라 박스 중심 간의 거리와 종횡비 일치도도 평가합니다.
\rho(b, b^{gt})은 예측된 박스 중심과 실제 박스 중심 사이의 유클리드 거리이고, c은 두 박스를 모두 포함하는 가장 작은 직사각형의 대각선 길이이며, v은 종횡비 불일치를 나타내고, \alpha은 IoU이 증가함에 따라 v에 더 큰 가중치를 부여하는 계수입니다. 박스가 겹치지 않을 때 IoU만 최적화하면 거의 기울기를 얻을 수 없지만, 중심 거리와 종횡비 항을 통해 이 문제를 완화할 수 있습니다.
학습에는 Mosaic(여러 이미지를 결합), MixUp(두 이미지를 혼합), Copy-Paste(객체 영역을 다른 이미지에 붙여넣기), RandAugment(랜덤 변환 자동 선택), Erasing(임의의 직사각형 영역 제거) 등의 증강 기법이 사용됩니다. 이 내용은 "YOLOv11 Demystified"(arXiv:2604.03349)에 설명된 내용을 따릅니다.
7. 모델 변형 비교
YOLO11은 파라미터 개수와 연산 요구 사항이 다른 다섯 가지 크기(n(나노), s(소형), m(중형), l(대형), x(초대형))로 제공됩니다. 다음은 Ultralytics 공식 문서에 보고된 COCO val2017 데이터셋을 사용한 640픽셀 입력에 대한 벤치마크 값입니다.
| 모델 | mAP50-95 | 파라미터 | FLOPs | CPU ONNX 추론 | T4 TensorRT 추론 |
|---|---|---|---|---|---|
| YOLO11n | 39.5 | 2.6M | 6.5B | 56.1 ± 0.8 ms | 1.5 ± 0.0 ms |
| YOLO11s | 47.0 | 9.4M | 21.6B | 90.0 ± 1.2 ms | 2.5 ± 0.0 ms |
| YOLO11m | 51.5 | 20.1M | 68.1B | 183.2 ± 2.0 ms | 4.7 ± 0.1 ms |
| YOLO11l | 53.4 | 25.3M | 87.2B | 238.6 ± 1.4 ms | 6.2 ± 0.1 ms |
| YOLO11x | 54.7 | 56.9M | 195.3B | 462.8 ± 6.7 ms | 11.3 ± 0.2 ms |
출처: Ultralytics YOLO11 공식 문서. CPU ONNX 추론은 ONNX 런타임을 사용하고, T4 TensorRT 추론은 NVIDIA T4 GPU에서 FP16으로 수행됩니다.
두 가지 중요한 실질적인 점이 눈에 띕니다. 첫째, 파라미터 개수는 n에서 x로 증가함에 따라 약 22배 증가하는 반면, mAP50-95는 39.5에서 54.7로 약 15점만 상승합니다. 즉, 정확도와 모델 크기는 선형적인 관계가 아닙니다. 둘째, m과 l 사이의 차이를 고려해 보십시오. 파라미터 개수는 2010만 개에서 2530만 개로 증가하는 반면, mAP는 51.5에서 53.4로, GPU 추론 시간은 4.7ms에서 6.2ms로 증가합니다. 따라서 m에서 l로의 전환으로 인한 성능 향상은 n → s → m 단계보다 다소 작습니다. 이러한 수치는 엣지 컴퓨팅 환경에서는 n/s 방식이, 정확도가 우선시되는 고정 시스템에서는 l/x 방식이 적합함을 보여줍니다.
YOLOv8과의 정량적 비교
동일한 Ultralytics 문서에 보고된 YOLOv8 값을 YOLO11 값과 나란히 비교함으로써 세대 변화를 더욱 명확하게 확인할 수 있습니다.
| 모델 | mAP50-95 (v8 → v11) | 파라미터 (v8 → v11) | FLOPs (v8 → v11) | CPU ONNX 추론 (v8 → v11) |
|---|---|---|---|---|
| n | 37.3 → 39.5 | 3.2M → 2.6M | 8.7B → 6.5B | 80.4ms → 56.1ms |
| s | 44.9 → 47.0 | 11.2M → 9.4M | 28.6B → 21.6B | 128.4ms → 90.0ms |
| 남 | 50.2 → 51.5 | 25.9M → 20.1M | 78.9B → 68.1B | 234.7ms → 183.2ms |
| 내가 | 52.9 → 53.4 | 43.7M → 25.3M | 165.1B → 87.2B | 375.2ms → 238.6ms |
| 엑스 | 53.9 → 54.7 | 68.2M → 56.9M | 257.8B → 195.3B | 479.1ms → 462.8ms |
출처: YOLOv8 공식 문서 및 YOLO11 공식 문서 (COCO val2017, 640px, 두 모델 모두 CPU ONNX 추론 사용).
l 크기의 경우, 파라미터 개수가 4370만 개에서 2530만 개로 거의 절반으로 줄어들었으며, mAP는 약간 향상되었습니다. 이는 C3k2와 C2PSA의 파라미터 효율성 효과가 가장 두드러지는 부분입니다. x 크기의 경우, 파라미터와 FLOPs는 크게 감소했지만 CPU 추론 시간은 약간만 개선되어, C2PSA의 셀프 어텐션 연산이 대규모 모델에서 병목 현상을 일으킬 수 있음을 시사합니다.
요컨대, YOLO11은 YOLOv8보다 적은 파라미터와 FLOPs로 최소한 동등한 mAP를 달성하는 방향으로 나아가고 있습니다. 그렇다고 해서 YOLO11이 항상 YOLOv8보다 우수하다는 의미는 아닙니다. 작업과 데이터셋에 따라 이전 세대 모델이 여전히 더 높은 절대 정확도를 보일 수 있습니다. 객체 탐지 트렌드에서도 이 점을 다루고 있습니다.
YOLO11의 객체 탐지 외 확장
YOLO11은 객체 탐지에만 국한되지 않습니다. 기존의 백본과 목 부분을 유지하면서 머리 부분만 교체함으로써, 인스턴스 분할(YOLO11-seg), 자세 추정(YOLO11-pose, 키포인트 좌표 회귀), 분류(YOLO11-cls), 방향 바운딩 박스 탐지(YOLO11-obb, 기울어진 객체의 방향도 회귀), 그리고 다중 프레임 추적까지 구현할 수 있습니다. C3k2와 C2PSA는 백본을 개선하기 때문에 이러한 개선 사항들이 여러 작업에 걸쳐 적용됩니다. 이는 YOLO11이 단순히 객체 탐지 모델이 아니라, 일반적인 시각 인식 기반 모델로 설계되었음을 보여줍니다.
8. 한계점
YOLO11은 YOLO 계열 모델의 공통적인 약점을 여전히 가지고 있습니다. 작고 멀리 있는 객체를 처리하는 데 어려움을 느낍니다. 백본이 점진적으로 해상도를 낮추기 때문에, 불과 몇 픽셀 크기의 객체라도 더 깊은 레이어에 도달할 때쯤이면 특징적인 형태를 거의 모두 잃을 수 있습니다. C2PSA는 이러한 문제를 부분적으로 완화하지만, 근본적으로 해결하지는 못합니다.
유사한 객체가 많은 밀집된 장면 또한 어려운 문제입니다. DFL과 CIoU는 경계 회귀를 개선하지만, 군중이나 과수원의 빽빽하게 들어찬 과일처럼 경계가 겹치는 인접 객체는 여전히 오탐지 및 탐지 실패를 유발할 수 있습니다.
도메인 시프트에 대한 민감도는 CNN 기반 검출기의 일반적인 문제입니다. 조명, 날씨 또는 카메라 각도가 훈련 데이터와 크게 다를 경우 정확도가 급격히 떨어질 수 있습니다. C2PSA는 Transformer 기반 DETR 계열만큼 넓은 수용 영역을 제공하지 않으므로 YOLO11은 이 점에서 다소 취약할 수 있습니다.
YOLO11은 AGPL-3.0 라이선스로 배포됩니다. 상업적 배포 시 소스 코드의 비공개 유지가 필요한 경우 Ultralytics Enterprise 라이선스가 필요합니다. 이는 기술적인 약점이 아니라, 간과하기 쉬운 실질적인 제약 조건입니다.
9. 실제 적용 방법
엣지 디바이스 및 배터리 구동 로봇의 경우, 추론 속도와 파라미터 개수가 중요한 제약 조건이므로 YOLO11n/s가 가장 먼저 고려되는 모델입니다. n 모델의 CPU 추론 시간이 약 56ms에 불과하여 시스템 사양에 따라 Raspberry Pi급 임베디드 하드웨어에서도 현실적인 성능을 발휘할 수 있습니다.
드론 및 기타 이동 플랫폼을 이용한 공중 검사의 경우, 작은 물체 탐지가 핵심입니다. 단순히 더 큰 YOLO11 모델을 선택하는 대신, 입력 해상도를 높이거나 타일링 추론을 사용하는 것이 좋습니다. 일부 연구에서는 변형 어텐션(deformable-attention) 기반의 DETR 변형 모델이 이 분야에서 유리하다고 보고하고 있으므로, 정확도가 우선시될 경우 RT-DETR 및 기타 계열 모델을 비교해 볼 수 있습니다.
고정식 창고 또는 공장 카메라를 이용한 검사의 경우, GPU 자원을 활용할 수 있고 정확도가 우선시된다면 YOLO11l/x를 고려해 볼 수 있습니다. 심지어 여기에서도 RF-DETR과 같은 Transformer 기반 검출기가 COCO 데이터셋에서 60 mAP 이상의 성능을 보여주었기 때문에 YOLO가 더 이상 유일한 선택지는 아닙니다. 자세한 내용은 객체 검출 트렌드 글을 참조하세요.
연구 및 프로토타이핑의 경우, Ultralytics의 Python 패키지가 이미 완성도가 높다는 점이 YOLO11을 선택하는 실질적인 이유입니다. 학습, 추론, 내보내기를 단 몇 줄의 코드로 구현할 수 있습니다. 라이선스 제약이 허용된다면, 작동하는 기준선을 빠르게 구축할 수 있다는 점은 여전히 큰 장점입니다.
10. 세 줄 요약
-
YOLO11은 YOLOv8의 백본-넥-헤드 구조를 유지하면서 기본 블록을 C3k2로 대체하고 C2PSA를 통해 공간 어텐션을 추가했습니다.
-
앵커가 없는 헤드는 DFL 분포의 기대값을 경계 거리로 예측하며, CIoU는 오버랩, 중심 거리, 종횡비를 동시에 최적화합니다.
-
파라미터 효율성은 n에서 x로 갈수록 향상되지만, 작은 객체, 밀집된 장면, 도메인 시프트는 YOLO 계열 검출기에서 여전히 해결해야 할 과제입니다.
객체 검출 및 의미론적 분할에 대한 보다 기본적인 소개는 객체 검출 및 의미론적 분할: 소개를 참조하십시오. NMS(Non-Mechanical System)를 사용하지 않는 접근 방식과 DETR 모델과의 경쟁을 포함한 YOLO 계열의 최신 동향은 객체 검출 동향을 참조하십시오.
참고 자료
- Ultralytics YOLO11 공식 문서
- Ultralytics: YOLO 아키텍처 가이드
- Ultralytics: 앵커 없는 객체 탐지기로서 YOLO11의 장점
- YOLO11 공식 모델 구성(GitHub)
- YOLOv11 이해하기: 고성능 객체 탐지를 위한 실용 가이드(arXiv:2604.03349)
- 일반화된 초점 손실: 밀집 객체 탐지를 위한 적합하고 분산된 경계 상자 학습(NeurIPS 2020, arXiv:2006.04388)
- Ultralytics 라이선스
높은 탐지 점수가 위치와 클래스의 정확성을 보장하나요?
점수는 모델 출력일 뿐 정확성을 보장하는 것은 아닙니다. 탐지된 박스의 위치 정확도와는 별도로 다양한 임계값에서 정밀도와 재현율을 평가하세요.
댓글
먼저 로그인해 주세요.
아직 데이터가 없습니다.