Contents — find the section you need

YOLO ailesi, pratik nesne algılamada en yaygın kullanılan yaklaşımlardan biri olmaya devam etti ve 2023'teki YOLOv8'den bu yana geliştirme çalışmaları sürdürüldü. Ultralytics tarafından 10 Eylül 2024'te piyasaya sürülen YOLO11, YOLOv8 ile aynı "omurga → boyun → kafa" ana hatlarını korurken, içindeki blokları yeniden tasarladı. Bu makale, resmi dokümantasyon ve model tanımlama YAML dosyalarından elde edilen birincil bilgiler, denklemler ve diyagramlar kullanarak YOLO11'in neleri değiştirdiğini ve neleri koruduğunu doğrulamaktadır.

Bu makale, Ultralytics resmi dokümantasyonuna (docs.ultralytics.com), resmi GitHub deposundaki yapılandırma dosyalarına ve “YOLOv11 Gizemini Çözme” (arXiv:2604.03349) ön baskısına dayanmaktadır.

0. Neler öğreneceksiniz

  • YOLO11'in YOLOv8'den özellikle neleri değiştirdiği, C3k2 ve C2PSA dahil
  • Çapa içermeyen algılama başlığının koordinatları nasıl tahmin ettiği, DFL dahil
  • Eğitim için kullanılan kayıp fonksiyonları ve veri artırma yöntemleri
  • Resmi ölçümler kullanılarak, n/s/m/l/x olmak üzere beş boyutta doğruluk, parametre sayısı ve hızın nasıl değiştiği
  • YOLO11'i ne zaman seçmeli ve başka bir seçeneği ne zaman düşünmelisiniz

1. YOLO11 nedir?

YOLO11, Ultralytics tarafından geliştirilen ve piyasaya sürülen bir nesil gerçek zamanlı nesne algılama modelidir. YOLOv8'in üç aşamalı "omurga, boyun ve kafa" tasarımını korur, özellik çıkarma bloklarını yeni tasarlanmış C3k2 ile değiştirir ve omurganın sonuna C2PSA uzamsal dikkat bloğunu ekler. Aynı genel mimari, tek bir çerçeve içinde algılama, segmentasyon, poz tahmini, sınıflandırma, yönlendirilmiş sınırlayıcı kutular (OBB) ve izlemeyi kapsar.

2. Bu yeniden tasarım neden gerekliydi?

O zamanlar YOLOv8, güçlü bir doğruluk-hız dengesine sahip tek aşamalı bir dedektör olarak yaygın olarak kullanılıyordu, ancak iki alanda hala iyileştirme alanı vardı. Birincisi parametre verimliliği idi. Aynı doğruluk daha az parametre ve FLOP ile elde edilebilirse, uç cihazlarda ve pille çalışan robotlarda kullanım daha pratik hale gelir. İkincisi, özellik haritasında nereye odaklanılacağını öğrenmek için açık bir mekanizmanın olmaması idi. YOLOv8'in omurgası, evrişimlerle özellikler oluşturur, ancak önemli bölgeleri arka plandan ayırmak için özel bir mekanizmaya sahip değildir. C3k2 ve C2PSA bu iki sorunu sırasıyla ele alır.

3. Giriş nedir?

Birçok diğer YOLO dedektöründe olduğu gibi, YOLO11 de sabit boyutta (varsayılan olarak 640 × 640 piksel) yeniden boyutlandırılmış ve dolgulu bir RGB görüntüsü alır. Hem eğitim hem de çıkarım sırasında, giriş, toplu bir [B, 3, H, W] tensörü olarak işlenir. Tescilli normalizasyon veya yama bölme gibi özel ön işlemeye gerek yoktur: Mozaik gibi standart artırmalardan sonraki görüntüler doğrudan omurgaya iletilir.

4. Ne tahmin eder?

Görüntüdeki her nesne için çıktı, bir sınıf, sınırlayıcı kutu koordinatları ve bir güven puanı içerir. YOLO11, sınıflandırma ve kutu regresyon dallarını ayıran ayrıştırılmış bir başlık kullanır. Ayrıca çapa içermeyen bir algoritmadır, bu nedenle önceden tanımlanmış çapa kutuları olmadan doğrudan koordinatları tahmin eder. Her ızgara konumundan nesne sınırına olan mesafeyi tahmin etme fikri, YOLO11'i çapa içermeyen dedektörlerin FCOS ailesine bağlar. Çeşitli en boy oranları ve ölçekler için önceden tanımlanmış kutuların kaldırılması, hiperparametre ayarını azaltır ve aşırı en boy oranlarına sahip nesnelere genelleme yeteneğini geliştirebilir.

5. Temel mimari

YOLOv8 gibi, YOLO11 de üç aşamalı “omurga → boyun → kafa” yapısını izler. Değişiklik, bu aşamaların içeriklerindedir.

Diagram 1 · Use the button to switch views
YOLO11 basic pipeline Flow from a 640 by 640 input image through a backbone containing C3k2 blocks, SPPF, and C2PSA spatial attention, into multi-scale P3/P4/P5 features, bidirectional fusion in a PAN-FPN neck, and an anchor-free detection head. Input image 640×640 Backbone C3k2 blocks SPPF C2PSA (spatial attention) Multi-scale P3/P4/P5 Neck PAN-FPN C3k2 blocks High- and low-level features fused both ways Head Anchor-free Box branch: DFL Cls branch: depthwise separable convolution Class + box coordinates + confidence

Şekil 1 — YOLO11'in omurgası, boynu ve başı. Mavi ile vurgulanmış kutular, YOLOv8'den değiştirilen parçalardır. C3k2, hem omurgada hem de boyunda temel bloğu değiştirirken, C2PSA omurganın sonuna, SPPF'den hemen sonra eklenir.

Omurga, P3, P4 ve P5 olmak üzere üç çözünürlükte özellik haritaları üretir. Boyun (PAN-FPN: Yol Birleştirme Ağı + Özellik Piramit Ağı), hem yüksek hem de düşük çözünürlüklü özellikleri her iki yönde birleştirerek aynı ağın küçük ve büyük nesneleri algılamasına olanak tanır. Bu çok ölçekli birleştirme iskeleti YOLOv8'den değişmemiştir. Değişen şey, temel blok olarak C2f'nin yerine C3k2'nin kullanılması ve omurga çıkışına C2PSA'nın eklenmesidir.

6. Bileşenlerin Teknik Detayları

C3k2 — C2f'nin Genelleştirilmiş Hali

YOLOv8, temel birim olarak CSP (Çapraz Aşama Kısmi) yapısına sahip C2f bloğunu kullanmıştır. C2f, giriş kanallarını iki yola ayırır, birini birkaç Bottleneck bloğundan geçirir, diğerini kısayol olarak bırakır, ardından her Bottleneck'ten gelen her iki çıktıyı ve ara çıktıları birleştirerek 1 × 1 evrişimle birleştirir.

YOLO11, tekrarlayan iç bloklar fikrini korurken, iç blok tipini yapılandırılabilir hale getiriyor. Resmi model tanımında (YAML), C3k2 içindeki her blok, yapıcı bayraklarına bağlı olarak aşağıdakilerden biri olabilir:

  1. Normal bir Bottleneck (küçük n modeli tarafından kullanılır)
  2. Bir C3k bloğu (yapılandırılabilir çekirdek boyutuna sahip bir C3 yapısı, orta ve daha büyük m/l/x modellerinde c3k=True ile birlikte kullanılır)
  3. Bir Bottleneck + PSABlock çifti (omurganın sonunda C2PSA içinde kullanılır)

Başka bir deyişle, C3k2 genelleştirilmiş bir bloktur: C2f fikrini korurken, iç Bottleneck'lerinin model boyutuna ve yerleşimine göre hafif bloklardan dikkat donanımlı bloklara kadar değişmesine izin verir. Bir uygulama detayı, bu iç bileşenleri değiştirerek tek bir YAML yapılandırmasının tüm beş boyutu (n/s/m/l/x) kapsamasıdır.

C2PSA — omurgaya uzamsal dikkat ekleme

C2PSA (Uzamsal Dikkatli Çapraz Aşamalı Kısmi), SPPF'den (Uzamsal Piramit Havuzlama - Hızlı, alıcı alanı birden fazla havuzlama boyutuyla genişleten bir modül) hemen sonra eklenen yeni bir YOLO11 bloğudur. C2PSA ayrıca bir CSP yapısını takip eder: bir yol birkaç PSABlok'tan geçer. Her PSABlok, artık yollarla bağlanan çok başlı öz dikkat (MHSA) ve iki katmanlı ileri beslemeli bir ağı (FFN) birleştirir.

z = x + \text{MHSA}(x), \qquad y = z + \text{FFN}(z)

Burada x giriş özelliğidir, \text{MHSA} çok başlı öz dikkattir ve \text{FFN} iki katmanlı ileri beslemeli ağdır. YOLOv8'in yalnızca evrişim tabanlı omurgasına kıyasla, C2PSA, özellik haritasındaki uzak konumlar arasındaki ilişkileri doğrudan öğrenmek için öz dikkat mekanizmasını kullanır. Evrişimin yerel alıcı alanını tamamlar ve görüntünün önemli bölgelerine ağırlık verilmesine yardımcı olur.

Çapa içermeyen algılama başlığı ve DFL

YOLO11'in algılama başlığı, sınıflandırma ve kutu regresyonunu ayrı dallara ayırır. Önceden tanımlanmış çapa kutuları kullanmaz; bunun yerine, özellik haritasındaki her ızgara noktası, nesne sınırına olan mesafeyi doğrudan tahmin eder. Dört yönün her biri için, kutu regresyon dalı, \text{reg\_max}=16 ayrık bölme üzerinde bir olasılık dağılımı üretir ve beklenen değerini sürekli mesafe olarak kullanır. Bu, YOLOv8'den miras alınan ve Li vd. tarafından "Genelleştirilmiş Odak Kaybı"nda (NeurIPS 2020) önerilen Dağıtılmış Odak Kaybı (DFL) fikrinin temelini oluşturmaktadır.

\hat{d} = \sum_{i=0}^{\text{reg\_max}-1} P(i) \cdot i, \qquad \sum_{i=0}^{\text{reg\_max}-1} P(i) = 1

Sınır mesafesi için tek bir gerçek değerin doğrudan regresyonu yerine, model olası bölmeler üzerinde ayrık bir dağılım öğrenir. Bu, belirsiz veya örtülü konturlara sahip nesneler için belirsizliği ifade etmeye olanak tanırken eğitimi daha kararlı hale getirir. YOLO11 ayrıca, sıradan evrişime kıyasla parametre sayısını ve hesaplamayı azaltan derinlemesine ayrılabilir evrişimi kullanmak için sınıflandırma dalını değiştirir.

Kayıp fonksiyonları ve eğitim yöntemi

YOLO11'in eğitim kaybı, kutu regresyonu için CIoU (Tam IoU) kaybının, koordinat dağılımı için DFL kaybının ve sınıflandırma için BCE (ikili çapraz entropi) kaybının ağırlıklı toplamıdır.

\mathcal{L} = \lambda_{box}\,\mathcal{L}_{CIoU} + \lambda_{dfl}\,\mathcal{L}_{DFL} + \lambda_{cls}\,\mathcal{L}_{BCE}

CIoU kaybı, yalnızca IoU'yu (örtüşme oranı) değil, aynı zamanda kutu merkezleri arasındaki mesafeyi ve en boy oranlarının ne kadar yakın eşleştiğini de değerlendirir.

\mathcal{L}_{CIoU} = 1 - IoU + \frac{\rho^2(b, b^{gt})}{c^2} + \alpha v, \qquad v = \frac{4}{\pi^2}\left(\arctan\frac{w^{gt}}{h^{gt}} - \arctan\frac{w}{h}\right)^2

\rho(b, b^{gt}), tahmin edilen ve gerçek kutu merkezleri arasındaki Öklid mesafesidir, c, her iki kutuyu da çevreleyen en küçük dikdörtgenin köşegen uzunluğudur, v, en boy oranı uyumsuzluğunu temsil eder ve \alpha, IoU arttıkça v'ye daha fazla ağırlık veren bir katsayıdır. Kutular üst üste binmediğinde, yalnızca IoU'yu optimize etmek neredeyse hiç gradyan sağlamaz; merkez mesafesi ve en boy oranı terimleri bu sorunu hafifletir.

Eğitim, birkaç görüntüyü birleştiren Mozaik; iki görüntüyü harmanlayan MixUp; bir nesne bölgesini başka bir görüntüye yapıştıran Kopyala-Yapıştır; rastgele dönüşümleri otomatik olarak seçen RandAugment; ve rastgele dikdörtgen bir bölgeyi kaldıran Silme gibi artırma yöntemlerini kullanır. Bu ayrıntılar, “YOLOv11 Gizemini Çözme” (arXiv:2604.03349) makalesindeki açıklamayı takip etmektedir.

7. Model Varyantlarının Karşılaştırılması

YOLO11, farklı parametre sayıları ve hesaplama gereksinimleriyle beş boyutta mevcuttur: n (nano), s (küçük), m (orta), l (büyük) ve x (ekstra büyük). Aşağıdakiler, 640 px girişli COCO val2017 üzerinde Ultralytics resmi dokümantasyonunda bildirilen kıyaslama değerleridir.

Model mAP50-95 Parametreler FLOP'lar CPU ONNX çıkarımı T4 TensorRT çıkarımı
YOLO11n 39.5 2.6M 6.5B 56.1 ± 0.8 ms 1,5 ± 0,0 ms
YOLO11s 47,0 9,4M 21,6B 90,0 ± 1,2 ms 2,5 ± 0,0 ms
YOLO11m 51,5 20,1M 68,1B 183,2 ± 2,0 ms 4,7 ± 0,1 ms
YOLO11l 53,4 25,3M 87,2B 238,6 ± 1,4 ms 6,2 ± 0,1 ms
YOLO11x 54,7 56,9M 195,3B 462,8 ± 6,7 ms 11,3 ± 0,2 ms

Kaynak: Ultralytics YOLO11 resmi dokümantasyonu. CPU ONNX çıkarımı ONNX Runtime kullanır; T4 TensorRT çıkarımı ise NVIDIA T4 GPU üzerinde FP16'dır.

İki pratik nokta öne çıkıyor. Birincisi, parametre sayısı n'den x'e yaklaşık 22 kat artarken, mAP50-95 yalnızca yaklaşık 15 puan artarak 39,5'ten 54,7'ye çıkıyor: doğruluk ve model boyutu doğrusal olarak ilişkili değil. İkincisi, m ve l arasındaki farkı düşünün. Parametreler yalnızca 20,1M'den 25,3M'ye yükselirken, mAP 51,5'ten 53,4'e ve GPU çıkarım süresi 4,7 ms'den 6,2 ms'ye çıkıyor. Bu nedenle, m'den l'ye geçişin getirisi, n → s → m adımlarındaki getiriden biraz daha küçüktür. Bu sayılar, uç sistemlerde n/s ve doğruluğun öncelikli olduğu sabit sistemlerde l/x'i desteklemektedir.

YOLOv8 ile Nicel Karşılaştırma

YOLO11'in yanına aynı Ultralytics dokümanında bildirilen YOLOv8 değerlerini koymak, nesil değişimini daha somut hale getiriyor.

Model mAP50-95 (v8 → v11) Parametreler (v8 → v11) FLOP'lar (v8 → v11) CPU ONNX çıkarımı (v8 → v11)
n 37.3 → 39.5 3.2M → 2.6M 8.7B → 6.5B 80.4ms → 56.1ms
s 44.9 → 47.0 11.2M → 9.4M 28.6B → 21.6B 128,4 ms → 90,0 ms
m 50,2 → 51,5 25,9 Milyon → 20,1 Milyon 78.9B → 68.1B 234,7 ms → 183,2 ms
ben 52,9 → 53,4 43,7 Milyon → 25,3 Milyon 165.1B → 87.2B 375,2 ms → 238,6 ms
x 53,9 → 54,7 68,2 Milyon → 56,9 Milyon 257,8B → 195,3B 479,1 ms → 462,8 ms

Kaynak: YOLOv8 resmi dokümantasyonu ve YOLO11 resmi dokümantasyonu (COCO val2017, 640 piksel, her ikisi için de CPU ONNX çıkarımı).

l boyutu için, parametre sayısı 43,7M'den 25,3M'ye, neredeyse yarı yarıya düşerken, mAP biraz iyileşiyor. C3k2 ve C2PSA'nın parametre verimliliği etkisi burada en belirgin şekilde görülüyor. x için, parametreler ve FLOP'lar önemli ölçüde azalırken, CPU çıkarım süresi yalnızca biraz iyileşiyor; bu da C2PSA'daki öz dikkat hesaplamasının büyük modeller için bir darboğaz haline gelebileceğini gösteriyor.

Tek bir cümleyle özetlemek gerekirse, YOLO11, YOLOv8'e göre daha az parametre ve FLOP ile en azından karşılaştırılabilir bir mAP elde etmeye doğru ilerliyor. Bu, her zaman YOLOv8'i geçtiği anlamına gelmez: göreve ve veri setine bağlı olarak, eski nesil hala daha yüksek mutlak doğruluk bildirebilir. Nesne algılama trendleri makalesi de bu noktayı ele alıyor.

YOLO11'i Algılamanın Ötesine Genişletmek

YOLO11, nesne algılama ile sınırlı değildir. Aynı omurga ve boynu korurken yalnızca başı değiştirerek, çerçeve örnek bölümleme (YOLO11-seg), poz tahmini (anahtar nokta koordinatlarını regresyonla hesaplayan YOLO11-pose), sınıflandırma (YOLO11-cls), yönlendirilmiş sınırlayıcı kutu algılama (eğik nesnelerin yönünü de regresyonla hesaplayan YOLO11-obb) ve birden fazla karede izleme işlemlerini kapsar. C3k2 ve C2PSA omurgayı iyileştirdiği için, bu görevlerin tümüne faydaları paylaşılır. Bu aynı zamanda YOLO11'in yalnızca bir algılama modeli değil, ortak bir görsel tanıma temeli olarak tasarlandığını da gösterir.

8. Zorlandığı Noktalar

YOLO11, YOLO ailesine özgü zayıf yönleri korur. Küçük ve uzak nesneler hala zorlayıcıdır. Omurga kademeli olarak çözünürlüğü azalttığı için, yalnızca birkaç piksel genişliğindeki bir nesne, daha derin katmanlara ulaştığında neredeyse tüm ayırt edici özelliklerini kaybedebilir. C2PSA bunu kısmen hafifletir, ancak temelden çözmez.

Birçok benzer nesne içeren yoğun sahneler de zorlayıcıdır. DFL ve CIoU sınır regresyonunu iyileştirir, ancak kalabalık veya bir meyve bahçesindeki yoğun meyve gibi sınırları üst üste gelen komşu nesneler hala yanlış tespitlere ve kaçırmalara neden olabilir.

Alan kaymasına duyarlılık, CNN tabanlı dedektörler için genel bir sorundur. Doğruluk, eğitim verilerinden önemli ölçüde farklı aydınlatma, hava koşulları veya kamera açıları altında keskin bir şekilde düşebilir. C2PSA, Transformer tabanlı DETR ailesi kadar geniş bir alıcı alan sağlamaz, bu nedenle YOLO11 bu açıdan daha az sağlam olabilir.

YOLO11 ayrıca AGPL-3.0 lisansı altında yayınlanmıştır. Ticari bir dağıtım, kaynak kodunun gizli tutulmasını gerektiriyorsa, Ultralytics Kurumsal Lisansı gereklidir. Bu teknik bir zayıflık değil, kolayca gözden kaçırılabilecek pratik bir kısıtlamadır.

9. Pratikte Nasıl Seçilir

Uç cihazlar ve pille çalışan robotlar için, çıkarım hızı ve parametre sayısı genellikle kısıtlamalardır ve bu da YOLO11n/s'yi ilk adaylar yapar. n modelinin yaklaşık 56 ms'lik CPU çıkarımı, sistemin geri kalanına bağlı olarak, Raspberry Pi sınıfı gömülü donanımlarda çalışmayı gerçekçi hale getirebilir.

Drone'lardan ve diğer hareketli platformlardan havadan inceleme için, küçük nesne tespiti merkezi öneme sahiptir. Daha büyük bir YOLO11 modeli seçmek yerine, giriş çözünürlüğünü artırın veya döşemeli çıkarım kullanın. Bazı raporlar, bu alanda deforme edilebilir dikkat mekanizmalı DETR varyantlarına avantaj vermektedir, bu nedenle doğruluk öncelikli olduğunda RT-DETR ve diğer aileler makul karşılaştırmalardır.

Sabit depo veya fabrika kameralarıyla yapılan incelemeler için, GPU kaynakları mevcut olduğunda ve doğruluk öncelikli olduğunda YOLO11l/x seçenekleri mevcuttur. Ancak burada bile, RF-DETR gibi Transformer tabanlı dedektörler COCO'da 60 mAP'den fazla değer bildirmiştir, bu nedenle YOLO artık tek seçenek değildir. Ayrıntılar için nesne algılama trendleri makalesine bakın.

Araştırma ve prototipleme için, Ultralytics'in Python paketinin olgunluğu, YOLO11'i seçmek için pratik bir nedendir: eğitim, çıkarım ve dışa aktarma birkaç satırda ifade edilebilir. Lisanslama kısıtlamaları kabul edilebilir olduğunda, çalışan bir temel elde etme hızı önemli bir avantaj olmaya devam etmektedir.

10. Üç satırlık özet

  • YOLO11, YOLOv8'in omurga-boyun-baş yapısını korur, temel bloklarını C3k2 ile değiştirir ve C2PSA aracılığıyla uzamsal dikkat ekler.

  • Çapa içermeyen başlığı, sınır mesafelerini DFL dağılımlarının beklenen değeri olarak tahmin ederken, CIoU birlikte örtüşmeyi, merkez mesafesini ve en boy oranını optimize eder.

  • Parametre verimliliği n'den x'e doğru artar, ancak küçük nesneler, yoğun sahneler ve alan kayması YOLO ailesi dedektörleri için ortak zorluklar olmaya devam etmektedir.

Nesne tespiti ve anlamsal segmentasyona daha temel bir giriş için Nesne Tespiti ve Anlamsal Segmentasyon: Bir Giriş makalesine bakın. NMS içermeyen yaklaşımlar ve DETR modellerinden gelen rekabet de dahil olmak üzere YOLO ailesindeki güncel eğilimler için nesne tespiti eğilimleri makalesine bakın.

Referanslar

Anlayışınızı kontrol edin
Yüksek bir tespit puanı, konumun ve sınıfın doğru olduğunu garanti eder mi?

Puan, bir model çıktısıdır, doğruluğun garantisi değildir. Tespit edilen kutuların yerelleştirme doğruluğundan ayrı olarak, farklı eşiklerde hassasiyeti ve geri çağırmayı değerlendirin.

What to read next

Review the backgroundNesne Algılama ve Semantik Bölümleme Temel Bilgileri — Bir Görüntüden "Nerede Ne Var"ı OkumaContinue the seriesSegFormer'a Kapsamlı Bir Kılavuz — Konumsal Kodlama Olmayan Bir Transformer'ın Segmentasyon İçin Neden İşe YaradığıExplore another aspect of this fieldYerel LLM'lerin performans testleri: ilk yanıt süresi, üretim hızı ve bellek