Contents — find the section you need
YOLO ailesi, pratik nesne algılamada en yaygın kullanılan yaklaşımlardan biri olmaya devam etti ve 2023'teki YOLOv8'den bu yana geliştirme çalışmaları sürdürüldü. Ultralytics tarafından 10 Eylül 2024'te piyasaya sürülen YOLO11, YOLOv8 ile aynı "omurga → boyun → kafa" ana hatlarını korurken, içindeki blokları yeniden tasarladı. Bu makale, resmi dokümantasyon ve model tanımlama YAML dosyalarından elde edilen birincil bilgiler, denklemler ve diyagramlar kullanarak YOLO11'in neleri değiştirdiğini ve neleri koruduğunu doğrulamaktadır.
Bu makale, Ultralytics resmi dokümantasyonuna (docs.ultralytics.com), resmi GitHub deposundaki yapılandırma dosyalarına ve “YOLOv11 Gizemini Çözme” (arXiv:2604.03349) ön baskısına dayanmaktadır.
0. Neler öğreneceksiniz
- YOLO11'in YOLOv8'den özellikle neleri değiştirdiği, C3k2 ve C2PSA dahil
- Çapa içermeyen algılama başlığının koordinatları nasıl tahmin ettiği, DFL dahil
- Eğitim için kullanılan kayıp fonksiyonları ve veri artırma yöntemleri
- Resmi ölçümler kullanılarak, n/s/m/l/x olmak üzere beş boyutta doğruluk, parametre sayısı ve hızın nasıl değiştiği
- YOLO11'i ne zaman seçmeli ve başka bir seçeneği ne zaman düşünmelisiniz
1. YOLO11 nedir?
YOLO11, Ultralytics tarafından geliştirilen ve piyasaya sürülen bir nesil gerçek zamanlı nesne algılama modelidir. YOLOv8'in üç aşamalı "omurga, boyun ve kafa" tasarımını korur, özellik çıkarma bloklarını yeni tasarlanmış C3k2 ile değiştirir ve omurganın sonuna C2PSA uzamsal dikkat bloğunu ekler. Aynı genel mimari, tek bir çerçeve içinde algılama, segmentasyon, poz tahmini, sınıflandırma, yönlendirilmiş sınırlayıcı kutular (OBB) ve izlemeyi kapsar.
2. Bu yeniden tasarım neden gerekliydi?
O zamanlar YOLOv8, güçlü bir doğruluk-hız dengesine sahip tek aşamalı bir dedektör olarak yaygın olarak kullanılıyordu, ancak iki alanda hala iyileştirme alanı vardı. Birincisi parametre verimliliği idi. Aynı doğruluk daha az parametre ve FLOP ile elde edilebilirse, uç cihazlarda ve pille çalışan robotlarda kullanım daha pratik hale gelir. İkincisi, özellik haritasında nereye odaklanılacağını öğrenmek için açık bir mekanizmanın olmaması idi. YOLOv8'in omurgası, evrişimlerle özellikler oluşturur, ancak önemli bölgeleri arka plandan ayırmak için özel bir mekanizmaya sahip değildir. C3k2 ve C2PSA bu iki sorunu sırasıyla ele alır.
3. Giriş nedir?
Birçok diğer YOLO dedektöründe olduğu gibi, YOLO11 de sabit boyutta (varsayılan olarak 640 × 640 piksel) yeniden boyutlandırılmış ve dolgulu bir RGB görüntüsü alır. Hem eğitim hem de çıkarım sırasında, giriş, toplu bir [B, 3, H, W] tensörü olarak işlenir. Tescilli normalizasyon veya yama bölme gibi özel ön işlemeye gerek yoktur: Mozaik gibi standart artırmalardan sonraki görüntüler doğrudan omurgaya iletilir.
4. Ne tahmin eder?
Görüntüdeki her nesne için çıktı, bir sınıf, sınırlayıcı kutu koordinatları ve bir güven puanı içerir. YOLO11, sınıflandırma ve kutu regresyon dallarını ayıran ayrıştırılmış bir başlık kullanır. Ayrıca çapa içermeyen bir algoritmadır, bu nedenle önceden tanımlanmış çapa kutuları olmadan doğrudan koordinatları tahmin eder. Her ızgara konumundan nesne sınırına olan mesafeyi tahmin etme fikri, YOLO11'i çapa içermeyen dedektörlerin FCOS ailesine bağlar. Çeşitli en boy oranları ve ölçekler için önceden tanımlanmış kutuların kaldırılması, hiperparametre ayarını azaltır ve aşırı en boy oranlarına sahip nesnelere genelleme yeteneğini geliştirebilir.
5. Temel mimari
YOLOv8 gibi, YOLO11 de üç aşamalı “omurga → boyun → kafa” yapısını izler. Değişiklik, bu aşamaların içeriklerindedir.
Şekil 1 — YOLO11'in omurgası, boynu ve başı. Mavi ile vurgulanmış kutular, YOLOv8'den değiştirilen parçalardır. C3k2, hem omurgada hem de boyunda temel bloğu değiştirirken, C2PSA omurganın sonuna, SPPF'den hemen sonra eklenir.
Omurga, P3, P4 ve P5 olmak üzere üç çözünürlükte özellik haritaları üretir. Boyun (PAN-FPN: Yol Birleştirme Ağı + Özellik Piramit Ağı), hem yüksek hem de düşük çözünürlüklü özellikleri her iki yönde birleştirerek aynı ağın küçük ve büyük nesneleri algılamasına olanak tanır. Bu çok ölçekli birleştirme iskeleti YOLOv8'den değişmemiştir. Değişen şey, temel blok olarak C2f'nin yerine C3k2'nin kullanılması ve omurga çıkışına C2PSA'nın eklenmesidir.
6. Bileşenlerin Teknik Detayları
C3k2 — C2f'nin Genelleştirilmiş Hali
YOLOv8, temel birim olarak CSP (Çapraz Aşama Kısmi) yapısına sahip C2f bloğunu kullanmıştır. C2f, giriş kanallarını iki yola ayırır, birini birkaç Bottleneck bloğundan geçirir, diğerini kısayol olarak bırakır, ardından her Bottleneck'ten gelen her iki çıktıyı ve ara çıktıları birleştirerek 1 × 1 evrişimle birleştirir.
YOLO11, tekrarlayan iç bloklar fikrini korurken, iç blok tipini yapılandırılabilir hale getiriyor. Resmi model tanımında (YAML), C3k2 içindeki her blok, yapıcı bayraklarına bağlı olarak aşağıdakilerden biri olabilir:
- Normal bir
Bottleneck(küçük n modeli tarafından kullanılır) - Bir
C3kbloğu (yapılandırılabilir çekirdek boyutuna sahip bir C3 yapısı, orta ve daha büyük m/l/x modellerindec3k=Trueile birlikte kullanılır) - Bir
Bottleneck + PSABlockçifti (omurganın sonunda C2PSA içinde kullanılır)
Başka bir deyişle, C3k2 genelleştirilmiş bir bloktur: C2f fikrini korurken, iç Bottleneck'lerinin model boyutuna ve yerleşimine göre hafif bloklardan dikkat donanımlı bloklara kadar değişmesine izin verir. Bir uygulama detayı, bu iç bileşenleri değiştirerek tek bir YAML yapılandırmasının tüm beş boyutu (n/s/m/l/x) kapsamasıdır.
C2PSA — omurgaya uzamsal dikkat ekleme
C2PSA (Uzamsal Dikkatli Çapraz Aşamalı Kısmi), SPPF'den (Uzamsal Piramit Havuzlama - Hızlı, alıcı alanı birden fazla havuzlama boyutuyla genişleten bir modül) hemen sonra eklenen yeni bir YOLO11 bloğudur. C2PSA ayrıca bir CSP yapısını takip eder: bir yol birkaç PSABlok'tan geçer. Her PSABlok, artık yollarla bağlanan çok başlı öz dikkat (MHSA) ve iki katmanlı ileri beslemeli bir ağı (FFN) birleştirir.
Burada x giriş özelliğidir, \text{MHSA} çok başlı öz dikkattir ve \text{FFN} iki katmanlı ileri beslemeli ağdır. YOLOv8'in yalnızca evrişim tabanlı omurgasına kıyasla, C2PSA, özellik haritasındaki uzak konumlar arasındaki ilişkileri doğrudan öğrenmek için öz dikkat mekanizmasını kullanır. Evrişimin yerel alıcı alanını tamamlar ve görüntünün önemli bölgelerine ağırlık verilmesine yardımcı olur.
Çapa içermeyen algılama başlığı ve DFL
YOLO11'in algılama başlığı, sınıflandırma ve kutu regresyonunu ayrı dallara ayırır. Önceden tanımlanmış çapa kutuları kullanmaz; bunun yerine, özellik haritasındaki her ızgara noktası, nesne sınırına olan mesafeyi doğrudan tahmin eder. Dört yönün her biri için, kutu regresyon dalı, \text{reg\_max}=16 ayrık bölme üzerinde bir olasılık dağılımı üretir ve beklenen değerini sürekli mesafe olarak kullanır. Bu, YOLOv8'den miras alınan ve Li vd. tarafından "Genelleştirilmiş Odak Kaybı"nda (NeurIPS 2020) önerilen Dağıtılmış Odak Kaybı (DFL) fikrinin temelini oluşturmaktadır.
Sınır mesafesi için tek bir gerçek değerin doğrudan regresyonu yerine, model olası bölmeler üzerinde ayrık bir dağılım öğrenir. Bu, belirsiz veya örtülü konturlara sahip nesneler için belirsizliği ifade etmeye olanak tanırken eğitimi daha kararlı hale getirir. YOLO11 ayrıca, sıradan evrişime kıyasla parametre sayısını ve hesaplamayı azaltan derinlemesine ayrılabilir evrişimi kullanmak için sınıflandırma dalını değiştirir.
Kayıp fonksiyonları ve eğitim yöntemi
YOLO11'in eğitim kaybı, kutu regresyonu için CIoU (Tam IoU) kaybının, koordinat dağılımı için DFL kaybının ve sınıflandırma için BCE (ikili çapraz entropi) kaybının ağırlıklı toplamıdır.
CIoU kaybı, yalnızca IoU'yu (örtüşme oranı) değil, aynı zamanda kutu merkezleri arasındaki mesafeyi ve en boy oranlarının ne kadar yakın eşleştiğini de değerlendirir.
\rho(b, b^{gt}), tahmin edilen ve gerçek kutu merkezleri arasındaki Öklid mesafesidir, c, her iki kutuyu da çevreleyen en küçük dikdörtgenin köşegen uzunluğudur, v, en boy oranı uyumsuzluğunu temsil eder ve \alpha, IoU arttıkça v'ye daha fazla ağırlık veren bir katsayıdır. Kutular üst üste binmediğinde, yalnızca IoU'yu optimize etmek neredeyse hiç gradyan sağlamaz; merkez mesafesi ve en boy oranı terimleri bu sorunu hafifletir.
Eğitim, birkaç görüntüyü birleştiren Mozaik; iki görüntüyü harmanlayan MixUp; bir nesne bölgesini başka bir görüntüye yapıştıran Kopyala-Yapıştır; rastgele dönüşümleri otomatik olarak seçen RandAugment; ve rastgele dikdörtgen bir bölgeyi kaldıran Silme gibi artırma yöntemlerini kullanır. Bu ayrıntılar, “YOLOv11 Gizemini Çözme” (arXiv:2604.03349) makalesindeki açıklamayı takip etmektedir.
7. Model Varyantlarının Karşılaştırılması
YOLO11, farklı parametre sayıları ve hesaplama gereksinimleriyle beş boyutta mevcuttur: n (nano), s (küçük), m (orta), l (büyük) ve x (ekstra büyük). Aşağıdakiler, 640 px girişli COCO val2017 üzerinde Ultralytics resmi dokümantasyonunda bildirilen kıyaslama değerleridir.
| Model | mAP50-95 | Parametreler | FLOP'lar | CPU ONNX çıkarımı | T4 TensorRT çıkarımı |
|---|---|---|---|---|---|
| YOLO11n | 39.5 | 2.6M | 6.5B | 56.1 ± 0.8 ms | 1,5 ± 0,0 ms |
| YOLO11s | 47,0 | 9,4M | 21,6B | 90,0 ± 1,2 ms | 2,5 ± 0,0 ms |
| YOLO11m | 51,5 | 20,1M | 68,1B | 183,2 ± 2,0 ms | 4,7 ± 0,1 ms |
| YOLO11l | 53,4 | 25,3M | 87,2B | 238,6 ± 1,4 ms | 6,2 ± 0,1 ms |
| YOLO11x | 54,7 | 56,9M | 195,3B | 462,8 ± 6,7 ms | 11,3 ± 0,2 ms |
Kaynak: Ultralytics YOLO11 resmi dokümantasyonu. CPU ONNX çıkarımı ONNX Runtime kullanır; T4 TensorRT çıkarımı ise NVIDIA T4 GPU üzerinde FP16'dır.
İki pratik nokta öne çıkıyor. Birincisi, parametre sayısı n'den x'e yaklaşık 22 kat artarken, mAP50-95 yalnızca yaklaşık 15 puan artarak 39,5'ten 54,7'ye çıkıyor: doğruluk ve model boyutu doğrusal olarak ilişkili değil. İkincisi, m ve l arasındaki farkı düşünün. Parametreler yalnızca 20,1M'den 25,3M'ye yükselirken, mAP 51,5'ten 53,4'e ve GPU çıkarım süresi 4,7 ms'den 6,2 ms'ye çıkıyor. Bu nedenle, m'den l'ye geçişin getirisi, n → s → m adımlarındaki getiriden biraz daha küçüktür. Bu sayılar, uç sistemlerde n/s ve doğruluğun öncelikli olduğu sabit sistemlerde l/x'i desteklemektedir.
YOLOv8 ile Nicel Karşılaştırma
YOLO11'in yanına aynı Ultralytics dokümanında bildirilen YOLOv8 değerlerini koymak, nesil değişimini daha somut hale getiriyor.
| Model | mAP50-95 (v8 → v11) | Parametreler (v8 → v11) | FLOP'lar (v8 → v11) | CPU ONNX çıkarımı (v8 → v11) |
|---|---|---|---|---|
| n | 37.3 → 39.5 | 3.2M → 2.6M | 8.7B → 6.5B | 80.4ms → 56.1ms |
| s | 44.9 → 47.0 | 11.2M → 9.4M | 28.6B → 21.6B | 128,4 ms → 90,0 ms |
| m | 50,2 → 51,5 | 25,9 Milyon → 20,1 Milyon | 78.9B → 68.1B | 234,7 ms → 183,2 ms |
| ben | 52,9 → 53,4 | 43,7 Milyon → 25,3 Milyon | 165.1B → 87.2B | 375,2 ms → 238,6 ms |
| x | 53,9 → 54,7 | 68,2 Milyon → 56,9 Milyon | 257,8B → 195,3B | 479,1 ms → 462,8 ms |
Kaynak: YOLOv8 resmi dokümantasyonu ve YOLO11 resmi dokümantasyonu (COCO val2017, 640 piksel, her ikisi için de CPU ONNX çıkarımı).
l boyutu için, parametre sayısı 43,7M'den 25,3M'ye, neredeyse yarı yarıya düşerken, mAP biraz iyileşiyor. C3k2 ve C2PSA'nın parametre verimliliği etkisi burada en belirgin şekilde görülüyor. x için, parametreler ve FLOP'lar önemli ölçüde azalırken, CPU çıkarım süresi yalnızca biraz iyileşiyor; bu da C2PSA'daki öz dikkat hesaplamasının büyük modeller için bir darboğaz haline gelebileceğini gösteriyor.
Tek bir cümleyle özetlemek gerekirse, YOLO11, YOLOv8'e göre daha az parametre ve FLOP ile en azından karşılaştırılabilir bir mAP elde etmeye doğru ilerliyor. Bu, her zaman YOLOv8'i geçtiği anlamına gelmez: göreve ve veri setine bağlı olarak, eski nesil hala daha yüksek mutlak doğruluk bildirebilir. Nesne algılama trendleri makalesi de bu noktayı ele alıyor.
YOLO11'i Algılamanın Ötesine Genişletmek
YOLO11, nesne algılama ile sınırlı değildir. Aynı omurga ve boynu korurken yalnızca başı değiştirerek, çerçeve örnek bölümleme (YOLO11-seg), poz tahmini (anahtar nokta koordinatlarını regresyonla hesaplayan YOLO11-pose), sınıflandırma (YOLO11-cls), yönlendirilmiş sınırlayıcı kutu algılama (eğik nesnelerin yönünü de regresyonla hesaplayan YOLO11-obb) ve birden fazla karede izleme işlemlerini kapsar. C3k2 ve C2PSA omurgayı iyileştirdiği için, bu görevlerin tümüne faydaları paylaşılır. Bu aynı zamanda YOLO11'in yalnızca bir algılama modeli değil, ortak bir görsel tanıma temeli olarak tasarlandığını da gösterir.
8. Zorlandığı Noktalar
YOLO11, YOLO ailesine özgü zayıf yönleri korur. Küçük ve uzak nesneler hala zorlayıcıdır. Omurga kademeli olarak çözünürlüğü azalttığı için, yalnızca birkaç piksel genişliğindeki bir nesne, daha derin katmanlara ulaştığında neredeyse tüm ayırt edici özelliklerini kaybedebilir. C2PSA bunu kısmen hafifletir, ancak temelden çözmez.
Birçok benzer nesne içeren yoğun sahneler de zorlayıcıdır. DFL ve CIoU sınır regresyonunu iyileştirir, ancak kalabalık veya bir meyve bahçesindeki yoğun meyve gibi sınırları üst üste gelen komşu nesneler hala yanlış tespitlere ve kaçırmalara neden olabilir.
Alan kaymasına duyarlılık, CNN tabanlı dedektörler için genel bir sorundur. Doğruluk, eğitim verilerinden önemli ölçüde farklı aydınlatma, hava koşulları veya kamera açıları altında keskin bir şekilde düşebilir. C2PSA, Transformer tabanlı DETR ailesi kadar geniş bir alıcı alan sağlamaz, bu nedenle YOLO11 bu açıdan daha az sağlam olabilir.
YOLO11 ayrıca AGPL-3.0 lisansı altında yayınlanmıştır. Ticari bir dağıtım, kaynak kodunun gizli tutulmasını gerektiriyorsa, Ultralytics Kurumsal Lisansı gereklidir. Bu teknik bir zayıflık değil, kolayca gözden kaçırılabilecek pratik bir kısıtlamadır.
9. Pratikte Nasıl Seçilir
Uç cihazlar ve pille çalışan robotlar için, çıkarım hızı ve parametre sayısı genellikle kısıtlamalardır ve bu da YOLO11n/s'yi ilk adaylar yapar. n modelinin yaklaşık 56 ms'lik CPU çıkarımı, sistemin geri kalanına bağlı olarak, Raspberry Pi sınıfı gömülü donanımlarda çalışmayı gerçekçi hale getirebilir.
Drone'lardan ve diğer hareketli platformlardan havadan inceleme için, küçük nesne tespiti merkezi öneme sahiptir. Daha büyük bir YOLO11 modeli seçmek yerine, giriş çözünürlüğünü artırın veya döşemeli çıkarım kullanın. Bazı raporlar, bu alanda deforme edilebilir dikkat mekanizmalı DETR varyantlarına avantaj vermektedir, bu nedenle doğruluk öncelikli olduğunda RT-DETR ve diğer aileler makul karşılaştırmalardır.
Sabit depo veya fabrika kameralarıyla yapılan incelemeler için, GPU kaynakları mevcut olduğunda ve doğruluk öncelikli olduğunda YOLO11l/x seçenekleri mevcuttur. Ancak burada bile, RF-DETR gibi Transformer tabanlı dedektörler COCO'da 60 mAP'den fazla değer bildirmiştir, bu nedenle YOLO artık tek seçenek değildir. Ayrıntılar için nesne algılama trendleri makalesine bakın.
Araştırma ve prototipleme için, Ultralytics'in Python paketinin olgunluğu, YOLO11'i seçmek için pratik bir nedendir: eğitim, çıkarım ve dışa aktarma birkaç satırda ifade edilebilir. Lisanslama kısıtlamaları kabul edilebilir olduğunda, çalışan bir temel elde etme hızı önemli bir avantaj olmaya devam etmektedir.
10. Üç satırlık özet
-
YOLO11, YOLOv8'in omurga-boyun-baş yapısını korur, temel bloklarını C3k2 ile değiştirir ve C2PSA aracılığıyla uzamsal dikkat ekler.
-
Çapa içermeyen başlığı, sınır mesafelerini DFL dağılımlarının beklenen değeri olarak tahmin ederken, CIoU birlikte örtüşmeyi, merkez mesafesini ve en boy oranını optimize eder.
-
Parametre verimliliği n'den x'e doğru artar, ancak küçük nesneler, yoğun sahneler ve alan kayması YOLO ailesi dedektörleri için ortak zorluklar olmaya devam etmektedir.
Nesne tespiti ve anlamsal segmentasyona daha temel bir giriş için Nesne Tespiti ve Anlamsal Segmentasyon: Bir Giriş makalesine bakın. NMS içermeyen yaklaşımlar ve DETR modellerinden gelen rekabet de dahil olmak üzere YOLO ailesindeki güncel eğilimler için nesne tespiti eğilimleri makalesine bakın.
Referanslar
- Ultralytics YOLO11 resmi dokümantasyonu
- Ultralytics: YOLO mimarisi kılavuzu
- Ultralytics: Çapa içermeyen bir dedektör olarak YOLO11'in faydaları
- YOLO11 resmi model yapılandırması (GitHub)
- YOLOv11 Gizemini Çözmek: Yüksek Performanslı Nesne Algılama İçin Pratik Bir Kılavuz (arXiv:2604.03349)
- Genelleştirilmiş Odak Kaybı: Yoğun Nesne Algılama İçin Nitelikli ve Dağıtılmış Sınır Kutularının Öğrenilmesi (NeurIPS 2020, arXiv:2006.04388)
- Ultralytics lisanslama
Yüksek bir tespit puanı, konumun ve sınıfın doğru olduğunu garanti eder mi?
Puan, bir model çıktısıdır, doğruluğun garantisi değildir. Tespit edilen kutuların yerelleştirme doğruluğundan ayrı olarak, farklı eşiklerde hassasiyeti ve geri çağırmayı değerlendirin.
Yorumlar
Lütfen önce giriş yapın.
Henüz veri yok.