Contents — find the section you need
Nesne tespiti, bir görüntüden hem nesnenin konumunu (sınır kutusu) hem de kategorisini eş zamanlı olarak tahmin etme işlemidir. YOLO ailesi uzun zamandır üretimde tercih edilen seçenek olmuştur, ancak 2026 yılına gelindiğinde, transformatör tabanlı dedektörler bu konumu gerçekten tehdit edecek bir noktaya ulaşmıştır.
Bu makale, araştırma trendlerine odaklanmakta ve öncelikle temel kavramları kısaca tanıtmaktadır.
YOLO/Ultralytics için lisanssız resmi bir logo bulunamadığından, yerine sınırlayıcı kutu algılamayı temsil eden basit bir simge oluşturuldu.
Dedektör Tasarımının Bölünmesine Genel Bakış
Diyagram: Duskcoil. Yoğun tahmin ve küme tahmini arasındaki temsili tasarım ayrımını vurgular.
Her nesne dedektörü, bir giriş görüntüsünü özelliklere dönüştürür ve nihayetinde konum, kategori ve güven döndürür. Temel ayrım, Birçok aday oluşturur ve daha sonra kopyaları kaldırır veya öğrenilen nesne sorgularını gerçek verilerle birebir eşleştirir ve doğrudan düşük kopyalama kümesi tahmin eder. Bu seçim, NMS ihtiyacına, eğitim hedefine, hıza ve kalabalık sahnelerdeki davranışa yansır.
YOLO Ailesinin Konumu: NMS'siz Yaklaşım
Geleneksel NMS, aynı nesne için üretilen birkaç aday kutuyu, örtüşmesi (IoU: Kesişim/Birleşim, iki kutu arasındaki örtüşme alanının birleşim alanına bölünmesi) bir eşiği aşan herhangi bir kutuyu atarak tek bir nihai tespite indirgeyen bir işlem sonrası adımıdır.
Bu işlem sonrası, ağın dışında bağımsız bir adım olarak çalışır ve beraberinde bazı dezavantajlar getirir: eşiğin nerede ayarlanacağına dair deneysel ayarlama ve gerçekten farklı, birbirine yakın nesneleri yanlışlıkla atma eğilimi. YOLO'nun en yeni nesli olan YOLO26, artık maksimum olmayan bastırmaya ihtiyaç duymayan NMS'siz bir mimari benimser. Yıllardır standart olan bir işlem sonrası adımı. NMS, çıkarım hattında hem hesaplama maliyeti hem de gecikme için bir darboğaz olma eğilimindedir ve kaldırılması hem çıkarım hızını hem de uygulama basitliğini iyileştirmeyi amaçlamaktadır. Saf verimlilik tarafında, hafif, yüksek hızlı uç da oldukça zengindir - örneğin RTMDet, 300 FPS'yi aşmaktadır.
Transformer Tabanlı Dedektörlerin Yükselişi: RF-DETR ve RT-DETRv2
Bir diğer önemli akım ise DETR (DEtection TRansformer) soyunun pratik olgunluğa ulaşmasıdır. RT-DETR/RT-DETRv2, bir CNN'yi bir transformatörle birleştirir ve YOLO ailesi gibi, NMS olmadan doğrudan nihai tespitleri çıktılamak üzere tasarlanmıştır.
2026'nın büyük olayı, ICLR 2026'da sunulan RF-DETR'nin gelişiydi. COCO kıyaslamasında 60 mAP'yi aşan ilk gerçek zamanlı model olarak tanımlanıyor ve Ayrıca, alan transferini değerlendiren RF100-VL kıyaslama testinde de lider konumdadır. Lisansı Apache 2.0'dır (ticari kullanım için izin verici) ve AGPL lisanslı YOLO26/YOLOv12'nin aksine bir durumdur.
Metin İstemleriyle Açık Kelime Dağarcığı Tespiti
Bir diğer önemli akım ise "açık kelime dağarcığı tespiti"dir; modelin daha önce hiç eğitilmediği kategorileri tespit etmektir. YOLO-World ve Grounding DINO, ek eğitim verisi gerektirmeden, yalnızca bir metin istemiyle rastgele bir kategoriyi tespit edebilir. Bu, sabit bir sınıf listesine bağlı tespitten uzaklaşan bir zihniyet değişikliğidir ve gerçek dünya kategorilerinin önceden tam olarak listelenemediği kullanım durumlarına iyi uyum sağlar; örneğin, genel amaçlı bir robot için nesne tanıma.
NMS'siz Algılamaya Geçişin Teknik Mekanizması
YOLO26'nın NMS'siz algılamaya geçişi sadece bir işlem sonrası adımı atlamakla ilgili değil, eğitim yöntemini değiştirmekten kaynaklanıyor. Geleneksel YOLO tasarımı, eğitim sırasında nesne başına birden fazla tahmin edilen kutuya (bire çok atama) izin veriyordu ve NMS'nin çıkarım sonrasında tekrarları azaltacağı varsayımına dayanıyordu. YOLO26, tahmin başlığını yeniden tasarlayarak bire bir atamaya geçiyor ve eğitimden başlayarak nesne örneği başına tek, kesin bir kutu çıktısı veriyor. Ayrıca, sınırlayıcı kutu regresyonu için kullanılan dağıtım tabanlı yaklaşımı (Dağıtım Odaklı Kayıp) daha hafif, donanıma daha uygun bir parametreleme ile değiştirerek, derleyiciler ve çalışma zamanları arasında kararsız olma eğiliminde olan işlemleri ortadan kaldırıyor. Sonuç olarak, CPU'da %43'e kadar daha hızlı çıkarım ve genel olarak daha basit bir işlem sonrası uygulama elde ediliyor.
RF-DETR de NMS içermez, ancak YOLO26'dan farklı bir mekanizma ile çalışır. RF-DETR, omurgası olarak önceden eğitilmiş bir Vision Transformer olan DINOv2'yi kullanır, çok çözünürlüklü özellikleri çıkarır ve bunları öğrenilebilir sorgularla (aday yerine geçen soyut temsiller) çalışan bir kod çözücüden geçirir. (nesneler). Her kod çözücü katmanı, öz dikkat (sorgular arasındaki ilişkileri yakalama), deforme edilebilir çapraz dikkat (görüntü özelliklerindeki küçük, öğrenilmiş bir örnekleme noktası kümesine odaklanma) ve tahmini iyileştiren bir ileri beslemeli ağdan oluşur. Bu "sadece az sayıda öğrenilmiş noktaya bakma" deforme edilebilir dikkati, standart transformatör çapraz dikkatine göre hesaplama maliyetini daha düşük tutarken, benzersiz, küme tabanlı tahminler üretir - ki bu da NMS'nin gereksiz hale gelmesinin asıl nedenidir.
Nesiller Arası Karşılaştırmalar Gerçekte Ne Gösteriyor: YOLOv8/v11/v26
"Yeni nesil = daha yüksek doğruluk" varsayımını geri çeviren veriler de ortaya çıktı. Ağustos 2026'da üç YOLO neslini ve beş model ölçeğini kapsayan bir kıyaslama - meyve bahçesi tespiti ve örnek bölümlendirmesinde ince taneli yapıları (dallar, meyveler, diğer küçük nesneler) hedefleyen - en yüksek mAP@50:95'in YOLOv26 tarafından belirlenmediğini buldu. YOLOv11s-960 (0.402 mask mAP@50:95, 0.426 box mAP@50:95) hariç tümü. Bu arada, YOLOv26s-960, yalnızca 10.37 milyon parametre ile yaklaşık olarak karşılaştırılabilir bir doğruluk elde etti. Dolayısıyla ortaya çıkan tablo şu: ham doğruluk kazanımları her yeni nesilde eşit olarak gelmiyor, ancak parametre verimliliği - çok daha az hesaplama ile doğruluğa ulaşma - istikrarlı bir şekilde ilerliyor.
Küçük nesne tespiti de gerçek, çözülmemiş bir zorluk olmaya devam ediyor. Ağustos 2026'da altı YOLO varyantı ve iki DETR varyantını askeri araç tespiti konusunda karşılaştıran bir değerlendirme, tutarlı bir örüntü buldu: daha büyük modeller daha iyi performans gösteriyor, DETR tabanlı yaklaşımlar umut vaat ediyor ve ince ayar havadan yere (A2G) performansını iyileştiriyor - ancak her bir model hala A2G senaryosunda küçük nesneleri tespit etmekte zorlanıyor. Ne YOLO26'nın NMS içermeyen tasarımı ne de RF-DETR'nin yüksek mAP'si Bu "küçük, uzaktaki nesne" sorununu tamamen çözdü.
Açık Kelime Dağarcığı Algılamasının Gelişimi: Somut AP Rakamları
YOLO-World/Grounding DINO'yu takip eden açık kelime dağarcığı dedektörlerinin geliştirilmesi, 2026 yılına kadar istikrarlı doğruluk kazanımları sağladı. Metinden bağımsız sorguları metin odaklı sorgulara dönüştürmek için üretken bir düzeltilmiş akış kullanan FlowOVD (Mayıs 2026), COCO'da 49,5 AP ve LVIS'te 31,5 AP raporladı; bu da Grounding DINO'ya göre sırasıyla +1,2 AP (göreceli +%2,5) ve +4,1 AP (göreceli +%15,0) iyileşme anlamına geliyor. Ağustos 2026'da yayınlanan OPUS, tek bir birleşik çerçeve içinde birden fazla istem türünü (metin, görsel (etkileşimli/genel) ve karışık) ele alıyor ve ağır çapraz mod füzyonundan kaçınan daha basit bir tasarıma rağmen, en son teknoloji seviyesinde rakamlar sunuyor. COCO, LVIS-minival ve ODinW35 kıyaslamalarında 68.1/69.2/54.7 AP değerleri elde edildi. Açık kelime dağarcığı tespiti artık sadece niteliksel bir kazanım değil (bilinmeyen kategorileri ele alma yeteneği), aynı zamanda sabit sınıf dedektörleriyle niceliksel olarak da rekabet etmeye başlıyor.
2026 İtibariyle Genel Durum
Nesne tespiti bugün büyük ölçüde iki eksen etrafında şekilleniyor: tek aşamalı, NMS'siz transformatör mimarileri ve yerleşik ekosistemiyle YOLO ailesi. Transformatör tarafı hızla gelişiyor, ancak YOLO ailesi, üretim geçmişi ve araçlarının derinliği sayesinde gerçek zamanlı üretim ortamlarının omurgasını oluşturmaya devam ediyor. Kullanım durumuna göre ayrıştırılmış hali:
- Her şeyden önce doğruluk: RF-DETR
- Geçmiş ve ekosistem en önemlisi: YOLO26/YOLOv12
- Saf hız: RTMDet
- Bilinmeyenleri ele alma ihtiyacı Kategoriler**: YOLO Dünyası / DINO'yu Temellendirme
İş bölümü şu anki şekilde.
mAP tek başına gerçek zamanlı bir dedektör seçebilir mi?
Eşleşen çözünürlük, veri ve donanımda gecikme ve kaliteyi karşılaştırın. Ön ve son işlem olmadan çıkarım süresi, uçtan uca gecikme değildir.
Referanslar
- RF-DETR'nin Gizemini Çözmek (Yapay Zekaya Doğru)
- RT-DETRv2 Makalesi (arXiv)
- DETR'ler Gerçek Zamanlı Nesne Algılamada YOLO'ları Yendi Makalesi (arXiv)
- En İyi Nesne Algılama Modelleri 2026 (Roboflow Blog)
- YOLO26: Gerçek Zamanlı Nesne Algılama için NMS'siz Uçtan Uca Çerçeve Analizi (arXiv)
- RF-DETR Makalesi (ICLR 2026, arXiv)
- RF-DETR GitHub (roboflow)
- YOLOv26, YOLOv11 ve YOLOv8'in Nesiller Arası Optimizasyonu Makalesi (arXiv)
- Otomatik Hedef Algılama ve Tanıma için Hazır Teknolojilerin Karşılaştırmalı Çalışması Makalesi (arXiv)
- FlowOVD Makalesi (arXiv)
- OPUS Makalesi (arXiv)
Yorumlar
Lütfen önce giriş yapın.
Henüz veri yok.