Contents — find the section you need

ऑब्जेक्ट डिटेक्शन एक ऐसी प्रक्रिया है जिसमें किसी इमेज से ऑब्जेक्ट की स्थिति (बाउंडिंग बॉक्स) और उसकी श्रेणी, दोनों का एक साथ अनुमान लगाया जाता है। YOLO परिवार लंबे समय से उत्पादन उपयोग के लिए सर्वोपरि विकल्प रहा है, लेकिन 2026 तक, ट्रांसफॉर्मर-आधारित डिटेक्टर इस स्थिति तक पहुँच चुके हैं कि वे वास्तव में इस स्थिति को चुनौती दे रहे हैं।

यह लेख अनुसंधान के रुझानों पर केंद्रित है और सबसे पहले आवश्यक अवधारणाओं का संक्षिप्त परिचय देता है।

ऑब्जेक्ट डिटेक्शन का एक उदाहरणऑब्जेक्ट डिटेक्शन

YOLO/Ultralytics के लिए कोई लाइसेंस-मुक्त आधिकारिक लोगो नहीं मिल सका, इसलिए इसके स्थान पर बाउंडिंग-बॉक्स डिटेक्शन को दर्शाने वाला एक साधारण आइकन बनाया गया।

डिटेक्टर डिज़ाइन विभाजन एक नज़र में

Diagram 1 · Use the button to switch views
कई सघन कैंडिडेट बॉक्स उत्पन्न करने और उन्हें फ़िल्टर करने वाले डिटेक्टर वंश की तुलना एक DETR वंश से की गई है जो वन-टू-वन ऑब्जेक्ट क्वेरी का उपयोग करता है, दोनों बॉक्स, क्लास और कॉन्फिडेंस उत्पन्न करते हैं

आरेख: डस्ककॉइल। यह सघन भविष्यवाणी और सेट भविष्यवाणी के बीच प्रतिनिधि डिज़ाइन विभाजन को दर्शाता है।

प्रत्येक ऑब्जेक्ट डिटेक्टर इनपुट छवि को विशेषताओं में परिवर्तित करता है और अंततः स्थान, श्रेणी और विश्वास लौटाता है। मुख्य अंतर यह है कि क्या यह कई संभावित परिणाम बनाता है और बाद में डुप्लिकेट हटाता है, या सीखे गए ऑब्जेक्ट प्रश्नों का ग्राउंड ट्रुथ के साथ एक-से-एक मिलान करता है और सीधे कम-डुप्लिकेशन वाले सेट की भविष्यवाणी करता है। यह चुनाव NMS की आवश्यकता, प्रशिक्षण उद्देश्य, गति और भीड़भाड़ वाले दृश्यों में व्यवहार को प्रभावित करता है।

YOLO परिवार की स्थिति: NMS-मुक्त होना

पारंपरिक NMS एक पोस्ट-प्रोसेसिंग चरण है जो एक ही ऑब्जेक्ट के लिए उत्पन्न कई संभावित बॉक्सों को एक अंतिम पहचान तक सीमित कर देता है, उन सभी बॉक्सों को हटाकर जिनका ओवरलैप (IoU: इंटरसेक्शन ओवर यूनियन, दो बॉक्सों के बीच ओवरलैप क्षेत्र को उनके यूनियन क्षेत्र से विभाजित करने पर प्राप्त मान) एक सीमा से अधिक हो जाता है।

\text{IoU}(A, B) = \frac{|A \cap B|}{|A \cup B|}

यह पोस्ट-प्रोसेसिंग नेटवर्क के बाहर एक स्वतंत्र चरण के रूप में चलती है, और इसके साथ कुछ कमियां भी हैं: सीमा निर्धारित करने के लिए अनुभवजन्य समायोजन, और वास्तव में अलग-अलग, घनी वस्तुओं को गलती से हटाने की प्रवृत्ति। YOLO की नवीनतम पीढ़ी, YOLO26, NMS-मुक्त दृष्टिकोण अपनाती है। एक ऐसा आर्किटेक्चर जिसे अब नॉन-मैक्सिमम सप्रेशन (NMS) की आवश्यकता नहीं है, जो वर्षों से मानक रहा पोस्ट-प्रोसेसिंग चरण है। NMS इन्फरेंस पाइपलाइन में कंप्यूट लागत और लेटेंसी दोनों के लिए एक बाधा बन जाता है, और इसे हटाने का उद्देश्य इन्फरेंस गति और कार्यान्वयन सरलता दोनों में सुधार करना है। शुद्ध थ्रूपुट की बात करें तो, स्पेक्ट्रम का हल्का और उच्च गति वाला हिस्सा भी अच्छी तरह से विकसित है - उदाहरण के लिए, RTMDet 300 FPS से अधिक गति प्रदान करता है।

ट्रांसफॉर्मर-आधारित डिटेक्टरों का उदय: RF-DETR और RT-DETRv2

एक और प्रमुख प्रगति DETR (डिटेक्शन ट्रांसफॉर्मर) श्रृंखला का व्यावहारिक परिपक्वता तक पहुंचना है। RT-DETR/RT-DETRv2 एक CNN को ट्रांसफॉर्मर के साथ जोड़ते हैं, और YOLO परिवार की तरह, NMS के बिना सीधे अंतिम डिटेक्शन आउटपुट करने के लिए डिज़ाइन किए गए हैं।

2026 की सबसे बड़ी घटना ICLR 2026 में प्रस्तुत RF-DETR का आगमन था। इसे 60 FPS को पार करने वाला पहला रीयल-टाइम मॉडल बताया गया है। COCO बेंचमार्क पर mAP उत्कृष्ट प्रदर्शन करता है, और यह RF100-VL बेंचमार्क में भी अग्रणी है, जो डोमेन स्थानांतरण का मूल्यांकन करता है। इसका लाइसेंस Apache 2.0 है — जो व्यावसायिक उपयोग के लिए अनुमेय है — यह AGPL लाइसेंस वाले YOLO26/YOLOv12 से भिन्न है।

टेक्स्ट प्रॉम्प्ट के माध्यम से ओपन-वोकैबुलरी डिटेक्शन

एक अन्य महत्वपूर्ण क्षेत्र "ओपन-वोकैबुलरी डिटेक्शन" है — ऐसी श्रेणियों का पता लगाना जिन पर मॉडल को कभी प्रशिक्षित नहीं किया गया था। YOLO-World और Grounding DINO केवल एक टेक्स्ट प्रॉम्प्ट के आधार पर किसी भी श्रेणी का पता लगा सकते हैं, इसके लिए किसी अतिरिक्त प्रशिक्षण डेटा की आवश्यकता नहीं होती है। यह एक निश्चित श्रेणी सूची तक सीमित डिटेक्शन से हटकर एक नई सोच है, और यह उन उपयोग मामलों के लिए उपयुक्त है जहां वास्तविक दुनिया की श्रेणियों को पहले से पूरी तरह से सूचीबद्ध नहीं किया जा सकता है — उदाहरण के लिए, एक सामान्य-उद्देश्य वाले रोबोट के लिए वस्तु पहचान।

NMS-मुक्त होने के पीछे की तकनीकी प्रक्रिया

YOLO26 का NMS-मुक्त डिटेक्शन की ओर बढ़ना केवल एक पोस्ट-प्रोसेसिंग चरण को छोड़ना नहीं है — यह प्रशिक्षण पद्धति में ही बदलाव से संभव हुआ है। पारंपरिक YOLO डिज़ाइन प्रशिक्षण के दौरान प्रति ऑब्जेक्ट कई अनुमानित बॉक्सों को सहन करता था (एक-से-अनेक असाइनमेंट), इस धारणा के साथ कि NMS अनुमान के बाद डुप्लिकेट को हटा देगा। YOLO26 भविष्यवाणी हेड को नया रूप देता है, एक-से-एक असाइनमेंट पर स्विच करता है, जहां प्रशिक्षण से ही प्रति ऑब्जेक्ट इंस्टेंस एक एकल, निश्चित बॉक्स आउटपुट होता है। यह बाउंडिंग-बॉक्स रिग्रेशन (डिस्ट्रिब्यूशन फोकल लॉस) के लिए उपयोग किए जाने वाले वितरण-आधारित दृष्टिकोण को एक हल्के, अधिक हार्डवेयर-अनुकूल पैरामीटराइजेशन से भी बदल देता है, जिससे उन ऑपरेशनों को कम किया जाता है जो कंपाइलर और रनटाइम में अस्थिर होते हैं। इसका परिणाम CPU पर 43% तक तेज़ अनुमान है, साथ ही समग्र रूप से सरल पोस्ट-प्रोसेसिंग कार्यान्वयन भी है।

RF-DETR भी NMS-मुक्त है, लेकिन YOLO26 से अलग तंत्र द्वारा। RF-DETR अपने आधार के रूप में एक पूर्व-प्रशिक्षित विज़न ट्रांसफ़ॉर्मर, DINOv2 का उपयोग करता है, बहु-रिज़ॉल्यूशन विशेषताओं को निकालता है, और उन्हें एक डिकोडर के माध्यम से पास करता है जो सीखने योग्य प्रश्नों (सार प्रतिनिधित्व जो इसके लिए खड़े होते हैं) के साथ काम करता है। उम्मीदवार ऑब्जेक्ट)। प्रत्येक डिकोडर परत में स्व-ध्यान (क्वेरी के बीच संबंधों को कैप्चर करना), विरूपण योग्य क्रॉस-ध्यान (छवि विशेषताओं के भीतर नमूना बिंदुओं के एक छोटे, सीखे हुए सेट पर ही ध्यान देना), और एक फीड-फॉरवर्ड नेटवर्क होता है जो भविष्यवाणी को परिष्कृत करता है। यह "केवल कुछ सीखे हुए बिंदुओं पर ध्यान केंद्रित करने वाला" विरूपण योग्य ध्यान, मानक ट्रांसफ़ॉर्मर क्रॉस-ध्यान की तुलना में कम्प्यूटेशनल लागत को कम रखता है, जबकि अद्वितीय, सेट-आधारित भविष्यवाणियाँ उत्पन्न करता है - यही कारण है कि एनएमएस की आवश्यकता ही नहीं रह जाती।

क्रॉस-जेनरेशन तुलनाएँ वास्तव में क्या दर्शाती हैं: YOLOv8/v11/v26

ऐसे डेटा भी सामने आए हैं जो इस धारणा को गलत साबित करते हैं कि "नई पीढ़ी = समान रूप से उच्च सटीकता।" अगस्त 2026 में तीन YOLO पीढ़ियों और पाँच मॉडल पैमानों पर किए गए एक बेंचमार्क - बाग का पता लगाने और उदाहरण विभाजन में सूक्ष्म संरचनाओं (शाखाएँ, फल, अन्य छोटी वस्तुएँ) को लक्षित करते हुए - में पाया गया कि उच्चतम mAP@50:95 YOLOv26 द्वारा बिल्कुल भी निर्धारित नहीं किया गया था, बल्कि इसके द्वारा निर्धारित किया गया था। YOLOv11s-960 (0.402 मास्क mAP@50:95, 0.426 बॉक्स mAP@50:95)। वहीं, YOLOv26s-960 ने केवल 10.37 मिलियन पैरामीटर के साथ लगभग तुलनीय सटीकता हासिल की। इससे जो तस्वीर उभरती है वह यह है: प्रत्येक नई पीढ़ी के साथ सटीकता में एकसमान वृद्धि नहीं होती, लेकिन पैरामीटर दक्षता — यानी बहुत कम कंप्यूटिंग के साथ सटीकता का मिलान — लगातार बढ़ रही है।

छोटे ऑब्जेक्ट का पता लगाना भी एक वास्तविक, अनसुलझी चुनौती बनी हुई है। अगस्त 2026 में सैन्य वाहनों का पता लगाने के लिए छह YOLO वेरिएंट और दो DETR वेरिएंट की तुलना करने वाले एक मूल्यांकन में एक सुसंगत पैटर्न पाया गया: बड़े मॉडल बेहतर प्रदर्शन करते हैं, DETR-आधारित दृष्टिकोण आशाजनक हैं, और फाइन-ट्यूनिंग से एयर-टू-ग्राउंड (A2G) प्रदर्शन में सुधार होता है — लेकिन A2G परिदृश्य में छोटे ऑब्जेक्ट का पता लगाने में अभी भी हर मॉडल को कठिनाई होती है। न तो YOLO26 के NMS-मुक्त डिज़ाइन और न ही RF-DETR के उच्च mAP ने इस "छोटे, दूर के ऑब्जेक्ट" की समस्या को पूरी तरह से हल किया है। समस्या।

ओपन-वोकैबुलरी डिटेक्शन की प्रगति: ठोस एपी आंकड़े

YOLO-World/Grounding DINO के बाद विकसित ओपन-वोकैबुलरी डिटेक्टरों ने 2026 तक सटीकता में लगातार सुधार किया है। FlowOVD (मई 2026), जो टेक्स्ट-अज्ञेय क्वेरी को टेक्स्ट-गाइडेड क्वेरी में बदलने के लिए जनरेटिव रेक्टिफाइड फ्लो का उपयोग करता है, COCO पर 49.5 एपी और LVIS पर 31.5 एपी रिपोर्ट करता है — Grounding DINO की तुलना में क्रमशः +1.2 एपी (सापेक्ष +2.5%) और +4.1 एपी (सापेक्ष +15.0%) का सुधार। OPUS, जो अगस्त 2026 में प्रकाशित हुआ, एक ही एकीकृत फ्रेमवर्क के भीतर कई प्रकार के प्रॉम्प्ट — टेक्स्ट, विज़ुअल (इंटरैक्टिव/जेनेरिक) और मिश्रित — को संभालता है, और भारी-भरकम क्रॉस-मोडल फ्यूजन से बचने वाले सरल डिज़ाइन के बावजूद, यह अत्याधुनिक स्तर के आंकड़े प्रस्तुत करता है। COCO, LVIS-minival और ODinW35 बेंचमार्क में 68.1/69.2/54.7 AP प्राप्त हुआ। ओपन-वोकैबुलरी डिटेक्शन अब केवल एक गुणात्मक उपलब्धि नहीं रह गई है — अज्ञात श्रेणियों को संभालने की क्षमता — बल्कि यह निश्चित-श्रेणी डिटेक्टरों के साथ मात्रात्मक रूप से भी प्रतिस्पर्धा करने लगी है।

2026 तक का परिदृश्य

आज ऑब्जेक्ट डिटेक्शन मुख्य रूप से दो अक्षों पर आधारित है: एकल-चरण, NMS-मुक्त ट्रांसफॉर्मर आर्किटेक्चर और अपने स्थापित इकोसिस्टम के साथ YOLO परिवार। ट्रांसफॉर्मर पक्ष तेजी से विकसित हो रहा है, लेकिन YOLO परिवार अपने उत्पादन ट्रैक रिकॉर्ड और टूलिंग की व्यापकता के बल पर वास्तविक समय उत्पादन वातावरण की रीढ़ बना हुआ है। उपयोग के मामले के अनुसार विश्लेषण:

  • सर्वोच्च सटीकता: RF-DETR
  • ट्रैक रिकॉर्ड और इकोसिस्टम सबसे महत्वपूर्ण: YOLO26/YOLOv12
  • शुद्ध गति: RTMDet
  • अज्ञात श्रेणियों को संभालने की आवश्यकता श्रेणियाँ**: YOLO-World / Grounding DINO

यह वर्तमान कार्य विभाजन है।

अपनी समझ की जाँच करें
क्या mAP अकेले ही रीयल-टाइम डिटेक्टर का चयन कर सकता है?

समान रिज़ॉल्यूशन, डेटा और हार्डवेयर पर विलंबता और गुणवत्ता की तुलना करें। प्री- और पोस्टप्रोसेसिंग के बिना अनुमान समय एंड-टू-एंड विलंबता नहीं है।

संदर्भ

What to read next

Review the backgroundनेविगेशन में प्रौद्योगिकी के रुझानContinue the seriesसिमेंटिक सेगमेंटेशन में प्रौद्योगिकी रुझानExplore another aspect of this fieldह्यूमनॉइड रोबोट में प्रौद्योगिकी के रुझान