Contents — find the section you need
ऑब्जेक्ट डिटेक्शन एक ऐसी प्रक्रिया है जिसमें किसी इमेज से ऑब्जेक्ट की स्थिति (बाउंडिंग बॉक्स) और उसकी श्रेणी, दोनों का एक साथ अनुमान लगाया जाता है। YOLO परिवार लंबे समय से उत्पादन उपयोग के लिए सर्वोपरि विकल्प रहा है, लेकिन 2026 तक, ट्रांसफॉर्मर-आधारित डिटेक्टर इस स्थिति तक पहुँच चुके हैं कि वे वास्तव में इस स्थिति को चुनौती दे रहे हैं।
यह लेख अनुसंधान के रुझानों पर केंद्रित है और सबसे पहले आवश्यक अवधारणाओं का संक्षिप्त परिचय देता है।
YOLO/Ultralytics के लिए कोई लाइसेंस-मुक्त आधिकारिक लोगो नहीं मिल सका, इसलिए इसके स्थान पर बाउंडिंग-बॉक्स डिटेक्शन को दर्शाने वाला एक साधारण आइकन बनाया गया।
डिटेक्टर डिज़ाइन विभाजन एक नज़र में
आरेख: डस्ककॉइल। यह सघन भविष्यवाणी और सेट भविष्यवाणी के बीच प्रतिनिधि डिज़ाइन विभाजन को दर्शाता है।
प्रत्येक ऑब्जेक्ट डिटेक्टर इनपुट छवि को विशेषताओं में परिवर्तित करता है और अंततः स्थान, श्रेणी और विश्वास लौटाता है। मुख्य अंतर यह है कि क्या यह कई संभावित परिणाम बनाता है और बाद में डुप्लिकेट हटाता है, या सीखे गए ऑब्जेक्ट प्रश्नों का ग्राउंड ट्रुथ के साथ एक-से-एक मिलान करता है और सीधे कम-डुप्लिकेशन वाले सेट की भविष्यवाणी करता है। यह चुनाव NMS की आवश्यकता, प्रशिक्षण उद्देश्य, गति और भीड़भाड़ वाले दृश्यों में व्यवहार को प्रभावित करता है।
YOLO परिवार की स्थिति: NMS-मुक्त होना
पारंपरिक NMS एक पोस्ट-प्रोसेसिंग चरण है जो एक ही ऑब्जेक्ट के लिए उत्पन्न कई संभावित बॉक्सों को एक अंतिम पहचान तक सीमित कर देता है, उन सभी बॉक्सों को हटाकर जिनका ओवरलैप (IoU: इंटरसेक्शन ओवर यूनियन, दो बॉक्सों के बीच ओवरलैप क्षेत्र को उनके यूनियन क्षेत्र से विभाजित करने पर प्राप्त मान) एक सीमा से अधिक हो जाता है।
यह पोस्ट-प्रोसेसिंग नेटवर्क के बाहर एक स्वतंत्र चरण के रूप में चलती है, और इसके साथ कुछ कमियां भी हैं: सीमा निर्धारित करने के लिए अनुभवजन्य समायोजन, और वास्तव में अलग-अलग, घनी वस्तुओं को गलती से हटाने की प्रवृत्ति। YOLO की नवीनतम पीढ़ी, YOLO26, NMS-मुक्त दृष्टिकोण अपनाती है। एक ऐसा आर्किटेक्चर जिसे अब नॉन-मैक्सिमम सप्रेशन (NMS) की आवश्यकता नहीं है, जो वर्षों से मानक रहा पोस्ट-प्रोसेसिंग चरण है। NMS इन्फरेंस पाइपलाइन में कंप्यूट लागत और लेटेंसी दोनों के लिए एक बाधा बन जाता है, और इसे हटाने का उद्देश्य इन्फरेंस गति और कार्यान्वयन सरलता दोनों में सुधार करना है। शुद्ध थ्रूपुट की बात करें तो, स्पेक्ट्रम का हल्का और उच्च गति वाला हिस्सा भी अच्छी तरह से विकसित है - उदाहरण के लिए, RTMDet 300 FPS से अधिक गति प्रदान करता है।
ट्रांसफॉर्मर-आधारित डिटेक्टरों का उदय: RF-DETR और RT-DETRv2
एक और प्रमुख प्रगति DETR (डिटेक्शन ट्रांसफॉर्मर) श्रृंखला का व्यावहारिक परिपक्वता तक पहुंचना है। RT-DETR/RT-DETRv2 एक CNN को ट्रांसफॉर्मर के साथ जोड़ते हैं, और YOLO परिवार की तरह, NMS के बिना सीधे अंतिम डिटेक्शन आउटपुट करने के लिए डिज़ाइन किए गए हैं।
2026 की सबसे बड़ी घटना ICLR 2026 में प्रस्तुत RF-DETR का आगमन था। इसे 60 FPS को पार करने वाला पहला रीयल-टाइम मॉडल बताया गया है। COCO बेंचमार्क पर mAP उत्कृष्ट प्रदर्शन करता है, और यह RF100-VL बेंचमार्क में भी अग्रणी है, जो डोमेन स्थानांतरण का मूल्यांकन करता है। इसका लाइसेंस Apache 2.0 है — जो व्यावसायिक उपयोग के लिए अनुमेय है — यह AGPL लाइसेंस वाले YOLO26/YOLOv12 से भिन्न है।
टेक्स्ट प्रॉम्प्ट के माध्यम से ओपन-वोकैबुलरी डिटेक्शन
एक अन्य महत्वपूर्ण क्षेत्र "ओपन-वोकैबुलरी डिटेक्शन" है — ऐसी श्रेणियों का पता लगाना जिन पर मॉडल को कभी प्रशिक्षित नहीं किया गया था। YOLO-World और Grounding DINO केवल एक टेक्स्ट प्रॉम्प्ट के आधार पर किसी भी श्रेणी का पता लगा सकते हैं, इसके लिए किसी अतिरिक्त प्रशिक्षण डेटा की आवश्यकता नहीं होती है। यह एक निश्चित श्रेणी सूची तक सीमित डिटेक्शन से हटकर एक नई सोच है, और यह उन उपयोग मामलों के लिए उपयुक्त है जहां वास्तविक दुनिया की श्रेणियों को पहले से पूरी तरह से सूचीबद्ध नहीं किया जा सकता है — उदाहरण के लिए, एक सामान्य-उद्देश्य वाले रोबोट के लिए वस्तु पहचान।
NMS-मुक्त होने के पीछे की तकनीकी प्रक्रिया
YOLO26 का NMS-मुक्त डिटेक्शन की ओर बढ़ना केवल एक पोस्ट-प्रोसेसिंग चरण को छोड़ना नहीं है — यह प्रशिक्षण पद्धति में ही बदलाव से संभव हुआ है। पारंपरिक YOLO डिज़ाइन प्रशिक्षण के दौरान प्रति ऑब्जेक्ट कई अनुमानित बॉक्सों को सहन करता था (एक-से-अनेक असाइनमेंट), इस धारणा के साथ कि NMS अनुमान के बाद डुप्लिकेट को हटा देगा। YOLO26 भविष्यवाणी हेड को नया रूप देता है, एक-से-एक असाइनमेंट पर स्विच करता है, जहां प्रशिक्षण से ही प्रति ऑब्जेक्ट इंस्टेंस एक एकल, निश्चित बॉक्स आउटपुट होता है। यह बाउंडिंग-बॉक्स रिग्रेशन (डिस्ट्रिब्यूशन फोकल लॉस) के लिए उपयोग किए जाने वाले वितरण-आधारित दृष्टिकोण को एक हल्के, अधिक हार्डवेयर-अनुकूल पैरामीटराइजेशन से भी बदल देता है, जिससे उन ऑपरेशनों को कम किया जाता है जो कंपाइलर और रनटाइम में अस्थिर होते हैं। इसका परिणाम CPU पर 43% तक तेज़ अनुमान है, साथ ही समग्र रूप से सरल पोस्ट-प्रोसेसिंग कार्यान्वयन भी है।
RF-DETR भी NMS-मुक्त है, लेकिन YOLO26 से अलग तंत्र द्वारा। RF-DETR अपने आधार के रूप में एक पूर्व-प्रशिक्षित विज़न ट्रांसफ़ॉर्मर, DINOv2 का उपयोग करता है, बहु-रिज़ॉल्यूशन विशेषताओं को निकालता है, और उन्हें एक डिकोडर के माध्यम से पास करता है जो सीखने योग्य प्रश्नों (सार प्रतिनिधित्व जो इसके लिए खड़े होते हैं) के साथ काम करता है। उम्मीदवार ऑब्जेक्ट)। प्रत्येक डिकोडर परत में स्व-ध्यान (क्वेरी के बीच संबंधों को कैप्चर करना), विरूपण योग्य क्रॉस-ध्यान (छवि विशेषताओं के भीतर नमूना बिंदुओं के एक छोटे, सीखे हुए सेट पर ही ध्यान देना), और एक फीड-फॉरवर्ड नेटवर्क होता है जो भविष्यवाणी को परिष्कृत करता है। यह "केवल कुछ सीखे हुए बिंदुओं पर ध्यान केंद्रित करने वाला" विरूपण योग्य ध्यान, मानक ट्रांसफ़ॉर्मर क्रॉस-ध्यान की तुलना में कम्प्यूटेशनल लागत को कम रखता है, जबकि अद्वितीय, सेट-आधारित भविष्यवाणियाँ उत्पन्न करता है - यही कारण है कि एनएमएस की आवश्यकता ही नहीं रह जाती।
क्रॉस-जेनरेशन तुलनाएँ वास्तव में क्या दर्शाती हैं: YOLOv8/v11/v26
ऐसे डेटा भी सामने आए हैं जो इस धारणा को गलत साबित करते हैं कि "नई पीढ़ी = समान रूप से उच्च सटीकता।" अगस्त 2026 में तीन YOLO पीढ़ियों और पाँच मॉडल पैमानों पर किए गए एक बेंचमार्क - बाग का पता लगाने और उदाहरण विभाजन में सूक्ष्म संरचनाओं (शाखाएँ, फल, अन्य छोटी वस्तुएँ) को लक्षित करते हुए - में पाया गया कि उच्चतम mAP@50:95 YOLOv26 द्वारा बिल्कुल भी निर्धारित नहीं किया गया था, बल्कि इसके द्वारा निर्धारित किया गया था। YOLOv11s-960 (0.402 मास्क mAP@50:95, 0.426 बॉक्स mAP@50:95)। वहीं, YOLOv26s-960 ने केवल 10.37 मिलियन पैरामीटर के साथ लगभग तुलनीय सटीकता हासिल की। इससे जो तस्वीर उभरती है वह यह है: प्रत्येक नई पीढ़ी के साथ सटीकता में एकसमान वृद्धि नहीं होती, लेकिन पैरामीटर दक्षता — यानी बहुत कम कंप्यूटिंग के साथ सटीकता का मिलान — लगातार बढ़ रही है।
छोटे ऑब्जेक्ट का पता लगाना भी एक वास्तविक, अनसुलझी चुनौती बनी हुई है। अगस्त 2026 में सैन्य वाहनों का पता लगाने के लिए छह YOLO वेरिएंट और दो DETR वेरिएंट की तुलना करने वाले एक मूल्यांकन में एक सुसंगत पैटर्न पाया गया: बड़े मॉडल बेहतर प्रदर्शन करते हैं, DETR-आधारित दृष्टिकोण आशाजनक हैं, और फाइन-ट्यूनिंग से एयर-टू-ग्राउंड (A2G) प्रदर्शन में सुधार होता है — लेकिन A2G परिदृश्य में छोटे ऑब्जेक्ट का पता लगाने में अभी भी हर मॉडल को कठिनाई होती है। न तो YOLO26 के NMS-मुक्त डिज़ाइन और न ही RF-DETR के उच्च mAP ने इस "छोटे, दूर के ऑब्जेक्ट" की समस्या को पूरी तरह से हल किया है। समस्या।
ओपन-वोकैबुलरी डिटेक्शन की प्रगति: ठोस एपी आंकड़े
YOLO-World/Grounding DINO के बाद विकसित ओपन-वोकैबुलरी डिटेक्टरों ने 2026 तक सटीकता में लगातार सुधार किया है। FlowOVD (मई 2026), जो टेक्स्ट-अज्ञेय क्वेरी को टेक्स्ट-गाइडेड क्वेरी में बदलने के लिए जनरेटिव रेक्टिफाइड फ्लो का उपयोग करता है, COCO पर 49.5 एपी और LVIS पर 31.5 एपी रिपोर्ट करता है — Grounding DINO की तुलना में क्रमशः +1.2 एपी (सापेक्ष +2.5%) और +4.1 एपी (सापेक्ष +15.0%) का सुधार। OPUS, जो अगस्त 2026 में प्रकाशित हुआ, एक ही एकीकृत फ्रेमवर्क के भीतर कई प्रकार के प्रॉम्प्ट — टेक्स्ट, विज़ुअल (इंटरैक्टिव/जेनेरिक) और मिश्रित — को संभालता है, और भारी-भरकम क्रॉस-मोडल फ्यूजन से बचने वाले सरल डिज़ाइन के बावजूद, यह अत्याधुनिक स्तर के आंकड़े प्रस्तुत करता है। COCO, LVIS-minival और ODinW35 बेंचमार्क में 68.1/69.2/54.7 AP प्राप्त हुआ। ओपन-वोकैबुलरी डिटेक्शन अब केवल एक गुणात्मक उपलब्धि नहीं रह गई है — अज्ञात श्रेणियों को संभालने की क्षमता — बल्कि यह निश्चित-श्रेणी डिटेक्टरों के साथ मात्रात्मक रूप से भी प्रतिस्पर्धा करने लगी है।
2026 तक का परिदृश्य
आज ऑब्जेक्ट डिटेक्शन मुख्य रूप से दो अक्षों पर आधारित है: एकल-चरण, NMS-मुक्त ट्रांसफॉर्मर आर्किटेक्चर और अपने स्थापित इकोसिस्टम के साथ YOLO परिवार। ट्रांसफॉर्मर पक्ष तेजी से विकसित हो रहा है, लेकिन YOLO परिवार अपने उत्पादन ट्रैक रिकॉर्ड और टूलिंग की व्यापकता के बल पर वास्तविक समय उत्पादन वातावरण की रीढ़ बना हुआ है। उपयोग के मामले के अनुसार विश्लेषण:
- सर्वोच्च सटीकता: RF-DETR
- ट्रैक रिकॉर्ड और इकोसिस्टम सबसे महत्वपूर्ण: YOLO26/YOLOv12
- शुद्ध गति: RTMDet
- अज्ञात श्रेणियों को संभालने की आवश्यकता श्रेणियाँ**: YOLO-World / Grounding DINO
यह वर्तमान कार्य विभाजन है।
क्या mAP अकेले ही रीयल-टाइम डिटेक्टर का चयन कर सकता है?
समान रिज़ॉल्यूशन, डेटा और हार्डवेयर पर विलंबता और गुणवत्ता की तुलना करें। प्री- और पोस्टप्रोसेसिंग के बिना अनुमान समय एंड-टू-एंड विलंबता नहीं है।
संदर्भ
- RF-DETR को समझना (AI की ओर)
- RT-DETRv2 पेपर (arXiv)
- रियल-टाइम ऑब्जेक्ट डिटेक्शन में DETRs, YOLOs से बेहतर प्रदर्शन करते हैं पेपर (arXiv)
- सर्वश्रेष्ठ ऑब्जेक्ट डिटेक्शन मॉडल 2026 (रोबोफ्लो ब्लॉग)
- YOLO26: रियल-टाइम ऑब्जेक्ट डिटेक्शन के लिए NMS-मुक्त एंड-टू-एंड फ्रेमवर्क का विश्लेषण (arXiv)
- RF-DETR पेपर (ICLR 2026, arXiv)
- RF-DETR GitHub (रोबोफ्लो)
- YOLOv26, YOLOv11 और YOLOv8 का क्रॉस-जेनरेशन ऑप्टिमाइजेशन पेपर (arXiv)
- ऑटोमैटिक टारगेट डिटेक्शन और रिकग्निशन के लिए आउट-ऑफ-द-बॉक्स टेक्नोलॉजी का तुलनात्मक अध्ययन पेपर (arXiv)
- FlowOVD पेपर (arXiv)
- OPUS पेपर (arXiv)
टिप्पणियाँ
पहले लॉग इन करें।
अभी कोई डेटा नहीं है।