Contents — find the section you need
YOLO परिवार व्यावहारिक वस्तु पहचान के लिए सबसे व्यापक रूप से उपयोग किए जाने वाले दृष्टिकोणों में से एक रहा है, और 2023 में YOLOv8 के बाद से इसका विकास जारी है। Ultralytics द्वारा 10 सितंबर, 2024 को जारी किया गया YOLO11, YOLOv8 के समान "रीढ़ की हड्डी → गर्दन → सिर" संरचना को बरकरार रखता है, जबकि इसके भीतर के ब्लॉकों को नया रूप देता है। यह लेख आधिकारिक दस्तावेज़ और मॉडल-परिभाषा YAML फ़ाइलों से प्राप्त प्राथमिक जानकारी, समीकरणों और आरेखों का उपयोग करते हुए, यह सत्यापित करता है कि YOLO11 में क्या परिवर्तन हुए और क्या बरकरार रखा गया है।
यह लेख Ultralytics के आधिकारिक दस्तावेज़ (docs.ultralytics.com), आधिकारिक GitHub रिपॉज़िटरी में मौजूद कॉन्फ़िगरेशन फ़ाइलों और प्रीप्रिंट “YOLOv11 Demystified” (arXiv:2604.03349) पर आधारित है।
0. आप क्या सीखेंगे
- YOLO11 में YOLOv8 से क्या बदलाव हुए हैं, जिनमें C3k2 और C2PSA शामिल हैं
- एंकर-मुक्त डिटेक्शन हेड निर्देशांकों का अनुमान कैसे लगाता है, जिनमें DFL शामिल है
- प्रशिक्षण के लिए उपयोग किए जाने वाले लॉस फ़ंक्शन और ऑग्मेंटेशन विधियाँ
- आधिकारिक मापों का उपयोग करते हुए, पाँच आकारों n/s/m/l/x में सटीकता, पैरामीटर संख्या और गति में परिवर्तन कैसे होता है
- YOLO11 कब चुनें और कब किसी अन्य विकल्प पर विचार करें
1. YOLO11 क्या है?
YOLO11 Ultralytics द्वारा विकसित और जारी किए गए रीयल-टाइम ऑब्जेक्ट-डिटेक्शन मॉडल की एक पीढ़ी है। यह YOLOv8 के तीन-चरण वाले “रीढ़ की हड्डी, गर्दन और सिर” डिज़ाइन को बरकरार रखता है, इसके फ़ीचर-एक्सट्रैक्शन ब्लॉक को नए डिज़ाइन किए गए C3k2 से बदल देता है, और रीढ़ की हड्डी के अंत में C2PSA स्थानिक-ध्यान ब्लॉक जोड़ता है। एक ही सामान्य आर्किटेक्चर एक ही फ्रेमवर्क के भीतर डिटेक्शन, सेगमेंटेशन, पोज़ एस्टिमेशन, क्लासिफिकेशन, ओरिएंटेड बाउंडिंग बॉक्स (OBB) और ट्रैकिंग को कवर करता है।
2. इस रीडिज़ाइन की आवश्यकता क्यों पड़ी?
उस समय, YOLOv8 एक मजबूत सटीकता-गति संतुलन वाले एक-चरण डिटेक्टर के रूप में व्यापक रूप से उपयोग किया जाता था, लेकिन दो क्षेत्रों में सुधार की गुंजाइश थी। पहला था पैरामीटर दक्षता। यदि कम पैरामीटर और FLOPs के साथ समान सटीकता प्राप्त की जा सकती है, तो एज डिवाइस और बैटरी-संचालित रोबोट पर इसका उपयोग अधिक व्यावहारिक हो जाता है। दूसरा था फ़ीचर मैप में कहाँ फ़ोकस करना है, यह सीखने के लिए एक स्पष्ट तंत्र का अभाव। YOLOv8 का बैकबोन कनवोल्यूशन का उपयोग करके फ़ीचर बनाता है, लेकिन इसमें बैकग्राउंड से महत्वपूर्ण क्षेत्रों को अलग करने का कोई समर्पित तंत्र नहीं है। C3k2 और C2PSA क्रमशः इन दोनों समस्याओं का समाधान करते हैं।
3. इनपुट क्या है?
कई अन्य YOLO डिटेक्टरों की तरह, YOLO11 एक निश्चित आकार (डिफ़ॉल्ट रूप से 640 × 640 पिक्सेल) की रीसाइज़ और पैडेड RGB छवि लेता है। प्रशिक्षण और अनुमान दोनों के दौरान, इनपुट को बैच्ड [B, 3, H, W] टेंसर के रूप में माना जाता है। किसी विशेष प्रीप्रोसेसिंग, जैसे कि मालिकाना नॉर्मलाइज़ेशन या पैच स्प्लिटिंग की आवश्यकता नहीं है: मोज़ेक जैसे मानक ऑग्मेंटेशन के बाद की छवियां सीधे बैकबोन को भेजी जाती हैं।
4. यह क्या अनुमान लगाता है?
छवि में प्रत्येक ऑब्जेक्ट के लिए, आउटपुट में एक क्लास, बाउंडिंग-बॉक्स निर्देशांक और एक कॉन्फिडेंस स्कोर होता है। YOLO11 एक डीकपल्ड हेड का उपयोग करता है जो वर्गीकरण और बॉक्स-रिग्रेशन शाखाओं को अलग करता है। यह एंकर-मुक्त भी है, इसलिए यह पूर्वनिर्धारित एंकर बॉक्स के बिना सीधे निर्देशांकों का प्रतिगमन करता है। प्रत्येक ग्रिड स्थान से वस्तु की सीमा तक की दूरी का अनुमान लगाने का विचार YOLO11 को एंकर-मुक्त डिटेक्टरों के FCOS परिवार से जोड़ता है। कई पहलू अनुपातों और पैमानों के लिए पूर्वनिर्धारित बॉक्सों को हटाने से हाइपरपैरामीटर ट्यूनिंग कम हो जाती है और अत्यधिक पहलू अनुपातों वाली वस्तुओं के लिए सामान्यीकरण में सुधार हो सकता है।
5. मूल संरचना
YOLOv8 की तरह, YOLO11 भी तीन-चरणीय "रीढ़ की हड्डी → गर्दन → सिर" संरचना का अनुसरण करता है। परिवर्तन इन चरणों की सामग्री में है।
चित्र 1 — YOLO11 की रीढ़, गर्दन और सिर। नीले रंग से हाइलाइट किए गए बॉक्स YOLOv8 से बदले गए हिस्से हैं। बैकबोन और नेक दोनों में C3k2 मूल ब्लॉक की जगह लेता है, जबकि C2PSA को बैकबोन के अंत में, SPPF के ठीक बाद जोड़ा जाता है।
बैकबोन तीन रिज़ॉल्यूशन, P3, P4 और P5 पर फ़ीचर मैप आउटपुट करता है। नेक (PAN-FPN: पाथ एग्रीगेशन नेटवर्क + फ़ीचर पिरामिड नेटवर्क) दोनों दिशाओं में उच्च और निम्न रिज़ॉल्यूशन फ़ीचर को फ़्यूज़ करता है, जिससे एक ही नेटवर्क छोटे और बड़े ऑब्जेक्ट का पता लगा सकता है। यह मल्टी-स्केल फ़्यूज़न स्केलेटन YOLOv8 से अपरिवर्तित है। जो बदला है वह यह है कि C2f को मूल ब्लॉक के रूप में C3k2 से बदल दिया गया है, और C2PSA को बैकबोन आउटपुट में डाला गया है।
6. घटकों का तकनीकी विवरण
C3k2 — C2f का सामान्यीकरण
YOLOv8 ने CSP (क्रॉस स्टेज पार्शियल) संरचना वाले C2f ब्लॉक को अपनी मूल इकाई के रूप में उपयोग किया। C2f इनपुट चैनलों को दो पथों में विभाजित करता है, एक पथ को कई बॉटलनेक ब्लॉकों से गुजारता है, दूसरे को शॉर्टकट के रूप में छोड़ देता है, फिर दोनों आउटपुट और प्रत्येक बॉटलनेक से मध्यवर्ती आउटपुट को जोड़ता है और अंत में उन्हें 1 × 1 कनवोल्यूशन के साथ मर्ज करता है।
YOLO11 आंतरिक ब्लॉकों को दोहराने की अवधारणा को बरकरार रखता है, लेकिन आंतरिक ब्लॉक प्रकार को कॉन्फ़िगर करने योग्य बनाता है। आधिकारिक मॉडल परिभाषा (YAML) में, C3k2 के भीतर प्रत्येक ब्लॉक कंस्ट्रक्टर फ़्लैग के आधार पर निम्न में से एक हो सकता है:
- एक सामान्य
Bottleneck(छोटे n मॉडल द्वारा उपयोग किया जाता है) - एक
C3kब्लॉक (एक C3 संरचना जिसमें कर्नेल का आकार निर्धारित किया जा सकता है, जिसका उपयोग मध्यम और बड़े m/l/x मॉडल मेंc3k=Trueके साथ किया जाता है) - एक
Bottleneck + PSABlockयुग्म (रीढ़ की हड्डी के अंत में C2PSA के भीतर उपयोग किया जाता है)
दूसरे शब्दों में, C3k2 एक सामान्यीकृत ब्लॉक है: यह C2f की अवधारणा को बरकरार रखता है, साथ ही मॉडल के आकार और स्थान के अनुसार इसके आंतरिक बॉटलनेक को हल्के ब्लॉक से लेकर विशेष रूप से डिज़ाइन किए गए ब्लॉक तक भिन्न होने की अनुमति देता है। एक कार्यान्वयन विवरण यह है कि एक YAML कॉन्फ़िगरेशन इन आंतरिक घटकों को बदलकर सभी पाँच आकारों, n/s/m/l/x को कवर करता है।
C2PSA — बैकबोन में स्थानिक ध्यान जोड़ना
C2PSA (क्रॉस स्टेज पार्शियल विद स्पेशल अटेंशन) YOLO11 का एक नया ब्लॉक है जिसे SPPF (स्पेशियल पिरामिड पूलिंग - फास्ट, एक मॉड्यूल जो कई पूलिंग आकारों के साथ रिसेप्टिव फील्ड का विस्तार करता है) के ठीक बाद डाला गया है। C2PSA भी CSP संरचना का अनुसरण करता है: एक पथ कई PSABlocks से होकर गुजरता है। प्रत्येक PSABlock मल्टी-हेड सेल्फ-अटेंशन (MHSA) और एक दो-परत फीड-फॉरवर्ड नेटवर्क (FFN) को जोड़ता है, जो अवशिष्ट पथों से जुड़े होते हैं।
यहाँ x इनपुट फीचर है, \text{MHSA} मल्टी-हेड सेल्फ-अटेंशन है, और \text{FFN} दो-परत फीड-फॉरवर्ड नेटवर्क है। YOLOv8 के केवल कनवोल्यूशन-आधारित बैकबोन की तुलना में, C2PSA फीचर मैप में दूरस्थ स्थितियों के बीच संबंधों को सीधे सीखने के लिए सेल्फ-अटेंशन का उपयोग करता है। यह कनवोल्यूशन के स्थानीय रिसेप्टिव फील्ड का पूरक है और छवि के महत्वपूर्ण क्षेत्रों पर भार केंद्रित करने में मदद करता है।
एंकर-मुक्त डिटेक्शन हेड और डीएफएल
YOLO11 का डिटेक्शन हेड वर्गीकरण और बॉक्स रिग्रेशन को अलग-अलग शाखाओं में विभाजित करता है। यह पूर्वनिर्धारित एंकर बॉक्स का उपयोग नहीं करता है; इसके बजाय, फीचर मैप पर प्रत्येक ग्रिड बिंदु सीधे ऑब्जेक्ट बाउंड्री की दूरी का अनुमान लगाता है। चारों दिशाओं में से प्रत्येक के लिए, बॉक्स-रिग्रेशन शाखा \text{reg\_max}=16 असतत बिन्स पर एक संभाव्यता वितरण आउटपुट करती है और इसके अपेक्षित मान को सतत दूरी के रूप में उपयोग करती है। यही डिस्ट्रीब्यूशन फोकल लॉस (डीएफएल) का मूल विचार है, जो YOLOv8 से लिया गया है और ली एट अल द्वारा "जनरलाइज्ड फोकल लॉस" (न्यूरिप्स 2020) में प्रस्तावित किया गया है।
बाउंड्री की दूरी के लिए सीधे एक वास्तविक मान का रिग्रेशन करने के बजाय, मॉडल संभावित बिन्स पर एक असतत वितरण सीखता है। इससे प्रशिक्षण अधिक स्थिर हो जाता है, साथ ही वितरण अस्पष्ट या अवरुद्ध आकृति वाली वस्तुओं के लिए अनिश्चितता को व्यक्त करने की अनुमति देता है। YOLO11 वर्गीकरण शाखा को भी डेप्थवाइज-सेपरेबल कनवोल्यूशन का उपयोग करने के लिए बदलता है, जिससे सामान्य कनवोल्यूशन की तुलना में पैरामीटर संख्या और गणना कम हो जाती है।
हानि फलन और प्रशिक्षण विधि
YOLO11 की प्रशिक्षण हानि बॉक्स रिग्रेशन के लिए CIoU (पूर्ण IoU) हानि, निर्देशांक वितरण के लिए DFL हानि और वर्गीकरण के लिए BCE (बाइनरी क्रॉस-एंट्रोपी) हानि का भारित योग है।
CIoU हानि न केवल IoU (ओवरलैप अनुपात) का मूल्यांकन करती है, बल्कि बॉक्स केंद्रों के बीच की दूरी और उनके पहलू अनुपातों के मिलान की सटीकता का भी मूल्यांकन करती है।
\rho(b, b^{gt}) अनुमानित और वास्तविक बॉक्स केंद्रों के बीच यूक्लिडियन दूरी है, c दोनों बॉक्सों को घेरने वाले सबसे छोटे आयत की विकर्ण लंबाई है, v पहलू अनुपात बेमेल को दर्शाता है, और \alpha एक गुणांक है जो IoU के बढ़ने पर v को अधिक भार देता है। जब बॉक्स ओवरलैप नहीं होते हैं तो केवल IoU को अनुकूलित करने से लगभग कोई ग्रेडिएंट नहीं मिलता है; केंद्र-दूरी और पहलू अनुपात पद इस समस्या को कम करते हैं।
प्रशिक्षण में मोज़ेक सहित संवर्द्धन का उपयोग किया जाता है, जो कई छवियों को जोड़ता है; मिक्सअप, जो दो छवियों को मिश्रित करता है; कॉपी-पेस्ट, जो एक ऑब्जेक्ट क्षेत्र को दूसरी छवि में पेस्ट करता है; रैंडऑगमेंट, जो स्वचालित रूप से यादृच्छिक रूपांतरणों का चयन करता है; और इरेज़िंग, जो एक यादृच्छिक आयताकार क्षेत्र को हटाता है। ये विवरण “YOLOv11 Demystified” (arXiv:2604.03349) में दिए गए विवरण के अनुसार हैं।
7. मॉडल वेरिएंट की तुलना
YOLO11 पाँच आकारों में उपलब्ध है, जिनमें अलग-अलग पैरामीटर संख्या और कंप्यूटिंग आवश्यकताएँ हैं: n (नैनो), s (स्मॉल), m (मीडियम), l (लार्ज) और x (एक्स्ट्रा-लार्ज)। COCO val2017 पर 640 px इनपुट के साथ Ultralytics के आधिकारिक दस्तावेज़ में रिपोर्ट किए गए बेंचमार्क मान निम्नलिखित हैं।
| मॉडल | mAP50-95 | पैरामीटर | FLOPs | CPU ONNX इन्फ़रेंस | T4 TensorRT इन्फ़रेंस |
|---|---|---|---|---|---|
| YOLO11n | 39.5 | 2.6M | 6.5B | 56.1 ± 0.8 ms | 1.5 ± 0.0 मिलीसेकंड |
योलो11एस | 47.0 | 9.4एम | 21.6बी | 90.0 ± 1.2 मिलीसेकंड | 2.5 ± 0.0 मिलीसेकंड |
योलो11एम | 51.5 | 20.1एम | 68.1बी | 183.2 ± 2.0 मिलीसेकंड | 4.7 ± 0.1 मिलीसेकंड |
योलो11एल | 53.4 | 25.3एम | 87.2बी | 238.6 ± 1.4 मिलीसेकंड | 6.2 ± 0.1 मिलीसेकंड |
योलो11एक्स | 54.7 | 56.9एम | 195.3बी | 462.8 ± 6.7 मिलीसेकंड | 11.3 ± 0.2 मिलीसेकंड |
स्रोत: अल्ट्रालिटिक्स YOLO11 आधिकारिक दस्तावेज़। CPU ONNX इन्फ़रेंस ONNX रनटाइम का उपयोग करता है; T4 TensorRT इन्फ़रेंस NVIDIA T4 GPU पर FP16 मानक पर चलता है।
दो व्यावहारिक बिंदु प्रमुख हैं। पहला, n से x तक पैरामीटर की संख्या लगभग 22 गुना बढ़ जाती है, जबकि mAP50-95 केवल लगभग 15 अंक बढ़ता है, 39.5 से 54.7 तक: सटीकता और मॉडल का आकार रैखिक रूप से संबंधित नहीं हैं। दूसरा, m और l के बीच के अंतर पर विचार करें। पैरामीटर केवल 20.1M से 25.3M तक बढ़ते हैं, जबकि mAP 51.5 से 53.4 तक और GPU इन्फ़रेंस समय 4.7 मिलीसेकंड से 6.2 मिलीसेकंड तक बढ़ता है। इसलिए, m से l तक जाने पर मिलने वाला लाभ n → s → m चरणों की तुलना में कुछ कम है। ये संख्याएँ एज डिप्लॉयमेंट के लिए n/s और सटीकता को प्राथमिकता देने वाले फिक्स्ड सिस्टम के लिए l/x का समर्थन करती हैं।
YOLOv8 के साथ मात्रात्मक तुलना
YOLATlytics के उसी दस्तावेज़ में रिपोर्ट किए गए YOLOv8 मानों को YOLO11 के साथ रखने से पीढ़ीगत परिवर्तन अधिक स्पष्ट हो जाता है।
| मॉडल | mAP50-95 (v8 → v11) | पैरामीटर (v8 → v11) | FLOPs (v8 → v11) | CPU ONNX इन्फ़रेंस (v8 → v11) |
|---|---|---|---|---|
| n | 37.3 → 39.5 | 3.2M → 2.6M | 8.7B → 6.5B | 80.4ms → 56.1ms |
| s | 44.9 → 47.0 | 11.2एम → 9.4एम | 28.6बी → 21.6बी | 128.4 एमएस → 90.0 एमएस |
| एम | 50.2 → 51.5 | 25.9एम → 20.1एम | 78.9बी → 68.1बी | 234.7 एमएस → 183.2 एमएस |
| एल | 52.9 → 53.4 | 43.7M → 25.3M | 165.1बी → 87.2बी | 375.2 एमएस → 238.6 एमएस |
| एक्स | 53.9 → 54.7 | 68.2M → 56.9M | 257.8B → 195.3B | 479.1ms → 462.8ms |
स्रोत: YOLOv8 आधिकारिक दस्तावेज़ और YOLO11 आधिकारिक दस्तावेज़ (COCO val2017, 640 px, दोनों के लिए CPU ONNX इन्फ़रेंस)।
l आकार के लिए, पैरामीटर संख्या 43.7M से घटकर 25.3M हो जाती है, लगभग आधी, जबकि mAP में मामूली सुधार होता है। यहीं पर C3k2 और C2PSA का पैरामीटर-दक्षता प्रभाव सबसे अधिक स्पष्ट होता है। x के लिए, पैरामीटर और FLOPs में काफ़ी कमी आती है, लेकिन CPU इन्फ़रेंस समय में केवल मामूली सुधार होता है, जिससे पता चलता है कि C2PSA में स्व-ध्यान गणना बड़े मॉडलों के लिए एक बाधा बन सकती है।
संक्षेप में कहें तो, YOLO11 कम पैरामीटर और कम FLOPs के साथ YOLOv8 की तुलना में कम से कम तुलनीय mAP प्राप्त करने की दिशा में आगे बढ़ रहा है। इसका मतलब यह नहीं है कि यह हमेशा YOLOv8 से बेहतर है: कार्य और डेटासेट के आधार पर, पुरानी पीढ़ी अभी भी उच्चतर निरपेक्ष सटीकता प्रदान कर सकती है। ऑब्जेक्ट डिटेक्शन ट्रेंड्स लेख में भी इस बिंदु पर चर्चा की गई है।
YOLO11 का डिटेक्शन से आगे विस्तार
YOLO11 केवल ऑब्जेक्ट डिटेक्शन तक सीमित नहीं है। केवल सिर को बदलकर और बैकबोन और गर्दन को समान रखते हुए, यह फ्रेमवर्क इंस्टेंस सेगमेंटेशन (YOLO11-seg), पोज एस्टिमेशन (YOLO11-pose, जो कीपॉइंट कोऑर्डिनेट्स का रिग्रेशन करता है), क्लासिफिकेशन (YOLO11-cls), ओरिएंटेड बाउंडिंग-बॉक्स डिटेक्शन (YOLO11-obb, जो झुकी हुई वस्तुओं के ओरिएंटेशन का भी रिग्रेशन करता है), और कई फ्रेमों में ट्रैकिंग को कवर करता है। चूंकि C3k2 और C2PSA बैकबोन को बेहतर बनाते हैं, इसलिए उनके लाभ इन सभी कार्यों में समान रूप से उपलब्ध हैं। इससे यह भी पता चलता है कि YOLO11 को केवल एक डिटेक्शन मॉडल के बजाय एक सामान्य दृश्य-पहचान आधार के रूप में डिज़ाइन किया गया है।
8. इसकी चुनौतियाँ
YOLO11 में YOLO परिवार की कुछ सामान्य कमियाँ बरकरार हैं। छोटे और दूर स्थित ऑब्जेक्ट अभी भी मुश्किल हैं। चूंकि बैकबोन धीरे-धीरे रिज़ॉल्यूशन कम करता है, इसलिए कुछ पिक्सेल चौड़ाई वाला ऑब्जेक्ट भी गहरी परतों तक पहुँचते-पहुँचते अपने लगभग सभी विशिष्ट लक्षण खो सकता है। C2PSA इसे आंशिक रूप से कम करता है, लेकिन इसका मूल समाधान नहीं करता।
कई समान ऑब्जेक्ट वाले सघन दृश्य भी चुनौतीपूर्ण हैं। DFL और CIoU सीमा प्रतिगमन में सुधार करते हैं, लेकिन आस-पास के ऑब्जेक्ट जिनकी सीमाएँ ओवरलैप होती हैं, जैसे कि भीड़ या बगीचे में घनी तरह से पैक किए गए फल, अभी भी गलत पहचान और चूक का कारण बन सकते हैं।
डोमेन शिफ्ट के प्रति संवेदनशीलता CNN-आधारित डिटेक्टरों के लिए एक सामान्य समस्या है। प्रशिक्षण डेटा से काफी भिन्न प्रकाश, मौसम या कैमरा कोणों के कारण सटीकता में तेजी से गिरावट आ सकती है। C2PSA, ट्रांसफ़ॉर्मर-आधारित DETR परिवार की तुलना में व्यापक रिसेप्टिव फ़ील्ड प्रदान नहीं करता है, इसलिए YOLO11 इस मामले में कम मज़बूत हो सकता है।
YOLO11 को AGPL-3.0 लाइसेंस के तहत जारी किया गया है। यदि किसी व्यावसायिक उपयोग के लिए स्रोत कोड को गोपनीय रखना आवश्यक है, तो Ultralytics Enterprise लाइसेंस की आवश्यकता होगी। यह कोई तकनीकी खामी नहीं है, बल्कि एक व्यावहारिक बाधा है जिसे नज़रअंदाज़ करना आसान है।
9. व्यवहार में इसका चुनाव कैसे करें
एज डिवाइस और बैटरी-चालित रोबोट के लिए, अनुमान गति और पैरामीटर संख्या आमतौर पर बाधाएँ होती हैं, जिससे YOLO11n/s पहली पसंद बन जाता है। n मॉडल का लगभग 56 मिलीसेकंड का CPU अनुमान, सिस्टम के बाकी हिस्सों के आधार पर, Raspberry Pi-क्लास एम्बेडेड हार्डवेयर पर संचालन को व्यावहारिक बना सकता है।
ड्रोन और अन्य गतिशील प्लेटफार्मों से हवाई निरीक्षण के लिए, छोटी वस्तुओं का पता लगाना महत्वपूर्ण है। केवल एक बड़ा YOLO11 मॉडल चुनने के बजाय, इनपुट रिज़ॉल्यूशन बढ़ाएँ या टाइल्ड अनुमान का उपयोग करें। कुछ रिपोर्टों में डिफॉर्मेबल-अटेंशन DETR वेरिएंट्स को इस क्षेत्र में बेहतर बताया गया है, इसलिए जब सटीकता को प्राथमिकता दी जाती है, तो RT-DETR और अन्य परिवार उचित तुलना के विकल्प हैं।
स्थिर गोदाम या फ़ैक्टरी कैमरों से निरीक्षण के लिए, GPU संसाधनों की उपलब्धता और सटीकता को प्राथमिकता दिए जाने पर YOLO11l/x विकल्प उपलब्ध हैं। यहाँ भी, RF-DETR जैसे ट्रांसफ़ॉर्मर-आधारित डिटेक्टरों ने COCO पर 60 mAP से अधिक की रिपोर्ट दी है, इसलिए YOLO अब एकमात्र विकल्प नहीं है। विवरण के लिए ऑब्जेक्ट डिटेक्शन ट्रेंड्स लेख देखें।
अनुसंधान और प्रोटोटाइपिंग के लिए, Ultralytics के Python पैकेज की परिपक्वता YOLO11 चुनने का एक व्यावहारिक कारण है: प्रशिक्षण, अनुमान और निर्यात कुछ ही पंक्तियों में किया जा सकता है। जहाँ इसकी लाइसेंसिंग संबंधी शर्तें स्वीकार्य हैं, वहाँ कार्यशील बेसलाइन प्राप्त करने की गति इसकी एक प्रमुख खूबी बनी हुई है।
10. तीन पंक्तियों में सारांश
-
YOLO11, YOLOv8 के बैकबोन-नेक-हेड आउटलाइन को बरकरार रखता है, इसके बेसिक ब्लॉक्स को C3k2 से बदलता है, और C2PSA के माध्यम से स्थानिक ध्यान जोड़ता है।
-
इसका एंकर-मुक्त हेड, DFL वितरणों के अपेक्षित मान के रूप में सीमा दूरियों का अनुमान लगाता है, जबकि CIoU संयुक्त रूप से ओवरलैप, केंद्र दूरी और पहलू अनुपात को अनुकूलित करता है।
पैरामीटर दक्षता n से x तक बेहतर होती है, लेकिन छोटी वस्तुएं, सघन दृश्य और डोमेन शिफ्ट, YOLO परिवार के डिटेक्टरों के लिए आम चुनौतियां बनी हुई हैं।
ऑब्जेक्ट डिटेक्शन और सिमेंटिक सेगमेंटेशन के अधिक मूलभूत परिचय के लिए, ऑब्जेक्ट डिटेक्शन और सिमेंटिक सेगमेंटेशन: एक परिचय देखें। NMS-मुक्त दृष्टिकोणों और DETR मॉडलों से प्रतिस्पर्धा सहित, YOLO परिवार में वर्तमान रुझानों के लिए, ऑब्जेक्ट डिटेक्शन ट्रेंड्स लेख देखें।
संदर्भ
- अल्ट्रालिटिक्स YOLO11 आधिकारिक दस्तावेज़
- अल्ट्रालिटिक्स: YOLO आर्किटेक्चर गाइड
- अल्ट्रालिटिक्स: एंकर-मुक्त डिटेक्टर के रूप में YOLO11 के लाभ
- YOLO11 आधिकारिक मॉडल कॉन्फ़िगरेशन (गिटहब)
- YOLOv11 का सरलीकरण: उच्च-प्रदर्शन ऑब्जेक्ट डिटेक्शन के लिए एक व्यावहारिक गाइड (arXiv:2604.03349)
- सामान्यीकृत फोकल लॉस: सघन ऑब्जेक्ट डिटेक्शन के लिए योग्य और वितरित बाउंडिंग बॉक्स सीखना (NeurIPS 2020, arXiv:2006.04388)
- अल्ट्रालिटिक्स लाइसेंसिंग
क्या उच्च पहचान स्कोर स्थिति और वर्ग की सटीकता की गारंटी देता है?
स्कोर एक मॉडल आउटपुट है, सटीकता की गारंटी नहीं। पता लगाए गए बॉक्सों की स्थानीयकरण सटीकता से अलग, विभिन्न थ्रेशोल्ड पर परिशुद्धता और रिकॉल का मूल्यांकन करें।
टिप्पणियाँ
पहले लॉग इन करें।
अभी कोई डेटा नहीं है।