Contents — find the section you need
SegFormer से पहले भी सिमेंटिक सेगमेंटेशन में ट्रांसफॉर्मर को शामिल करने के प्रयास किए गए थे, लेकिन उनमें से कई पोजीशनल एनकोडिंग और जटिल डिकोडर पर निर्भर थे। इसलिए उन्हें दो समस्याओं का सामना करना पड़ा: परीक्षण रिज़ॉल्यूशन और प्रशिक्षण रिज़ॉल्यूशन में अंतर होने पर सटीकता कम हो सकती थी, और गणना महंगी हो सकती थी। SegFormer (Xie, Wang, Yu, Anandkumar, Alvarez, and Luo, NeurIPS 2021) एक उल्लेखनीय रूप से सरल डिज़ाइन के साथ इन दोनों समस्याओं का समाधान करता है: एक पदानुक्रमित एनकोडर जिसमें पोजीशनल एनकोडिंग नहीं है और एक ऑल-MLP डिकोडर जो बिल्कुल भी कनवोल्यूशन का उपयोग नहीं करता है। यह लेख मूल शोध पत्र (arXiv:2105.15203) के आधार पर चरण दर चरण यह विश्लेषण करता है कि यह डिज़ाइन कैसे काम करता है।
यह लेख मूल शोधपत्र “SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers” (Xie et al., NeurIPS 2021, arXiv:2105.15203) पर आधारित है।
0. आप क्या सीखेंगे
- SegFormer ने पहले के ट्रांसफ़ॉर्मर-आधारित सेगमेंटेशन मॉडलों में जिन समस्याओं को हल करने का लक्ष्य रखा है
- पदानुक्रमित MiT (मिक्स ट्रांसफ़ॉर्मर) एनकोडर बिना पोजीशनल एनकोडिंग के कैसे काम करता है
- बिना किसी कनवोल्यूशन के, केवल MLP से बना डिकोडर उच्च सटीकता कैसे प्राप्त कर सकता है
- सिटीस्केप्स और ADE20K पर B0–B5 के लिए मापा गया mIoU, पैरामीटर गणना और कम्प्यूटेशनल लागत
- व्यवहार में मॉडल का चयन कैसे करें, जिसमें छवि संक्षारण के प्रति मजबूती भी शामिल है
1. SegFormer क्या है?
SegFormer एक सिमेंटिक सेगमेंटेशन मॉडल है जो पोजीशनल एनकोडिंग के बिना एक पदानुक्रमित ट्रांसफॉर्मर एनकोडर (MiT) को एक हल्के ऑल-MLP डिकोडर के साथ जोड़ता है जो बिल्कुल भी कनवोल्यूशन का उपयोग नहीं करता है। इसका मूल विचार एनकोडर और डिकोडर के बीच कार्य विभाजन को पुनर्परिभाषित करना है: एक बार जब एनकोडर कई रिज़ॉल्यूशन पर विशेषताएँ उत्पन्न कर लेता है, तो डिकोडर को बहुत सरल बनाया जा सकता है।
2. यह डिज़ाइन क्यों आवश्यक था?
सिमेंटिक सेगमेंटेशन के लिए विज़न ट्रांसफॉर्मर (ViT) को सीधे एनकोडर के रूप में उपयोग करने से दो समस्याएँ उत्पन्न होती हैं। पहली, ViT द्वारा उत्पन्न विशेषताओं का केवल एकल रिज़ॉल्यूशन होता है। एक छवि में वस्तुओं के कई अलग-अलग आकार हो सकते हैं, और FCN और U-Net जैसे पारंपरिक CNN-आधारित सेगमेंटेशन मॉडल कई रिज़ॉल्यूशन पर विशेषताओं को संयोजित करके इस समस्या का समाधान करते हैं। केवल एक रिज़ॉल्यूशन उत्पन्न करने वाला ViT इस बहु-स्तरीय प्रतिनिधित्व क्षमता को खो देता है।
दूसरी समस्या पोजीशनल एनकोडिंग पर निर्भरता है। ViT एक छवि को पैच में विभाजित करता है और उन्हें ट्रांसफ़ॉर्मर को देता है, लेकिन ट्रांसफ़ॉर्मर को स्वयं इस बात की जानकारी नहीं होती कि छवि में प्रत्येक पैच कहाँ स्थित है। इसलिए, एक निश्चित या सीखा हुआ स्थितिगत एन्कोडिंग अलग से जोड़ना आवश्यक है। चूंकि यह एन्कोडिंग प्रशिक्षण के दौरान उपयोग किए गए इनपुट रिज़ॉल्यूशन के लिए बनाया गया है, अनुमान के समय भिन्न रिज़ॉल्यूशन वाली छवि के लिए स्थितिगत एन्कोडिंग का इंटरपोलेशन आवश्यक होता है, जिससे सटीकता कम हो सकती है। सेगमेंटेशन में अक्सर डिटेक्शन की तुलना में उच्च-रिज़ॉल्यूशन इनपुट की आवश्यकता होती है, जिससे यह रिज़ॉल्यूशन निर्भरता विशेष रूप से समस्याग्रस्त हो जाती है।
SegFormer एक पदानुक्रमित एनकोडर का उपयोग करके और स्थितिगत एन्कोडिंग को पूरी तरह से समाप्त करके इन दोनों समस्याओं का मूल समाधान करता है।
3. इनपुट क्या है?
अन्य सेगमेंटेशन मॉडल की तरह, इनपुट एक RGB छवि x \in \mathbb{R}^{H \times W \times 3} है। SegFormer का मूल्यांकन सिटीस्केप के लिए उच्च-रिज़ॉल्यूशन छवियों (1024×2048) और ADE20K के लिए लगभग 512×512 छवियों पर किया जाता है। जबकि ViT मोटे 16×16 पैच के साथ डाउनसैंपलिंग करता है, SegFormer का एनकोडर 4×4 जितने छोटे पैच से शुरू होता है, जिससे फीचर एक्सट्रैक्शन की शुरुआत में अधिक विवरण संरक्षित रहता है।
4. यह क्या अनुमान लगाता है?
आउटपुट इनपुट रिज़ॉल्यूशन के 1/4 पर एक सेगमेंटेशन मैप होता है, जिसमें प्रत्येक पिक्सेल का वर्ग \hat{y} \in \mathbb{R}^{\frac{H}{4} \times \frac{W}{4} \times N_{cls}} के रूप में दर्शाया जाता है (N_{cls} वर्गों की संख्या है)। फिर इसे निकटतम-पड़ोसी इंटरपोलेशन या इसी तरह की विधि का उपयोग करके मूल रिज़ॉल्यूशन में वापस लाया जाता है। मूल विचार यह है कि यदि एनकोडर पर्याप्त समृद्ध मल्टी-स्केल फीचर्स बनाता है, तो डिकोडर को उन्हें एकीकृत करने और उन्हें एक सटीक मास्क में परिवर्तित करने के लिए केवल सरल रैखिक परतों के संयोजन की आवश्यकता होती है।
5. मूल संरचना
SegFormer में दो प्रमुख ब्लॉक होते हैं: एक MiT (मिक्स ट्रांसफ़ॉर्मर) एनकोडर जो चार रिज़ॉल्यूशन पर फ़ीचर निकालता है, और एक ऑल-MLP डिकोडर जो उन फ़ीचर को संयोजित करता है और एक सेगमेंटेशन मास्क आउटपुट करता है।
चित्र 1 — MiT एनकोडर चार रिज़ॉल्यूशन (1/4, 1/8, 1/16 और 1/32) पर फ़ीचर उत्पन्न करता है, और ऑल-MLP डिकोडर केवल लीनियर लेयर्स का उपयोग करके उन्हें संयोजित करके एक सेगमेंटेशन मास्क बनाता है। एनकोडर के Mix-FFN में केवल कनवोल्यूशन होता है; डिकोडर पूरी तरह से लीनियर लेयर्स से बना है।
चूंकि एनकोडर पहले से ही चार रिज़ॉल्यूशन पर फ़ीचर्स बनाता है, इसलिए डिकोडर लगभग न्यूनतम प्रोसेसिंग के साथ एक सटीक मास्क प्राप्त कर सकता है: फ़ीचर्स को अलाइन करें और उन्हें संयोजित करें। काम का यह विभाजन ही SegFormer के कुल पैरामीटर की संख्या कम रखने का मुख्य कारण है।
6. घटकों का तकनीकी विवरण
ओवरलैप्ड पैच मर्जिंग — एक चार-चरणीय पदानुक्रम
ViT की तरह छवि को केवल एक बार पैच में विभाजित करने के बजाय, MiT एनकोडर चार चरणों में धीरे-धीरे रिज़ॉल्यूशन कम करता है। आउटपुट रिज़ॉल्यूशन इनपुट के 1/4, 1/8, 1/16 और 1/32 होते हैं, जो ResNet जैसे CNN बैकबोन द्वारा उपयोग की जाने वाली पदानुक्रमित संरचना को पुन: उत्पन्न करते हैं।
पैच विभाजन विधि ViT के गैर-अतिव्यापी पैचों से भी भिन्न है: जब आसन्न पैचों को मर्ज किया जाता है तो वे ओवरलैप हो जाते हैं। पहले चरण में कर्नेल आकार K=7, स्ट्राइड S=4 और पैडिंग P=3 का उपयोग किया जाता है; बाद के चरणों में K=3, S=2, P=1 का उपयोग किया जाता है। ओवरलैप पैच सीमाओं के पार स्थानीय निरंतरता को बनाए रखता है—पड़ोसी पैचों द्वारा साझा की गई जानकारी—जबकि फीचर मैप को कम किया जाता है।
कुशल स्व-ध्यान
सामान्य मल्टी-हेड स्व-ध्यान के लिए N लंबाई के अनुक्रम के लिए O(N^2) गणना की आवश्यकता होती है। चूंकि उच्च-रिज़ॉल्यूशन विभाजन के लिए N बहुत बड़ा हो जाता है, यह एक गंभीर बाधा है। SegFormer अनुक्रम न्यूनीकरण प्रस्तुत करता है, जो ध्यान की गणना करने से पहले कुंजी और मान अनुक्रमों को R न्यूनीकरण अनुपात द्वारा संपीड़ित करता है।
K, V अनुक्रमों को उपयोग करने से पहले उनकी लंबाई N से घटाकर N/R कर दी जाती है। चरण 1-4 के लिए कमी अनुपात R को [64, 16, 4, 1] पर सेट किया गया है: उथले चरणों में उच्च रिज़ॉल्यूशन और लंबे अनुक्रम होते हैं, इसलिए वे अत्यधिक संपीड़ित होते हैं; गहरे चरणों में कम रिज़ॉल्यूशन और छोटे अनुक्रम होते हैं, इसलिए वे बिल्कुल भी संपीड़ित नहीं होते हैं। इससे O(N^2) से O(N^2/R) तक की गणना लागत कम हो जाती है और उच्च-रिज़ॉल्यूशन इनपुट के लिए भी स्व-ध्यान व्यावहारिक हो जाता है।
मिक्स-FFN — स्थितिगत एन्कोडिंग को कैसे समाप्त किया जाता है
SegFormer स्थितिगत एन्कोडिंग से पूरी तरह बच सकता है क्योंकि यह फीड-फॉरवर्ड नेटवर्क (FFN) में 3×3 कनवोल्यूशन को मिलाकर मिक्स-FFN बनाता है।
3×3 कनवोल्यूशन में इमेज की सीमा पर शून्य पैडिंग का उपयोग किया जाता है। यह पैडेड सीमा अप्रत्यक्ष रूप से कनवोल्यूशन में "इमेज में मेरी स्थिति" के बारे में संकेत देती है, जिससे स्पष्ट स्थितिगत एन्कोडिंग के बिना ही Mix-FFN से गुजरने पर स्थितिगत जानकारी विशेषताओं में समाहित हो जाती है। परिणामस्वरूप, प्रशिक्षण रिज़ॉल्यूशन से भिन्न रिज़ॉल्यूशन पर परीक्षण करने के लिए स्थितिगत एन्कोडिंग के इंटरपोलेशन की आवश्यकता नहीं होती है, जो अन्यथा सटीकता को कम कर सकता है।
ऑल-एमएलपी डिकोडर - कनवोल्यूशन क्यों अनावश्यक है
डिकोडर में निम्नलिखित चार चरण होते हैं, जिनमें शाब्दिक रूप से केवल रैखिक परतों (एमएलपी) का उपयोग किया जाता है।
-
चैनलों को एकीकृत करें: प्रत्येक चरण की विशेषता F_i को एक स्वतंत्र रैखिक परत के साथ समान चैनल संख्या C पर मैप करें।
-
अपसैंपल करें और संयोजित करें: प्रत्येक विशेषता को 1/4 रिज़ॉल्यूशन तक अपसैंपल करें और चैनल आयाम के साथ संयोजित करें।
-
फ्यूज़: संयोजित 4C -आयामी फ़ीचर को एक लीनियर लेयर के साथ C आयामों में मैप करें।
-
प्रेडिक्ट: अंतिम लीनियर लेयर का उपयोग करके प्रत्येक वर्ग के लिए एक चैनल के साथ एक सेगमेंटेशन मास्क आउटपुट करें।
मूल शोध पत्र प्रभावी रिसेप्टिव फ़ील्ड (ERF) के विश्लेषण के साथ इस डिज़ाइन का समर्थन करता है। DeepLabv3+ जैसे CNN-आधारित डिकोडर को व्यापक रिसेप्टिव फ़ील्ड प्राप्त करने और उच्च सटीकता हासिल करने के लिए जटिल तंत्रों—डाइलेटेड कनवोल्यूशन और मल्टी-स्केल पूलिंग—की आवश्यकता होती है। इसके विपरीत, MiT एनकोडर बिना किसी अतिरिक्त तंत्र के, स्व-ध्यान के माध्यम से उथले चरणों में स्वाभाविक रूप से स्थानीय ERF और गहरे चरणों में पूरी छवि को कवर करने वाले गैर-स्थानीय ERF प्राप्त करता है। क्योंकि एनकोडर स्वयं ही स्थानीय से वैश्विक स्तर तक की जानकारी वाले फ़ीचर बनाता है, इसलिए डिकोडर को जटिल रिसेप्टिव-फ़ील्ड विस्तार तंत्र की आवश्यकता नहीं होती है। यही सैद्धांतिक कारण है कि रैखिक परतों का एक सरल संयोजन पर्याप्त है।
प्रशिक्षण विधि
मूल शोध पत्र में विशेष तकनीकों के बिना एक सरल प्रशिक्षण सेटअप का उपयोग किया गया है। MiT एनकोडर को ImageNet-1K पर पूर्व-प्रशिक्षित किया गया है, जबकि डिकोडर को यादृच्छिक आरंभीकरण से प्रशिक्षित किया गया है। अनुकूलन के लिए AdamW का उपयोग किया गया है, जिसमें सीखने की दर 0.00006 के प्रारंभिक मान से पॉली शेड्यूल (गुणांक 1.0 के साथ पावर-लॉ क्षय) के तहत घटती है। ADE20K और Cityscapes पर पुनरावृत्तियों की संख्या 160K है और COCO-Stuff पर 80K है। प्रशिक्षण संवर्धन 0.5–2.0 के अनुपात के साथ यादृच्छिक आकार परिवर्तन, यादृच्छिक क्षैतिज फ़्लिपिंग और यादृच्छिक क्रॉपिंग (ADE20K के लिए 512×512, Cityscapes के लिए 1024×1024 और ADE20K पर B5 के लिए 640×640) तक सीमित है। इस शोधपत्र में स्पष्ट रूप से कहा गया है कि इसमें OHEM (ऑनलाइन हार्ड एग्जांपल माइनिंग), सहायक हानियों या वर्ग-संतुलित हानियों जैसी व्यापक रूप से अपनाई जाने वाली तकनीकों का उपयोग नहीं किया गया है। इसका उद्देश्य यह प्रदर्शित करना है कि MiT एनकोडर और ऑल-MLP डिकोडर इन अतिरिक्त तकनीकों के बिना भी उच्च mIoU प्राप्त कर सकते हैं।
7. मॉडल वेरिएंट की तुलना
SegFormer छह आकारों में उपलब्ध है, MiT-B0 से लेकर MiT-B5 तक। मूल शोधपत्र की तालिका 2 में उल्लिखित सिटीस्केप्स और ADE20K के मापे गए परिणाम निम्नलिखित हैं।
| मॉडल | पैरामीटर | सिटीस्केप्स FLOPs | सिटीस्केप्स mIoU (MS) | ADE20K FLOPs | ADE20K mIoU |
|---|---|---|---|---|---|
| SegFormer-B0 | 3.8M | 125.5G | 76.2 | 8.4G | 37.4 |
| सेगफॉर्मर-बी1 | 13.1एम | 243.7जी | 78.5 | 15.9जी | 42.2 |
| सेगफॉर्मर-बी2 | 24.2एम | 717.1जी | 81.0 | 62.4जी | 46.5 |
| सेगफॉर्मर-बी3 | 44.0एम | 962.9जी | 81.7 | 79.0जी | 49.4 |
| सेगफॉर्मर-बी4 | 64.1एम | 1240.6जी | 82.3 | 95.7जी | 50.3 |
| सेगफॉर्मर-बी5 | 84.7एम | 1460.4जी | 84.0 | 183.3जी | 51.0 |
स्रोत: मूल शोधपत्र (Xie et al., NeurIPS 2021) की तालिका 2। सिटीस्केप्स mIoU को मल्टी-स्केल और लेफ्ट-राइट फ्लिप (MS) परीक्षण के साथ मापा गया है। पैरामीटर गणना में पूर्ण एनकोडर और डिकोडर शामिल हैं; B5 के लिए भी, डिकोडर कुल का लगभग 4% ही है। संदर्भ के लिए, B5 सिंगल-स्केल (SS) परीक्षण के साथ 82.4 mIoU और MS परीक्षण के साथ 84.0 mIoU तक पहुँचता है।
शोधपत्र इन परिणामों की तुलना उस समय की अत्याधुनिक तकनीक से करता है और बताता है कि SegFormer-B4 64.1 मिलियन पैरामीटर के साथ ADE20K पर 50.3% mIoU तक पहुँचता है, जो उस समय की सर्वश्रेष्ठ विधि से 2.2 अंक अधिक है, जबकि मॉडल का आकार लगभग पाँचवाँ हिस्सा है। B0 केवल 3.8 मिलियन पैरामीटर के साथ 76.2 का व्यावहारिक सिटीस्केप्स mIoU बनाए रखता है, और ये आंकड़े इसके एज-ओरिएंटेड डिज़ाइन का समर्थन करते हैं।
8. इसकी चुनौतियाँ
SegFormer की अधिकांश कमज़ोरियाँ आम तौर पर Transformer-आधारित मॉडलों में पाई जाती हैं। सबसे पहले, बड़े मॉडलों (B3 और उससे ऊपर) की ट्रेनिंग और इन्फ़रेंस लागत बहुत अधिक होती है। Cityscapes FLOPs B0 के लिए 125.5G से बढ़कर B5 के लिए 1460.4G हो जाते हैं, जो दस गुना से भी अधिक की वृद्धि है। उच्च-रिज़ॉल्यूशन सेगमेंटेशन के लिए, यह वृद्धि रीयल-टाइम ऑपरेशन को मुश्किल बना सकती है।
बड़े पैमाने पर प्रीट्रेनिंग डेटा पर निर्भरता भी मायने रखती है। MiT एनकोडर ImageNet-1K पर प्रीट्रेन किया गया है, इसलिए फ़ाइन-ट्यूनिंग डेटा की गुणवत्ता और मात्रा उन डोमेन में स्थानांतरण को बहुत प्रभावित करती है जो प्रीट्रेनिंग डेटा से काफ़ी भिन्न होते हैं, जैसे कि मेडिकल या सैटेलाइट इमेजरी।
बहुत छोटी वस्तुएँ और पतली संरचनाएँ—उदाहरण के लिए, तार और साइनपोस्ट—भी SegFormer के लिए मूल रूप से आसान नहीं हैं। ओवरलैप्ड पैच मर्जिंग पहले चरण में भी 4×4 से डाउनसैंपलिंग करता है, इसलिए कुछ पिक्सेल चौड़ी संरचनाएं गहरे चरणों तक पहुंचने से पहले ही जानकारी खो सकती हैं।
साथ ही, मूल शोध पत्र द्वारा रिपोर्ट किया गया सिटीस्केप्स-सी पर किया गया मजबूती मूल्यांकन एक स्पष्ट मजबूती है। अतिरिक्त गाऊसी शोर वाली दूषित छवियों के लिए, Xception-71 बैकबोन वाले DeepLabv3+ की तुलना में SegFormer-B5 ने अधिकतम सापेक्ष mIoU में 588% का सुधार दर्ज किया है; बर्फ जैसी विकृति के लिए, अधिकतम सापेक्ष सुधार 295% है। ये माप सामान्य CNN-आधारित मॉडलों की तुलना में छवि विकृति के प्रति अधिक सहनशीलता दर्शाते हैं। यह मजबूती इसलिए मानी जाती है क्योंकि स्व-ध्यान स्थानीय शोर से आसानी से प्रभावित नहीं होता है।
9. व्यवहार में मॉडल का चयन कैसे करें
एज डिवाइस और रीयल-टाइम प्रोसेसिंग के लिए, SegFormer-B0 या B1 एक व्यावहारिक विकल्प है। सिटीस्केप्स पर B0, 3.8 मिलियन पैरामीटर और 76.2 मिलियन IU के साथ सटीकता और कॉम्पैक्टनेस का संतुलन बनाए रखता है, जिससे एम्बेडेड डिवाइस और ड्रोन पर इसका उपयोग संभव हो पाता है।
स्वायत्त ड्राइविंग में ड्राइव करने योग्य क्षेत्र की पहचान जैसे अनुप्रयोगों के लिए, जहां उच्च-रिज़ॉल्यूशन छवियों और निरंतर सटीकता की आवश्यकता होती है, B2 या B3 अक्सर एक उपयुक्त विकल्प होता है। B4 और B5 में उच्चतम सटीकता होती है, लेकिन उनके सिटीस्केप्स FLOPs 1200G से अधिक होते हैं, इसलिए वाहन के GPU पर रीयल-टाइम इन्फरेंस के लिए आमतौर पर क्वांटाइजेशन या TensorRT रूपांतरण जैसे ऑप्टिमाइजेशन की आवश्यकता होती है।
चिकित्सा या उपग्रह इमेजरी के ऑफ़लाइन सटीक विश्लेषण के लिए, रीयल-टाइम प्रदर्शन की तुलना में सटीकता को प्राथमिकता दी जाती है। B4 या B5 उपयुक्त है, और आवश्यकतानुसार डोमेन-विशिष्ट डेटा पर इसे फाइन-ट्यून किया जा सकता है।
कृषि रोबोट और आउटडोर निगरानी कैमरों जैसे खराब मौसम या प्रकाश परिवर्तन वाले बाहरी वातावरण के लिए, सिटीस्केप्स-C पर मापी गई मजबूती एक व्यावहारिक लाभ है। समान सटीकता वाले CNN-आधारित मॉडलों की तुलना में, SegFormer से छवि संक्षारण की स्थिति में सटीकता में कम हानि की उम्मीद की जा सकती है।
ऑब्जेक्ट डिटेक्शन और सिमेंटिक सेगमेंटेशन की बुनियादी बातें सीखने के लिए, “ऑब्जेक्ट डिटेक्शन और सिमेंटिक सेगमेंटेशन का परिचय” देखें। सेगमेंटेशन में नवीनतम रुझानों के लिए, “सिमेंटिक सेगमेंटेशन में तकनीकी रुझान” देखें।
10. तीन पंक्तियों में सारांश
-
SegFormer एक पदानुक्रमित एनकोडर (MiT) को जोड़ता है जो स्थितिगत एन्कोडिंग के बिना मल्टी-स्केल विशेषताएँ उत्पन्न करता है, और एक ऑल-MLP डिकोडर के साथ जो कनवोल्यूशन का उपयोग नहीं करता है।
-
Mix-FFN में 3×3 कनवोल्यूशन अप्रत्यक्ष रूप से स्थिति संबंधी जानकारी लीक करता है, जिससे स्थिति संबंधी एन्कोडिंग की आवश्यकता समाप्त हो जाती है, जबकि ट्रांसफ़ॉर्मर का व्यापक प्रभावी रिसेप्टिव फ़ील्ड एक सरल MLP डिकोडर को संभव बनाता है।
- यह परिवार B0 (3.8M पैरामीटर, सिटीस्केप पर 76.2 mIoU) से लेकर B5 (84.7M, 84.0 mIoU) तक फैला हुआ है, और मापे गए परिणाम भी छवि संक्षारण के प्रति इसकी मजबूती का समर्थन करते हैं।
संदर्भ
- SegFormer: ट्रांसफ़ॉर्मर के साथ सिमेंटिक सेगमेंटेशन के लिए सरल और कुशल डिज़ाइन (NeurIPS 2021, arXiv:2105.15203)
- ar5iv पर SegFormer पेपर (पूर्ण पाठ)
- आधिकारिक SegFormer कार्यान्वयन (NVlabs/SegFormer, GitHub)
- NeurIPS 2021 कार्यवाही: SegFormer
टिप्पणियाँ
पहले लॉग इन करें।
अभी कोई डेटा नहीं है।