Contents — find the section you need

SegFormer से पहले भी सिमेंटिक सेगमेंटेशन में ट्रांसफॉर्मर को शामिल करने के प्रयास किए गए थे, लेकिन उनमें से कई पोजीशनल एनकोडिंग और जटिल डिकोडर पर निर्भर थे। इसलिए उन्हें दो समस्याओं का सामना करना पड़ा: परीक्षण रिज़ॉल्यूशन और प्रशिक्षण रिज़ॉल्यूशन में अंतर होने पर सटीकता कम हो सकती थी, और गणना महंगी हो सकती थी। SegFormer (Xie, Wang, Yu, Anandkumar, Alvarez, and Luo, NeurIPS 2021) एक उल्लेखनीय रूप से सरल डिज़ाइन के साथ इन दोनों समस्याओं का समाधान करता है: एक पदानुक्रमित एनकोडर जिसमें पोजीशनल एनकोडिंग नहीं है और एक ऑल-MLP डिकोडर जो बिल्कुल भी कनवोल्यूशन का उपयोग नहीं करता है। यह लेख मूल शोध पत्र (arXiv:2105.15203) के आधार पर चरण दर चरण यह विश्लेषण करता है कि यह डिज़ाइन कैसे काम करता है।

यह लेख मूल शोधपत्र “SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers” (Xie et al., NeurIPS 2021, arXiv:2105.15203) पर आधारित है।

0. आप क्या सीखेंगे

  • SegFormer ने पहले के ट्रांसफ़ॉर्मर-आधारित सेगमेंटेशन मॉडलों में जिन समस्याओं को हल करने का लक्ष्य रखा है
  • पदानुक्रमित MiT (मिक्स ट्रांसफ़ॉर्मर) एनकोडर बिना पोजीशनल एनकोडिंग के कैसे काम करता है
  • बिना किसी कनवोल्यूशन के, केवल MLP से बना डिकोडर उच्च सटीकता कैसे प्राप्त कर सकता है
  • सिटीस्केप्स और ADE20K पर B0–B5 के लिए मापा गया mIoU, पैरामीटर गणना और कम्प्यूटेशनल लागत
  • व्यवहार में मॉडल का चयन कैसे करें, जिसमें छवि संक्षारण के प्रति मजबूती भी शामिल है

1. SegFormer क्या है?

SegFormer एक सिमेंटिक सेगमेंटेशन मॉडल है जो पोजीशनल एनकोडिंग के बिना एक पदानुक्रमित ट्रांसफॉर्मर एनकोडर (MiT) को एक हल्के ऑल-MLP डिकोडर के साथ जोड़ता है जो बिल्कुल भी कनवोल्यूशन का उपयोग नहीं करता है। इसका मूल विचार एनकोडर और डिकोडर के बीच कार्य विभाजन को पुनर्परिभाषित करना है: एक बार जब एनकोडर कई रिज़ॉल्यूशन पर विशेषताएँ उत्पन्न कर लेता है, तो डिकोडर को बहुत सरल बनाया जा सकता है।

2. यह डिज़ाइन क्यों आवश्यक था?

सिमेंटिक सेगमेंटेशन के लिए विज़न ट्रांसफॉर्मर (ViT) को सीधे एनकोडर के रूप में उपयोग करने से दो समस्याएँ उत्पन्न होती हैं। पहली, ViT द्वारा उत्पन्न विशेषताओं का केवल एकल रिज़ॉल्यूशन होता है। एक छवि में वस्तुओं के कई अलग-अलग आकार हो सकते हैं, और FCN और U-Net जैसे पारंपरिक CNN-आधारित सेगमेंटेशन मॉडल कई रिज़ॉल्यूशन पर विशेषताओं को संयोजित करके इस समस्या का समाधान करते हैं। केवल एक रिज़ॉल्यूशन उत्पन्न करने वाला ViT इस बहु-स्तरीय प्रतिनिधित्व क्षमता को खो देता है।

दूसरी समस्या पोजीशनल एनकोडिंग पर निर्भरता है। ViT एक छवि को पैच में विभाजित करता है और उन्हें ट्रांसफ़ॉर्मर को देता है, लेकिन ट्रांसफ़ॉर्मर को स्वयं इस बात की जानकारी नहीं होती कि छवि में प्रत्येक पैच कहाँ स्थित है। इसलिए, एक निश्चित या सीखा हुआ स्थितिगत एन्कोडिंग अलग से जोड़ना आवश्यक है। चूंकि यह एन्कोडिंग प्रशिक्षण के दौरान उपयोग किए गए इनपुट रिज़ॉल्यूशन के लिए बनाया गया है, अनुमान के समय भिन्न रिज़ॉल्यूशन वाली छवि के लिए स्थितिगत एन्कोडिंग का इंटरपोलेशन आवश्यक होता है, जिससे सटीकता कम हो सकती है। सेगमेंटेशन में अक्सर डिटेक्शन की तुलना में उच्च-रिज़ॉल्यूशन इनपुट की आवश्यकता होती है, जिससे यह रिज़ॉल्यूशन निर्भरता विशेष रूप से समस्याग्रस्त हो जाती है।

SegFormer एक पदानुक्रमित एनकोडर का उपयोग करके और स्थितिगत एन्कोडिंग को पूरी तरह से समाप्त करके इन दोनों समस्याओं का मूल समाधान करता है।

3. इनपुट क्या है?

अन्य सेगमेंटेशन मॉडल की तरह, इनपुट एक RGB छवि x \in \mathbb{R}^{H \times W \times 3} है। SegFormer का मूल्यांकन सिटीस्केप के लिए उच्च-रिज़ॉल्यूशन छवियों (1024×2048) और ADE20K के लिए लगभग 512×512 छवियों पर किया जाता है। जबकि ViT मोटे 16×16 पैच के साथ डाउनसैंपलिंग करता है, SegFormer का एनकोडर 4×4 जितने छोटे पैच से शुरू होता है, जिससे फीचर एक्सट्रैक्शन की शुरुआत में अधिक विवरण संरक्षित रहता है।

4. यह क्या अनुमान लगाता है?

आउटपुट इनपुट रिज़ॉल्यूशन के 1/4 पर एक सेगमेंटेशन मैप होता है, जिसमें प्रत्येक पिक्सेल का वर्ग \hat{y} \in \mathbb{R}^{\frac{H}{4} \times \frac{W}{4} \times N_{cls}} के रूप में दर्शाया जाता है (N_{cls} वर्गों की संख्या है)। फिर इसे निकटतम-पड़ोसी इंटरपोलेशन या इसी तरह की विधि का उपयोग करके मूल रिज़ॉल्यूशन में वापस लाया जाता है। मूल विचार यह है कि यदि एनकोडर पर्याप्त समृद्ध मल्टी-स्केल फीचर्स बनाता है, तो डिकोडर को उन्हें एकीकृत करने और उन्हें एक सटीक मास्क में परिवर्तित करने के लिए केवल सरल रैखिक परतों के संयोजन की आवश्यकता होती है।

5. मूल संरचना

SegFormer में दो प्रमुख ब्लॉक होते हैं: एक MiT (मिक्स ट्रांसफ़ॉर्मर) एनकोडर जो चार रिज़ॉल्यूशन पर फ़ीचर निकालता है, और एक ऑल-MLP डिकोडर जो उन फ़ीचर को संयोजित करता है और एक सेगमेंटेशन मास्क आउटपुट करता है।

Diagram 1 · Use the button to switch views
SegFormer basic pipeline A pipeline in which an input image passes through MiT encoder Stages 1–4, reducing its resolution from 1/4 to 1/32 while extracting features, and then applies an All-MLP decoder. Input image MiT encoder (no positional encoding) Stage 1 (1/4) Stage 2 (1/8) Stage 3 (1/16) Stage 4 (1/32) Each stage: Overlap Patch Merging Efficient Self-Attention Mix-FFN (3×3 Conv injects position implicitly) All-MLP decoder 1. Unify channels with MLPs 2. Upsample to 1/4 resolution 3. Concatenate 4. Fuse with MLP (4C→C) 5. Predict classes with MLP Mask

चित्र 1 — MiT एनकोडर चार रिज़ॉल्यूशन (1/4, 1/8, 1/16 और 1/32) पर फ़ीचर उत्पन्न करता है, और ऑल-MLP डिकोडर केवल लीनियर लेयर्स का उपयोग करके उन्हें संयोजित करके एक सेगमेंटेशन मास्क बनाता है। एनकोडर के Mix-FFN में केवल कनवोल्यूशन होता है; डिकोडर पूरी तरह से लीनियर लेयर्स से बना है।

चूंकि एनकोडर पहले से ही चार रिज़ॉल्यूशन पर फ़ीचर्स बनाता है, इसलिए डिकोडर लगभग न्यूनतम प्रोसेसिंग के साथ एक सटीक मास्क प्राप्त कर सकता है: फ़ीचर्स को अलाइन करें और उन्हें संयोजित करें। काम का यह विभाजन ही SegFormer के कुल पैरामीटर की संख्या कम रखने का मुख्य कारण है।

6. घटकों का तकनीकी विवरण

ओवरलैप्ड पैच मर्जिंग — एक चार-चरणीय पदानुक्रम

ViT की तरह छवि को केवल एक बार पैच में विभाजित करने के बजाय, MiT एनकोडर चार चरणों में धीरे-धीरे रिज़ॉल्यूशन कम करता है। आउटपुट रिज़ॉल्यूशन इनपुट के 1/4, 1/8, 1/16 और 1/32 होते हैं, जो ResNet जैसे CNN बैकबोन द्वारा उपयोग की जाने वाली पदानुक्रमित संरचना को पुन: उत्पन्न करते हैं।

पैच विभाजन विधि ViT के गैर-अतिव्यापी पैचों से भी भिन्न है: जब आसन्न पैचों को मर्ज किया जाता है तो वे ओवरलैप हो जाते हैं। पहले चरण में कर्नेल आकार K=7, स्ट्राइड S=4 और पैडिंग P=3 का उपयोग किया जाता है; बाद के चरणों में K=3, S=2, P=1 का उपयोग किया जाता है। ओवरलैप पैच सीमाओं के पार स्थानीय निरंतरता को बनाए रखता है—पड़ोसी पैचों द्वारा साझा की गई जानकारी—जबकि फीचर मैप को कम किया जाता है।

कुशल स्व-ध्यान

सामान्य मल्टी-हेड स्व-ध्यान के लिए N लंबाई के अनुक्रम के लिए O(N^2) गणना की आवश्यकता होती है। चूंकि उच्च-रिज़ॉल्यूशन विभाजन के लिए N बहुत बड़ा हो जाता है, यह एक गंभीर बाधा है। SegFormer अनुक्रम न्यूनीकरण प्रस्तुत करता है, जो ध्यान की गणना करने से पहले कुंजी और मान अनुक्रमों को R न्यूनीकरण अनुपात द्वारा संपीड़ित करता है।

\text{Attention}(Q, K, V) = \text{Softmax}\!\left(\frac{QK^{\top}}{\sqrt{d_{head}}}\right)V

K, V अनुक्रमों को उपयोग करने से पहले उनकी लंबाई N से घटाकर N/R कर दी जाती है। चरण 1-4 के लिए कमी अनुपात R को [64, 16, 4, 1] पर सेट किया गया है: उथले चरणों में उच्च रिज़ॉल्यूशन और लंबे अनुक्रम होते हैं, इसलिए वे अत्यधिक संपीड़ित होते हैं; गहरे चरणों में कम रिज़ॉल्यूशन और छोटे अनुक्रम होते हैं, इसलिए वे बिल्कुल भी संपीड़ित नहीं होते हैं। इससे O(N^2) से O(N^2/R) तक की गणना लागत कम हो जाती है और उच्च-रिज़ॉल्यूशन इनपुट के लिए भी स्व-ध्यान व्यावहारिक हो जाता है।

मिक्स-FFN — स्थितिगत एन्कोडिंग को कैसे समाप्त किया जाता है

SegFormer स्थितिगत एन्कोडिंग से पूरी तरह बच सकता है क्योंकि यह फीड-फॉरवर्ड नेटवर्क (FFN) में 3×3 कनवोल्यूशन को मिलाकर मिक्स-FFN बनाता है।

x_{out} = \text{MLP}\big(\text{GELU}(\text{Conv}_{3\times3}(\text{MLP}(x_{in})))\big) + x_{in}

3×3 कनवोल्यूशन में इमेज की सीमा पर शून्य पैडिंग का उपयोग किया जाता है। यह पैडेड सीमा अप्रत्यक्ष रूप से कनवोल्यूशन में "इमेज में मेरी स्थिति" के बारे में संकेत देती है, जिससे स्पष्ट स्थितिगत एन्कोडिंग के बिना ही Mix-FFN से गुजरने पर स्थितिगत जानकारी विशेषताओं में समाहित हो जाती है। परिणामस्वरूप, प्रशिक्षण रिज़ॉल्यूशन से भिन्न रिज़ॉल्यूशन पर परीक्षण करने के लिए स्थितिगत एन्कोडिंग के इंटरपोलेशन की आवश्यकता नहीं होती है, जो अन्यथा सटीकता को कम कर सकता है।

ऑल-एमएलपी डिकोडर - कनवोल्यूशन क्यों अनावश्यक है

डिकोडर में निम्नलिखित चार चरण होते हैं, जिनमें शाब्दिक रूप से केवल रैखिक परतों (एमएलपी) का उपयोग किया जाता है।

  1. चैनलों को एकीकृत करें: प्रत्येक चरण की विशेषता F_i को एक स्वतंत्र रैखिक परत के साथ समान चैनल संख्या C पर मैप करें।

  2. अपसैंपल करें और संयोजित करें: प्रत्येक विशेषता को 1/4 रिज़ॉल्यूशन तक अपसैंपल करें और चैनल आयाम के साथ संयोजित करें।

  3. फ्यूज़: संयोजित 4C -आयामी फ़ीचर को एक लीनियर लेयर के साथ C आयामों में मैप करें।

  4. प्रेडिक्ट: अंतिम लीनियर लेयर का उपयोग करके प्रत्येक वर्ग के लिए एक चैनल के साथ एक सेगमेंटेशन मास्क आउटपुट करें।

\hat{M} = \text{Linear}\Big(\text{Concat}\big(\text{Upsample}(\text{Linear}(F_1)), \dots, \text{Upsample}(\text{Linear}(F_4))\big)\Big)

मूल शोध पत्र प्रभावी रिसेप्टिव फ़ील्ड (ERF) के विश्लेषण के साथ इस डिज़ाइन का समर्थन करता है। DeepLabv3+ जैसे CNN-आधारित डिकोडर को व्यापक रिसेप्टिव फ़ील्ड प्राप्त करने और उच्च सटीकता हासिल करने के लिए जटिल तंत्रों—डाइलेटेड कनवोल्यूशन और मल्टी-स्केल पूलिंग—की आवश्यकता होती है। इसके विपरीत, MiT एनकोडर बिना किसी अतिरिक्त तंत्र के, स्व-ध्यान के माध्यम से उथले चरणों में स्वाभाविक रूप से स्थानीय ERF और गहरे चरणों में पूरी छवि को कवर करने वाले गैर-स्थानीय ERF प्राप्त करता है। क्योंकि एनकोडर स्वयं ही स्थानीय से वैश्विक स्तर तक की जानकारी वाले फ़ीचर बनाता है, इसलिए डिकोडर को जटिल रिसेप्टिव-फ़ील्ड विस्तार तंत्र की आवश्यकता नहीं होती है। यही सैद्धांतिक कारण है कि रैखिक परतों का एक सरल संयोजन पर्याप्त है।

प्रशिक्षण विधि

मूल शोध पत्र में विशेष तकनीकों के बिना एक सरल प्रशिक्षण सेटअप का उपयोग किया गया है। MiT एनकोडर को ImageNet-1K पर पूर्व-प्रशिक्षित किया गया है, जबकि डिकोडर को यादृच्छिक आरंभीकरण से प्रशिक्षित किया गया है। अनुकूलन के लिए AdamW का उपयोग किया गया है, जिसमें सीखने की दर 0.00006 के प्रारंभिक मान से पॉली शेड्यूल (गुणांक 1.0 के साथ पावर-लॉ क्षय) के तहत घटती है। ADE20K और Cityscapes पर पुनरावृत्तियों की संख्या 160K है और COCO-Stuff पर 80K है। प्रशिक्षण संवर्धन 0.5–2.0 के अनुपात के साथ यादृच्छिक आकार परिवर्तन, यादृच्छिक क्षैतिज फ़्लिपिंग और यादृच्छिक क्रॉपिंग (ADE20K के लिए 512×512, Cityscapes के लिए 1024×1024 और ADE20K पर B5 के लिए 640×640) तक सीमित है। इस शोधपत्र में स्पष्ट रूप से कहा गया है कि इसमें OHEM (ऑनलाइन हार्ड एग्जांपल माइनिंग), सहायक हानियों या वर्ग-संतुलित हानियों जैसी व्यापक रूप से अपनाई जाने वाली तकनीकों का उपयोग नहीं किया गया है। इसका उद्देश्य यह प्रदर्शित करना है कि MiT एनकोडर और ऑल-MLP डिकोडर इन अतिरिक्त तकनीकों के बिना भी उच्च mIoU प्राप्त कर सकते हैं।

7. मॉडल वेरिएंट की तुलना

SegFormer छह आकारों में उपलब्ध है, MiT-B0 से लेकर MiT-B5 तक। मूल शोधपत्र की तालिका 2 में उल्लिखित सिटीस्केप्स और ADE20K के मापे गए परिणाम निम्नलिखित हैं।

मॉडल पैरामीटर सिटीस्केप्स FLOPs सिटीस्केप्स mIoU (MS) ADE20K FLOPs ADE20K mIoU
SegFormer-B0 3.8M 125.5G 76.2 8.4G 37.4
सेगफॉर्मर-बी1 13.1एम 243.7जी 78.5 15.9जी 42.2
सेगफॉर्मर-बी2 24.2एम 717.1जी 81.0 62.4जी 46.5
सेगफॉर्मर-बी3 44.0एम 962.9जी 81.7 79.0जी 49.4
सेगफॉर्मर-बी4 64.1एम 1240.6जी 82.3 95.7जी 50.3
सेगफॉर्मर-बी5 84.7एम 1460.4जी 84.0 183.3जी 51.0

स्रोत: मूल शोधपत्र (Xie et al., NeurIPS 2021) की तालिका 2। सिटीस्केप्स mIoU को मल्टी-स्केल और लेफ्ट-राइट फ्लिप (MS) परीक्षण के साथ मापा गया है। पैरामीटर गणना में पूर्ण एनकोडर और डिकोडर शामिल हैं; B5 के लिए भी, डिकोडर कुल का लगभग 4% ही है। संदर्भ के लिए, B5 सिंगल-स्केल (SS) परीक्षण के साथ 82.4 mIoU और MS परीक्षण के साथ 84.0 mIoU तक पहुँचता है।

शोधपत्र इन परिणामों की तुलना उस समय की अत्याधुनिक तकनीक से करता है और बताता है कि SegFormer-B4 64.1 मिलियन पैरामीटर के साथ ADE20K पर 50.3% mIoU तक पहुँचता है, जो उस समय की सर्वश्रेष्ठ विधि से 2.2 अंक अधिक है, जबकि मॉडल का आकार लगभग पाँचवाँ हिस्सा है। B0 केवल 3.8 मिलियन पैरामीटर के साथ 76.2 का व्यावहारिक सिटीस्केप्स mIoU बनाए रखता है, और ये आंकड़े इसके एज-ओरिएंटेड डिज़ाइन का समर्थन करते हैं।

8. इसकी चुनौतियाँ

SegFormer की अधिकांश कमज़ोरियाँ आम तौर पर Transformer-आधारित मॉडलों में पाई जाती हैं। सबसे पहले, बड़े मॉडलों (B3 और उससे ऊपर) की ट्रेनिंग और इन्फ़रेंस लागत बहुत अधिक होती है। Cityscapes FLOPs B0 के लिए 125.5G से बढ़कर B5 के लिए 1460.4G हो जाते हैं, जो दस गुना से भी अधिक की वृद्धि है। उच्च-रिज़ॉल्यूशन सेगमेंटेशन के लिए, यह वृद्धि रीयल-टाइम ऑपरेशन को मुश्किल बना सकती है।

बड़े पैमाने पर प्रीट्रेनिंग डेटा पर निर्भरता भी मायने रखती है। MiT एनकोडर ImageNet-1K पर प्रीट्रेन किया गया है, इसलिए फ़ाइन-ट्यूनिंग डेटा की गुणवत्ता और मात्रा उन डोमेन में स्थानांतरण को बहुत प्रभावित करती है जो प्रीट्रेनिंग डेटा से काफ़ी भिन्न होते हैं, जैसे कि मेडिकल या सैटेलाइट इमेजरी।

बहुत छोटी वस्तुएँ और पतली संरचनाएँ—उदाहरण के लिए, तार और साइनपोस्ट—भी SegFormer के लिए मूल रूप से आसान नहीं हैं। ओवरलैप्ड पैच मर्जिंग पहले चरण में भी 4×4 से डाउनसैंपलिंग करता है, इसलिए कुछ पिक्सेल चौड़ी संरचनाएं गहरे चरणों तक पहुंचने से पहले ही जानकारी खो सकती हैं।

साथ ही, मूल शोध पत्र द्वारा रिपोर्ट किया गया सिटीस्केप्स-सी पर किया गया मजबूती मूल्यांकन एक स्पष्ट मजबूती है। अतिरिक्त गाऊसी शोर वाली दूषित छवियों के लिए, Xception-71 बैकबोन वाले DeepLabv3+ की तुलना में SegFormer-B5 ने अधिकतम सापेक्ष mIoU में 588% का सुधार दर्ज किया है; बर्फ जैसी विकृति के लिए, अधिकतम सापेक्ष सुधार 295% है। ये माप सामान्य CNN-आधारित मॉडलों की तुलना में छवि विकृति के प्रति अधिक सहनशीलता दर्शाते हैं। यह मजबूती इसलिए मानी जाती है क्योंकि स्व-ध्यान स्थानीय शोर से आसानी से प्रभावित नहीं होता है।

9. व्यवहार में मॉडल का चयन कैसे करें

एज डिवाइस और रीयल-टाइम प्रोसेसिंग के लिए, SegFormer-B0 या B1 एक व्यावहारिक विकल्प है। सिटीस्केप्स पर B0, 3.8 मिलियन पैरामीटर और 76.2 मिलियन IU के साथ सटीकता और कॉम्पैक्टनेस का संतुलन बनाए रखता है, जिससे एम्बेडेड डिवाइस और ड्रोन पर इसका उपयोग संभव हो पाता है।

स्वायत्त ड्राइविंग में ड्राइव करने योग्य क्षेत्र की पहचान जैसे अनुप्रयोगों के लिए, जहां उच्च-रिज़ॉल्यूशन छवियों और निरंतर सटीकता की आवश्यकता होती है, B2 या B3 अक्सर एक उपयुक्त विकल्प होता है। B4 और B5 में उच्चतम सटीकता होती है, लेकिन उनके सिटीस्केप्स FLOPs 1200G से अधिक होते हैं, इसलिए वाहन के GPU पर रीयल-टाइम इन्फरेंस के लिए आमतौर पर क्वांटाइजेशन या TensorRT रूपांतरण जैसे ऑप्टिमाइजेशन की आवश्यकता होती है।

चिकित्सा या उपग्रह इमेजरी के ऑफ़लाइन सटीक विश्लेषण के लिए, रीयल-टाइम प्रदर्शन की तुलना में सटीकता को प्राथमिकता दी जाती है। B4 या B5 उपयुक्त है, और आवश्यकतानुसार डोमेन-विशिष्ट डेटा पर इसे फाइन-ट्यून किया जा सकता है।

कृषि रोबोट और आउटडोर निगरानी कैमरों जैसे खराब मौसम या प्रकाश परिवर्तन वाले बाहरी वातावरण के लिए, सिटीस्केप्स-C पर मापी गई मजबूती एक व्यावहारिक लाभ है। समान सटीकता वाले CNN-आधारित मॉडलों की तुलना में, SegFormer से छवि संक्षारण की स्थिति में सटीकता में कम हानि की उम्मीद की जा सकती है।

ऑब्जेक्ट डिटेक्शन और सिमेंटिक सेगमेंटेशन की बुनियादी बातें सीखने के लिए, “ऑब्जेक्ट डिटेक्शन और सिमेंटिक सेगमेंटेशन का परिचय” देखें। सेगमेंटेशन में नवीनतम रुझानों के लिए, “सिमेंटिक सेगमेंटेशन में तकनीकी रुझान” देखें।

10. तीन पंक्तियों में सारांश

  • SegFormer एक पदानुक्रमित एनकोडर (MiT) को जोड़ता है जो स्थितिगत एन्कोडिंग के बिना मल्टी-स्केल विशेषताएँ उत्पन्न करता है, और एक ऑल-MLP डिकोडर के साथ जो कनवोल्यूशन का उपयोग नहीं करता है।

  • Mix-FFN में 3×3 कनवोल्यूशन अप्रत्यक्ष रूप से स्थिति संबंधी जानकारी लीक करता है, जिससे स्थिति संबंधी एन्कोडिंग की आवश्यकता समाप्त हो जाती है, जबकि ट्रांसफ़ॉर्मर का व्यापक प्रभावी रिसेप्टिव फ़ील्ड एक सरल MLP डिकोडर को संभव बनाता है।

  • यह परिवार B0 (3.8M पैरामीटर, सिटीस्केप पर 76.2 mIoU) से लेकर B5 (84.7M, 84.0 mIoU) तक फैला हुआ है, और मापे गए परिणाम भी छवि संक्षारण के प्रति इसकी मजबूती का समर्थन करते हैं।

संदर्भ

अपनी समझ की जाँच करें
छवि वर्गीकरण और सेगमेंटेशन के आउटपुट कैसे काम करते हैं