Contents — find the section you need

स्ट्रक्चर फ्रॉम मोशन (SfM) से प्राप्त होने वाला पॉइंट क्लाउड विरल होता है और उसमें केवल फीचर पॉइंट ही जुड़े होते हैं। इससे किसी इमारत की रूपरेखा या उसके टेक्सचर के कोने तो पहचाने जा सकते हैं, लेकिन दीवारों और घुमावदार सतहों पर लगभग कोई पॉइंट नहीं बचते, और इस तरह प्राप्त परिणाम को "आकृति" के रूप में इस्तेमाल नहीं किया जा सकता। मल्टी-व्यू स्टीरियो (MVS) SfM या कैमरा कैलिब्रेशन से प्राप्त कैमरा पोज़ को मानकर चलता है और छवि के लगभग हर पिक्सेल की गहराई का अनुमान लगाकर उसे एक सघन पॉइंट क्लाउड या मेश में बदल देता है। कार्य विभाजन - पोज़ का अनुमान लगाना SfM का काम है, सघन आकृति पुनर्प्राप्ति MVS का काम है - इन दोनों तकनीकों के संबंध को समझने का प्रारंभिक बिंदु है।

30 सेकंड का संक्षिप्त सारांश

  • एमवीएस एक ऐसी तकनीक है जो ज्ञात पोज़ वाली कई छवियों से प्रति-पिक्सेल सघन गहराई का अनुमान लगाती है और इसे एक पॉइंट क्लाउड या मेश में एकीकृत करती है। यह वह प्रक्रिया है जो एसएफएम के विरल पॉइंट क्लाउड को सघन आकार में भरती है।

  • इसका मूल सिद्धांत फोटो-संगति है: यदि किसी 3डी बिंदु के लिए सही गहराई मान ली जाए, तो उसे देखने वाली कई छवियों में संबंधित पिक्सेल का रंग और चमक समान होनी चाहिए।

  • इसके दो प्रमुख पारंपरिक दृष्टिकोण हैं: प्लेन-स्वीप, जो गहराई के संभावित बिंदुओं को समतल मानकर संगति का मूल्यांकन करता है, और पैच-आधारित (पीएमवीएस), जो छोटे पैचों को पुनरावृत्त रूप से विस्तारित और फ़िल्टर करता है।

  • हाल के वर्षों में, कनवोल्यूशन के माध्यम से लागत वॉल्यूम को संसाधित करने वाली डीप-लर्निंग-आधारित विधियाँ (जैसे एमवीएसनेट) सटीकता और मजबूती में पारंपरिक विधियों को तेजी से पीछे छोड़ रही हैं।

  • परिणामी मल्टी-व्यू डेप्थ मैप्स को या तो सीधे पॉइंट क्लाउड के रूप में उपयोग किया जाता है, या TSDF फ्यूजन या पॉइसन सरफेस रिकंस्ट्रक्शन के माध्यम से मेश में परिवर्तित किया जाता है। स्टीरियो या डेप्थ कैमरों के साथ रीयल-टाइम डेप्थ एस्टिमेशन फोटो-कंसिस्टेंसी के सिद्धांत पर आधारित है, लेकिन व्यूप्वाइंट्स की संख्या, ऑफ़लाइन-नेस और कंप्यूट बजट में भिन्न है।

1. यह इनपुट के रूप में क्या लेता है, और यह क्या हल करता है?

MVS का इनपुट निम्नलिखित जानकारी है, जो पहले से ही SfM या कैमरा कैलिब्रेशन के माध्यम से प्राप्त की जा चुकी है:

  • प्रत्येक छवि i का कैमरा पोज़ और आंतरिक पैरामीटर P_i = K_i[R_i\mid\mathbf{t}_i] (जिन्हें ज्ञात माना जाता है)
  • लक्ष्य दृश्य को दर्शाने वाली छवियों का एक सेट \{I_1,\dots,I_N\}

आउटपुट प्रत्येक छवि (या चयनित संदर्भ छवियों के सेट) के लिए एक सघन डेप्थ मैप \{D_i\} है, या उन्हें एकीकृत करके प्राप्त किया गया पॉइंट क्लाउड/मेश है। यदि SfM का आउटपुट — विरल पॉइंट क्लाउड और कैमरा पोज़ — "कंकाल" है, तो MVS वह प्रक्रिया है जो इसे "आकृति" प्रदान करती है। अज्ञात पोज़ के साथ सघन आकृति को पुनर्प्राप्त नहीं किया जा सकता है — MVS हमेशा SfM या कैलिब्रेशन के बाद आता है, और इस क्रम को शुरू से ही ध्यान में रखना महत्वपूर्ण है।

2. एक विरल बिंदु बादल पर्याप्त क्यों नहीं है?

SfM द्वारा सीधे सघन बिंदु बादल आउटपुट न करने का कारण यह है कि इसका इनपुट फीचर-पॉइंट मिलान पर निर्भर करता है। जैसा कि हमने फीचर डिटेक्शन प्राइमर में देखा, केवल "विशिष्ट" पिक्सेल — कोने, किनारे — ही स्थिर रूप से पहचाने और मिलान किए जा सकते हैं। एक समतल दीवार जैसे एकसमान बनावट वाले क्षेत्र में कोई फीचर बिंदु नहीं होते हैं, जिससे SfM के 3D बिंदु बादल में एक बड़ा गैप रह जाता है।

दूसरी ओर, MVS इस मजबूत बाधा का लाभ उठा सकता है कि पोज पहले से ही ज्ञात हैं, इसलिए इसे फीचर बिंदुओं की बिल्कुल भी आवश्यकता नहीं होती है। किसी भी पिक्सेल के लिए, यह सीधे मूल्यांकन कर सकता है कि "क्या यह गहराई उम्मीदवार अन्य छवियों में सुसंगत रहता है?" इससे बनावट-रहित दीवार के लिए भी गहराई का अनुमान लगाने की संभावना खुल जाती है, बशर्ते कि काम करने के लिए कम से कम कुछ पैटर्न या शेडिंग मौजूद हो (जैसा कि नीचे चर्चा की गई है, पूरी तरह से फीचर-रहित सतह एक कमजोर बिंदु बनी रहती है)।

3. मूल सिद्धांत: फोटो-संगति

लगभग सभी एमवीएस विधियाँ फोटो-संगति की मान्यता पर आधारित हैं। मान लीजिए कि संदर्भ छवि में पिक्सेल \mathbf{u} के अनुरूप 3D बिंदु की गहराई d है; उस 3D बिंदु को इस प्रकार पुनर्प्राप्त किया जा सकता है:

\mathbf{X}(\mathbf{u}, d) = \pi_{\text{ref}}^{-1}(\mathbf{u}, d)

और फोटो-संगति की मान्यता यह है कि इसे दूसरी छवि k में, पिक्सेल \mathbf{u}' = \pi_k(\mathbf{X}(\mathbf{u},d)) पर पुनः प्रक्षेपित करने पर, I_{\text{ref}}(\mathbf{u}) के निकट का रंग और चमक प्राप्त होनी चाहिए। इसे स्टीरियो-कैमरा असमानता खोज के सामान्यीकरण के रूप में समझना सबसे आसान है, जो दो दृष्टिकोणों से लेकर N दृष्टिकोणों तक है। यह प्रक्रिया, जिसका वर्णन How Depth Cameras Work और How Stereo Cameras Work में किया गया है, चमक का मिलान करके बाएँ और दाएँ चित्रों के बीच संगत पिक्सेल ढूँढने की है। वास्तव में, दो-आँखों वाले स्टीरियो कैमरे के लिए गहराई निम्न सरल सूत्र द्वारा ज्ञात की जाती है:

Z = \frac{fB}{d_{\text{disp}}}

फोकल लंबाई f, बेसलाइन लंबाई B और असमानता d_{\text{disp}} का उपयोग करते हुए। MVS ठीक यही "असमानता की खोज और उसे गहराई में परिवर्तित करना" की प्रक्रिया है, जिसे किसी भी संख्या में कैमरों के लिए किसी भी व्यवस्था में विस्तारित किया गया है।

एक सामान्य कार्यान्वयन में पिक्सेल के चारों ओर एक छोटी विंडो W का उपयोग किया जाता है और सामान्यीकृत क्रॉस-सहसंबंध (NCC) के साथ इस सहमति को मापा जाता है।

\mathrm{NCC}(\mathbf{u}, d) = \frac{\sum_{\mathbf{x}\in W}\left(I_{\text{ref}}(\mathbf{x})-\bar I_{\text{ref}}\right)\left(I_k(\mathbf{x}')-\bar I_k\right)} {\sqrt{\sum_{\mathbf{x}\in W}\left(I_{\text{ref}}(\mathbf{x})-\bar I_{\text{ref}}\right)^2}\sqrt{\sum_{\mathbf{x}\in W}\left(I_k(\mathbf{x}')-\bar I_k\right)^2}}

\mathbf{x}' वह संगत बिंदु है जो \mathbf{x} को छवि k में मैप करके प्राप्त किया जाता है, जिसमें गहराई उम्मीदवार d पर एक स्थानीय समतल माना जाता है। \mathrm{NCC} चमक पैमाने और ऑफसेट परिवर्तनों के प्रति प्रतिरोधी है, इसलिए यह छवियों के बीच कुछ एक्सपोज़र या प्रकाश अंतर होने पर भी कार्य करता है। प्रत्येक छवि जोड़ी और प्रत्येक गहराई उम्मीदवार के लिए इस सहमति स्कोर की गणना करना और सर्वोत्तम स्कोर वाली गहराई का चयन करना, MVS की गणनात्मक संरचना का निर्माण करता है।

4. मूल पाइपलाइन

Diagram 1 · Use the button to switch views
The basic MVS pipeline A diagram showing the flow from a set of images with known camera poses, through estimating each image's dense depth map via either Plane-Sweep or Patch-based methods, to fusing multi-view depth maps into a dense point cloud or mesh. Image set +known camera poses Plane-Sweepsweep depth candidates,evaluate photo-consistency Patch-basedexpand patches,filter by visibility Dense depth mapfor each image Depth mapfusion Point cloud/mesh

क्लासिक MVS का मूल स्वरूप दो चरणों वाली संरचना है: पहले चरण में प्रत्येक छवि का सघन डेप्थ मैप खोजने के लिए प्लेन-स्वीप या पैच-आधारित विधि चुनें, फिर दूसरे चरण में उन्हें एक सुसंगत 3D आकार में मिला दें। आधुनिक डीप-लर्निंग आधारित विधियाँ काफी हद तक इसी दो-चरण वाली संरचना का अनुसरण करती हैं, जबकि वे प्लेन-स्वीप विधि को प्रतिस्थापित करती हैं। न्यूरल नेटवर्क के साथ गहराई अनुमान की आंतरिक प्रक्रिया।

5. प्लेन-स्वीप विधि

प्लेन-स्वीप विधि का संबंध स्पेस-स्कैनिंग मल्टी-इमेज मैचिंग दृष्टिकोण से है जिसे कॉलिन्स ने CVPR 1996 में प्रस्तावित किया था। यह विधि संदर्भ कैमरे के ऑप्टिकल अक्ष के लंबवत (या दृश्य के अनुसार उन्मुख) नियमित अंतराल पर स्थित आभासी तलों को संदर्भ कैमरे के व्यू फ्रस्टम के भीतर संरेखित करती है और उथले से गहरे की ओर गहराई को स्वीप करते हुए उनका मूल्यांकन करती है।

किसी गहराई d पर स्थित एक तल को मानते हुए, उस तल पर स्थित बिंदुओं को होमोग्राफी ट्रांसफॉर्म के माध्यम से संदर्भ छवि से दूसरी छवि पर मैप किया जा सकता है। होमोग्राफी प्राइमर में वर्णित H = K_k(R+\mathbf{t}\mathbf{n}^\mathsf{T}/d)K_{\text{ref}}^{-1} प्रकार के ट्रांसफॉर्म का उपयोग करके, दूसरी छवि I_k को संदर्भ व्यूप्वाइंट में विकृत किया जाता है। फोटो-संगति (जैसे पिछले अनुभाग का NCC) विकृत छवि और संदर्भ छवि के बीच प्रत्येक पिक्सेल पर लागत की गणना की जाती है, और प्रत्येक गहराई उम्मीदवार के लिए लागत संचित की जाती है।

d^*(\mathbf{u}) = \arg\min_{d\in\mathcal{D}} \sum_{k} \rho\left(1-\mathrm{NCC}_k(\mathbf{u},d)\right)

प्रत्येक गहराई उम्मीदवार के लिए लागत की गणना हो जाने के बाद, प्रति पिक्सेल न्यूनतम लागत वाली गहराई का चयन किया जाता है। यह एक असतत गहराई खोज है, जो GPU समानांतरकरण के साथ अच्छी तरह से काम करती है, और एक साथ कई गहराई परिकल्पनाओं का मूल्यांकन करती है। कई कार्यान्वयन इसे अर्ध-स्थानीय लागत एकत्रीकरण (अर्ध-वैश्विक मिलान के समान नियमितीकरण) के साथ जोड़ते हैं, जिससे बनावट-कम क्षेत्रों में भी पड़ोसी जानकारी से गहराई को सुचारू रूप से इंटरपोलेट किया जा सकता है। COLMAP का सघन पुनर्निर्माण मॉड्यूल भी प्लेन-स्वीप के समान दृष्टिकोण अपनाता है, जो प्रति-पिक्सेल दृश्य चयन (पिक्सेलवाइज व्यू सिलेक्शन) को अनुकूलित करता है - शॉनबर्गर एट अल का ECCV 2016 पेपर इसका एक प्रतिनिधि उदाहरण है।

6. पैच-आधारित विधि (PMVS)

पिक्सेल दर पिक्सेल गहराई स्वीप करने के बजाय, पैच-आधारित विधि सीधे उत्पन्न करती है और उसका विस्तार करती है। दृश्य सतह को ढकने वाले छोटे आयताकार पैचों का एक समूह। इसका एक प्रतिनिधि उदाहरण पीएमवीएस (पैच-आधारित मल्टी-व्यू स्टीरियो) है, जिसे फुरुकावा और पोंस ने 2010 में आईईईई टीपीएएमआई में प्रकाशित किया था।

प्रसंस्करण तीन चरणों को दोहराता है: "मिलान, विस्तार, फ़िल्टरिंग।"

  1. मिलान: सबसे पहले, एसआईएफटी या हैरिस कॉर्नर जैसे फीचर बिंदुओं के रूप में आसानी से पहचाने जाने वाले पत्राचार बिंदुओं से कुछ प्रारंभिक पैच उत्पन्न करें। प्रत्येक पैच में एक केंद्र स्थिति, एक सामान्य दिशा और उस बिंदु को देखने वाली छवियों का समूह (दृश्यता) होता है।

  2. विस्तार: नए पैचों को प्रारंभिक पैचों के आस-पास के क्षेत्र में फैलाएं, जिससे कवर किया गया क्षेत्र आसपास के पिक्सेल तक विस्तृत हो जाता है। प्रत्येक विस्तारित पैच की स्थिति और सामान्य को आसपास की छवियों के साथ फोटो-संगतता को अधिकतम करने के लिए स्थानीय रूप से अनुकूलित किया जाता है।

  3. फ़िल्टर: दृश्यता विरोधाभासों (जैसे कि एक मामला जहां एक पैच दूसरे पैच के पीछे होने के बावजूद दिखाई देता है) या कम फोटो-संगतता वाले पैचों को हटा दें।

इसके विपरीत प्लेन-स्वीप (PMVS), जो प्रत्येक पिक्सेल के लिए स्वतंत्र रूप से गहराई निर्धारित करता है, पैच नॉर्मल की अतिरिक्त जानकारी रखता है, इसलिए तिरछी सतहों के लिए इसकी पुनर्निर्माण सटीकता अधिक होती है। दूसरी ओर, क्योंकि यह पुनरावर्ती विस्तार और फ़िल्टरिंग पर आधारित है, इसलिए कम प्रारंभिक पैच या खराब बनावट वाले क्षेत्रों में विस्तार अच्छी तरह से नहीं हो पाता है, और पुनर्निर्माण में छेद रह जाने की संभावना रहती है।

7. डीप-लर्निंग आधारित विधियाँ: कॉस्ट-वॉल्यूम का विचार

हाल के वर्षों में, ऐसी विधियाँ जो प्रति-गहराई-उम्मीदवार सहमति को किसी हस्तनिर्मित मीट्रिक (जैसे NCC) के बजाय कनवोल्यूशनल न्यूरल नेटवर्क और कॉस्ट वॉल्यूम द्वारा सीखे गए फ़ीचर्स के साथ दर्शाती हैं, मुख्यधारा बन गई हैं। इसका एक प्रतिनिधि उदाहरण MVSNet है, जिसे याओ एट अल. ने ECCV 2018 में प्रकाशित किया था।

MVSNet एक प्रशिक्षित फ़ीचर एक्सट्रैक्टर के माध्यम से प्रत्येक छवि से एक फ़ीचर मैप प्राप्त करता है, संदर्भ कैमरे के व्यू फ्रस्टम के भीतर असतत गहराई तलों को मानता है, और प्रत्येक छवि के फ़ीचर मैप को संदर्भ के साथ संरेखित करता है। एक डिफरेंशिएबल होमोग्राफी वार्प के माध्यम से व्यूप्वाइंट प्राप्त किया जाता है। यह कई छवियों के फीचर मैप्स में भिन्नता को एक एकल कॉस्ट वॉल्यूम में संयोजित करता है, इसे 3D कनवोल्यूशन के साथ नियमित करता है, और फिर गहराई की दिशा में सॉफ्टमैक्स के माध्यम से गहराई को रिग्रेस करता है। इसका मूल ढांचा प्लेन-स्वीप के "स्वीप डेप्थ कैंडिडेट्स और इवैल्यूएट" के विचार का अनुसरण करता है, लेकिन शास्त्रीय विधियों से अंतर यह है कि फोटो-कंसिस्टेंसी की गणना स्वयं सीखने योग्य हो जाती है।

सीखने पर आधारित विधियाँ उन स्थितियों में अधिक मजबूती से काम करती हैं जहाँ हस्तनिर्मित फोटो-कंसिस्टेंसी मेट्रिक्स संघर्ष करते हैं — जैसे कि दोहराव वाले पैटर्न, कमजोर बनावट — बशर्ते प्रशिक्षण डेटा में समान स्थितियाँ शामिल हों। दूसरी ओर, प्रशिक्षण डेटासेट के वितरण से बहुत दूर के दृश्यों (अपरिचित सामग्री, अत्यधिक प्रकाश व्यवस्था) में प्रदर्शन खराब हो सकता है।

8. डेप्थ-मैप फ्यूजन और मेशिंग

चूंकि मल्टी-व्यू डेप्थ मैप्स का अनुमान स्वतंत्र रूप से लगाया जाता है, इसलिए उन्हें 3D बिंदुओं के रूप में सीधे ओवरले करने से शोर और अवरोध (एक ही बिंदु पर थोड़े ऑफसेट बिंदु) से विरोधाभास उत्पन्न होते हैं। स्थान कई परतों में एकत्रित हो रहे हों, या अलग-अलग दृष्टिकोणों से गहराई में अंतर हो, तो ऐसे पिक्सेल का उपयोग किया जा सकता है। फ़्यूज़न वह प्रक्रिया है जो इन डेप्थ मैप्स को एक एकल, सुसंगत निरूपण में समेकित करती है।

  • पॉइंट क्लाउड के रूप में फ़्यूज़न: केवल उन पिक्सेल को अपनाएं जहां अलग-अलग दृष्टिकोणों से गहराई सुसंगत हो, कम आत्मविश्वास वाली गहराई को हटा दें और एकीकृत करें। COLMAP और अन्य सॉफ्टवेयर इस तरह से एक सघन पॉइंट क्लाउड आउटपुट करते हैं।

  • TSDF (ट्रंकेटेड साइन्ड डिस्टेंस फंक्शन) फ़्यूज़न: कर्लेस और लेवॉय द्वारा SIGGRAPH 1996 में प्रस्तावित एक वॉल्यूमेट्रिक विधि, जो स्थान को वोक्सेल में विभाजित करती है और प्रत्येक वोक्सेल में एक साइन्ड डिस्टेंस संचित करती है। यह विधि रीयल-टाइम डेप्थ-कैमरा फ़्यूज़न (जैसे KinectFusion) में व्यापक रूप से उपयोग की जाती है, और MVS डेप्थ मैप्स को फ़्यूज़ करने के लिए भी लागू होती है।

  • मेशिंग: एक पॉइंट क्लाउड या साइन्ड डिस्टेंस फ़ील्ड से, पॉइसन सरफेस रिकंस्ट्रक्शन (2006), कज़दान एट अल द्वारा विकसित विधियां, एक चिकना पॉलीगॉन मेश उत्पन्न करती हैं। टेक्सचर मैपिंग जोड़ने से प्रक्रिया पूरी हो जाती है। 3D मॉडल को दृष्टिगत रूप से भी उपयोग किया जा सकता है।

9. प्रतिनिधि एल्गोरिदम की तुलना

पहलू प्लेन-स्वीप पैच-आधारित (PMVS) लर्निंग-आधारित (MVSNet परिवार)
सिद्धांत गहराई वाले तलों को स्वीप करता है, प्रति पिक्सेल फोटो-संगति का मूल्यांकन करता है छोटे पैचों को पुनरावृत्त रूप से विस्तारित और फ़िल्टर करता है CNN के साथ लागत आयतन को नियमित करता है और गहराई का प्रतिगमन करता है
सटीकता गहराई रिज़ॉल्यूशन और लागत-एकत्रीकरण डिज़ाइन पर निर्भर करता है; मध्यम से उच्च तिरछी या जटिल स्थानीय आकृतियों के लिए सटीक होने की प्रवृत्ति रखता है प्रशिक्षण डेटा के निकट की स्थितियों में उच्च सटीकता

कम्प्यूटेशनल लागत | आसानी से GPU-समानांतर किया जा सकता है, तेज़ | पुनरावृत्त प्रसंस्करण के कारण प्लेन-स्वीप की तुलना में धीमा होने की प्रवृत्ति रखता है | प्रशिक्षण के बाद तेज़ अनुमान; प्रशिक्षण लागत अलग है |

| मजबूती | बनावट-कम क्षेत्रों में कमजोर | क्षेत्रों में छेद छोड़ने की प्रवृत्ति रखता है कुछ प्रारंभिक पैच के साथ | कमजोर बनावट या दोहराव वाले पैटर्न के प्रति अपेक्षाकृत मजबूत |

कार्यान्वयन कठिनाई | मध्यम (होमोग्राफी वार्पिंग और लागत एकत्रीकरण) | उच्च (दृश्यता प्रबंधन और पुनरावृत्ति विस्तार डिजाइन) | उच्च (प्रशिक्षण डेटा और नेटवर्क डिजाइन की आवश्यकता) |

प्रतिनिधि कार्यान्वयन | COLMAP सघन, कई वाणिज्यिक फोटोग्रामेट्री उपकरण | PMVS/CMVS | MVSNet, अनुवर्ती शिक्षण-आधारित विधियाँ |

10. स्टीरियो और डेप्थ कैमरों से संबंध

MVS अपने मूल सिद्धांत — "कई दृष्टिकोणों के बीच पत्राचार से गहराई ज्ञात करना" — को स्टीरियो कैमरों और डेप्थ कैमरों के साथ साझा करता है, लेकिन उनकी स्थिति अलग-अलग है।

  • स्टीरियो कैमरे एक निश्चित दो-आंख व्यवस्था का उपयोग करते हैं, जो असमानता खोज को उपध्रुवीय रेखा के साथ एक आयाम तक सीमित करता है, और इस आधार पर डिज़ाइन किए गए हैं कि वास्तविक समय प्रसंस्करण। एमवीएस की प्लेन-स्वीप विधि को किसी भी व्यवस्था में किसी भी संख्या में कैमरों के लिए इस असमानता खोज के सामान्यीकरण के रूप में समझा जा सकता है।

गहराई कैमरे (संरचित प्रकाश, टॉफ़िनिशन, सक्रिय स्टीरियो) सक्रिय रूप से प्रकाश प्रक्षेपित करते हैं, जिससे वे बनावट-रहित सतहों के लिए भी स्थिर रूप से दूरी प्राप्त कर सकते हैं। चूंकि एमवीएस पूरी तरह से निष्क्रिय फोटो-संगति पर निर्भर करता है, इसलिए यह स्वाभाविक रूप से कम पैटर्न वाली सतहों पर नुकसान में रहता है - सक्रिय गहराई कैमरों से एक स्पष्ट अंतर।

एमवीएस मूल रूप से ऑफ़लाइन है, जो कई छवियों (दसियों से सैकड़ों) से उच्च-परिशुद्धता, उच्च-घनत्व आकार का निर्माण करता है, जबकि स्टीरियो और गहराई कैमरे वास्तविक समय में, एक समय में एक फ्रेम गहराई आउटपुट करने के लिए अनुकूलित होते हैं।

अनुप्रयोग के आधार पर, वास्तविक समय प्रदर्शन की आवश्यकता वाले रोबोट या एआर स्टीरियो/गहराई कैमरों के लिए उपयुक्त होते हैं, जबकि सांस्कृतिक विरासत प्रलेखन, वास्तु सर्वेक्षण या फोटोग्रामेट्री के लिए ऑफ़लाइन, उच्च-परिशुद्धता 3डी मॉडल एमवीएस के लिए उपयुक्त होते हैं।

11. कठिन परिस्थितियाँ और सामान्य विफलता के मामले

  • कम बनावट वाली या एकसमान सतहें: सफेद दीवारें, सादे फर्श और आसमान फोटो-संगति के बारे में बहुत कम संकेत देते हैं, जिससे गहराई या तो अनिश्चित रह जाती है या आसपास के शोर के कारण गलत मान तक पहुँच जाती है।

चमकीली, पारदर्शी या अर्धपारदर्शी वस्तुएँ: कांच, पानी की सतहें और धातु की चमक देखने के कोण के अनुसार अपना रूप बदलती हैं, जिससे फोटो-संगति की धारणा ही टूट जाती है।

दोहराव वाले पैटर्न: खेत में टाइलें, ईंटें और फसलों की पंक्तियाँ "भूतिया समाधान" उत्पन्न कर सकती हैं, जहाँ गलत गहराई होने पर भी स्थानीय फोटो-संगति उच्च दिखाई देती है।

अवरोध: यदि दृश्यता का अनुमान गलत लगाया जाता है, तो केवल कुछ देखने के बिंदुओं से दिखाई देने वाले क्षेत्र गलत छवि का उपयोग करके फोटो-संगति का मूल्यांकन कर सकते हैं, जिससे गहराई का अनुमान गलत हो जाता है।

अपर्याप्त देखने के बिंदु या लंबन: यदि कवर करने वाले देखने के बिंदुओं की संख्या कम है, या लंबन बहुत कम है, तो गहराई की दिशा में शुरू से ही कोई रिज़ॉल्यूशन उपलब्ध नहीं होता है।

12. व्यावहारिक विकल्प

  • यदि पोज़ पहले से ही SfM या कैलिब्रेशन से ज्ञात हैं और लक्ष्य सटीकता-प्रथम ऑफ़लाइन 3D पुनर्निर्माण (सांस्कृतिक विरासत प्रलेखन, वास्तुकला सर्वेक्षण, वीडियो निर्माण के लिए फोटोग्रामेट्री) है, तो COLMAP की सघन पाइपलाइन जैसी प्लेन-स्वीप परिवार की कार्यान्वयन विधि एक सुलभ प्रारंभिक बिंदु है।

  • यदि तिरछी सतहों या जटिल स्थानीय आकृतियों के लिए सटीकता विशेष प्राथमिकता है, तो PMVS परिवार में पैच-आधारित दृष्टिकोण या इसके विचारों को समाहित करने वाली एक हाइब्रिड कार्यान्वयन विधि पर विचार करें।

  • यदि आपको पहले से पता है कि दृश्य में बनावट कम है या इसमें कई दोहराव वाले पैटर्न हैं, तो सीखने-आधारित विधियाँ (MVSNet परिवार) अधिक मजबूत होती हैं। चूंकि प्रशिक्षण-डेटा वितरण से बाहर के दृश्यों पर प्रदर्शन खराब हो सकता है, इसलिए किसी एक को अपनाने से पहले अपने लक्ष्य डोमेन के निकट डेटा पर मूल्यांकन करें।

  • वास्तविक समय प्रदर्शन की आवश्यकता वाले अनुप्रयोगों के लिए — रोबोट, AR/VR, स्वायत्त ड्राइविंग में बाधा पहचान — स्टीरियो कैमरे या [डेप्थ सेंसर] पर विचार करें। MVS के बजाय मल्टी-व्यू कैमरों का उपयोग करें। MVS का मुख्य क्षेत्र ऑफ़लाइन, उच्च-घनत्व और उच्च-सटीकता पुनर्निर्माण है।

यदि अंतिम परिणाम एक मेश या टेक्सचर्ड 3D मॉडल होना चाहिए, तो डेप्थ-मैप-फ़्यूज़न चरण में TSDF फ़्यूज़न या पॉइसन सरफेस रिकंस्ट्रक्शन चुनें; यदि केवल पॉइंट क्लाउड पर्याप्त है, तो आप वहीं रुक सकते हैं।

13. सारांश

मल्टी-व्यू स्टीरियो, SfM या कैलिब्रेशन से पहले से ज्ञात कैमरा पोज़ को मानकर चलता है और फोटो-कंसिस्टेंसी को आधार बनाकर सघन डेप्थ रिकवर करता है। दो पारंपरिक दृष्टिकोण, प्लेन-स्वीप और पैच-आधारित, के अलग-अलग फायदे और नुकसान हैं, और हाल के वर्षों में, MVSNet परिवार के तरीके जो कॉस्ट वॉल्यूम सीखते हैं, सटीकता और मजबूती को और आगे बढ़ा रहे हैं। पूरी प्रक्रिया परिणामी डेप्थ मैप्स को फ्यूज़ और मेश करने और विभाजन को समझने तक चलती है — MVS सटीकता के लिए रीयल-टाइम प्रदर्शन का त्याग करता है, जबकि स्टीरियो/डेप्थ कैमरे इसे प्राथमिकता देते हैं। वास्तविक समय का प्रदर्शन — सही व्यावहारिक विकल्प चुनने का आधार है।

अपनी समझ की जाँच करें
क्या सघन पॉइंट क्लाउड अधिक सटीक ज्यामिति की गारंटी देता है?

अधिक गलत गहराई से सटीकता में सुधार नहीं होता है। घनत्व से अलग मल्टी-व्यू संगति, अवरोध, परावर्तन और बनावट की जाँच करें।

संदर्भ

What to read next

Review the backgroundबंडल एडजस्टमेंट प्राइमर — नॉनलाइनियर लीस्ट स्क्वेयर्स जो कैमरा पोज़ और 3डी पॉइंट्स को एक साथ परिष्कृत करते हैंContinue the seriesVO/VIO प्राइमर — कैमरा और IMU से गति का अनुमान लगाने के लिए एक व्यावहारिक आधारExplore another aspect of this fieldछवि चमक और ल्यूमिनेंस Lab — एक्सपोज़र, गामा और क्लिपिंग