Contents — find the section you need
न्यूरल 3डी विधियाँ कई छवियों और कैमरा स्थितियों से एक दृश्य प्रतिनिधित्व सीखती हैं, फिर एक ऐसे दृष्टिकोण से छवि प्रस्तुत करती हैं जिसे कैप्चर नहीं किया गया था। जबकि SfM मुख्य रूप से स्थितियों और विरल बिंदुओं का अनुमान लगाती है, और MVS मुख्य रूप से सघन ज्यामिति का पुनर्निर्माण करती है, न्यूरल 3डी यह भी मॉडल करती है कि कोई दृश्य किसी स्थिति और देखने की दिशा से कैसा दिखता है।
संक्षेप में
-
NeRF एक दृश्य को एक फ़ंक्शन के रूप में प्रस्तुत करता है जो स्थिति और देखने की दिशा से घनत्व और दीप्ति लौटाता है; 3डी गॉसियन स्प्लैटिंग कई स्पष्ट 3डी गॉसियन तत्वों को अनुकूलित करता है।
-
प्रशिक्षण दृश्यों को अच्छी तरह से पुन: प्रस्तुत करना यह साबित नहीं करता कि अनदेखे दृश्य या ज्यामिति सही हैं।
-
गहराई, बिंदुओं, अभिलंबों और स्थितियों के ज्यामितीय मूल्यांकन से PSNR/SSIM जैसे छवि मेट्रिक्स को अलग करें। नवीन-दृश्य संश्लेषण सर्वेक्षण-सटीकता का प्रमाण नहीं है।
प्रतिनिधित्व विकल्प
NeRF, कैमरा किरणों के अनुदिश नमूनों पर (\sigma,\mathbf{c})=F_\theta(\mathbf{x},\mathbf{d}) का मूल्यांकन करता है और छवि बनाने के लिए वॉल्यूम रेंडरिंग का उपयोग करता है। प्रशिक्षण, रेंडर की गई और इनपुट छवियों के बीच के अंतर को कम करता है। 3डी गॉसियन स्प्लैटिंग, स्थिति, सहप्रसरण, अपारदर्शिता और रंग के साथ गॉसियन को प्रोजेक्ट करता है और विरल बिंदुओं से शुरू करके इन तत्वों को अनुकूलित करता है।
| प्रतिनिधित्व | खूबियाँ | कमियाँ |
|---|---|---|
| NeRF परिवार | निरंतर रेडियंस क्षेत्र और दृश्य-निर्भर उपस्थिति | कई किरण नमूने; प्रशिक्षण और रेंडरिंग सेटअप पर निर्भर करते हैं |
| 3डी गॉसियन स्प्लैटिंग | स्पष्ट प्रोजेक्टेड तत्व तेजी से रेंडर हो सकते हैं | घनत्व, अदृश्य ज्यामिति और गतिशील वस्तुओं को अलग-अलग मान्य करें |
| मेश / MVS | सतह ज्यामिति स्पष्ट है और निरीक्षण करना आसान है | परावर्तन, अवरोध, छिद्र और कमज़ोर बनावट के प्रति संवेदनशील |
प्रशिक्षण और मूल्यांकन दृश्यों को अलग-अलग करें
प्रशिक्षण के लिए उपयोग की जाने वाली प्रत्येक इनपुट छवि को रेंडर करने से केवल देखे गए दृश्यों के पुनर्निर्माण का मापन होता है। यह अनदेखे क्षेत्रों में इंटरपोलेशन स्थापित नहीं करता है। छवियों या कैमरा प्रक्षेप पथ को प्रशिक्षण, सत्यापन और होल्ड-आउट दृश्यों में विभाजित करें, और दृश्य अंतराल, ओवरलैप, गतिशील वस्तुओं और कैमरा-पोज़ स्रोत को स्थिर करें। यदि पोज़ का अनुमान लगाया जाता है, तो उनकी अनिश्चितता को भी रिकॉर्ड करें।
PSNR, SSIM और LPIPS छवि समानता को माप सकते हैं, लेकिन वे दिखावट को मापते हैं। ज्यामितीय मूल्यांकन में गहराई, बिंदुओं, नॉर्मल, कैमरा पोज़ और रीप्रोजेक्शन त्रुटि की अलग-अलग तुलना की जानी चाहिए। एक धुंधली प्रस्तुति छवि स्कोर में सुधार कर सकती है, जबकि दीवार या पतली संरचना को गलत तरीके से रखा जा सकता है।
सामान्य विफलता की स्थितियाँ
-
दर्पण, पारदर्शी सतहें, परावर्तन और बदलती रोशनी इस धारणा को तोड़ देती हैं कि एक बिंदु की दिखावट स्थिर होती है।
-
प्रशिक्षण प्रक्षेप पथ के बाहर के क्षेत्र या अवरोध द्वारा छिपे हुए क्षेत्र ठोस प्रमाण के बिना भी विश्वसनीय प्रतीत हो सकते हैं।
-
गतिमान व्यक्तियों, वाहनों या पौधों को स्थिर ज्यामिति के रूप में मानने से अदृश्य आकृतियाँ और डुप्लिकेट सतहें बन सकती हैं।
-
यदि SfM पोज़ या स्केल अस्थिर हैं, तो केवल रेंडर की गई छवियों से कारण का पता नहीं लगाया जा सकता है।
सारांश
न्यूरल 3D छवियों और पोज़ से दृश्य-निर्भर दृश्य निरूपण सीखता है। NeRF और 3D गॉसियन स्प्लैटिंग अलग-अलग निरूपण और रेंडरिंग रणनीतियों का उपयोग करते हैं, लेकिन दोनों के लिए प्रशिक्षण-दृश्य पुनर्निर्माण और हेल्ड-आउट-दृश्य सामान्यीकरण के बीच स्पष्ट पृथक्करण आवश्यक है। परिणाम की व्याख्या करने से पहले दृश्य गुणवत्ता, ज्यामिति, पोज़ त्रुटि, गतिशील सामग्री और दृश्य विभाजन को स्वतंत्र रूप से रिकॉर्ड करें।
क्या उच्च प्रशिक्षण-दृश्य PSNR यह सिद्ध करता है कि 3D ज्यामिति सही है?
नहीं।
होल्ड-आउट व्यू, डेप्थ या पॉइंट-क्लाउड मेट्रिक्स और कैमरा-पोज़ त्रुटि की अलग-अलग जाँच करें। ## संदर्भ - [मिल्डेनहॉल एट अल., NeRF: व्यू सिंथेसिस के लिए दृश्यों को न्यूरल रेडियंस फील्ड के रूप में प्रस्तुत करना](https://arxiv.org/abs/2003.08934) - [केर्बल एट अल., रियल-टाइम रेडियंस फील्ड रेंडरिंग के लिए 3D गॉसियन स्प्लैटिंग](https://arxiv.org/abs/2308.04079)
टिप्पणियाँ
पहले लॉग इन करें।
अभी कोई डेटा नहीं है।