Contents — find the section you need
वीडियो को एक-एक फ्रेम करके देखने पर, यह सहज रूप से स्पष्ट नहीं होता कि छवि का कौन सा भाग कितना हिला है। ऑप्टिकल फ्लो प्रत्येक पिक्सेल की चमक की स्थिति को अगले फ्रेम में एक वेक्टर के रूप में दर्शाता है। यह गति से संबंधित किसी भी प्रक्रिया के लिए एक सामान्य भाषा बन जाता है: सेल्फ-ड्राइविंग कारों में टक्कर का पूर्वानुमान, ड्रोन के लिए सेल्फ-लोकलाइज़ेशन, स्पोर्ट्स एनालिटिक्स और वीडियो इंटरपोलेशन।
30-सेकंड का सारांश
-
फ्लो "वस्तु का वेग" नहीं है, बल्कि छवि में उसकी आभासी गति है। इसमें कैमरा गति, वस्तु गति और गहराई सभी मिश्रित होते हैं।
-
चमक-स्थिरता समीकरण प्रति पिक्सेल केवल एक समीकरण देता है, इसलिए इसे स्थानीय-विंडो स्मूथनेस धारणा, फीचर पॉइंट्स या रेगुलराइजेशन जोड़कर हल करना पड़ता है।
-
लुकास-कनाडे एक छोटी विंडो को एकल वेग के रूप में मानता है - एक विरल ट्रैकिंग विधि। हॉर्न-शंक पूरी छवि में स्मूथनेस का उपयोग करता है - एक सघन अनुमान विधि।
-
बड़े विस्थापनों के लिए एक इमेज पिरामिड की आवश्यकता होती है; अवरोध, परावर्तन और धुंधलापन के लिए आत्मविश्वास माप और आउटलायर हैंडलिंग की आवश्यकता होती है। रोलिंग शटर के लिए भी पंक्ति समय में अंतर को ठीक करना आवश्यक है।
RAFT जैसी लर्निंग-आधारित विधियाँ अत्यधिक सटीक होती हैं, लेकिन GPU मेमोरी, वितरण से बाहर व्यवहार, वास्तविक समय प्रदर्शन और लाइसेंसिंग की जाँच के बाद ही इन्हें अपनाया जाना चाहिए।
1. चमक स्थिरता से प्रवाह अवरोध समीकरण तक
चित्र 1 — एक पिरामिड पहले बड़े विस्थापन को संभालता है, फिर एक सघन सदिश क्षेत्र को महीन पैमानों पर परिष्कृत करता है। विश्वास और अवरोध मास्क को सदिशों के साथ चलना चाहिए।
यदि एक छोटा, स्थिर पैटर्न फ्रेम के बीच गति करता है, तो हम इसे स्थिर चमक वाला मान सकते हैं।
प्रथम क्रम का टेलर विस्तार, \Delta t\to0 के साथ मिलकर देता है
चूंकि दो अज्ञात वेग घटक (u,v) हैं लेकिन केवल एक समीकरण है, इसलिए इसे अकेले हल नहीं किया जा सकता है। किनारे पर, किनारे की दिशा में गति अदृश्य होती है; समतल क्षेत्र में, कोई ग्रेडिएंट नहीं होता। यही एपर्चर की समस्या है।
2. लुकास-कनाडे और हॉर्न-शंक
लुकास-कनाडे यह मानता है कि वेग एक स्थानीय विंडो W में समान है, और निम्नलिखित वर्ग त्रुटि को न्यूनतम करता है।
यह केवल उन कोनों का उपयोग करता है जहां ग्रेडिएंट मैट्रिक्स पर्याप्त रूप से अच्छी तरह से अनुकूलित होता है, और इसे फीचर-पॉइंट ट्रैकिंग में उपयोग किए जाने वाले समान पिरामिड और पुनरावृत्ति अद्यतन के साथ जोड़ता है (पिछला अनुभाग देखें)। OpenCV का calcOpticalFlowPyrLK इसी परिवार का एक कार्यान्वयन है।
हॉर्न-शंक पूरी छवि पर प्रवाह क्षेत्र को अज्ञात मानता है, और साथ ही चमक बाधा और वेग की सुगमता को न्यूनतम करता है।
एक बड़ा \alpha एक सुगम प्रवाह क्षेत्र प्रदान करता है; एक छोटा स्थानीय असंतुलन की अनुमति देता है। किसी ऑब्जेक्ट की सीमा पर स्मूथिंग करने से अलग-अलग ऑब्जेक्ट्स के वेग आपस में मिल जाते हैं, इसलिए इसके बजाय रोबस्ट लॉस या एज-प्रिजर्विंग रेगुलराइजेशन का उपयोग किया जाता है।
3. स्पार्स फ्लो और डेंस फ्लो
| प्रकार | अनुमानित बिंदु | प्रतिनिधि विधियाँ | खूबियाँ | कमियाँ |
|---|---|---|---|---|
| स्पार्स | सैकड़ों से हजारों बिंदु, जैसे कोने | LK, KLT | हल्का, सीधे पोज़ एस्टिमेशन में उपयोग होता है | कम टेक्सचर वाले क्षेत्रों में अंतराल छोड़ देता है |
| सेमी-डेंस | ग्रेडिएंट वाले पिक्सेल | डायरेक्ट VO, हेसियन-आधारित विधियाँ | कंप्यूट लागत के मुकाबले ज्यामितीय जानकारी को संतुलित करता है | पूरी छवि को नहीं भरता |
डेंस | लगभग हर पिक्सेल | हॉर्न-शंक, TV-L1, RAFT | गतिशील वस्तुओं, तरल पदार्थों, इंटरपोलेशन के लिए प्रभावी | कंप्यूट लागत, अवरोध सीमाओं पर अस्पष्टता |
विजुअल ओडोमेट्री के लिए, स्पार्स को पास करना ज्यामितीय गणना में पत्राचार अधिक स्थिर होता है। दूसरी ओर, चलते हुए पैदल यात्रियों के क्षेत्रों को मास्क करना, या वीडियो इंटरपोलेशन के लिए प्रति-पिक्सेल गति का उपयोग करना, सघन प्रवाह की आवश्यकता होती है। समस्या पर केवल अधिक GPU लगाने की तुलना में, उद्देश्य के लिए आवश्यक घनत्व को पहले से तय करना अधिक प्रभावी होता है।
4. बड़े विस्थापन, अवरोध और चमक परिवर्तन को संभालना
एक-पिक्सेल विभेदक सन्निकटन बड़ी गति के तहत विफल हो जाता है। छवि को 1/2, 1/4, 1/8 पैमाने पर सिकोड़कर एक गाऊसी पिरामिड बनाया जाता है; बड़े विस्थापनों का अनुमान मोटे स्तर पर लगाया जाता है, फिर उन्हें सूक्ष्म स्तर तक अपसैंपल किया जाता है और पुनरावृत्ति से परिष्कृत किया जाता है। बहुत अधिक पिरामिड स्तर होने पर छोटी वस्तुएँ गायब हो जाती हैं; बहुत कम होने पर खोज सीमा अपर्याप्त रह जाती है।
प्रकाश में परिवर्तन होने पर, चमक स्थिरता विफल हो जाती है, इसलिए स्थानीय सामान्यीकरण, प्रवणता दिशा, मजबूत चारबोनियर हानि, या सापेक्ष रंग अंतर का उपयोग किया जाता है। एक गतिशील वस्तु की सीमा पर, पिछले फ्रेम में दिखाई देने वाला पिक्सेल अगले फ्रेम में छिपा हो सकता है। (अवरोध)। अवरोध फ़्लैग, आगे-पीछे संगति और दृश्यता मास्क का उपयोग ट्रैक को जबरदस्ती आगे बढ़ाने के बजाय किया जाता है।
5. लर्निंग-आधारित विधियाँ: RAFT को कैसे पढ़ें
RAFT (रिकरेंट ऑल-पेयर्स फील्ड ट्रांसफ़ॉर्म) दो छवियों के बीच सभी पिक्सेल युग्मों में सहसंबंध की गणना करने और फिर एक पुनरावृत्ति अद्यतन ऑपरेटर के साथ प्रवाह को परिष्कृत करने के लिए जाना जाता है। क्योंकि यह पारंपरिक विधियों की "स्थानीय विंडो" की तुलना में पत्राचार उम्मीदवारों के एक बहुत व्यापक पूल का उपयोग कर सकता है, यह दोहराव वाली बनावट वाले क्षेत्रों या बड़े विस्थापन के तहत मजबूत हो सकता है।
लेकिन बेंचमार्क पर कम औसत एंडपॉइंट त्रुटि (EPE) का मतलब यह नहीं है कि इसे वास्तविक रोबोट पर क्षेत्र में उपयोग करना सुरक्षित है। यदि कैमरे का लेंस, एक्सपोज़र, रोलिंग शटर, धूल या रात्रि प्रकाश प्रशिक्षण डेटा से भिन्न हैं, तो विश्वास कम हो जाता है। मूल्यांकन में अनुमान समय, इनपुट रिज़ॉल्यूशन, क्वांटिज़ेशन त्रुटि, GPU ड्राइवर और मॉडल का लाइसेंस शामिल होना चाहिए।
6. गतिशील वस्तुओं से कैमरा गति को अलग करना
रूपांतरण कैमरा गति में प्रवाह के लिए कैमरा इंट्रिंसिक मैट्रिक्स K और गहराई Z की आवश्यकता होती है। एक छवि बिंदु \mathbf{x} के सामान्यीकृत निर्देशांकों में, कैमरे के ट्रांसलेशन \mathbf{t} और कोणीय वेग \boldsymbol{\omega} के कारण प्रवाह को वैचारिक रूप से इस प्रकार लिखा जा सकता है:
ट्रांसलेशनल घटक 1/Z के साथ बदलता रहता है — पास की वस्तुएँ दूर की वस्तुओं की तुलना में अधिक गति करती हैं — जबकि रोटेशनल घटक गहराई पर निर्भर नहीं करता है। RANSAC के माध्यम से प्राप्त एकल गति मॉडल के अनुरूप प्रवाह को पृष्ठभूमि माना जाता है; बड़े अवशिष्ट वाले क्षेत्र संभावित गतिशील वस्तुएँ बन जाते हैं। कई वाहनों या पैदल यात्रियों वाले दृश्यों में, ऑब्जेक्ट डिटेक्शन और सिमेंटिक मास्क का उपयोग ज्यामितीय अनुमान के साथ किया जाता है।
7. मूल्यांकन मैट्रिक्स और प्रतिलिपि योग्य मापन
ग्राउंड-ट्रुथ प्रवाह (u^*,v^*) को देखते हुए, औसत एंडपॉइंट त्रुटि है
केवल माध्य ही नहीं, बल्कि 95वां पर्सेंटाइल, अवरोध सीमाओं पर त्रुटि, कम बनावट वाले क्षेत्रों में त्रुटि और वेग के अनुसार विभाजित त्रुटि भी रिपोर्ट करें। चूंकि वास्तविक हार्डवेयर पर ग्राउंड ट्रुथ प्राप्त करना कठिन है, इसलिए इसे आमतौर पर मोशन कैप्चर, रोबोट आर्म के ज्ञात प्रक्षेप पथ, सिंथेटिक छवियों, फॉरवर्ड-बैकवर्ड कंसिस्टेंसी और वीओ रीप्रोजेक्शन त्रुटि से संयोजित किया जाता है।
लॉग में कैमरा टाइमस्टैम्प, एक्सपोज़र, रिज़ॉल्यूशन, पिरामिड स्तर, विंडो आकार, पुनरावृति संख्या, जीपीयू/सीपीयू, तापमान और प्रवाह आत्मविश्वास को बनाए रखना चाहिए। एक ही एल्गोरिदम नाम के तहत भी, यदि ये स्थितियाँ भिन्न होती हैं तो परिणाम तुलनीय नहीं होते हैं।
8. सारांश
ऑप्टिकल फ्लो समीकरणों के साथ पिक्सेल की स्पष्ट गति को सीमित करता है, और इसे स्थानीय विंडो, संपूर्ण छवि चिकनाई, छवि पिरामिड और सीखने-आधारित सहसंबंध का उपयोग करके हल करता है। स्पार्स एलके स्व-स्थानीकरण के लिए उपयुक्त है; सघन प्रवाह गतिशील वस्तुओं और वीडियो प्रसंस्करण के लिए उपयुक्त है। कैमरा गति बनाम वस्तु गति, अवरोध, प्रकाश व्यवस्था और अन्य कारकों पर विचार करते हुए रोलिंग शटर को अलग से देखना और केवल औसत त्रुटि के बजाय विफलता की स्थितियों का मूल्यांकन करना, गलत कार्यान्वयन विकल्प से बचने में मदद करता है।
क्या छवि गति वस्तु का भौतिक वेग है?
कैमरा गति, वस्तु गति और गहराई, ये सभी प्रक्षेपित गति को प्रभावित करते हैं। पिक्सल प्रति सेकंड को मीटर प्रति सेकंड में परिवर्तित करने के लिए ज्यामितीय जानकारी की आवश्यकता होती है।
टिप्पणियाँ
पहले लॉग इन करें।
अभी कोई डेटा नहीं है।