Contents — find the section you need

न तो विज़ुअल-एसएलएएम और न ही लिडार-एसएलएएम अकेले हर जगह काम करते हैं। कैमरा अंधेरे में या तेज़ गति में ठीक से काम नहीं कर पाता; लिडार कम सुविधाओं वाले वातावरण में कम प्रभावी होता है और महंगा भी होता है। इन कमियों को दूर करने की कुंजी आईएमयू (इनर्टियल मेज़रमेंट यूनिट) है, जो उच्च आवृत्ति पर त्वरण और कोणीय वेग को मापता है। वीआईओ (विज़ुअल-इनर्टियल ओडोमेट्री) और एलआईओ (लिडार-इनर्टियल ओडोमेट्री) - जिसमें कैमरे या लिडार को आईएमयू के साथ जोड़ा जाता है - आज कई स्वायत्त मोबाइल रोबोट, ड्रोन और एआर/वीआर उपकरणों में मानक कॉन्फ़िगरेशन बन गए हैं। यह लेख इस सिद्धांत से शुरू होता है कि क्यों केवल आईएमयू स्थिति का अनुमान नहीं लगा सकता, सेंसर फ़्यूज़न की अवधारणा, फ़िल्टर-आधारित और ऑप्टिमाइज़ेशन-आधारित अनुमान की दो डिज़ाइन पद्धतियों और अंत में प्रमुख एल्गोरिदम: आरओवीआईओ, ओकेवीआईएस, वीआईएनएस-मोनो, ओपनवीआईएनएस, एलआईओ-एसएएम और फास्ट-एलआईओ2 पर चर्चा करता है।

Xsens MTi-G GNSS/INS integrated IMUIMU/INS उदाहरण
Livox LiDAR सेंसर परिवारLiDAR उदाहरण

छवियां: Xsens MTi-G (Kallap85, CC BY-SA 4.0) / Livox मिड-40, होराइज़न, और टेली-15(Dllu, CC BY-SA 4.0), विकिमीडिया कॉमन्स। प्रतिनिधि इनपुट सेंसर, आवश्यक VIO/LIO हार्डवेयर कॉन्फ़िगरेशन नहीं।

0. इस लेख में क्या शामिल है

  • IMU क्या मापता है, और IMU अकेले समय के साथ स्थिति को पुनः प्राप्त क्यों नहीं कर सकता
  • कैमरा और LiDAR की क्रमशः कमियाँ, और IMU के साथ इनका संयोजन इतना कारगर क्यों होता है
  • VIO और LIO का क्या अर्थ है, और इनमें क्या अंतर है
  • फ़िल्टर-आधारित (EKF/MSCKF) और ऑप्टिमाइज़ेशन-आधारित (फ़ैक्टर ग्राफ़) डिज़ाइन सिद्धांतों में अंतर
  • ROVIO, OKVIS, VINS-Mono, VINS-Fusion, और OpenVINS (VIO) तथा LIO-SAM, FAST-LIO, और FAST-LIO2 (LIO) का क्या योगदान है
  • उपयोग के मामले के आधार पर व्यवहार में VIO और LIO में से सही चुनाव कैसे करें

1. संक्षिप्त उत्तर: IMU, VIO, और LIO क्या हैं

प्रत्येक का एक वाक्य में वर्णन: **एक IMU (जड़त्वीय एक आईएमयू (IMU) एक ऐसा सेंसर है जो एक्सेलेरोमीटर और जाइरोस्कोप को मिलाकर उच्च आवृत्ति पर स्वयं के त्वरण और कोणीय वेग को मापता है, बिना किसी बाहरी संदर्भ के। विजुअल-इनर्टियल ओडोमेट्री (VIO) इस आईएमयू को कैमरे के साथ संयोजित करने की तकनीक है, जिससे स्वयं की स्थिति और अभिविन्यास का अनुमान लगाया जाता है; लिडार-इनर्टियल ओडोमेट्री (LIO) भी यही काम आईएमयू को लिडार के साथ संयोजित करके करती है।

एक आईएमयू आपको उच्च आवृत्ति (आमतौर पर सैकड़ों हर्ट्ज़ से लेकर लगभग 1 किलो हर्ट्ज़ तक) पर बताता है कि "मैं अभी कितनी तेजी से त्वरित हो रहा हूँ और कितनी गति से घूम रहा हूँ" - लेकिन इसकी एकीकृत मात्रा, स्थिति, समय के साथ तेजी से बदलती रहती है (हम इस पर खंड 3 में विस्तार से चर्चा करेंगे)। एक कैमरा या लिडार, आसपास के वातावरण का क्रॉस-रेफरेंस करके, सापेक्ष स्थिति संबंधी जानकारी प्रदान कर सकता है, लेकिन केवल कम आवृत्ति (दसियों हर्ट्ज़) पर, और दोनों कुछ स्थितियों में पूरी तरह से काम करना बंद कर देते हैं - अंधेरा, अस्पष्ट दृश्य, तीव्र गति। VIO और LIO का मूल विचार इस "उच्च-आवृत्ति लेकिन अस्थिर IMU" को "पर्यावरण-निर्भर विफलता मोड वाले निम्न-आवृत्ति कैमरा/LiDAR" के साथ संयोजित करना है, ताकि एक दूसरे की कमियों को दूर कर सके।

2. IMU वास्तव में क्या मापता है?

IMU के भीतर, मोटे तौर पर, दो प्रकार के सेंसर होते हैं।

एक एक्सेलेरोमीटर अपने सेंसर फ्रेम में विशिष्ट बल को मापता है। आदर्श रूप से, \mathbf{f}_b=R_{wb}^{T}(\mathbf{a}_w-\mathbf{g}_w), जहाँ R_{wb} सेंसर निर्देशांकों को विश्व निर्देशांकों में घुमाता है, \mathbf{a}_w विश्व-फ्रेम त्वरण है, और \mathbf{g}_w गुरुत्वाकर्षण है। यह विराम अवस्था में लगभग 1 g और आदर्श मुक्त पतन में लगभग शून्य मान देता है। एकीकरण से पहले, बायस को ठीक करें, विश्व फ्रेम में घुमाएँ और गुरुत्वाकर्षण जोड़ें। OpenVINS IMU मॉडल में निर्देशांक और बायस परिभाषाएँ देखें।

एक जाइरोस्कोप सेंसर की स्वयं की घूर्णन दर, अर्थात् कोणीय वेग को मापता है। यहाँ तीनों अक्षों को एक साथ मिलाने से रोल, पिच और यॉ के सापेक्ष घूर्णन दर प्राप्त होती है।

इन दो प्रकार के सेंसरों को मिलाकर, एक आईएमयू उच्च आवृत्ति पर 6-डिग्री-ऑफ-फ्रीडम गति की जानकारी (3 स्थानांतरीय + 3 घूर्णी) उत्पन्न कर सकता है, जो पूरी तरह से सेंसर की आंतरिक स्थिति पर आधारित होती है, बिना किसी बाहरी संदर्भ (मैप की गई विशेषता, रेडियो सिग्नल) के। यह "बिना किसी बाहरी संदर्भ के" गुण ही आईएमयू की सबसे बड़ी ताकत और सबसे बड़ी कमजोरी है - ताकत यह है कि यह पूर्ण अंधकार में या कांच की दीवारों वाले कमरे के अंदर भी अपरिवर्तित रहता है; कमजोरी वह संचित त्रुटि है जिसकी चर्चा हम अनुभाग 3 में करेंगे।

एक आईएमयू के आउटपुट में हमेशा बायस और शोर भी शामिल होता है। बायस सेंसर की अंतर्निहित एक ऑफसेट त्रुटि है - आउटपुट शून्य नहीं होता, भले ही वास्तविक मान शून्य हो - और तापमान परिवर्तन जैसे कारकों के कारण यह समय के साथ धीरे-धीरे बदलता रहता है (बायस अस्थिरता)। शोर प्रत्येक रीडिंग के साथ जुड़ने वाला एक यादृच्छिक उतार-चढ़ाव है। सस्ते MEMS (माइक्रो-इलेक्ट्रो-मैकेनिकल सिस्टम) IMU में आमतौर पर अधिक बायस और शोर होता है, और यही आगे चर्चा किए गए ड्रिफ्ट का मुख्य कारण है।

3. केवल IMU से स्थिति ज्ञात करना (एकीकरण और ड्रिफ्ट)

IMU आउटपुट से स्थिति प्राप्त करने के लिए त्वरण का दो बार एकीकरण करना आवश्यक है: वेग त्वरण का एकीकरण है, और स्थिति वेग का एकीकरण है।

p(t) = p_0 + v_0 t + \int_0^{t}\!\!\int_0^{\tau} a(s)\,ds\,d\tau

यहाँ p_0 प्रारंभिक स्थिति है, v_0 प्रारंभिक वेग है, और a(s) समय s पर त्वरण है। सूत्र स्वयं सरल है, लेकिन व्यवहार में उपयोग किया जाने वाला त्वरण a(s) हमेशा खंड 2 में वर्णित पूर्वाग्रह b को वहन करता है। पूर्वाग्रह सहित त्वरण a(s) + b का दोहरा समाकलन करने पर पूर्वाग्रह-प्रेरित त्रुटि पद इस प्रकार प्राप्त होता है:

\text{position error}(t) \approx \frac{1}{2} b\, t^2

जो बीते हुए समय के वर्ग के अनुपात में अपसारी होता है। इसके अतिरिक्त, जाइरोस्कोप पूर्वाग्रह धीरे-धीरे अभिविन्यास अनुमान को विकृत करता है, और यह अभिविन्यास त्रुटि उस दिशा को दूषित करती है जिसमें त्वरण का समाकलन होता है - इसलिए समग्र स्थिति त्रुटि लगभग O(t^2) से O(t^3) तक बढ़ती जाती है। इस घटना को, जहाँ त्रुटि समय के साथ असीमित रूप से बढ़ती जाती है, ड्रिफ्ट कहा जाता है।

एक ठोस संख्या यहाँ सहज ज्ञान विकसित करने में सहायक होती है। मान लीजिए कि एक सस्ते MEMS IMU में त्वरणमापी पूर्वाग्रह लगभग 0.01\,\mathrm{m/s^2} है। 10 सेकंड के बाद, परिणामी स्थिति त्रुटि लगभग \frac{1}{2} \times 0.01 \times 10^2 = 0.5\,\mathrm{m} होती है। एक मिनट के बाद, यह संख्या 18\,\mathrm{m} हो जाती है। केवल एक आईएमयू से बहुत कम समय के लिए ही स्थिति का अनुमान लगाया जा सकता है - कुछ सेकंड से लेकर कुछ दसियों सेकंड तक - और यही मूल कारण है कि केवल एक आईएमयू स्व-स्थान निर्धारण प्रणाली के रूप में काम नहीं कर सकता। दूसरे शब्दों में: आईएमयू "अल्पकालिक, उच्च-आवृत्ति परिवर्तन" में तो मजबूत है, लेकिन "दीर्घकालिक, निरपेक्ष स्थिति" में कमजोर है - कैमरा या लिडार की खूबियों और कमियों के ठीक विपरीत।

4. कैमरा और लिडार की भी कुछ कमियां हैं

यदि केवल आईएमयू से स्थिति का पता नहीं लगाया जा सकता है, तो स्वाभाविक रूप से कैमरा (देखें "विजुअल-एसएलएएम प्राइमर") या लिडार (देखें "लिडार-एसएलएएम टेक्नोलॉजी ट्रेंड्स") का उपयोग करना ही उचित होता है। यह बात कुछ हद तक सही है, लेकिन कैमरा और लिडार दोनों की अपनी-अपनी अलग-अलग कमियां हैं।

कैमरे की कमियां हैं: कम रोशनी में छवि की गुणवत्ता में गिरावट (फीचर पॉइंट्स, या चमक प्रवणता जिस पर प्रत्यक्ष विधि निर्भर करती है, की गणना करना असंभव हो जाता है), कम बनावट वाले वातावरण (एक सादी सफेद दीवार या ठोस रंग का फर्श कोई पत्राचार बिंदु नहीं देता है), और तेज गति के दौरान मोशन ब्लर (एक्सपोजर विंडो के दौरान छवि धुंधली हो जाती है, जिससे फीचर डिस्क्रिप्टर अस्थिर हो जाते हैं)। इन सभी का मूल कारण एक ही है: कैमरे को काम करने के लिए पर्याप्त दृश्य संकेत नहीं मिल रहे हैं।

LiDAR की कमज़ोरियाँ* हैं: कम विशेषताओं वाले वातावरण (एक लंबी सुरंग या एक विस्तृत खुले मैदान में, ICP/NDT जैसी बिंदु-क्लाउड पंजीकरण विधियाँ एक अद्वितीय समाधान तक अभिसरित नहीं हो सकतीं - जिसे ज्यामितीय अपघटन कहा जाता है) और सेंसर की लागत। LiDAR दूरी मापने के लिए सक्रिय रूप से लेज़र उत्सर्जित करता है, इसलिए यह अंधेरे और बैकलाइटिंग के प्रति प्रतिरोधी है, लेकिन ऐसे स्थान पर जहाँ वातावरण की ज्यामिति विरल होती है, यह कैमरे की तरह ही अपनी स्थिति खो देता है।

*IMU की कमज़ोरी, जैसा कि अनुभाग 3 में देखा गया है, समय के साथ संचित होने वाला असीमित बहाव है, और यह तथ्य कि इसके पास स्वयं से पूर्ण स्थिति को पुनः प्राप्त करने का कोई साधन नहीं है।

महत्वपूर्ण बात यह है कि जिन स्थितियों में ये तीनों सेंसर विफल होते हैं, वे लगभग एक-दूसरे से मेल नहीं खातीं। एक आईएमयू अंधेरे में भी बिना किसी रुकावट के काम करता रहता है, जबकि कैमरा को इसमें कठिनाई होती है। यह तब भी उच्च-आवृत्ति गति संबंधी जानकारी प्रदान करता रहता है जब कैमरा या लिडार अपनी विशेषताएं खो देते हैं। कैमरा और लिडार अवलोकन पर्यावरणीय ज्यामिति का उपयोग करके विचलन को सीमित करते हैं। ज्ञात मानचित्र, जीएनएसएस या लूप क्लोजर जैसी बाधाओं के बिना वे दीर्घकालिक पूर्ण स्थिति सटीकता की गारंटी नहीं देते हैं। यह पूरकता अगले खंड में चर्चा किए गए सेंसर संलयन का प्रारंभिक बिंदु है।

5. सेंसर संलयन का विचार

सेंसर संलयन कई सेंसरों की विशिष्ट त्रुटि विशेषताओं और मजबूत क्षेत्रों को मिलाकर एक ऐसा अनुमान प्राप्त करने का ढांचा है जो किसी भी एक सेंसर की तुलना में अधिक सटीक, उच्च-आवृत्ति और अधिक मजबूत होता है (संलयन के सामान्य विचार के लिए, "सेंसर संलयन प्राइमर" देखें)। VIO और LIO द्वारा साझा किए गए ढांचे को एक पूर्वानुमान-अद्यतन लूप के रूप में व्यवस्थित किया जा सकता है:

Diagram 1 · Use the button to switch views
A closed loop combining high-rate IMU prediction with lower-rate camera or lidar observations and feeding the corrected state and bias into the next propagation
Diagram 2 · Use the button to switch views

चित्र 1 — IMU (उच्च दर) प्रसार (एकीकरण) के माध्यम से स्थिति का पूर्वानुमान लगाता रहता है। कैमरा/LiDAR (निम्न दर) के साथ फीचर/पॉइंट मिलान से प्राप्त अवलोकन अद्यतन चरण में उस पूर्वानुमान को सही करते हैं। उस सुधार के दौरान अनुमानित IMU पूर्वाग्रह को अगले प्रसार में वापस फीड किया जाता है, जिससे बहाव संचय लगातार कम होता रहता है।

इस लूप के दो मुख्य बिंदु हैं। पहला, IMU-चालित प्रसार लगातार उच्च आवृत्ति पर चलता है, और उन क्षणों में भी स्थिति का पूर्वानुमान लगाना कभी नहीं रोकता जब कोई कैमरा/LiDAR अवलोकन उपलब्ध नहीं होता (अंधेरा, कम बनावट, फीचर-रहित स्थान, तीव्र गति)। दूसरा, अद्यतन चरण - जो केवल कैमरा/LiDAR अवलोकन प्राप्त होने पर ही सक्रिय होता है - बहाव संचय को कम करता है। आईएमयू से प्राप्त होने वाले असीमित रूप से संचित होने वाले विचलन को कम करता है, और साथ ही आईएमयू के स्वयं के पूर्वाग्रह के अनुमान को अद्यतन करता है, इसे प्रसार में वापस फीड करता है। यह संयोजन - "उच्च आवृत्ति पर निरंतर चलने वाला पूर्वानुमान" और "अवलोकन द्वारा सीमित दिशाओं में त्रुटियों को कम करने वाला सुधार" - वीआईओ और एलआईओ द्वारा साझा की गई डिज़ाइन फिलॉसफी है।

6. वीआईओ (विज़ुअल-इनर्टियल ओडोमेट्री)

वीआईओ (विज़ुअल-इनर्टियल ओडोमेट्री) वह कॉन्फ़िगरेशन है जिसमें एक कैमरा इस ढांचे के भीतर अपडेट-साइड सेंसर की भूमिका निभाता है। आईएमयू के उच्च-आवृत्ति पूर्वानुमान को कैमरे के फीचर-पॉइंट अवलोकनों के साथ मिलाकर, आईएमयू की मीट्रिक त्वरण जानकारी का उपयोग करके, मोनोक्युलर विज़ुअल ओडोमेट्री में व्याप्त स्केल अस्पष्टता को दूर किया जाता है (जिसका उल्लेख अनुभाग 4 में किया गया है - यह तथ्य कि केवल मोनोक्युलर छवियां वास्तविक दुनिया की मीट्रिक दूरी को पुनर्प्राप्त नहीं कर सकती हैं)। और तीव्र गति में, जहां कैमरा संघर्ष करता है, आईएमयू लगातार उच्च आवृत्ति पर अभिविन्यास परिवर्तन प्रदान करता रहता है। इससे ट्रैकिंग के पूरी तरह विफल होने की संभावना काफी कम हो जाती है।

VIO को आगे लूज़ली-कपल्ड और टाइटली-कपल्ड कॉन्फ़िगरेशन में विभाजित किया जाता है, यह इस बात पर निर्भर करता है कि कैमरा और IMU किस प्रकार से जुड़े हुए हैं। एक लूज़ली-कपल्ड सिस्टम कैमरा-साइड पोज़ एस्टीमेट और IMU-साइड पोज़ एस्टीमेट की गणना स्वतंत्र रूप से करता है और फिर बाद में दोनों परिणामों को मिला देता है; इसे लागू करना सरल है, लेकिन क्योंकि IMU साइड कैमरा-साइड एस्टीमेट की आंतरिक त्रुटि संरचना (कौन सा फ़ीचर ऑब्ज़र्वेशन कम या ज्यादा अनिश्चित है) का लाभ नहीं उठा सकता है, इसलिए सटीकता में कमी आती है। एक टाइटली-कपल्ड सिस्टम IMU के रॉ डेटा और इमेज के फ़ीचर ऑब्ज़र्वेशन को शुरू से ही एक ही, संयुक्त रूप से अनुमानित स्थिति समस्या के रूप में मानता है; कार्यान्वयन अधिक जटिल है, लेकिन दोनों सेंसर से प्राप्त प्रत्येक जानकारी का उपयोग किया जाता है, जिससे उच्च सटीकता प्राप्त होती है। अनुभाग 8, 9 और 10 में हम जिन प्रतिनिधि आधुनिक VIO कार्यान्वयनों (OKVIS, VINS-Mono, OpenVINS, और अन्य) पर चर्चा करते हैं, वे सभी टाइट कपलिंग को अपनाते हैं।

7. एलआईओ (लाइडार-इनर्टियल ओडोमेट्री)

एलआईओ (लाइडार-इनर्टियल ओडोमेट्री) एक समान फ्रेमवर्क है जिसमें लिडार अपडेट-साइड की भूमिका निभाता है। लिडार पॉइंट क्लाउड पर्यावरण की ज्यामिति को सीधे और उच्च परिशुद्धता के साथ कैप्चर करते हैं, लेकिन एक स्कैन में दसियों से लेकर सैकड़ों मिलीसेकंड तक का समय लगता है, और यदि सेंसर स्वयं उस दौरान हिलता है, तो परिणामी पॉइंट क्लाउड विकृत हो जाता है (गति विरूपण)। आईएमयू की उच्च-आवृत्ति अभिविन्यास जानकारी की सहायता से, स्कैन के दौरान होने वाली इस गति को ठीक किया जा सकता है, जिससे एक विरूपण-मुक्त पॉइंट क्लाउड का पुनर्निर्माण होता है।

धारा 6 में वीआईओ की तरह, ज्यामितीय रूप से विकृत वातावरणों में, जिनसे एलआईओ जूझता है (लंबी सुरंगें, चौड़े खुले मैदान), आईएमयू का निरंतर अल्पकालिक पोज़ पूर्वानुमान पॉइंट-क्लाउड पंजीकरण (आईसीपी/एनडीटी जैसी विधियाँ) के विचलन की संभावना को काफी कम कर देता है। एलआईओ को भी व्यवहार में मुख्य रूप से एक कसकर युग्मित प्रणाली के रूप में कार्यान्वित किया जाता है - एलआईओ-एसएएम और अनुभाग 10 में वर्णित FAST-LIO/FAST-LIO2, दोनों ही इस कसकर युग्मित डिज़ाइन को अपनाते हैं।

8. फ़िल्टर-आधारित (कलमन फ़िल्टर / EKF / MSCKF)

VIO और LIO का मूल तत्व - भविष्यवाणी और अवलोकन का संयोजन - दो व्यापक डिज़ाइन सिद्धांतों में से एक के अंतर्गत कार्यान्वित किया जाता है: फ़िल्टर-आधारित, या ऑप्टिमाइज़ेशन-आधारित दृष्टिकोण, जिसका वर्णन अगले अनुभाग में किया गया है।

फ़िल्टर-आधारित दृष्टिकोण का आधार कलमन फ़िल्टर है, एक ऐसा ढाँचा जो रैखिक गतिकी वाले सिस्टम के लिए इष्टतम स्थिति अनुमान प्राप्त करने के लिए भविष्यवाणी और अवलोकन-संचालित अद्यतन को बारी-बारी से उपयोग करता है। VIO/LIO जैसी समस्या के लिए, जहाँ IMU एकीकरण (पोज़ कंपोज़िशन) और कैमरे के प्रक्षेपण का संयोजन स्वाभाविक रूप से अरैखिक होता है, इसके स्थान पर अरैखिक विस्तार का उपयोग किया जाता है: EKF (विस्तारित कलमन फ़िल्टर)। एक EKF वर्तमान अनुमान के आसपास प्रत्येक अरैखिक फ़ंक्शन को रैखिक बनाता है (प्रथम-क्रम टेलर विस्तार)। और फिर यह सामान्य कल्मन फ़िल्टर के समान ही अद्यतन समीकरणों को लागू करता है।

\hat{x}_k = \hat{x}_k^{-} + K_k\left(z_k - h(\hat{x}_k^{-})\right), \qquad K_k = P_k^{-} H_k^{\top}\left(H_k P_k^{-} H_k^{\top} + R\right)^{-1}

यहाँ \hat{x}_k^{-} प्रसार से अनुमानित अवस्था है, z_k वास्तविक अवलोकन है, h(\cdot) अवलोकन मॉडल है जो अवस्था से अवलोकन का अनुमान लगाता है, और K_k कल्मन लाभ है - वह भार जो यह निर्धारित करता है कि अनुमान बनाम अवलोकन पर कितना भरोसा किया जाए। P_k^{-} अनुमानित अवस्था का सहप्रसरण (अनिश्चितता) है, H_k अवलोकन मॉडल को रेखीय बनाने वाला जैकोबियन है, और R अवलोकन शोर का सहप्रसरण है। सहज रूप से, अनुमानित अनिश्चितता P_k^{-} अवलोकन शोर R के सापेक्ष जितनी अधिक होगी, कल्मन लाभ K_k उतना ही अधिक होगा, और उतना ही अधिक दृढ़ता से अवलोकन z_k की जानकारी स्टेट करेक्शन में समाहित हो जाती है।

एक EKF-आधारित VIO को लागू करने के लिए, छवि के प्रत्येक व्यक्तिगत फीचर बिंदु को स्टेट वेक्टर में शामिल करना आवश्यक होता है, और फीचर बिंदुओं की संख्या बढ़ने के साथ ही गणना लागत तेजी से बढ़ती जाती है। 2007 में मौरिकिस और रूमेलीओटिस द्वारा प्रस्तावित MSCKF (मल्टी-स्टेट कंस्ट्रेंट कलमन फ़िल्टर), इस समस्या का सटीक समाधान करता है। MSCKF फ़िल्टर की स्टेट में स्वयं फीचर बिंदुओं को शामिल नहीं करता है; इसके बजाय, यह स्टेट में कई कैमरा पोज़ (एक स्लाइडिंग विंडो) रखता है, और केवल इस ज्यामितीय बाधा का उपयोग करके स्टेट को अपडेट करता है कि एक ही फीचर बिंदु को उन कई पोज़ से देखा गया था। स्टेट से फीचर बिंदुओं को हटाकर, यह फीचर संख्या के साथ होने वाली गणनात्मक वृद्धि से बचता है, जबकि अभी भी कई फ्रेमों में फैले अवलोकनों का लाभ उठाता है - एक कुशल फ़िल्टर-आधारित VIO डिज़ाइन जो अब व्यापक रूप से उपयोग में है।

9. अनुकूलन-आधारित (बंडल समायोजन / फैक्टर ग्राफ)

फ़िल्टर-आधारित अनुमान पुनरावर्ती रूप से अपडेट होते हैं, लेकिन MSCKF जैसी विधियाँ क्लोन किए गए पिछले पोज़ को अस्थायी रूप से बनाए रख सकती हैं। ऑप्टिमाइज़ेशन-आधारित दृष्टिकोण स्लाइडिंग विंडो या ग्राफ़ में फैले स्टेट और ऑब्ज़र्वेशन को बनाए रखता है और उनकी संयुक्त संगति के लिए एक नॉन-लीनियर ऑप्टिमाइज़ेशन को हल करता है। इसे विज़ुअल-SLAM के बंडल एडजस्टमेंट (देखें "विज़ुअल-SLAM प्राइमर", सेक्शन 10) के विस्तार के रूप में समझना सहायक होता है, जिसमें IMU जानकारी को भी शामिल किया गया है।

IMU त्वरण और कोणीय दरें ज्ञात ऑब्ज़र्वेशन हैं, ऑप्टिमाइज़ेशन वैरिएबल नहीं। प्रत्येक IMU टाइमस्टैम्प पर एक स्टेट जोड़ना, या प्रत्येक रिलीनियराइज़ेशन पर प्रत्येक अंतराल को पुन: एकीकृत करना, लागत बढ़ाता है। IMU प्रीइंटीग्रेशन, जिसे फ़ॉर्स्टर एट अल. ने 2015 में प्रस्तावित किया था (arXiv:1512.02363), कीफ़्रेम के बीच के मापों को एक बायस-सुधार योग्य सापेक्ष-गति कारक के रूप में सारांशित करता है। स्टेट में वेग और बायस शामिल हो सकते हैं, और कुछ प्रणालियों में लैंडमार्क भी। साथ ही, लागत को केवल IMU सैंपल दर के बजाय विंडो डिज़ाइन और रिलाइनराइज़ेशन द्वारा नियंत्रित किया जाता है।

परिणामी IMU प्रीइंटीग्रेशन फैक्टर, कैमरा/LiDAR प्रेक्षणों (रीप्रोजेक्शन त्रुटि या स्कैन-मैचिंग त्रुटि) से प्राप्त फैक्टरों के साथ, एक सामान्य फैक्टर ग्राफ पर रखे जाते हैं, और संपूर्ण को अधिकतम संभावना (या अधिकतम पश्चवर्ती) अनुमान समस्या के रूप में एक साथ हल किया जाता है - यह अनुकूलन-आधारित दृष्टिकोण का मूल रूप है।

\mathcal{X}^{*} = \arg\min_{\mathcal{X}} \sum_{k} \left\| r_{\mathrm{IMU}}(z_{I_k}, \mathcal{X}) \right\|^2_{\Sigma_{I_k}} \; + \; \sum_{(i,j)} \left\| r_{\mathrm{C/L}}(z_{ij}, \mathcal{X}) \right\|^2_{\Sigma_{ij}}

\mathcal{X} अनुमानित किए जाने वाले पोज़, वेग, बायस और (जहाँ आवश्यक हो) मानचित्र बिंदुओं का समूह है; r_{\mathrm{IMU}} प्रीइंटीग्रेशन फैक्टर से अवशिष्ट है। फ़िल्टर-आधारित अनुमान अनुक्रमिक अद्यतन और सीमित इतिहास के माध्यम से लागत को नियंत्रित करता है; अनुकूलन-आधारित अनुमान स्लाइडिंग विंडो को रिलाइनराइज़ कर सकता है। सटीकता और लागत विंडो की लंबाई, आरंभीकरण, रिलाइनराइज़ेशन शेड्यूल आदि पर निर्भर करती है। मॉडल और कंप्यूट बजट, इसलिए कोई भी सर्वमान्य रूप से श्रेष्ठ नहीं है।

Diagram 3 · Use the button to switch views
Many high-rate IMU measurements between keyframes are preintegrated into one bias-correctable relative-motion factor
Diagram 4 · Use the button to switch views
i Keyframe i{+}1 High-rate IMU measurements (hundreds of Hz) Integrated together over the interval → a single relative-motion Factor
क्या विराम अवस्था में लगभग 1 ग्राम के मान को सीधे समाकलित किया जाना चाहिए?

विशिष्ट बल को विश्व फ्रेम में रूपांतरित करें और पहले गुरुत्वाकर्षण और पूर्वाग्रह को ध्यान में रखें। विराम अवस्था में बढ़ते वेग से मॉडल या फ्रेम संबंधी समस्या का संकेत मिलता है।

10. लैंडमार्क एल्गोरिदम

VIO

ROVIO (रोबस्ट विज़ुअल इनर्टियल ओडोमेट्री), जिसे ब्लोश एट अल. ने IROS 2015 में प्रस्तुत किया था, एक EKF-आधारित VIO है। फ़ीचर-पॉइंट डिस्क्रिप्टर का मिलान करने के बजाय, यह छवि-पैच चमक की जानकारी सीधे EKF के अवलोकन मॉडल में फीड करता है - एक प्रत्यक्ष-विधि-शैली का दृष्टिकोण जो इसे फ़िल्टर-आधारित अनुमान को प्रत्यक्ष विधि के साथ संयोजित करने का एक प्रतिनिधि उदाहरण बनाता है।

ल्यूटेनेगर एट अल द्वारा IJRR 2015 में प्रस्तुत OKVIS (ओपन कीफ़्रेम-आधारित विज़ुअल-इनर्टियल SLAM), एक नॉनलाइनियर ऑप्टिमाइज़ेशन पर आधारित कीफ़्रेम-आधारित VIO है। IMU प्रीइंटीग्रेशन (अनुभाग 9) को बंडल-एडजस्टमेंट-शैली के रीप्रोजेक्शन त्रुटि न्यूनीकरण के साथ मिलाकर, यह ऑप्टिमाइज़ेशन-आधारित VIO के शुरुआती महत्वपूर्ण कार्यान्वयनों में से एक है।

हांगकांग यूनिवर्सिटी ऑफ साइंस एंड टेक्नोलॉजी के किन, ली और शेन द्वारा विकसित VINS-Mono, मोनोक्युलर कैमरों के लिए एक VIO है जो IMU प्रीइंटीग्रेशन (अनुभाग 9) पर नॉनलाइनियर ऑप्टिमाइज़ेशन पर आधारित है, वैश्विक सुधार के लिए लूप क्लोज़र जोड़ता है, और एक लचीला डिज़ाइन प्रदान करता है जिसे प्रत्येक घटक के लिए लूज़ली-कपल्ड और टाइटली-कपल्ड ऑपरेशन के बीच स्विच किया जा सकता है। VINS-Fusion VINS-Mono का उन्नत संस्करण है जो कई सेंसर कॉन्फ़िगरेशन (स्टीरियो कैमरे, GPS) को सपोर्ट करता है और विविध हार्डवेयर सेटअपों में व्यावहारिकता को प्राथमिकता देता है।

OpenVINS, जेनेवा, एकेनहॉफ, ली, यांग, हुआंग और उनके सहयोगियों द्वारा विकसित, एक ओपन-सोर्स MSCKF-आधारित VIO अनुसंधान मंच है। MSCKF (अनुभाग 8) के कुशल फ़िल्टर-आधारित डिज़ाइन पर आधारित, यह अनुसंधान उद्देश्यों के लिए विस्तार और सत्यापन में आसानी को प्राथमिकता देने वाले कार्यान्वयन के रूप में व्यापक रूप से उपयोग किया जाता है।

LIO

LIO-SAM (टाइटली-कपल्ड लिडार इनर्टियल ओडोमेट्री वाया स्मूथिंग एंड मैपिंग), जिसे शान, एंगलोट, मेयर्स, वांग, रत्ती, रस और उनके सहयोगियों द्वारा IROS 2020 में प्रस्तुत किया गया था, एक फैक्टर ग्राफ पर निर्मित एक टाइटली-कपल्ड LIO है। यह एक ही फैक्टर ग्राफ पर कई फैक्टर प्रकारों को एकीकृत करता है - एक आईएमयू प्रीइंटीग्रेशन फैक्टर, लिडार स्कैन मैचिंग से प्राप्त ओडोमेट्री फैक्टर, जीपीएस फैक्टर और लूप क्लोजर फैक्टर - और यह लिडार पर ऑप्टिमाइजेशन-आधारित डिजाइन दर्शन (अनुभाग 9) को लागू करने का एक प्रतिनिधि उदाहरण है।

हांगकांग विश्वविद्यालय की मार्स लैब में जू, झांग और उनके सहयोगियों द्वारा विकसित फास्ट-एलआईओ (फास्ट लिडार-इनर्टियल ओडोमेट्री) एक टाइटली-कपल्ड इटरेटेड कल्मन फिल्टर पर आधारित एक फास्ट एलआईओ है। ऑप्टिमाइजेशन-आधारित एलआईओ-एसएएम के विपरीत, यह फिल्टर-आधारित है, जिसे उच्च-दर लिडार पॉइंट क्लाउड को सीधे संभालने के लिए डिज़ाइन किया गया है, और सीमित कंप्यूटिंग क्षमता वाले प्लेटफॉर्म पर वास्तविक समय संचालन को प्राथमिकता देता है। FAST-LIO2 इसका उन्नत संस्करण है: यह इंक्रीमेंटल नियरेस्ट-नेबर सर्च स्ट्रक्चर (एक iKD-ट्री) का उपयोग करके पॉइंट क्लाउड को सीधे प्रबंधित करता है, जिससे मैप को फिर से बनाने की लागत में काफी कमी आती है और तेज़, अधिक सटीक और टाइटली-कपल्ड LIO प्राप्त होता है।

11. VIO बनाम LIO तुलना

| पहलू | VIO (प्रतिनिधि: VINS-Mono/OpenVINS) | LIO (प्रतिनिधि: LIO-SAM/FAST-LIO2) |

|---|---|---|

| प्राथमिक सेंसर | कैमरा (मोनो/स्टीरियो) + IMU | LiDAR + IMU |

| अनुकूल वातावरण | टेक्सचर से भरपूर इनडोर/आउटडोर दृश्य, जहाँ रंग और पैटर्न की पहचान महत्वपूर्ण होती है | ज्यामितीय संरचना से भरपूर वातावरण; अंधेरे या बैकलाइटिंग में काम करता है |

| प्रतिकूल वातावरण | अंधेरा, कम टेक्सचर, बैकलाइटिंग/तेज धूप | ज्यामितीय रूप से विकृत स्थान - लंबी सुरंगें, खुले मैदान |

सेंसर की लागत | अपेक्षाकृत कम (कैमरा + MEMS IMU) | अधिक (LiDAR इकाई, विशेष रूप से लंबी दूरी और उच्च-रिज़ॉल्यूशन वाले मॉडल) |

मैप की विशेषता | विरल फ़ीचर बिंदु, या लर्निंग-आधारित दृष्टिकोण के साथ सघन गहराई | सघन, ज्यामितीय रूप से सटीक पॉइंट-क्लाउड मैप |

स्केल अस्पष्टता | मोनोक्युलर कॉन्फ़िगरेशन के लिए सैद्धांतिक रूप से मौजूद (IMU के माध्यम से हल किया गया) | सैद्धांतिक रूप से मौजूद नहीं, क्योंकि LiDAR रेंजिंग स्वाभाविक रूप से मीट्रिक है |

गणना | मध्यम (फ़ीचर निष्कर्षण और डिस्क्रिप्टर गणना की लागत) | पॉइंट-क्लाउड प्रोसेसिंग (निकटतम पड़ोसी खोज, स्कैन मिलान) की लागत लगभग समान है |

प्रतिनिधि डिज़ाइन दर्शन | फ़िल्टर-आधारित (MSCKF) और ऑप्टिमाइज़ेशन-आधारित (प्रीइंटीग्रेशन + BA) दोनों व्यापक रूप से उपयोग किए जाते हैं | फ़िल्टर-आधारित (FAST-LIO2) और ऑप्टिमाइज़ेशन-आधारित (LIO-SAM) दोनों व्यापक रूप से उपयोग किए जाते हैं |

VIO की खूबियाँ हैं कम सेंसर लागत और रंग एवं पैटर्न पहचान द्वारा प्रदान की जाने वाली उच्च स्तरीय पर्यावरणीय समझ (जो ऑब्जेक्ट रिकग्निशन के साथ स्वाभाविक रूप से मेल खाती है); LIO की खूबियाँ हैं ज्यामितीय सटीकता और अंधेरे और खराब मौसम में भी मज़बूती - यही मूल विभाजन है।

12. व्यवहार में चुनाव

VIO, LIO, या दोनों के संयोजन का चुनाव इस बात पर निर्भर करता है कि आप कौन से सेंसर ले जा सकते हैं, आपका बजट क्या है, और आप किस वातावरण में काम करने की उम्मीद करते हैं।

  • इनडोर सर्विस रोबोट / रोबोट वैक्यूम: यदि कम लागत प्राथमिकता है, तो VIO (या कैमरा-प्लस-IMU का एक संयोजन) बेहतर विकल्प होता है; यदि सटीकता और ज्यामितीय रूप से सटीक मानचित्र प्राथमिकता है, तो LIO को चुना जाता है। गलियारों और दीवारों से भरे एक सामान्य इनडोर वातावरण में, LiDAR की लागत से प्राप्त सटीकता लाभ को उचित ठहराना आसान होता है।

  • ड्रोन: पेलोड और बिजली की सख्त सीमाओं के साथ, एक हल्का कैमरा-प्लस-IMU VIO संयोजन बेहतर विकल्प होता है। खुले बाहरी स्थानों में, जीपीएस के साथ पेयरिंग भी आम है।

  • एआर/वीआर: हेडसेट के बिल्ट-इन कैमरा और आईएमयू का उपयोग करने वाला वीआईओ (विजुअल-इनर्टियल ओडोमेट्री) मानक है; कुछ उच्च-स्तरीय मॉडलों को छोड़कर जिनमें लिडार जोड़ा गया है, लागत और वजन की सीमाओं के कारण वीआईओ पहली पसंद बना रहता है।

  • स्वायत्त ड्राइविंग / बाहरी स्वायत्त मोबाइल रोबोट: खराब मौसम, बैकलाइटिंग और रात्रिकालीन ड्राइविंग में मजबूती की मांग को देखते हुए, एलआईओ आमतौर पर मुख्य आधार होता है, जिसे वीआईओ और जीएनएसएस के साथ जोड़ा जाता है (देखें "सेंसर फ्यूजन प्राइमर")।

  • ज्यामितीय रूप से विकृत स्थान - सुरंगें, लंबे सीधे गलियारे: केवल LiDAR या केवल LIO से पंजीकरण में अस्थिरता आने लगती है, इसलिए इस विकृति को दूर करने के लिए एक अलग सूचना स्रोत - VIO या व्हील ओडोमेट्री - जोड़ना महत्वपूर्ण है।

सामान्य नियम यह है: यदि बजट और सेंसर का वजन अनुमति देते हैं और ज्यामितीय सटीकता सर्वोच्च प्राथमिकता है, तो LIO चुनें; यदि लागत और हल्का वजन प्राथमिकता हैं और आप रंग/पैटर्न-आधारित पर्यावरणीय समझ का भी लाभ उठाना चाहते हैं, तो VIO चुनें। वास्तविक उत्पाद विकास में, इन दोनों को शायद ही कभी विशेष रूप से चुना जाता है - इसके बजाय, वे एक बहु-सेंसर संलयन (देखें "सेंसर संलयन प्राइमर") में विकसित होते हैं जो स्थिति के अनुसार VIO, LIO, GNSS और व्हील ओडोमेट्री को महत्व देता है।

13. सारांश

एक आईएमयू उच्च आवृत्ति वाली, पूर्णतः आत्मनिर्भर गति संबंधी जानकारी प्रदान करता है, लेकिन एकीकरण द्वारा प्राप्त स्थिति में तेजी से विचलन होता है, जो बीते समय के वर्ग के घन के अनुपात में होता है। एक कैमरा (वीआईओ) या एक लिडार (एलआईओ) समय-समय पर इस संचित त्रुटि को ठीक करता है, लेकिन दोनों की अपनी-अपनी कमजोरियाँ हैं - कैमरे के लिए अंधकार और कम टेक्सचर, जबकि लिडार के लिए ज्यामितीय रूप से विकृत वातावरण। वीआईओ और एलआईओ इन पूरक कमजोरियों को एक प्रेडिक्ट (उच्च आवृत्ति आईएमयू प्रेडिक्शन) - अपडेट (कैमरा/लिडार करेक्शन) लूप के माध्यम से जोड़ते हैं, जिसे फ़िल्टर-आधारित (ईकेएफ/एमएससीकेएफ) या ऑप्टिमाइजेशन-आधारित (आईएमयू प्रीइंटीग्रेशन + फैक्टर ग्राफ) फ्रेमवर्क के तहत कार्यान्वित किया जाता है, ताकि ऐसी मजबूती और सटीकता प्राप्त की जा सके जो कोई भी एकल सेंसर अकेले प्राप्त नहीं कर सकता।

अपनी समझ की जाँच करें
क्या विराम अवस्था में लगभग 1 ग्राम के मान को सीधे समाकलित किया जाना चाहिए?

विशिष्ट बल को विश्व फ्रेम में रूपांतरित करें और पहले गुरुत्वाकर्षण और पूर्वाग्रह को ध्यान में रखें। विराम अवस्था में बढ़ते वेग से मॉडल या फ्रेम संबंधी समस्या का संकेत मिलता है।

What to read next

Review the backgroundसेंसर फ्यूजन विफल क्यों होता है — समय, फ्रेम और बाह्य अंशांकनContinue the seriesSLAM का मूल्यांकन कैसे करें — ATE, RPE, रनटाइम और विफलताएँExplore another aspect of this fieldICP की विफलता के कारण: आरंभीकरण, आउटलायर्स और सममित ज्यामिति