Contents — find the section you need

रोबोट और स्वायत्त वाहन आमतौर पर एक साथ कई सेंसर ले जाते हैं — कैमरा, लिडार, आईएमयू, रडार, जीएनएसएस। फिर भी, इनमें से कोई भी अकेला दुनिया को सही ढंग से नहीं समझ पाता: कैमरा गहराई को समझने में असमर्थ होता है, लिडार रंग या बनावट नहीं बता सकता, और आईएमयू की त्रुटियां समय के साथ बढ़ती जाती हैं। सेंसर फ्यूजन वह तकनीक है जो प्रत्येक सेंसर की कमियों को दूसरे सेंसर की खूबियों से भर देती है, जिससे अलग-अलग खामियों वाले हिस्सों से एक सुसंगत "विश्व मॉडल" तैयार होता है। यह लेख गणितीय आधारों — संभाव्यता और अनुकूलन — और फिर ठोस युग्मों: वीआईओ, एलआईओ और कैमरा × लिडार — पर विस्तार से चर्चा करता है।

Xsens MTi-G GNSS-integrated IMUIMU/INS उदाहरण
Intel RealSense D435 डेप्थ कैमराडेप्थ-कैमरा उदाहरण

छवियां: Xsens MTi-G (Kallap85, CC BY-SA 4.0) / Intel RealSense डेप्थ कैमरा D435 (मार्क औलेदास, CC BY-SA 4.0), विकिमीडिया कॉमन्स।

0. इस लेख में क्या शामिल है

  • सेंसर फ़्यूज़न का उद्देश्य क्या है, और एक सेंसर पर्याप्त क्यों नहीं होता
  • बुनियादी फ़्यूज़न पाइपलाइन (सेंसर → माप → फ़ीचर/स्टेट → फ़्यूज़न → अनुमानित स्टेट)
  • अर्ली, मिड-लेवल और लेट फ़्यूज़न में अंतर
  • प्रोबेबिलिस्टिक फ़्यूज़न कैसे काम करता है — कल्मन फ़िल्टर, EKF, UKF, पार्टिकल फ़िल्टर
  • ऑप्टिमाइज़ेशन-आधारित फ़्यूज़न कैसे काम करता है — फ़ैक्टर ग्राफ़, पोज़ ग्राफ़
  • VIO (कैमरा×IMU), LIO (LiDAR×IMU), और कैमरा×LiDAR इतने स्वाभाविक संयोजन क्यों हैं
  • स्वायत्त ड्राइविंग का उपयोग करके चार सेंसर एकीकरण का उदाहरण (कैमरा×LiDAR×Radar×IMU)
  • फ़्यूज़न को वास्तव में क्या बनाता है व्यवहार में कठिन — समय सिंक्रनाइज़ेशन, कैलिब्रेशन, शोर
  • अपने उपयोग के लिए फ़्यूज़न सिस्टम डिज़ाइन करने के बारे में कैसे सोचें

1. संक्षिप्त उत्तर: सेंसर फ़्यूज़न क्या है

एक वाक्य में: सेंसर फ़्यूज़न गणितीय रूप से कई सेंसरों से प्राप्त अपूर्ण, शोरगुल वाले प्रेक्षणों को संयोजित करके "स्थिति" का एक अनुमान उत्पन्न करता है जो किसी भी एक सेंसर द्वारा अकेले दिए गए अनुमान से अधिक सटीक और विश्वसनीय होता है।

इस परिभाषा में तीन विचार समाहित हैं। पहला, पूरकता — विभिन्न सेंसर अलग-अलग स्थानों पर मजबूत और कमजोर होते हैं, इसलिए उन्हें संयोजित करने से प्रत्येक दूसरे की कमजोरियों को दूर कर देता है। दूसरा, स्थिति अनुमान — प्रत्यक्ष रूप से देखी जा सकने वाली मात्राओं से ऐसी मात्रा का अनुमान लगाने के लिए सांख्यिकीय ढांचा जिसे आप प्रत्यक्ष रूप से नहीं देख सकते (मैं अभी कहाँ हूँ, किस वेग पर, किस अभिविन्यास में)। तीसरा, विश्व मॉडल — प्रत्येक सेंसर की खंडित जानकारी को एक ऐसे एकल निरूपण में एकीकृत करने का परिणाम जो समय और स्थान दोनों में सुसंगत हो। एक रोबोट कच्चे सेंसर डेटा पर कार्य नहीं करता — यह इस एकीकृत विश्व मॉडल पर कार्य करता है।

2. एक सेंसर पर्याप्त क्यों नहीं है?

प्रत्येक सेंसर की खूबियों और कमियों को समझने से यह स्पष्ट हो जाता है कि फ़्यूज़न अनिवार्य क्यों है।

सेंसर खूबियाँ कमियाँ
कैमरा रंग, बनावट और अर्थ (वस्तु श्रेणी) को पहचानता है; उच्च कोणीय रिज़ॉल्यूशन गहराई को सीधे मापना कठिन है; अंधेरे, बैकलाइट या खराब मौसम में कमज़ोर प्रदर्शन; पैमाना अनिश्चित (एककोशिकीय)
लिडार दूरी और ज्यामिति का सटीक, प्रत्यक्ष मापन; प्रकाश से स्वतंत्र रंग या बनावट की जानकारी नहीं देता; बारिश, कोहरे या धूल में कमज़ोर प्रदर्शन; दूरी बढ़ने पर पॉइंट क्लाउड विरल और कम सटीक हो जाते हैं
आईएमयू (जड़त्वीय मापन इकाई) उच्च नमूना दर (सैकड़ों हर्ट्ज़+); अभिविन्यास परिवर्तन के प्रति संवेदनशील; कैमरा रोशनी और दृश्यता से स्वतंत्र तापमान, कंपन और माउंटिंग त्रुटि से प्रभावित; एकीकरण के दौरान त्रुटियाँ जमा होती हैं (ड्रिफ्ट); कोई सटीक स्थिति नहीं देता
रडार खराब मौसम (बारिश, कोहरा, धूल) के प्रति प्रतिरोधी; डॉप्लर विधि द्वारा सापेक्ष वेग का सीधा मापन कम कोणीय रिज़ॉल्यूशन — वस्तु के आकार का मोटा-मोटा अनुमान; स्थिर वस्तुओं को पहचानने में कठिनाई
जीएनएसएस निरपेक्ष, वैश्विक निर्देशांक प्रदान करता है; त्रुटियाँ संचित नहीं होतीं कम अद्यतन दर (आमतौर पर 1-10 हर्ट्ज़); घर के अंदर, सुरंगों में, या शहरी ऊँची इमारतों के बीच (मल्टीपाथ) इसकी कार्यक्षमता कम हो जाती है या यह काम करना बंद कर देता है

यह तालिका दर्शाती है कि "उच्च-परिशुद्धता सेंसर" और "सार्वभौमिक सेंसर" दो अलग-अलग चीजें हैं। लिडार ज्यामितीय परिशुद्धता में कैमरे से बेहतर है, लेकिन यह रंग या अर्थ नहीं बता सकता। जीएनएसएस निरपेक्ष स्थिति बताता है, लेकिन इसका अद्यतन धीमा होता है और शहरी क्षेत्रों में इस पर भरोसा नहीं किया जा सकता। आईएमयू प्रकाश या दृश्यता पर निर्भर नहीं करता, लेकिन यह तापमान, कंपन और माउंटिंग त्रुटि से प्रभावित होता है; क्योंकि यह एकीकरण के माध्यम से स्थिति प्राप्त करता है, समय के साथ विचलन अपरिहार्य है। सेंसर फ़्यूज़न गणितीय रूप से इस पूरक संबंध का लाभ उठाता है।

3. संलयन की मूल संरचना

सेंसर संलयन पाइपलाइन का विवरण इस बात पर निर्भर करता है कि क्या संलयन किया जा रहा है और किस स्तर पर (अगला खंड), लेकिन इसका व्यापक ढांचा हर बार एक ही पांच चरणों का होता है।

Diagram 1 · Use the button to switch views
The basic Sensor Fusion pipeline Sensor Measurement Feature / State Fusion Estimated State

4. फ़्यूज़न के तीन स्तर

फ़्यूज़न को व्यापक रूप से तीन स्तरों में विभाजित किया जा सकता है, यह इस बात पर निर्भर करता है कि पाइपलाइन में किस चरण में कई सेंसरों की जानकारी संयोजित की जाती है।

स्तर फ़्यूज़न कब होता है विशेषताएँ उदाहरण
प्रारंभिक फ़्यूज़न लगभग कच्चा डेटा कम सूचना हानि, संभावित रूप से अत्यधिक सटीक, लेकिन सेंसरों के बीच सटीक समय सिंक्रनाइज़ेशन और निर्देशांक संरेखण की आवश्यकता होती है एक LiDAR पॉइंट क्लाउड को कैमरा छवि पर प्रोजेक्ट करना और उन्हें एक इनपुट में संयोजित करना
मध्य-स्तरीय (फीचर) फ़्यूज़न निकाले गए फीचर चरण पर कच्चे डेटा फ़्यूज़न जितना सटीक सिंक्रनाइज़ेशन आवश्यक नहीं; कार्यान्वयन में अधिक लचीला BEV-स्पेस विधियाँ जो कैमरा और LiDAR फीचर्स को संयोजित करती हैं (BEV फ़्यूज़न परिवार)
लेट फ़्यूज़न प्रत्येक सेंसर के स्वतंत्र बोध/अनुमान आउटपुट (जैसे डिटेक्शन) पर प्रत्येक सेंसर की पाइपलाइन स्वतंत्र रहती है, कार्यान्वयन में आसान, लेकिन पहले खोई हुई जानकारी बाद में पुनर्प्राप्त नहीं की जा सकती एन्सेम्बल-शैली के दृष्टिकोण जो बाद में कैमरा ऑब्जेक्ट डिटेक्शन को LiDAR ऑब्जेक्ट डिटेक्शन के साथ संयोजित करते हैं

किस स्तर का चयन करना सटीकता और कार्यान्वयन लागत के बीच एक संतुलन है। सिद्धांत रूप में, अर्ली फ़्यूज़न सबसे अधिक जानकारी का उपयोग करता है, लेकिन सेंसरों के बीच मिलीसेकंड-स्तर के समय अंतर या मिलीमीटर-स्तर की माउंटिंग त्रुटियाँ परिणाम को सीधे प्रभावित करती हैं, जिसके लिए बहुत सटीक कैलिब्रेशन की आवश्यकता होती है। लेट फ्यूजन का एक बड़ा व्यावहारिक लाभ यह है कि प्रत्येक सेंसर की प्रोसेसिंग पाइपलाइन को स्वतंत्र रूप से विकसित और डीबग किया जा सकता है - लेकिन किसी व्यक्तिगत सेंसर द्वारा "छूटे" गए डेटा को पुनः प्राप्त नहीं किया जा सकता, चाहे परिणामों को कितनी भी चतुराई से संयोजित किया जाए। मिड-लेवल फ्यूजन, विशेष रूप से स्वायत्त ड्राइविंग में बीईवी फ्यूजन, इन दोनों चरम सीमाओं के बीच तेजी से लोकप्रिय मध्य मार्ग बन गया है।

5. संभाव्यता फ्यूजन

कई सेंसरों के प्रेक्षणों को संयोजित करने के लिए दो गणितीय ढाँचों में से पहला संभाव्यता सिद्धांत पर आधारित है। इसका आधार बायेसियन अनुमान है: "पिछले चरण से आगे ले जाए गए अनुमान" (पूर्व) को "नए प्रेक्षण" (संभावना) के साथ संयोजित करके "वर्तमान अनुमान" (पश्चवर्ती) को अद्यतन करना।

p(x_t \mid z_{1:t}) \propto p(z_t \mid x_t) \int p(x_t \mid x_{t-1}) \, p(x_{t-1} \mid z_{1:t-1}) \, dx_{t-1}

बाईं ओर का भाग समय 1 से t तक के प्रत्येक प्रेक्षण z_{1:t} को देखते हुए स्थिति x_t पर पश्चवर्ती वितरण है। दायां पक्ष पिछले अनुमान p(x_{t-1}\mid z_{1:t-1}) को लेता है, उसे गति मॉडल p(x_t\mid x_{t-1}) (अभिन्न) के माध्यम से एक कदम आगे बढ़ाता है, और फिर उस पूर्वानुमान को नए अवलोकन p(z_t\mid x_t) की संभावना से भारित करता है — एक "पूर्वानुमान, फिर अद्यतन" चक्र।

कलमन फ़िल्टर वह प्रक्रिया है जो आपको तब प्राप्त होती है जब आप उस सामान्य बायेसियन अद्यतन को लेते हैं और यह मान लेते हैं कि सब कुछ — स्थिति और अवलोकन दोनों — रैखिक और गाऊसी हैं, जिससे अद्यतन एक बंद-रूप अभिव्यक्ति में बदल जाता है। पूर्वानुमान चरण में, स्थिति और त्रुटि सहप्रसरण को गति मॉडल के माध्यम से आगे बढ़ाया जाता है; अद्यतन चरण में, नए अवलोकन और पूर्वानुमान के बीच बेमेल (नवाचार) कलमन लाभ द्वारा भारित स्थिति को ठीक करता है।

K_t = P_t^{-} H^{\top} \left( H P_t^{-} H^{\top} + R \right)^{-1}, \qquad \hat{x}_t = \hat{x}_t^{-} + K_t \left( z_t - H \hat{x}_t^{-} \right)

P_t^{-} अनुमानित त्रुटि सहप्रसरण है, H स्थिति को अवलोकन स्थान में मैप करता है, और R अवलोकन शोर सहप्रसरण है। कल्मन लाभ K_t एक भार है जो यह व्यक्त करता है कि "मॉडल के पूर्वानुमान" बनाम "नए अवलोकन" पर कितना भरोसा किया जाए: अवलोकन शोर जितना कम होगा R (एक विश्वसनीय सेंसर), अवलोकन को उतना ही अधिक भार दिया जाएगा; पूर्वानुमान अनिश्चितता जितनी कम होगी P_t^{-} (एक आत्मविश्वासपूर्ण मॉडल), पूर्वानुमान को उतना ही अधिक भार दिया जाएगा - संतुलन स्वतः समायोजित हो जाता है।

एक वास्तविक रोबोट के गति और सेंसर मॉडल लगभग कभी भी रैखिक नहीं होते हैं, इसलिए एक साधारण कल्मन फ़िल्टर को आमतौर पर सीधे लागू नहीं किया जा सकता है। एक्सटेंडेड कलमन फ़िल्टर (ईकेएफ) जैकोबियन का उपयोग करके वर्तमान अनुमान के आसपास अरैखिक गति और अवलोकन मॉडल को रैखिक बनाता है, फिर साधारण कलमन फ़िल्टर के समान ही अद्यतन समीकरणों को लागू करता है। अनसेंटेड कलमन फ़िल्टर (यूकेएफ; जूलियर और उहलमैन, 1997) जैकोबियन सन्निकटन को पूरी तरह से छोड़ देता है, इसके बजाय प्रतिनिधि नमूना बिंदुओं (सिग्मा बिंदुओं) के एक छोटे समूह को सीधे अरैखिक कार्यों से गुजारता है और परिणामों से माध्य और सहप्रसरण का पुनर्निर्माण करता है - जो प्रबल अरैखिकता के तहत ईकेएफ से बेहतर प्रदर्शन कर सकता है। पार्टिकल फ़िल्टर (गॉर्डन, सैलमंड और स्मिथ, 1993) वितरण को गाऊसी तक सीमित नहीं करता है; यह बड़ी संख्या में कणों (नमूनों) के साथ स्वयं संभाव्यता वितरण का सन्निकटन करता है, जो इसे बहु-मोडल वितरणों का प्रतिनिधित्व करने देता है जहां कई परिकल्पनाएं सह-अस्तित्व में होती हैं - उच्च सटीकता के लिए अधिक कणों और अधिक गणना की आवश्यकता के बावजूद।

6. अनुकूलन-आधारित फ़्यूज़न

जहां संभाव्यता-आधारित फ़्यूज़न क्रमिक रूप से, एक-एक चरण करके अपडेट करता है, वहीं दूसरा गणितीय ढांचा — अनुकूलन-आधारित फ़्यूज़न — एक अलग दृष्टिकोण अपनाता है: प्रेक्षणों की एक विंडो को रोककर रखता है, फिर उस स्थिति के लिए पुनः हल करता है जो उन सभी के साथ एक साथ अधिकतम सुसंगत हो।

इसका प्रमुख सूत्रण फैक्टर ग्राफ है। अनुमानित की जाने वाली स्थितियां (प्रत्येक समय चरण पर रोबोट की स्थिति, प्रेक्षित स्थलों की स्थिति) नोड्स बन जाती हैं; उनके बीच की बाधाएं (एक दिया गया सेंसर प्रेक्षण हमें दो स्थितियों के बीच संबंध के बारे में क्या बताता है) उन नोड्स को जोड़ने वाले फैक्टर बन जाते हैं, और पूरे ग्राफ को एक अरैखिक न्यूनतम वर्ग समस्या के रूप में हल किया जाता है।

\mathbf{x}^{*} = \arg\min_{\mathbf{x}} \sum_{k} \left\| \mathbf{e}_k(\mathbf{x}, \mathbf{z}_k) \right\|^{2}_{\Sigma_k^{-1}}

\mathbf{x} अनुमान लगाने के लिए सभी अवस्थाओं का पूरा सेट है, \mathbf{z}_k k वां सेंसर अवलोकन है, \mathbf{e}_k त्रुटि फ़ंक्शन है जो उस अवलोकन द्वारा अनुमानित स्थिति और वर्तमान स्थिति के बीच बेमेल को मापता है, और \Sigma_k^{-1} उस अवलोकन के विश्वास से प्राप्त भार है। जब लैंडमार्क 3D स्थितियों को कैमरा पोज़ के साथ अनुकूलित किया जाता है, तो इस प्रक्रिया को विशेष रूप से बंडल एडजस्टमेंट कहा जाता है। जब नोड्स रोबोट के प्रक्षेप पथ के साथ पोज़ होते हैं, तो इसे पोज़ ग्राफ़ ऑप्टिमाइज़ेशन कहा जाता है - लूप क्लोज़र (पहले से देखी गई जगह को पहचानना) के बाद संचित बहाव को ठीक करने के लिए मानक ढांचा।

प्रोबेबिलिस्टिक फ़्यूज़न (विशेष रूप से EKF) सस्ता है और अनुक्रमिक प्रसंस्करण के लिए उपयुक्त है, लेकिन एक बार अवलोकन समाहित हो जाने के बाद यह उस पर दोबारा नहीं जा सकता - यह केवल वर्तमान अनुमान से आगे बढ़ता है। ऑप्टिमाइजेशन-आधारित फ़्यूज़न, जब कोई नया अवलोकन पुराने अनुमान से मेल नहीं खाता, तो पूरी ट्रैजेक्टरी को ठीक कर सकता है, जिससे आमतौर पर सटीकता बढ़ जाती है - हालांकि ग्राफ के बढ़ने के साथ कंप्यूटिंग क्षमता भी बढ़ती जाती है। सेरेस सॉल्वर, जी2ओ और जीटीएसएएम जैसी सामान्य-उद्देश्यीय लाइब्रेरीज़ का उपयोग इस प्रकार की विरल नॉनलाइनियर लीस्ट-स्क्वेयर्स समस्या (जहां कोई भी अवलोकन केवल कुछ ही वेरिएबल्स को प्रभावित करता है) को कुशलतापूर्वक हल करने के लिए व्यापक रूप से किया जाता है।

7. कैमरा×आईएमयू (VIO)

कैमरा और आईएमयू के संयोजन को विज़ुअल-इनर्टियल ओडोमेट्री (VIO) कहा जाता है, और यह व्यवहार में सबसे व्यापक रूप से उपयोग किए जाने वाले फ़्यूज़न संयोजनों में से एक है। इन दोनों के इतने अच्छे से काम करने का कारण यह है कि इनकी कमज़ोरियाँ एक-दूसरे की लगभग पूर्णतः पूरक होती हैं।

एक कैमरा छवियों में फ़ीचर बिंदुओं की गति से अपनी गति का अनुमान लगा सकता है, लेकिन एक मोनोक्युलर कैमरा सिद्धांत रूप में निरपेक्ष पैमाने (वास्तविक दुनिया की दूरी इकाइयाँ) का निर्धारण नहीं कर सकता है, और तेज़ रोटेशन से छवि धुंधली हो जाती है और फ़ीचर ट्रैकिंग बाधित हो जाती है। आईएमयू एक दर्पण प्रतिबिंब है: यह सैकड़ों हर्ट्ज़ पर त्वरण और कोणीय वेग को सीधे मापता है, इसलिए यह तीव्र गति के प्रति प्रतिरोधी है, और त्वरण का समाकलन करके वास्तविक पैमाने पर वेग और स्थिति में परिवर्तन प्राप्त किया जा सकता है - लेकिन इसी समाकलन का अर्थ है कि समय के साथ त्रुटियाँ संचित होती जाती हैं (विचलन), और यह कभी भी निरपेक्ष स्थिति को नहीं जान पाता।

v_{t+\Delta t} = v_t + a_t \, \Delta t, \qquad p_{t+\Delta t} = p_t + v_t \, \Delta t + \tfrac{1}{2} a_t \, \Delta t^{2}

जैसा कि यह समीकरण दर्शाता है, एक आईएमयू त्वरण का दो बार समाकलन करके स्थिति प्राप्त करता है a_t, इसलिए त्वरणमापी में एक छोटा सा पूर्वाग्रह भी स्थिति त्रुटि में परिवर्तित हो जाता है जो बीते हुए समय के वर्ग के साथ बढ़ता जाता है। वीआईओ दृश्य विशेषताओं के अवलोकन का उपयोग करके उस विचलन को सीमित कर सकता है; पर्याप्त गति उत्तेजना और अवलोकन क्षमता के साथ, आईएमयू मीट्रिक-पैमाने पर अनुमान लगाने में सक्षम है, लेकिन यह हर स्थिति में पैमाने की अस्पष्टता को दूर नहीं करता है। MSCKF (मौरीकिस और रूमेलीओटिस, 2007, EKF-आधारित), OKVIS (ल्यूटेनेगर एट अल., 2015, नॉनलाइनियर-ऑप्टिमाइजेशन-आधारित), और VINS-Mono (किन एट अल., 2018, मोनोक्युलर + IMU) इन दो फ्रेमवर्क के तहत VIO के प्रमुख कार्यान्वयन हैं।

8. LiDAR×IMU (LIO)

LiDAR को IMU के साथ संयोजित करने को LiDAR-इनर्टियल ओडोमेट्री (LIO) कहा जाता है, जिसका व्यापक रूप से आउटडोर रोबोट और स्वायत्त ड्राइविंग में उपयोग किया जाता है। LiDAR आसपास की ज्यामिति को सीधे और सटीक रूप से एक बिंदु क्लाउड के रूप में मापता है, लेकिन एक स्कैन को पूरा होने में दसियों से लेकर सौ मिलीसेकंड तक का समय लगता है, और यदि सेंसर स्वयं उस समयावधि के दौरान हिलता है, तो एक स्कैन के भीतर के बिंदु विकृत हो जाते हैं (गति विरूपण)।

यहां भी, आईएमयू की उच्च सैंपल दर ही कारगर साबित होती है: स्कैन के दौरान कैप्चर किए गए सूक्ष्म अभिविन्यास परिवर्तनों का इंटरपोलेशन करके उस विकृति को ठीक किया जाता है। और केवल पॉइंट-क्लाउड-टू-पॉइंट-क्लाउड मैचिंग (आईसीपी और इसी तरह की विधियाँ) पर निर्भर रहने से ज्यामितीय रूप से कम विशेषताओं वाले वातावरणों में विचलन होने की संभावना रहती है — जैसे कि एक लंबा, बिना विशेषताओं वाला गलियारा, एक खुला मैदान — जहां आईएमयू की जड़त्वीय जानकारी इस अंतर को भर देती है और अनुमान को स्थिर रखती है।

प्रारंभिक एलओएएम (झांग और सिंह, 2014) ने पॉइंट क्लाउड से किनारे और समतल विशेषताओं वाले बिंदुओं को निकालकर और उनका मिलान करके लिडार ओडोमेट्री में अग्रणी भूमिका निभाई। एलआईओ-एसएएम (शान एट अल., 2020) ने फैक्टर ग्राफ पर लिडार और आईएमयू की जानकारी को एकीकृत किया, जिसे इस तरह से डिज़ाइन किया गया था कि जीपीएस और लूप-क्लोजर बाधाओं को एक ही ग्राफ में समाहित किया जा सके। FAST-LIO / FAST-LIO2 (Xu et al., 2021 / 2022) ने इटरेटेड कल्मन फ़िल्टर के माध्यम से LiDAR-IMU के घनिष्ठ एकीकरण को अपनाया, और विशेष रूप से FAST-LIO2 विरल फ़ीचर निष्कर्षण के बजाय सीधे पॉइंट क्लाउड को संसाधित करता है। घनिष्ठ युग्मन संयुक्त जानकारी का लाभ उठा सकता है, लेकिन सटीकता और लागत आरंभीकरण, अपघटन, कार्यान्वयन और सेंसर समय पर निर्भर करती है; यह हमेशा शिथिल युग्मन से बेहतर नहीं है।

9. कैमरा×LiDAR

कैमरा और LiDAR का संयोजन सबसे सहज रूप से पूरक फ़्यूज़न संयोजन है — "अर्थ जानता है लेकिन दूरी नहीं" और "दूरी जानता है लेकिन अर्थ नहीं" का मिलन होता है। लेकिन इस संयोजन में एक ऐसी कठिनाई है जो अन्य संयोजनों में नहीं है: दोनों सेंसरों की समन्वय प्रणालियाँ मौलिक रूप से भिन्न हैं (कैमरे का 2D इमेज प्लेन बनाम LiDAR का 3D पॉइंट क्लाउड), इसलिए दोनों को जोड़ने के लिए एक स्पष्ट अंशांकन और प्रक्षेपण प्रक्रिया की आवश्यकता होती है।

कैलिब्रेशन कैमरे के आंतरिक मापदंडों (फोकल लेंथ, लेंस विरूपण, आंतरिक मैट्रिक्स K) और कैमरे तथा LiDAR के बीच सापेक्ष स्थिति (बाह्य मापदंड: रोटेशन R, ट्रांसलेशन t) को हल करता है। इन मापदंडों के आधार पर, LiDAR द्वारा मापे गए 3D बिंदु \mathbf{X} को कैमरे के पिक्सेल निर्देशांक \mathbf{u} में प्रक्षेपित किया जा सकता है।

\mathbf{e} = \mathbf{u} - \pi\left( K \, [R \mid t] \, \mathbf{X} \right)

\pi(\cdot) परिप्रेक्ष्य-प्रक्षेपण फ़ंक्शन है जो समरूप निर्देशांकों को 2D छवि तल पर मैप करता है, और [R\mid t] LiDAR निर्देशांकों से कैमरे के निर्देशांकों में रूपांतरण है। कैलिब्रेशन वह प्रक्रिया है जिसमें R और t को इस त्रुटि \mathbf{e} को न्यूनतम करने के लिए हल किया जाता है; एक बार यह हो जाने पर, यही प्रोजेक्शन यह निर्धारित करता है कि "कौन सा LiDAR बिंदु किस छवि पिक्सेल से मेल खाता है" (पॉइंट-पिक्सेल एसोसिएशन)। यह पत्राचार आपको LiDAR बिंदुओं के साथ कैमरे की रंग या श्रेणी की जानकारी जोड़ने या कैमरे द्वारा पता लगाए गए ऑब्जेक्ट को LiDAR की सटीक दूरी प्रदान करने की अनुमति देता है।

आधुनिक स्वायत्त ड्राइविंग में प्रचलित दृष्टिकोण इस प्रोजेक्शन को बिंदु-दर-बिंदु के बजाय फीचर स्तर पर करता है: BEV फ्यूजन (बर्ड्स-आई व्यू फ्यूजन)। BEVFusion (लियांग एट अल., 2022, और अलग से लियू एट अल., 2022) कैमरा-इमेज फीचर्स और LiDAR पॉइंट-क्लाउड फीचर्स को स्वतंत्र रूप से BEV (टॉप-डाउन 2D) स्पेस में परिवर्तित करता है, फिर उन्हें वहां संयोजित करता है — और इसे कैमरा×LiDAR के लिए मिड-लेवल फ्यूजन के प्रमुख उदाहरण के रूप में व्यापक रूप से उद्धृत किया जाता है।

10. कैमरा×LiDAR×रडार×IMU

स्वायत्त ड्राइविंग को उदाहरण के रूप में लें, तो व्यवहार में फ्यूजन एक जोड़ी से कहीं आगे जाता है: कैमरा, LiDAR, रडार और IMU (साथ ही GNSS) सभी एक साथ एकीकृत हो जाते हैं, जिनमें से प्रत्येक की एक स्पष्ट रूप से परिभाषित भूमिका होती है।

  • कैमरा: यह उन चीजों को पहचानता है जिन्हें केवल ज्यामिति से नहीं समझा जा सकता — जैसे ट्रैफिक लाइट का रंग, साइन बोर्ड पर लिखा टेक्स्ट, लेन का प्रकार।
  • लिडार: यह आसपास की वस्तुओं के सटीक 3D आकार और दूरी को मापता है, जो प्रकाश से अप्रभावित रहता है।
  • रडार: यह बारिश, कोहरे या बैकलाइट में भी काम करता रहता है, जो कैमरों और लिडार को प्रभावित कर सकते हैं, और डॉप्लर तकनीक के माध्यम से सीधे सापेक्ष वेग को मापता है।
  • आईएमयू: यह वाहन के स्वयं के अभिविन्यास परिवर्तन और त्वरण को उच्च आवृत्ति पर कैप्चर करता है, और अन्य सेंसरों के रीडिंग के बीच इंटरपोलेशन करता है।
  • जीएनएसएस: यह मानचित्र के साथ वैश्विक संरेखण के लिए संदर्भ प्रदान करता है (आमतौर पर उच्च परिशुद्धता सुधार के बाद आईएमयू में एकीकृत होता है, जैसे आरटीके)।

ये चार या पांच प्रकार के सेंसर एक-दूसरे की कमजोरियों को दूर करते हैं, ताकि लगभग किसी भी विफलता को कोई दूसरा सेंसर पकड़ सके: घना कोहरा कैमरा और लिडार की सटीकता को कम कर देता है, लेकिन रडार काम करता रहता है; एक सुरंग जीपीएस को अवरुद्ध कर देती है, लेकिन आईएमयू और लिडार ओडोमेट्री स्व-स्थान निर्धारण को चालू रखते हैं। अतिरेक के लिए यह डिज़ाइन—एक ही परिस्थितियों में कई सेंसरों के एक साथ विफल होने की संभावना को कम करना—वही सबसे बड़ा कारण है कि स्वायत्त ड्राइविंग जैसे उपयोग के मामलों में मल्टी-सेंसर फ़्यूज़न को अपरिहार्य माना जाता है, जहाँ विफलता का कोई विकल्प नहीं है।

11. फ़्यूज़न को कठिन क्या बनाता है

सेंसर फ़्यूज़न कागज़ पर कितना भी आकर्षक क्यों न लगे, इसे लागू करने में कई वास्तविक व्यावहारिक कठिनाइयाँ आती हैं।

  • समय सिंक्रनाइज़ेशन: प्रत्येक सेंसर अलग-अलग दर और विलंबता के साथ डेटा आउटपुट करता है, इसलिए उन्हें "एक ही क्षण" के रूप में मानने के लिए सटीक समय संरेखण की आवश्यकता होती है—हार्डवेयर-स्तर ट्रिगर सिंक, या टाइमस्टैम्प इंटरपोलेशन।

  • कैलिब्रेशन: सेंसरों के बीच सापेक्ष स्थिति और अभिविन्यास (बाह्य पैरामीटर), और प्रत्येक सेंसर के अपने आंतरिक पैरामीटर (आंतरिक पैरामीटर), सटीक रूप से ज्ञात होने चाहिए। माउंटिंग में थोड़ा सा अंतर पूरे फ़्यूज़्ड परिणाम में एक व्यवस्थित त्रुटि उत्पन्न करता है।

  • निर्देशांक रूपांतरण: प्रत्येक सेंसर अपने स्वयं के फ्रेम (कैमरा फ्रेम, लिडार फ्रेम, वाहन फ्रेम, वैश्विक फ्रेम) में स्थित होता है, और इन्हें लगातार और सुसंगत रूप से रूपांतरित करना आवश्यक है।

  • सेंसर शोर: प्रत्येक सेंसर के शोर की विशेषताएँ (गॉसियन हो या नहीं, पक्षपाती हो या नहीं) भिन्न होती हैं, और इसका गलत मॉडलिंग संभाव्य संलयन में भार (जैसे कल्मन लाभ) को प्रभावित करता है।

  • आउटलायर्स: गलत पहचान, या गतिशील वस्तुओं के कारण होने वाली विसंगतियाँ, ऐसा शोर उत्पन्न करती हैं जिसकी मॉडल ने कभी अपेक्षा नहीं की थी - एक साधारण सांख्यिकीय मॉडल इसे अकेले संभाल नहीं सकता, इसलिए RANSAC जैसी मजबूत-अनुमान तकनीकें, या स्पष्ट आउटलायर अस्वीकृति, आवश्यक हो जाती हैं।

अनिश्चितता प्रसार*: जब तक प्रत्येक सेंसर की व्यक्तिगत अनिश्चितता (सहप्रसरण) को संपूर्ण संलयन प्रक्रिया में सही ढंग से प्रसारित नहीं किया जाता है, अंतिम अनुमान की वास्तविक विश्वसनीयता का गलत आकलन किया जाता है - और या तो अति आत्मविश्वास या अत्यधिक सावधानी आगे के निर्णयों को गलत दिशा में ले जाती है।

इनमें से कोई भी समस्या केवल पाठ्यपुस्तक में वर्णित कल्मन फ़िल्टर समीकरणों को लागू करने मात्र से हल नहीं हो जाती — ये सभी सिस्टम इंजीनियरिंग के दायरे में आती हैं।

12. अंतिम विश्व मॉडल

अब तक चर्चा की गई सभी बातों को एक साथ मिलाएँ — व्यक्तिगत सेंसर, व्यक्तिगत फ़्यूज़न विधियाँ — और अंततः एक रोबोट या स्वायत्त वाहन जिस प्रकार का "विश्व मॉडल" धारण करता है, वह नीचे दिखाया गया है, जो प्रत्येक सेंसर की विशेषता को एक साथ जोड़ता है।

Diagram 2 · Use the button to switch views
How multiple sensors integrate into one World Model Camera → Semantics LiDAR → Geometry IMU → Motion Radar → Velocity GNSS → Global Position Sensor Fusion (Filter / Optimization) World Model (position, geometry, semantics, velocity)

चित्र 2 — कैमरा, लिडार, आईएमयू, रडार और जीएनएसएस प्रत्येक अलग-अलग जानकारी प्रदान करते हैं, और फ़्यूज़न परत इसे एक सुसंगत विश्व मॉडल में एकीकृत करती है।

विश्व मॉडल केवल "मैं कहाँ हूँ" नहीं है — इसमें आसपास की वस्तुओं की ज्यामिति (लिडार से), वे वस्तुएँ क्या हैं (कैमरे से), उनके सापेक्ष वेग (रडार से), वाहन के स्वयं के अभिविन्यास परिवर्तन (आईएमयू से), और मानचित्र पर एक वैश्विक स्थिति (जीएनएसएस से) शामिल हैं, जो समय या स्थान में विरोधाभास के बिना एकीकृत हैं। किसी रोबोट की पथ योजना, या किसी स्वायत्त वाहन के ड्राइविंग निर्णय, इस विश्व मॉडल के आधार पर लिए जाते हैं - कच्चे सेंसर डेटा के आधार पर नहीं। इस अर्थ में, सेंसर फ्यूजन धारणा और क्रिया के बीच सेतु का काम करता है: यह प्रत्येक सेंसर की व्यक्तिगत अवधारणात्मक क्षमता को एक सुसंगत प्रतिनिधित्व में परिवर्तित करता है जिस पर सिस्टम वास्तव में कार्य कर सकता है।

13. व्यवहार में फ्यूजन सिस्टम का डिज़ाइन

जब वास्तव में एक सेंसर फ्यूजन सिस्टम का डिज़ाइन किया जाता है, तो चार प्रश्न निर्णय लेने को सुगम बनाते हैं।

डिज़ाइन निर्णय किन बातों पर ध्यान देना है
किसे फ्यूज करना है सबसे पहले यह तय करें कि एप्लिकेशन को वास्तव में किन सेंसर की कमियों को दूर करने की आवश्यकता है (खराब मौसम में बेहतर प्रदर्शन के लिए रडार, सटीक स्थिति के लिए GNSS आदि)
किस चरण में फ्यूज करना है प्रारंभिक/मध्य स्तर पर यदि सटीकता प्राथमिकता है; बाद के चरण में फ्यूजन यदि विकास की स्वतंत्रता और रखरखाव अधिक महत्वपूर्ण हैं
फ़िल्टर बनाम अनुकूलन यदि आवश्यकता अनुक्रमिक, कम विलंबता और कम कंप्यूटिंग क्षमता की हो तो फ़िल्टर (ईकेएफ, आदि) का उपयोग किया जाता है; यदि सटीकता सर्वोपरि हो, कंप्यूटिंग क्षमता पर्याप्त हो और पिछले अनुमानों को संशोधित किया जा सके तो अनुकूलन-आधारित दृष्टिकोण (फैक्टर ग्राफ, आदि) का उपयोग किया जाता है।

सटीकता बनाम कंप्यूटिंग लागत | टाइट कपलिंग आमतौर पर अधिक सटीक होती है लेकिन इसे लागू करने और चलाने में अधिक लागत आती है; लूज़ कपलिंग (प्रत्येक सेंसर के लिए अनुमान लगाना, फिर उन्हें मिलाना) लागू करना आसान और सस्ता होता है, हालांकि सटीकता में कुछ कमी आती है।

ये निर्णय एक-दूसरे से स्वतंत्र नहीं हैं — ये एक-दूसरे को प्रभावित करते हैं। उदाहरण के लिए, बड़े पैमाने पर उत्पादित ऑटोमोटिव सिस्टम को कंप्यूटिंग सीमाओं के कारण अक्सर फ़िल्टर-आधारित, लूज़ कपलिंग डिज़ाइन की ओर बाध्य होना पड़ता है, जबकि अनुसंधान उपयोग के मामलों या ऑफ़लाइन मानचित्र निर्माण में अधिकतम सटीकता प्राप्त करने के लिए अनुकूलन-आधारित, टाइट कपलिंग डिज़ाइन का उपयोग किया जा सकता है। "परफेक्ट फ़्यूज़न विधि" जैसी कोई चीज़ नहीं है — व्यावहारिक सेंसर फ़्यूज़न डिज़ाइन का सार यह है कि बोर्ड पर मौजूद सेंसर, उपलब्ध कंप्यूटिंग क्षमता और एप्लिकेशन की सटीकता और विलंबता की मांग को ध्यान में रखते हुए सबसे उपयुक्त संयोजन का चयन किया जाए।

14. सारांश

सेंसर फ़्यूज़न गणितीय रूप से कैमरा, लिडार, आईएमयू, रडार और जीएनएसएस से प्राप्त प्रेक्षणों को संयोजित करता है — जिनमें से प्रत्येक अलग-अलग स्थानों पर मजबूत और कमजोर होता है — संभाव्यता विधियों (कलमन फ़िल्टर/ईकेएफ/यूकेएफ/पार्टिकल फ़िल्टर) या अनुकूलन-आधारित विधियों (फैक्टर ग्राफ़/बंडल समायोजन) का उपयोग करके, एक ऐसा स्टेट एस्टीमेट तैयार करता है जो किसी भी एक सेंसर द्वारा दिए गए एस्टीमेट से अधिक सटीक और विश्वसनीय होता है। वीआईओ (कैमरा × आईएमयू), एलआईओ (लिडार × आईएमयू) और बीईवी फ़्यूज़न (कैमरा × लिडार) जैसे ठोस युग्मन इसी विचार पर आधारित हैं — पूरकता को समीकरणों में बदलना — और जहां और कैसे फ़्यूज़न करना है, इसके डिज़ाइन विकल्प अंततः परिणामी सटीकता, गणना लागत और कार्यान्वयन जटिलता को निर्धारित करते हैं।

मापों को संयोजित करने से पहले जांच

एक ही प्रेक्षण से प्राप्त स्थिति और वेग को स्वतंत्र माप मानना अनुमान को अतिआत्मविश्वासपूर्ण बना सकता है। सेंसर जोड़ने से पहले टाइमस्टैम्प, निर्देशांक फ्रेम, एक्सट्रिंसिक्स और त्रुटि सहसंबंधों की जांच करें। आउटेज सहित समान परिस्थितियों में एकल-सेंसर बेसलाइन के विरुद्ध फ़्यूज़न का मूल्यांकन करें।

अपनी समझ की जाँच करें
यदि एक ही जानकारी दो बार फ़्यूज़न में प्रवेश करती है तो क्या होगा?

सहसंबंधित जानकारी को स्वतंत्र मानने से अतिविश्वास पैदा हो सकता है। सेंसरों की गिनती करने के बजाय सूचना स्रोतों और सहसंबंधों की जाँच करें।

Related reading

Explore another aspect of this fieldICP की विफलता के कारण: आरंभीकरण, आउटलायर्स और सममित ज्यामितिExplore another aspect of this fieldROS 2 में मैपिंग से लेकर नेविगेशन तक — जैज़ी और Nav2 की एक संक्षिप्त प्रक्रियाExplore another aspect of this fieldरोबोट निर्देशांक रूपांतरण: मैट्रिक्स, क्वाटरनियन और TF