Contents — find the section you need

विज़ुअल-एसएलएएम उन तकनीकों का समूह है जो केवल कैमरा फुटेज (या कैमरा-प्लस-आईएमयू संयोजन) के आधार पर स्व-स्थान निर्धारण और मानचित्रण करती हैं। इसमें लिडार जैसे महंगे रेंजिंग सेंसर की आवश्यकता नहीं होती है, लेकिन इसकी एक कमजोरी है - प्रकाश परिवर्तन और कमज़ोर बनावट वाले दृश्यों के प्रति संवेदनशीलता - और इस कमजोरी को दूर करने का इतिहास ही मूल रूप से इस तकनीक का चलन है।

OpenCVOpenCV

छवि: OpenCV लोगो, विकिमीडिया कॉमन्स (अपैची 2.0)

विज़ुअल-एसएलएएम एक नज़र में

Diagram 1 · Use the button to switch views
विज़ुअल-एसएलएएम कीपॉइंट्स या सघन सहसंबंध का उपयोग करके फ़्रेमों के बीच पत्राचार ढूंढता है, पोज़ और गहराई का अनुमान लगाता है, और बंडल समायोजन के माध्यम से प्रक्षेपवक्र और मानचित्र को संयुक्त रूप से सामंजस्य स्थापित करता है

आरेख: डस्ककॉइल। यह शास्त्रीय और अधिगम-आधारित दृष्टिकोणों द्वारा साझा किए गए ज्यामितीय संबंधों को दर्शाता है।

विज़ुअल-एसएलएएम में केंद्रीय समस्या फ़्रेमों में एक ही स्थान को संबद्ध करना और कैमरा गति और 3डी संरचना को संयुक्त रूप से पुनर्प्राप्त करना है जो उन संबद्धताओं को सुसंगत बनाते हैं। शास्त्रीय विधियाँ स्पष्ट रूप से विरल कुंजी बिंदुओं का मिलान करती हैं; अधिगम-आधारित विधियाँ सघन विशेषताओं या सीखे गए पूर्व ज्ञान से पत्राचार का अनुमान लगाती हैं। दोनों अवलोकन-स्थिति-संरचना संगति से बंधी रहती हैं। मानचित्र एक विरल बिंदु क्लाउड है, सघन गहराई है, या एक तंत्रिका प्रतिनिधित्व है, यह एक और महत्वपूर्ण व्यावहारिक विकल्प है।

फ़ीचर-पॉइंट-आधारित एंडपॉइंट: ORB-SLAM3

शास्त्रीय विज़ुअल-एसएलएएम का एक एंडपॉइंट ORB-SLAM3 है। यह मोनोक्युलर, स्टीरियो या RGB-D सेटअपों में वास्तविक समय में विज़ुअल, विज़ुअल-इनर्टियल या मल्टी-मैप एसएलएएम चला सकता है, ORB नामक एक फ़ीचर डिस्क्रिप्टर का उपयोग करके छवियों के बीच पत्राचार ढूंढता है, और फिर बंडल समायोजन के माध्यम से स्थिति और मानचित्र बिंदुओं को अनुकूलित करता है। बंडल एडजस्टमेंट उस बेमेल (रीप्रोजेक्शन त्रुटि) के योग को न्यूनतम करता है जो 3D मानचित्र बिंदु \mathbf{X}_i के उस स्थान के बीच होता है जहाँ उसे कैमरा पोज़ (\mathbf{R}_j, \mathbf{t}_j) के तहत छवि में प्रक्षेपित किया जाता है, और जहाँ संबंधित फ़ीचर बिंदु \mathbf{u}_{ij} वास्तव में छवि में देखा गया था।

\min_{\{\mathbf{R}_j, \mathbf{t}_j\}, \{\mathbf{X}_i\}} \sum_{i,j} \left\| \pi\left( \mathbf{R}_j \mathbf{X}_i + \mathbf{t}_j \right) - \mathbf{u}_{ij} \right\|^2

यहाँ \pi(\cdot) कैमरे के आंतरिक मापदंडों पर आधारित, 3D बिंदु से छवि तल पर प्रक्षेपण फ़ंक्शन है। कैमरा पोज़ और मानचित्र बिंदुओं दोनों पर इस व्यंजक को संयुक्त रूप से अनुकूलित करना बंडल एडजस्टमेंट का सार है, जिसे उसी अरैखिक न्यूनतम वर्ग ढांचे के भीतर हल किया जाता है जैसा कि पहले वर्णित ग्राफ़ अनुकूलन (विवरण के लिए "SLAM में प्रौद्योगिकी रुझान" देखें)। इसके जारी होने के वर्षों बाद भी, इसे शोध पत्रों में तुलनात्मक आधार रेखा के रूप में उद्धृत किया जाता है - वास्तविक मानक संदर्भ कार्यान्वयन।

डीप लर्निंग के ज़रिए संपूर्ण विश्लेषण: DROID-SLAM

फीचर एक्सट्रैक्शन और मैचिंग की स्पष्ट प्रक्रिया को सीधे डीप लर्निंग से बदलने का चलन भी तेज़ी से बढ़ रहा है। DROID-SLAM इसका प्रमुख उदाहरण है, जो आवर्ती पुनरावृत्ति अपडेट और एक सघन बंडल-एडजस्टमेंट लेयर के माध्यम से कैमरा पोज़ और प्रति-पिक्सेल गहराई का अनुमान लगाता है। हालांकि इसे केवल मोनोक्युलर वीडियो पर प्रशिक्षित किया गया है, लेकिन यह बेहतर सटीकता के लिए परीक्षण के समय स्टीरियो या RGB-D वीडियो का भी उपयोग करने में सक्षम है। हालांकि, इसकी कंप्यूटिंग आवश्यकताएं पारंपरिक विधियों की तुलना में अधिक हैं - केवल इन्फरेंस के लिए ही 11 GB या उससे अधिक GPU मेमोरी की आवश्यकता होती है।

DROID-SLAM के अंदर: सहसंबंध वॉल्यूम और डिफरेंशिएबल बंडल एडजस्टमेंट

DROID-SLAM बिना स्पष्ट फीचर एक्सट्रैक्शन के पोज़ और गहराई का अनुमान कैसे लगाता है, इस पर थोड़ा और गौर करें: यह पहले इनपुट रिज़ॉल्यूशन के 1/8 पर सघन फीचर मैप्स की गणना करता है, जिसमें दो CNN का उपयोग किया जाता है - एक फीचर एक्सट्रैक्शन के लिए, दूसरा प्रासंगिक जानकारी के लिए। प्रत्येक फ्रेम जोड़ी के लिए, यह फीचर वैक्टर की प्रत्येक जोड़ी के बीच डॉट प्रोडक्ट की गणना करके एक "4D सहसंबंध वॉल्यूम" बनाता है, जो पिक्सेल-वार पत्राचार का अनुमान लगाने का आधार बनता है।

यह अनुमान एक पुनरावर्ती अपडेट ऑपरेटर द्वारा नियंत्रित किया जाता है। सहसंबंध वॉल्यूम से प्राप्त फीचर्स, पिछली पुनरावृति से प्राप्त अवशिष्ट (सुधार) के साथ, कनवोल्यूशनल परतों से गुजरते हुए एक ConvGRU (एक कनवोल्यूशनल गेटेड रिकरेंट यूनिट) में जाते हैं, जो प्रवाह (स्पष्ट गति) में सुधार आउटपुट करता है। गेटिंग तंत्र - जो नेटवर्क को चुनिंदा रूप से यह नियंत्रित करने देता है कि कौन सी जानकारी शामिल करनी है और कौन सी छोड़नी है - वह हिस्सा है जिसे नेटवर्क ने वास्तव में सीखा है।

इस पुनरावर्ती अपडेट का आउटपुट एक डिफरेंशिएबल डेंस बंडल एडजस्टमेंट (DBA) परत में जाता है जो कैमरा पोज और प्रति-पिक्सेल व्युत्क्रम गहराई को एक साथ अपडेट करता है। इस प्रकार नेटवर्क में ज्यामितीय बाधाओं को स्पष्ट रूप से शामिल करने से एक मोनोक्युलर-प्रशिक्षित मॉडल को भी बिना पुनः प्रशिक्षण के स्टीरियो या RGB-D इनपुट को संभालने की सुविधा मिलती है।

मानचित्र निरूपण का पुनर्आविष्कार: 3डी गॉसियन स्प्लैटिंग और NeRF

वर्तमान में सबसे तेजी से विकसित हो रहा क्षेत्र मानचित्र निरूपण प्रारूप का पुनर्आविष्कार है। न्यूरल रेडियंस फील्ड्स (NeRF) और 3डी गॉसियन स्प्लैटिंग (3DGS) एक फोटोरियलिस्टिक 3डी दृश्य को साधारण बिंदु क्लाउड के बजाय मापदंडों के एक संक्षिप्त समूह के रूप में निरूपित कर सकते हैं। यह विशेषता SLAM की मानचित्रण सटीकता, प्रतिपादन गुणवत्ता और गणनात्मक दक्षता को लगातार बढ़ा रही है।

2026 तक, प्रमुख सम्मेलनों और पत्रिकाओं में 3DGS/NeRF-आधारित नई विधियों की एक श्रृंखला लगातार सामने आती रही है: स्प्लैट-SLAM, जो केवल RGB वीडियो से वैश्विक अनुकूलन करता है; गॉसियन-LIC/गॉसियन-LIC2, जो LiDAR, IMU और कैमरे को एकीकृत करते हैं; GTS-SLAM, जो भूमिगत खानों जैसे कठोर वातावरणों के लिए लक्षित है; MTE-SLAM (ICRA 2026), जो सिमेंटिक SLAM की ओर उन्मुख है; और PMET-SLAM, जो फोटोरियलिस्टिक मैपिंग और कुशल ट्रैकिंग के बीच संतुलन बनाता है। पारंपरिक विधियों की तुलना में, रेंडरिंग गुणवत्ता और मानचित्र पुन: प्रयोज्यता (किसी भी दृष्टिकोण से बाद में वातावरण को पुनः रेंडर करने की क्षमता) को इसकी स्पष्ट खूबियों के रूप में बताया गया है।

2025-2026 का वर्तमान: फीड-फॉरवर्ड 3D फाउंडेशन मॉडल पर आधारित SLAM

DROID-SLAM के डिज़ाइन — पुनरावृत्ति अनुमान और विभेदनीय बंडल समायोजन — को एक कदम आगे ले जाते हुए, MASt3R-SLAM (एक CVPR 2025 हाईलाइट पेपर), जो 2024 के अंत में प्रकाशित हुआ, MASt3R के आउटपुट — दो-दृश्य 3D पुनर्निर्माण और पत्राचार पर पूर्व-प्रशिक्षित एक फाउंडेशन मॉडल — को "पूर्व ज्ञान" के रूप में मानता है। यह एक ही फ्रेमवर्क के भीतर पॉइंटमैप मैचिंग, कैमरा ट्रैकिंग, लोकल मैप फ्यूजन और लूप-क्लोजर डिटेक्शन को संभालता है, यहां तक कि तब भी जब कैमरा इंट्रिंसिक्स अज्ञात हों। यह ज्ञात कैमरा मॉडल के साथ 15 FPS पर चलता है और कई बेंचमार्क में अत्याधुनिक सटीकता हासिल करने का दावा करता है।

2025 में VGGT (विजुअल ज्योमेट्री ग्राउंडेड ट्रांसफॉर्मर) के आगमन के साथ इस फाउंडेशन-मॉडल श्रृंखला को और गति मिली - एक फीड-फॉरवर्ड 3D फाउंडेशन मॉडल जो एक ही फॉरवर्ड पास में मल्टी-व्यू छवियों से कैमरा पोज, डेप्थ और पॉइंट क्लाउड को एक साथ आउटपुट करता है। VGGT के आउटपुट पर आधारित व्युत्पन्न अनुसंधान की एक लहर 2026 तक जारी रही। VGGT-SLAM++ (अप्रैल 2026) VGGT के ट्रांसफॉर्मर आउटपुट को लगातार लोकल ऑप्टिमाइजेशन - कोविजिबिलिटी ग्राफ और विजुअल प्लेस रिकग्निशन के माध्यम से - के साथ मिलाकर ट्रैजेक्टरी को स्थिर करके एक पूर्ण SLAM सिस्टम में बदल देता है। VGGT-Align (अगस्त 2026) प्रत्येक चंक के पॉइंट क्लाउड से निकाले गए प्रमुख ज्यामितीय अपरिवर्तनीयताओं का उपयोग करके स्केल को सीमित करके लंबी अनुक्रमों पर चंक-दर-चंक स्केल ड्रिफ्ट की समस्या का समाधान करता है। Co-VGGT (जुलाई 2026) जैसे विश्लेषण कार्य भी सामने आए हैं, जिन्होंने दिखाया कि VGGT बिना किसी स्पष्ट पर्यवेक्षी संकेत के सह-दृश्यता (कौन से दृष्टिकोण एक ही क्षेत्र को साझा करते हैं) को अप्रत्यक्ष रूप से एन्कोड करता है - यह समझने का एक सक्रिय प्रयास है कि इन आधारभूत मॉडलों के आंतरिक निरूपण वास्तव में क्या कैप्चर करते हैं।

बेंचमार्क क्या दिखाते हैं: अधिक सटीक, लेकिन अचूक समाधान नहीं

2026 के उत्तरार्ध में आधारभूत मॉडल-आधारित SLAM के वास्तविक दुनिया के प्रदर्शन को मापने वाले अध्ययनों का एक समूह सामने आया। DJI ड्रोन से प्राप्त उच्च-ऊंचाई नादिर फुटेज पर पांच मोनोक्युलर SLAM प्रणालियों की तुलना करने वाले एक मूल्यांकन में पाया गया कि MASt3R-SLAM ने पथ लंबाई के 0.53% पर सबसे कम औसत क्षैतिज निरपेक्ष त्रुटि प्राप्त की, जबकि यह भी नोट किया गया कि ऊर्ध्वाधर (ऊंचाई) सटीकता अभी भी एक अनसुलझी समस्या बनी हुई है। कृत्रिम और वास्तविक दोनों प्रकार की त्रुटियों के तहत मोनोक्युलर SLAM का मूल्यांकन करने वाले एक अलग अध्ययन (अगस्त 2026) में पाया गया कि जहां पारंपरिक फीचर-आधारित विधियां खराब परिस्थितियों में "भयानक ट्रैकिंग विफलता" का शिकार होती हैं, वहीं लर्नड ट्रैकर्स इस भयानक विफलता को काफी हद तक "निरंतर, और कभी-कभी गंभीर, ड्रिफ्ट" से बदल देते हैं। दूसरे शब्दों में, लर्नड विधियां एक नाटकीय, स्पष्ट विफलता के स्थान पर एक शांत विफलता को अपना सकती हैं जहां त्रुटि का पता नहीं चलता - यह इस बात की याद दिलाता है कि केवल सटीकता मेट्रिक्स ही यह पूरी कहानी नहीं बताते कि वास्तव में कौन सा दृष्टिकोण बेहतर है।

स्केल अस्पष्टता - वह क्लासिक कमजोरी जहां केवल मोनोक्युलर फीड से निरपेक्ष दूरी स्केल प्राप्त नहीं किया जा सकता - के संबंध में भी नए दृष्टिकोण सामने आ रहे हैं। Scalix (अगस्त 2026), जो लर्नड डेप्थ प्रेडिक्शन को एक प्रोबेबिलिस्टिक फैक्टर ग्राफ में एकीकृत करता है, मीट्रिक (निरपेक्ष-स्केल) और अप-टू-स्केल (सापेक्ष-स्केल) दोनों बेंचमार्क पर अत्याधुनिक प्रदर्शन की रिपोर्ट करता है।

व्यावहारिक चयन मानदंड

वर्तमान में व्यावहारिक वर्गीकरण इस प्रकार है:

  • संसाधन सीमित, सिद्ध ट्रैक रिकॉर्ड: ORB-SLAM3 परिवार में फीचर-पॉइंट आधारित विधियाँ — एम्बेडेड हार्डवेयर पर भी पर्याप्त वास्तविक ट्रैक रिकॉर्ड
  • सटीकता को प्राथमिकता, पर्याप्त GPU संसाधन: DROID-SLAM परिवार में एंड-टू-एंड डीप-लर्निंग विधियाँ
  • अपरिचित वातावरणों में सामान्यीकरण, अंशांकन की आवश्यकता नहीं: MASt3R-SLAM/VGGT परिवार में फीड-फॉरवर्ड 3D फाउंडेशन-मॉडल विधियाँ — हालांकि ऊर्ध्वाधर सटीकता और दीर्घकालिक संचालन में विचलन जैसी कुछ समस्याएँ अभी भी बनी हुई हैं
  • फोटोरियलिस्टिक मानचित्र पुन: उपयोग की आवश्यकता: 3DGS/NeRF आधारित विधियाँ — हालांकि इनमें से कई अभी भी अनुसंधान चरण में हैं, और वास्तविक दुनिया में इनका उपयोग अभी भी विकसित हो रहा है

इनमें से कोई भी परिवार वास्तव में दूसरे का स्थान नहीं ले रहा है — वर्तमान वास्तविकता यह है कि वे उपयोग के मामलों के विभाजन में व्यवस्थित हो रहे हैं।

अपनी समझ की जाँच करें
क्या अच्छे नॉवेल-व्यू रेंडरिंग से सही कैमरा पोज़ स्थापित होते हैं?

ज्यामिति और प्रक्षेपवक्र सटीकता से अलग रेंडरिंग गुणवत्ता का मापन करें।

दृश्य गुणवत्ता मात्र से स्थानीयकरण विधियों का निर्धारण नहीं किया जा सकता। ## संदर्भ - [ORB-SLAM3 GitHub (UZ-SLAMLab)](https://github.com/UZ-SLAMLab/ORB_SLAM3) - [DROID-SLAM GitHub (princeton-vl)](https://github.com/princeton-vl/DROID-SLAM) / [पेपर (arXiv)](https://arxiv.org/abs/2108.10869) - [NeRFs और 3D गॉसियन स्प्लैटिंग SLAM को कैसे नया रूप दे रहे हैं: एक सर्वेक्षण](https://www.semanticscholar.org/paper/How-NeRFs-and-3D-Gaussian-Splatting-are-Reshaping-a-Tosi-Zhang/d48aa5b757b4d05a697ed62484b4e7cd956e97e9) - [Splat-SLAM: 3D गॉसियन के साथ वैश्विक रूप से अनुकूलित RGB-ओनली SLAM (arXiv)](https://arxiv.org/pdf/2405.16544) - [awesome-NeRF-and-3DGS-SLAM (पेपर/कोड राउंडअप, GitHub)](https://github.com/3D-Vision-World/awesome-NeRF-and-3DGS-SLAM) - [MASt3R-SLAM: 3D पुनर्निर्माण प्रायर के साथ रियल-टाइम डेंस SLAM पर शोध पत्र (arXiv)](https://arxiv.org/abs/2412.12392) - [VGGT-Align पर शोध पत्र (arXiv)](https://arxiv.org/abs/2608.15260) - [Scalix: अनिश्चितता-जागरूक स्केल-संगत मोनोक्युलर SLAM पर शोध पत्र (arXiv)](https://arxiv.org/abs/2608.17553)

What to read next

Review the backgroundलिडार-एसएलएएम में प्रौद्योगिकी रुझानContinue the seriesनेविगेशन में प्रौद्योगिकी के रुझानExplore another aspect of this fieldह्यूमनॉइड रोबोट में प्रौद्योगिकी के रुझान