Contents — find the section you need
किसी रोबोट को कप को सुरक्षित रूप से रखना, संकरे गलियारे में किसी व्यक्ति से बचना या किसी जटिल उपकरण को चलाना सिखाना जितना आसान लगता है, उतना आसान नहीं होता, क्योंकि इनाम को स्पष्ट रूप से परिभाषित करना कठिन होता है। लक्ष्य तक की दूरी को पुरस्कृत करने से रोबोट वस्तुओं को एक तरफ धकेलने के लिए प्रोत्साहित हो सकता है; केवल अंतिम सफलता को पुरस्कृत करने से अन्वेषण को कोई उपयोगी संकेत नहीं मिल सकता है। अनुकरण अधिगम (इमिटेशन लर्निंग) में, अवलोकनों से क्रियाएँ सीखने के लिए लोगों, टेलीऑपरेटरों या किसी मौजूदा नीति के प्रदर्शन का उपयोग किया जाता है। इसके विपरीत, व्युत्क्रम सुदृढ़ीकरण अधिगम (IRL) उस उद्देश्य—या इनाम—का अनुमान लगाने का प्रयास करता है जो प्रदर्शित व्यवहार को सार्थक बनाता है, और फिर उस उद्देश्य के लिए एक नीति तैयार करता है।
मानव डेटा का उपयोग करने मात्र से ही कोई भी विधि सुरक्षित नहीं हो जाती। मुख्य प्रश्न यह है कि प्रदर्शन के अभाव में नीति क्या करती है, लेबल का समय और श्रेय कैसे निर्धारित किया जाता है, विफलताओं को कैसे एकत्र किया जाता है, और कौन सी चीज़ें किसी भौतिक क्रिया को स्वतंत्र रूप से सीमित करती हैं। यह लेख व्यवहार क्लोनिंग (BC), कोवेरिएट शिफ्ट, DAgger, IRL, विज़न-लैंग्वेज-एक्शन मॉडल, मूल्यांकन, सुरक्षा और डेटा स्रोत को आपस में जोड़ता है। संबंधित अवधारणाओं के लिए Reinforcement Learning Basics, PPO and SAC, और VLA Primer देखें।
व्यावहारिक निष्कर्ष
-
BC, प्रदर्शित अवस्था s से विशेषज्ञ क्रिया a तक पर्यवेक्षित शिक्षण है। यह शुरू में तेज़ है, लेकिन एक छोटी सी प्रारंभिक त्रुटि नीति को ऐसी अवस्था वितरण में ले जा सकती है जिसे उसने पहले कभी नहीं देखा।
-
DAgger वर्तमान नीति को एक नियंत्रित सेटिंग में चलाता है, विशेषज्ञ से उन अवस्थाओं में क्रिया पूछता है जिन पर नीति वास्तव में जाती है, उन लेबलों को एकत्रित करता है, और पुनः प्रशिक्षित करता है। यह विफलता मोड को डेटा में बदल देता है, लेकिन इसके लिए सुरक्षित निष्पादन और विश्वसनीय विशेषज्ञ हस्तक्षेप की आवश्यकता होती है।
-
IRL प्रदर्शनों से एक पुरस्कार r_\theta(s,a) का अनुमान लगाता है और फिर उसके लिए एक नीति को अनुकूलित करता है। पुरस्कार की कोई विशिष्ट पहचान नहीं होती; इसका मूल्यांकन नियंत्रित परिस्थितियों और स्पष्ट सुरक्षा प्रतिबंधों में व्यवहार के आधार पर करें, न कि किसी विश्वसनीय दिखने वाले हीटमैप के आधार पर।
-
एक वीएलए एक बड़ी सशर्त अनुकरण नीति हो सकती है, लेकिन भाषा और छवि का पैमाना भौतिक सीमाओं, समय, संपर्क सुरक्षा या सुरक्षित-स्टॉप पथ को समाप्त नहीं करते।
प्रदर्शन केवल वीडियो नहीं, बल्कि परिचालन रिकॉर्ड होते हैं
एक उपयोगी प्रदर्शन में अवलोकन (छवियां, गहराई, बल, संयुक्त स्थिति), क्रियाएं (संयुक्त आदेश, वेग, ग्रिपर, स्टॉप), टाइमस्टैम्प, फ्रेम, कार्य निर्देश, सफलता/विफलता, ऑपरेटर, पर्यावरण की स्थितियां और हस्तक्षेप घटनाएं शामिल होती हैं। यदि लॉग किया गया आदेश वह है जो ऑपरेटर के इरादे के बजाय परिवहन विलंब के बाद रोबोट तक पहुंचा है, तो विलंब को डेटासेट में शामिल किया जाना चाहिए। 100 मिलीसेकंड का छवि-से-आर्म अंतर सही व्यवहार को असंगत प्रशिक्षण युग्मों में बदल देता है।
डेटा स्रोत में संग्राहक की सहमति, रिकॉर्डिंग वातावरण की अनुमति, गोपनीयता, तृतीय-पक्ष कार्य, रोबोट सुरक्षा जिम्मेदारी और नमूने को उसके स्रोत तक ट्रेस करने की क्षमता शामिल है। किसी सार्वजनिक डेटासेट को मिलाने के लिए लाइसेंस, व्यावसायिक उपयोग की शर्तें, पुनर्वितरण, व्यक्तियों और ऑडियो की जाँच करना और इच्छित उपयोग के लिए अंशांकन करना आवश्यक है। "इंटरनेट पर पाया गया" स्रोत का प्रमाण नहीं है; यह पता लगाने योग्य सहमति और शर्तों का अभाव है।
आरेख: डस्ककॉइल, अवधारणात्मक। रोलआउट वास्तविक डेटा संग्रह है; आरेख का अर्थ यह नहीं है कि सुरक्षा निगरानी, स्टॉप लॉजिक या ऑपरेटर हस्तक्षेप को छोड़ा जा सकता है।
व्यवहार क्लोनिंग और सहचर स्थानांतरण
दिए गए विशेषज्ञ युग्मों D=\{(s_i,a_i^*)\}_{i=1}^N के लिए, निरंतर-क्रिया BC न्यूनतम कर सकता है
असतत क्रियाएँ क्रॉस-एंट्रोपी का उपयोग करती हैं। यदि एक से अधिक क्रियाएँ मान्य हैं, तो एक एकल वर्ग-त्रुटि भविष्यवाणी "बाएँ से गुजरना" और "दाएँ से गुजरना" को एक असुरक्षित मध्य क्रिया में औसत कर सकती है; सशर्त वितरण, मिश्रण मॉडल या प्रसार-शैली नीतियाँ कई मोड का प्रतिनिधित्व कर सकती हैं। संदर्भ, ऑपरेटर शैली और कार्य निर्देश मायने रखते हैं।
BC आकर्षक है क्योंकि इसे इनाम डिज़ाइन या अन्वेषण से पहले ऑफ़लाइन प्रशिक्षित किया जा सकता है। इसकी मुख्य कमजोरी यह है कि प्रदर्शन विशेषज्ञ अवस्था वितरण d_{\pi^*}(s) से आते हैं जबकि परिनियोजन d_{\pi_\theta}(s) उत्पन्न करता है। छोटी-छोटी गलतियाँ अगले अवलोकन को बदल देती हैं और इनका प्रभाव बढ़ता जाता है। सरलीकृत विश्लेषणों में, एक चरण की त्रुटि \epsilon एक अनुक्रमिक अवधि T में बढ़कर O(T^2\epsilon) के क्रम तक पहुँच सकती है; सटीक सीमा मान्यताओं पर निर्भर करती है, लेकिन कारण बिंदु स्थिर रहता है: एक नीति अपने भविष्य के इनपुट स्वयं बनाती है।
DAgger: लेबल को एकत्रित करें जहाँ लर्नर जाता है
डेटासेट एग्रीगेशन नियंत्रित परिस्थितियों में सीखी गई नीति को चलाता है, वास्तव में देखी गई स्थिति s पर वांछित विशेषज्ञ क्रिया a^* का अनुरोध करता है, जोड़ी को D में जोड़ता है, और पुनः प्रशिक्षण देता है। पुनरावृति के दौरान नीति मिश्रणों का उपयोग किया जा सकता है। यह विधि प्रशिक्षण वितरण को परिनियोजन वितरण की ओर ले जाती है।
DAgger किसी रोबोट को सार्वजनिक रूप से विफल होने देने की पूर्ण अनुमति नहीं देता है। सिमुलेशन, कम गति, भौतिक सुरक्षा, रिमोट ई-स्टॉप, तत्काल विशेषज्ञ नियंत्रण और एक क्रिया सुरक्षा फ़िल्टर से शुरुआत करें। लेबल वे क्रियाएँ हो सकती हैं जो विशेषज्ञ ने भौतिक रूप से की हों या “यहाँ क्या होना चाहिए था?” के काल्पनिक उत्तर बाद वाला तरीका उपयोगी हो सकता है, लेकिन इससे विशेषज्ञ कार्यभार, विलंब और व्यक्तिपरक भिन्नता बढ़ जाती है। योजना संग्रह केवल पंक्ति गणना के आधार पर नहीं, बल्कि अनदेखे विफलता मोड के आधार पर करें।
वास्तविक जीवन: क्रिया की नकल करने के बजाय उद्देश्य का अनुमान लगाएं
वास्तविक जीवन में विशेषज्ञ नीति \pi_E से इनाम r_\theta(s,a) या r_\theta(s,a,s') का अनुमान लगाया जाता है। अधिकतम-एंट्रोपी की मूल धारणा यह है कि विशेषज्ञ प्रक्षेप पथ समान रूप से अच्छे प्रक्षेप पथों के बीच अनावश्यक रूप से नियतात्मक हुए बिना उच्च इनाम को प्राथमिकता देते हैं। अवधारणात्मक रूप से, प्रक्षेप पथ \tau की प्रायिकता है
विशेषज्ञ प्रक्षेप पथ की संभावना बढ़ाने के लिए \theta को अपडेट करने से एक ऐसा इनाम प्राप्त होता है जिसे RL या इष्टतम नियंत्रण के साथ जोड़ा जा सकता है। यह प्रत्यक्ष BC की तुलना में नई प्रारंभिक स्थितियों या बाधाओं के लिए बेहतर अनुकूल हो सकता है, क्योंकि उद्देश्य को पुनः अनुकूलित किया जा सकता है।
लेकिन कई इनाम एक ही प्रदर्शन की व्याख्या कर सकते हैं; अनदेखी बाधाएं और संचालक की आदतें भी हो सकती हैं। एक सीखे हुए इनाम में समाहित हो जाना। प्रशिक्षण प्रक्षेप पथों की व्याख्या करने वाला इनाम खतरनाक रूप से सामान्यीकृत हो सकता है। इसके बजाय, GAIL-शैली की विधियाँ एक विभेदक के माध्यम से विशेषज्ञ और शिक्षार्थी अधिभोग वितरण का मिलान करती हैं। कोई भी सूत्र केवल अनुमान के आधार पर किसी निषेध—टकराव, दबाव बल, मानव बहिष्करण क्षेत्र—को सीखने को उचित नहीं ठहराता। स्पष्ट सुरक्षा नियम स्पष्ट ही रहते हैं।
VLA से संबंध
एक विज़न-लैंग्वेज-एक्शन मॉडल छवियों, भाषा और रोबोट की स्थिति के आधार पर अगली क्रिया या क्रिया खंड को नियंत्रित करता है। व्यापक अर्थ में, यह बड़े पैमाने पर सशर्त अनुकरण है। वस्तुओं और भाषा की इसकी सीमा नए प्रकाश, घर्षण, कैमरा प्लेसमेंट, अस्पष्ट निर्देशों या संपर्क-बल सीमाओं के लिए एक्सट्रपलेशन की गारंटी नहीं देती है। "कप को शेल्फ पर रखें" की व्याख्या करने वाला VLA स्वयं बल, टकराव दूरी, संयुक्त सीमा या रुकने की दूरी को प्रमाणित नहीं करता है; VLA प्राइमर देखें।
किसी क्रिया के एक्चुएटर तक पहुँचने से पहले समन्वय फ्रेम, इकाइयों, वेग, त्वरण और नवीनता को मान्य करें। इसे इसके माध्यम से रूट करें। काइनेमेटिक्स, टकराव जाँच, और एक प्रतिबाधा या स्थिति/वेग नियंत्रक। अस्पष्ट भाषा होने पर स्पष्टीकरण, अस्वीकृति, या कम गति मोड सक्रिय होना चाहिए; क्षीण धारणा होने पर निष्पादन रुक जाना चाहिए। डेटा स्केल भौतिक सुरक्षा सीमा का विकल्प नहीं है।
मूल्यांकन, सुरक्षा और स्रोत
केवल ऑफ़लाइन क्रिया त्रुटि के आधार पर नीति को स्वीकृत न करें। प्रारंभिक स्थिति, वस्तुओं, प्रकाश व्यवस्था, पृष्ठभूमि, घर्षण, विलंबता, निर्देश शब्दावली और व्यवधान पर होल्ड-आउट मूल्यांकन करें। सफलता, टकराव, अवरोध, हस्तक्षेप संख्या, अधिकतम बल, पूर्णता समय और सबसे खराब देखे गए मामलों की रिपोर्ट करें। उच्च औसत सफलता दुर्लभ मानवीय या उपकरण जोखिम को अवशोषित नहीं करती है। प्रत्येक DAgger पुनरावृति, स्रोत प्रदर्शन, लेबलर, विभाजन, मॉडल, सीमाएँ, विफलताएँ और रोलबैक पथ को ट्रैक करें।
| परत | सत्यापित करें | विफलता पर प्रतिक्रिया |
|---|---|---|
| डेटा | सहमति, लाइसेंस, समय, फ्रेम, सफलता/विफलता स्रोत | संगरोध, पुनः लेबल करें, उपयोग रोकें |
| नीति | होल्ड-आउट स्थितियाँ, बदलाव, क्रिया अनिश्चितता | धीमा, विशेषज्ञ से पूछताछ करें, पुनः याद करें |
| सक्रियण | सीमाएँ, दर, टक्कर, बल, संचार | सुरक्षा फ़िल्टर, स्टॉप, ई-स्टॉप |
| संचालन | पर्यवेक्षक, पुनर्प्राप्ति, लॉग, परिवर्तन नियंत्रण | रोलबैक और मूल कारण समीक्षा |
क्या अनुकरण प्रदर्शक के कारणों को पुनः प्राप्त करता है?
व्यवहार का पुनरुत्पादन और पुरस्कार का अनुमान लगाना अलग-अलग कार्य हैं। एक ही व्यवहार को कई पुरस्कार समझा सकते हैं, इसलिए वास्तविक जीवन की मान्यताओं की जाँच करें।
टिप्पणियाँ
पहले लॉग इन करें।
अभी कोई डेटा नहीं है।