Contents — find the section you need
रीइन्फोर्समेंट लर्निंग (RL) एक ऐसी विधि है जिससे रोबोट अपने परिवेश के साथ परस्पर क्रिया करके यह सीखता है कि कौन सी क्रिया लंबे समय में लाभप्रद होती है। इमेज क्लासिफिकेशन के विपरीत, जहाँ इनपुट और लेबल एक साथ आते हैं, रोबोट परिवेश का अवलोकन करता है, मोटर को गति देता है और इनाम प्राप्त करता है—अक्सर कुछ सेकंड बाद। मूल चक्र है प्रयास करना, परिणाम का अवलोकन करना और नीति को अद्यतन करना।
30-सेकंड का सारांश
-
सबसे छोटा RL संक्रमण, समय t पर, स्थिति (या अवलोकन) s_t, क्रिया a_t, इनाम r_{t+1} और अगली स्थिति s_{t+1} है।
-
एक मार्कोव निर्णय प्रक्रिया (MDP) यह मॉडल करती है कि वर्तमान स्थिति और क्रिया अगली स्थिति और इनाम कैसे उत्पन्न करती हैं। भविष्यवाणी के लिए स्थिति को इतिहास का पर्याप्त सारांश प्रस्तुत करना आवश्यक है।
-
एक नीति \pi(a\mid s) क्रियाओं का चयन करती है; एक मूल्य फ़ंक्शन V^\pi(s) उस नीति का पालन करने पर अपेक्षित भविष्य का प्रतिफल है।
यह प्रतिफल \gamma के साथ भविष्य के पुरस्कारों को कम करता है। बहुत लंबी समयावधि सीखने की प्रक्रिया को अस्थिर कर सकती है, जबकि बहुत छोटी समयावधि एक अदूरदर्शी और असुरक्षित रोबोट को जन्म देती है।
अन्वेषण अनिश्चित क्रियाओं को आजमाता है; दोहन वर्तमान में सर्वोत्तम मानी जाने वाली क्रिया का चयन करता है। हार्डवेयर पर, सुरक्षा संबंधी प्रतिबंध इन दोनों से ऊपर होते हैं।
1. रोबोट को एक एजेंट के रूप में देखें
चित्र 1 — एजेंट द्वारा क्रिया करने के बाद, वातावरण बदलता है और अगला अवलोकन और इनाम लौटाता है। एक वास्तविक रोबोट इस लूप में संचार विलंब, सेंसर शोर और एक्चुएटर संतृप्ति को जोड़ता है।
डिफरेंशियल-ड्राइव रोबोट के लिए, एजेंट कैमरा, लिडार और एनकोडर डेटा को अपनी स्थिति के रूप में उपयोग कर सकता है और क्रियाओं के रूप में बाएं और दाएं पहियों की गति को आउटपुट कर सकता है। वातावरण में वाहन की गतिशीलता, फर्श का घर्षण, बाधाएं और बैटरी की स्थिति शामिल हैं। लक्ष्य की ओर बढ़ने पर सकारात्मक इनाम मिल सकता है, जबकि टक्कर या अचानक स्टीयरिंग परिवर्तन पर दंड दिया जा सकता है। एक एकल "लक्ष्य पर +1" संकेत आमतौर पर बहुत विरल होता है; दूरी, वेग, स्टॉपिंग मार्जिन और ऊर्जा को एक साथ ध्यान में रखना आवश्यक है।
2. एमडीपी: समस्या को घटकों में विभाजित करें
एक एमडीपी को स्टेट स्पेस \mathcal{S}, एक्शन स्पेस \mathcal{A}, ट्रांज़िशन प्रोबेबिलिटी P(s'\mid s,a), रिवार्ड फंक्शन R(s,a,s') और डिस्काउंट फैक्टर \gamma द्वारा परिभाषित किया जाता है:
जब एजेंट स्टेट s_t में एक्शन a_t चुनता है, तो वातावरण P के अनुसार अगले स्टेट s_{t+1} में ट्रांज़िशन करता है और रिवार्ड r_{t+1}=R(s_t,a_t,s_{t+1}) लौटाता है।
“मार्कोव” का अर्थ है कि, एक बार वर्तमान स्थिति ज्ञात हो जाने पर, अतीत भविष्य की भविष्यवाणी करने के लिए आवश्यक जानकारी नहीं जोड़ता है। एक मोबाइल रोबोट जिसकी स्थिति में केवल स्थिति डेटा होता है, वह रुके हुए रोबोट और उसी स्थिति से गुजरते हुए चल रहे रोबोट के बीच अंतर नहीं कर सकता। वेग, कोणीय दर और सेंसर कॉन्फिडेंस को शामिल करें, या इतिहास को बनाए रखने वाले एक आवर्ती मॉडल का उपयोग करें।
जब संपूर्ण स्थिति s_t को सीधे तौर पर नहीं देखा जा सकता, तो समस्या आंशिक रूप से अवलोकन योग्य MDP (POMDP) होती है। लगभग हर वास्तविक रोबोट POMDP होता है, क्योंकि उसमें रुकावटें और LiDAR रिटर्न की कमी होती है। एक स्टेट एस्टीमेटर—एक EKF, फैक्टर ग्राफ, या लर्नड मॉडल—अवलोकनों o_t को एक उपयोगी आंतरिक स्थिति में बदल देता है। सेंसर-फ्यूजन लेख इस सीमा को स्पष्ट करता है, और ROS 2 प्राइमर दिखाता है कि इसे पुनरुत्पादित करने योग्य सॉफ़्टवेयर घटक कैसे बनाया जाए।
3. मान फलन और प्रतिफल
समय t से प्राप्त पुरस्कारों का रियायती योगफल G_t प्रतिफल है:
नीति \pi के अंतर्गत अवस्था s का मान है:
और अवस्था-क्रिया मान प्रथम क्रिया को भी निर्दिष्ट करता है:
सबसे बड़े Q मान का चयन करना एक मान-आधारित डिज़ाइन है। किसी न्यूरल नीति \pi_\theta(a\mid s) के मापदंडों \theta को सीधे अद्यतन करना नीति-आधारित है। निरंतर स्टीयरिंग कोण और संयुक्त टॉर्क अक्सर नीति-ग्रेडिएंट या एक्टर-क्रिटिक विधियों के पक्ष में होते हैं, क्योंकि प्रत्येक संभावित क्रिया की गणना करना असंभव है।
4. बेलमैन समीकरण एक लंबी अवधि को एक चरण में विभाजित करता है
पूरे भविष्य का एक साथ मूल्यांकन करने के बजाय, इसे तात्कालिक पुरस्कार और एक चरण बाद के मूल्य में विभाजित करें। बेलमैन प्रत्याशा समीकरण है:
इष्टतम मान V^*(s) बेलमैन इष्टतमता समीकरण का पालन करता है:
यही कारण है कि मूल्य लक्ष्य मानव द्वारा दिए गए लेबल के बजाय अन्य अनुमानों से उत्पन्न किया जा सकता है। स्व-संदर्भ भी अस्थिरता का एक स्रोत है। लक्ष्य नेटवर्क, अनुभव पुनर्प्रस्तुति और पुरस्कार सामान्यीकरण पुराने अनुमानों को वर्तमान अद्यतन से अलग करते हैं और हानिकारक सहसंबंधों को कम करते हैं।
5. अन्वेषण और दोहन में संतुलन
हमेशा वर्तमान उच्चतम अनुमान वाली क्रिया का चयन करने से एजेंट एक भाग्यशाली स्थानीय समाधान में फंस सकता है। अन्वेषण अज्ञात क्रियाओं को आजमाता है, लेकिन वास्तविक मशीन पर यादृच्छिक गति टकराव का कारण बन सकती है। सामान्य विकल्प हैं:
| विधि | अंतर्ज्ञान | क्षमता | हार्डवेयर संबंधी चिंता |
|---|---|---|---|
| ε-ग्रीडी | ε प्रायिकता के साथ यादृच्छिक रूप से चुनें | सरल | निरंतर टॉर्क के लिए अचानक परिवर्तन असुरक्षित हैं |
| बोल्ट्ज़मैन/सॉफ्टमैक्स | मान के अनुपात में नमूना लें | आशाजनक विकल्पों को प्राथमिकता देता है | तापमान को समायोजित करने की आवश्यकता है |
| यूसीबी | उच्च अनिश्चितता वाली क्रियाओं को आजमाएं | स्पष्ट अन्वेषण तर्क | अनिश्चितता अनुमानों की आवश्यकता है |
| शोर वाली नीति | क्रियाओं या भारों में निरंतर शोर जोड़ें | सुगम अन्वेषण | अभी भी संतृप्ति और सीमाओं की आवश्यकता है |
हार्डवेयर पर, अन्वेषण को एक मान्य ऑपरेटिंग एनवेलप तक सीमित रखें। गति सीमा, संयुक्त सॉफ्ट सीमा, बल/धारा सीमा, एक वॉचडॉग और एक आपातकालीन स्टॉप को लर्नर के बाहर रखें ताकि प्रत्येक नीति आउटपुट को इंटरसेप्ट किया जा सके। सिम्युलेटर में यादृच्छिकीकरण उपयोगी है; यह मशीन पर यादृच्छिक कमांड लागू करने की अनुमति नहीं देता है।
6. एक छोटे ग्रिड वर्ल्ड में विचार की जाँच करें
एक 5×5 ग्रिड सीखने की गतिशीलता को दृश्यमान बनाता है। एक सेल को अवस्था मानिए, ऊपर/नीचे/बाएँ/दाएँ को क्रियाएँ, लक्ष्य पुरस्कार को +1, दीवार को −0.1 और प्रत्येक चरण को −0.01 मानिए। Q को शून्य से आरंभ कीजिए और अस्थायी-अंतर अद्यतन को दोहराइए:
कोष्ठक में दिया गया पद TD त्रुटि है: पूर्वानुमान और एक-चरण लक्ष्य के बीच का अंतर। यदि \alpha बहुत अधिक है, तो नए अनुभव हावी हो जाते हैं; यदि यह बहुत कम है, तो नीति बदलते परिवेश का अनुसरण नहीं कर सकती। सफलता दर, औसत चरण, टकराव दर और अविभाजित अवस्थाओं के अंश को लॉग करें—केवल एक पुरस्कार वक्र को नहीं।
7. पुरस्कार को एक विनिर्देश की तरह लिखें
पुरस्कार डिज़ाइन अक्सर एल्गोरिथम संबंधी विवरण से अधिक महत्वपूर्ण होता है। एक डिलीवरी रोबोट इसका उपयोग कर सकता है
प्रगति, टकराव, इनपुट ऊर्जा और सुगमता को संयोजित करने के लिए। भार w बढ़ाने से हमेशा व्यवहार में सुधार नहीं होता है। यदि टक्कर दंड हावी हो जाता है, तो रोबोट सुरक्षित लेकिन निरर्थक नीति सीख सकता है जिसके तहत वह कभी हिलता ही नहीं है। प्रत्येक चरण को अलग-अलग लॉग करें और ऑडिट करें कि नीति वास्तव में किस चरण को अनुकूलित कर रही है।
इनाम हैकिंग एक अन्य विफलता का कारण है: लक्ष्य डिटेक्टर में बग, सेंसर का ब्लाइंड स्पॉट, या केवल सिम्युलेटर-आधारित संपर्क नियम इच्छित कार्य को पूरा किए बिना उच्च स्कोर उत्पन्न कर सकते हैं। मानव-पठनीय लक्ष्य, भौतिकी-आधारित बाधाएं और एक स्वतंत्र मूल्यांकन वातावरण इन शॉर्टकट को आसानी से पहचानने में सहायक होते हैं।
8. जहां अनुसंधान उत्पाद से मिलता है
मूल्य विधियां डेटा-कुशल होती हैं लेकिन अक्सर असतत अवस्थाओं और क्रियाओं को मानती हैं। पॉलिसी ग्रेडिएंट्स और एक्टर-क्रिटिक विधियां निरंतर नियंत्रण को संभालती हैं; SAC एक एन्ट्रॉपी उद्देश्य जोड़ता है, जबकि मॉडल-आधारित RL रोबोट को चलाने से पहले एक सीखे हुए या विश्लेषणात्मक गतिशीलता मॉडल के साथ योजना बनाता है। मॉडल-आधारित विधियां वास्तविक दुनिया के नमूनों को कम कर सकती हैं, लेकिन उन्हें मॉडल त्रुटि को सहन करना होगा।
उत्पादन में, RL को सुरक्षा निगरानी से लेकर मोटर करंट तक हर स्तर पर लागू करना आवश्यक नहीं है। एक क्लासिकल पीआईडी या एमपीसी सुरक्षा सीमा प्रदान कर सकता है, जबकि आरएल ग्रैस्प कॉन्टैक्ट, रूट प्रेफरेंस या गेन शेड्यूल का चयन करता है। वीएलए ओवरव्यू एक समान सीमा का वर्णन करता है: एक विज़न-लैंग्वेज मॉडल एक्शन चंक्स प्रस्तावित कर सकता है, जबकि एक सत्यापित लो-लेवल कंट्रोलर टॉर्क और गति को सीमित करता है।
9. हार्डवेयर पर जाने से पहले
-
क्या स्टेट में वेलोसिटी, डिले और सेंसर कॉन्फिडेंस शामिल हैं, या मार्कोव एजम्पशन को चुपचाप तोड़ दिया गया है?
-
क्या रिवार्ड टर्म्स को अलग से लॉग किया जाता है, जिसमें सफलता दर के अलावा कोलिजन रेट, एनर्जी, इनपुट स्मूथनेस और स्टॉपिंग डिस्टेंस शामिल हैं?
-
क्या एक्शन रेंज, रेट लिमिट, वॉचडॉग और इमरजेंसी स्टॉप लर्नर से स्वतंत्र हैं?
-
क्या सिमुलेशन में फ्रिक्शन, मास, सेंसर डिले, लाइटिंग और पैकेट लॉस को रैंडमाइज्ड किया गया था, और क्या डिस्ट्रीब्यूशन गैप को वास्तविक लॉग पर मापा गया था?
-
क्या एक अनदेखे मूल्यांकन सेट को ट्रेनिंग डेटा से अलग रखा गया है? क्या विफलताओं को फ़िल्टर करने के बजाय शामिल किया गया है?
-
क्या किसी प्रक्रिया को पुनः आरंभ करने से वह सुरक्षित स्थिति में प्रवेश कर जाती है और किसी पुराने कमांड को दोहराने से बच जाती है?
सारांश
रीइन्फोर्समेंट लर्निंग किसी रोबोट को "सही गति" याद करने के लिए बाध्य नहीं करती है। यह एक मल्टी-डिसिप्लिनरी पैटर्न (एमडीपी) के रूप में अवस्थाओं, क्रियाओं, संक्रमणों और पुरस्कारों को परिभाषित करती है, फिर बेलमैन समीकरणों के साथ एक-एक चरण करके दीर्घकालिक मूल्य का अनुमान लगाती है। किसी सीखी गई नीति को सिमुलेशन से बाहर निकलने से पहले सिस्टम डिज़ाइन में अन्वेषण, रिवार्ड हैकिंग और हार्डवेयर सुरक्षा को शामिल करना आवश्यक है। इस श्रृंखला के अगले लेख क्यू-लर्निंग/डीक्यूएन, पॉलिसी ग्रेडिएंट्स, पीपीओ और एसएसी, इमिटेशन लर्निंग और सिम-टू-रियल की तुलना एक ही ढांचे के अंतर्गत करेंगे।
क्या उच्चतम तात्कालिक पुरस्कार वाली क्रिया हमेशा सर्वोत्तम होती है?
भविष्य के पुरस्कार और संक्रमण उत्तर को बदल सकते हैं।
तत्काल मिलने वाले लाभ और विलंबित प्रतिफल में अंतर स्पष्ट करें। ## संदर्भ - [रिचर्ड एस. सटन और एंड्रयू जी. बार्टो, रीइन्फोर्समेंट लर्निंग: एक परिचय (द्वितीय संस्करण)](http://incompleteideas.net/book/the-book-2nd.html) - [ओपनएआई स्पिनिंग अप - आरएल में प्रमुख अवधारणाएँ](https://spinningup.openai.com/en/latest/spinningup/rl_intro.html) - [डेविड सिल्वर, रीइन्फोर्समेंट लर्निंग पाठ्यक्रम](https://www.davidsilver.uk/teaching/) - [आरओएस 2 आधिकारिक दस्तावेज़ीकरण](https://docs.ros.org/en/rolling/) - [रोबोटिक्स: विज्ञान और प्रणालियाँ - सार्वजनिक शोध पत्र](https://roboticsconference.org/)
टिप्पणियाँ
पहले लॉग इन करें।
अभी कोई डेटा नहीं है।