Contents — find the section you need

रीइन्फोर्समेंट लर्निंग (RL) एक ऐसी विधि है जिससे रोबोट अपने परिवेश के साथ परस्पर क्रिया करके यह सीखता है कि कौन सी क्रिया लंबे समय में लाभप्रद होती है। इमेज क्लासिफिकेशन के विपरीत, जहाँ इनपुट और लेबल एक साथ आते हैं, रोबोट परिवेश का अवलोकन करता है, मोटर को गति देता है और इनाम प्राप्त करता है—अक्सर कुछ सेकंड बाद। मूल चक्र है प्रयास करना, परिणाम का अवलोकन करना और नीति को अद्यतन करना।

30-सेकंड का सारांश

  • सबसे छोटा RL संक्रमण, समय t पर, स्थिति (या अवलोकन) s_t, क्रिया a_t, इनाम r_{t+1} और अगली स्थिति s_{t+1} है।

  • एक मार्कोव निर्णय प्रक्रिया (MDP) यह मॉडल करती है कि वर्तमान स्थिति और क्रिया अगली स्थिति और इनाम कैसे उत्पन्न करती हैं। भविष्यवाणी के लिए स्थिति को इतिहास का पर्याप्त सारांश प्रस्तुत करना आवश्यक है।

  • एक नीति \pi(a\mid s) क्रियाओं का चयन करती है; एक मूल्य फ़ंक्शन V^\pi(s) उस नीति का पालन करने पर अपेक्षित भविष्य का प्रतिफल है।

यह प्रतिफल \gamma के साथ भविष्य के पुरस्कारों को कम करता है। बहुत लंबी समयावधि सीखने की प्रक्रिया को अस्थिर कर सकती है, जबकि बहुत छोटी समयावधि एक अदूरदर्शी और असुरक्षित रोबोट को जन्म देती है।

अन्वेषण अनिश्चित क्रियाओं को आजमाता है; दोहन वर्तमान में सर्वोत्तम मानी जाने वाली क्रिया का चयन करता है। हार्डवेयर पर, सुरक्षा संबंधी प्रतिबंध इन दोनों से ऊपर होते हैं।

1. रोबोट को एक एजेंट के रूप में देखें

Diagram 1 · Use the button to switch views
Observation, action, and reward loop in reinforcement learning An agent selects an action from an observation and the environment returns the next observation and a reward Agentcomputes π(a|s) Environmentphysics, simulator, or people action aₜ observation oₜ₊₁ and reward rₜ₊₁ state sₜ is an internal summary of the observation history

चित्र 1 — एजेंट द्वारा क्रिया करने के बाद, वातावरण बदलता है और अगला अवलोकन और इनाम लौटाता है। एक वास्तविक रोबोट इस लूप में संचार विलंब, सेंसर शोर और एक्चुएटर संतृप्ति को जोड़ता है।

डिफरेंशियल-ड्राइव रोबोट के लिए, एजेंट कैमरा, लिडार और एनकोडर डेटा को अपनी स्थिति के रूप में उपयोग कर सकता है और क्रियाओं के रूप में बाएं और दाएं पहियों की गति को आउटपुट कर सकता है। वातावरण में वाहन की गतिशीलता, फर्श का घर्षण, बाधाएं और बैटरी की स्थिति शामिल हैं। लक्ष्य की ओर बढ़ने पर सकारात्मक इनाम मिल सकता है, जबकि टक्कर या अचानक स्टीयरिंग परिवर्तन पर दंड दिया जा सकता है। एक एकल "लक्ष्य पर +1" संकेत आमतौर पर बहुत विरल होता है; दूरी, वेग, स्टॉपिंग मार्जिन और ऊर्जा को एक साथ ध्यान में रखना आवश्यक है।

2. एमडीपी: समस्या को घटकों में विभाजित करें

एक एमडीपी को स्टेट स्पेस \mathcal{S}, एक्शन स्पेस \mathcal{A}, ट्रांज़िशन प्रोबेबिलिटी P(s'\mid s,a), रिवार्ड फंक्शन R(s,a,s') और डिस्काउंट फैक्टर \gamma द्वारा परिभाषित किया जाता है:

\mathcal{M}=(\mathcal{S},\mathcal{A},P,R,\gamma),\qquad 0\le\gamma<1

जब एजेंट स्टेट s_t में एक्शन a_t चुनता है, तो वातावरण P के अनुसार अगले स्टेट s_{t+1} में ट्रांज़िशन करता है और रिवार्ड r_{t+1}=R(s_t,a_t,s_{t+1}) लौटाता है।

“मार्कोव” का अर्थ है कि, एक बार वर्तमान स्थिति ज्ञात हो जाने पर, अतीत भविष्य की भविष्यवाणी करने के लिए आवश्यक जानकारी नहीं जोड़ता है। एक मोबाइल रोबोट जिसकी स्थिति में केवल स्थिति डेटा होता है, वह रुके हुए रोबोट और उसी स्थिति से गुजरते हुए चल रहे रोबोट के बीच अंतर नहीं कर सकता। वेग, कोणीय दर और सेंसर कॉन्फिडेंस को शामिल करें, या इतिहास को बनाए रखने वाले एक आवर्ती मॉडल का उपयोग करें।

जब संपूर्ण स्थिति s_t को सीधे तौर पर नहीं देखा जा सकता, तो समस्या आंशिक रूप से अवलोकन योग्य MDP (POMDP) होती है। लगभग हर वास्तविक रोबोट POMDP होता है, क्योंकि उसमें रुकावटें और LiDAR रिटर्न की कमी होती है। एक स्टेट एस्टीमेटर—एक EKF, फैक्टर ग्राफ, या लर्नड मॉडल—अवलोकनों o_t को एक उपयोगी आंतरिक स्थिति में बदल देता है। सेंसर-फ्यूजन लेख इस सीमा को स्पष्ट करता है, और ROS 2 प्राइमर दिखाता है कि इसे पुनरुत्पादित करने योग्य सॉफ़्टवेयर घटक कैसे बनाया जाए।

3. मान फलन और प्रतिफल

समय t से प्राप्त पुरस्कारों का रियायती योगफल G_t प्रतिफल है:

G_t=r_{t+1}+\gamma r_{t+2}+\gamma^2r_{t+3}+\cdots

नीति \pi के अंतर्गत अवस्था s का मान है:

V^\pi(s)=\mathbb{E}_\pi[G_t\mid s_t=s]

और अवस्था-क्रिया मान प्रथम क्रिया को भी निर्दिष्ट करता है:

Q^\pi(s,a)=\mathbb{E}_\pi[G_t\mid s_t=s,a_t=a]

सबसे बड़े Q मान का चयन करना एक मान-आधारित डिज़ाइन है। किसी न्यूरल नीति \pi_\theta(a\mid s) के मापदंडों \theta को सीधे अद्यतन करना नीति-आधारित है। निरंतर स्टीयरिंग कोण और संयुक्त टॉर्क अक्सर नीति-ग्रेडिएंट या एक्टर-क्रिटिक विधियों के पक्ष में होते हैं, क्योंकि प्रत्येक संभावित क्रिया की गणना करना असंभव है।

4. बेलमैन समीकरण एक लंबी अवधि को एक चरण में विभाजित करता है

पूरे भविष्य का एक साथ मूल्यांकन करने के बजाय, इसे तात्कालिक पुरस्कार और एक चरण बाद के मूल्य में विभाजित करें। बेलमैन प्रत्याशा समीकरण है:

V^\pi(s)=\sum_a\pi(a\mid s)\sum_{s'}P(s'\mid s,a)\left[R(s,a,s')+\gamma V^\pi(s')\right]

इष्टतम मान V^*(s) बेलमैन इष्टतमता समीकरण का पालन करता है:

V^*(s)=\max_a\sum_{s'}P(s'\mid s,a)\left[R(s,a,s')+\gamma V^*(s')\right]

यही कारण है कि मूल्य लक्ष्य मानव द्वारा दिए गए लेबल के बजाय अन्य अनुमानों से उत्पन्न किया जा सकता है। स्व-संदर्भ भी अस्थिरता का एक स्रोत है। लक्ष्य नेटवर्क, अनुभव पुनर्प्रस्तुति और पुरस्कार सामान्यीकरण पुराने अनुमानों को वर्तमान अद्यतन से अलग करते हैं और हानिकारक सहसंबंधों को कम करते हैं।

5. अन्वेषण और दोहन में संतुलन

हमेशा वर्तमान उच्चतम अनुमान वाली क्रिया का चयन करने से एजेंट एक भाग्यशाली स्थानीय समाधान में फंस सकता है। अन्वेषण अज्ञात क्रियाओं को आजमाता है, लेकिन वास्तविक मशीन पर यादृच्छिक गति टकराव का कारण बन सकती है। सामान्य विकल्प हैं:

विधि अंतर्ज्ञान क्षमता हार्डवेयर संबंधी चिंता
ε-ग्रीडी ε प्रायिकता के साथ यादृच्छिक रूप से चुनें सरल निरंतर टॉर्क के लिए अचानक परिवर्तन असुरक्षित हैं
बोल्ट्ज़मैन/सॉफ्टमैक्स मान के अनुपात में नमूना लें आशाजनक विकल्पों को प्राथमिकता देता है तापमान को समायोजित करने की आवश्यकता है
यूसीबी उच्च अनिश्चितता वाली क्रियाओं को आजमाएं स्पष्ट अन्वेषण तर्क अनिश्चितता अनुमानों की आवश्यकता है
शोर वाली नीति क्रियाओं या भारों में निरंतर शोर जोड़ें सुगम अन्वेषण अभी भी संतृप्ति और सीमाओं की आवश्यकता है

हार्डवेयर पर, अन्वेषण को एक मान्य ऑपरेटिंग एनवेलप तक सीमित रखें। गति सीमा, संयुक्त सॉफ्ट सीमा, बल/धारा सीमा, एक वॉचडॉग और एक आपातकालीन स्टॉप को लर्नर के बाहर रखें ताकि प्रत्येक नीति आउटपुट को इंटरसेप्ट किया जा सके। सिम्युलेटर में यादृच्छिकीकरण उपयोगी है; यह मशीन पर यादृच्छिक कमांड लागू करने की अनुमति नहीं देता है।

6. एक छोटे ग्रिड वर्ल्ड में विचार की जाँच करें

एक 5×5 ग्रिड सीखने की गतिशीलता को दृश्यमान बनाता है। एक सेल को अवस्था मानिए, ऊपर/नीचे/बाएँ/दाएँ को क्रियाएँ, लक्ष्य पुरस्कार को +1, दीवार को −0.1 और प्रत्येक चरण को −0.01 मानिए। Q को शून्य से आरंभ कीजिए और अस्थायी-अंतर अद्यतन को दोहराइए:

Q(s_t,a_t)\leftarrow Q(s_t,a_t)+\alpha\left[r_{t+1}+\gamma\max_{a'}Q(s_{t+1},a')-Q(s_t,a_t)\right]

कोष्ठक में दिया गया पद TD त्रुटि है: पूर्वानुमान और एक-चरण लक्ष्य के बीच का अंतर। यदि \alpha बहुत अधिक है, तो नए अनुभव हावी हो जाते हैं; यदि यह बहुत कम है, तो नीति बदलते परिवेश का अनुसरण नहीं कर सकती। सफलता दर, औसत चरण, टकराव दर और अविभाजित अवस्थाओं के अंश को लॉग करें—केवल एक पुरस्कार वक्र को नहीं।

7. पुरस्कार को एक विनिर्देश की तरह लिखें

पुरस्कार डिज़ाइन अक्सर एल्गोरिथम संबंधी विवरण से अधिक महत्वपूर्ण होता है। एक डिलीवरी रोबोट इसका उपयोग कर सकता है

r=w_d\,\Delta d-w_c\,\mathbf{1}_{\mathrm{collision}}-w_u\,|u|^2-w_j\,\|\Delta u\|^2

प्रगति, टकराव, इनपुट ऊर्जा और सुगमता को संयोजित करने के लिए। भार w बढ़ाने से हमेशा व्यवहार में सुधार नहीं होता है। यदि टक्कर दंड हावी हो जाता है, तो रोबोट सुरक्षित लेकिन निरर्थक नीति सीख सकता है जिसके तहत वह कभी हिलता ही नहीं है। प्रत्येक चरण को अलग-अलग लॉग करें और ऑडिट करें कि नीति वास्तव में किस चरण को अनुकूलित कर रही है।

इनाम हैकिंग एक अन्य विफलता का कारण है: लक्ष्य डिटेक्टर में बग, सेंसर का ब्लाइंड स्पॉट, या केवल सिम्युलेटर-आधारित संपर्क नियम इच्छित कार्य को पूरा किए बिना उच्च स्कोर उत्पन्न कर सकते हैं। मानव-पठनीय लक्ष्य, भौतिकी-आधारित बाधाएं और एक स्वतंत्र मूल्यांकन वातावरण इन शॉर्टकट को आसानी से पहचानने में सहायक होते हैं।

8. जहां अनुसंधान उत्पाद से मिलता है

मूल्य विधियां डेटा-कुशल होती हैं लेकिन अक्सर असतत अवस्थाओं और क्रियाओं को मानती हैं। पॉलिसी ग्रेडिएंट्स और एक्टर-क्रिटिक विधियां निरंतर नियंत्रण को संभालती हैं; SAC एक एन्ट्रॉपी उद्देश्य जोड़ता है, जबकि मॉडल-आधारित RL रोबोट को चलाने से पहले एक सीखे हुए या विश्लेषणात्मक गतिशीलता मॉडल के साथ योजना बनाता है। मॉडल-आधारित विधियां वास्तविक दुनिया के नमूनों को कम कर सकती हैं, लेकिन उन्हें मॉडल त्रुटि को सहन करना होगा।

उत्पादन में, RL को सुरक्षा निगरानी से लेकर मोटर करंट तक हर स्तर पर लागू करना आवश्यक नहीं है। एक क्लासिकल पीआईडी या एमपीसी सुरक्षा सीमा प्रदान कर सकता है, जबकि आरएल ग्रैस्प कॉन्टैक्ट, रूट प्रेफरेंस या गेन शेड्यूल का चयन करता है। वीएलए ओवरव्यू एक समान सीमा का वर्णन करता है: एक विज़न-लैंग्वेज मॉडल एक्शन चंक्स प्रस्तावित कर सकता है, जबकि एक सत्यापित लो-लेवल कंट्रोलर टॉर्क और गति को सीमित करता है।

9. हार्डवेयर पर जाने से पहले

  • क्या स्टेट में वेलोसिटी, डिले और सेंसर कॉन्फिडेंस शामिल हैं, या मार्कोव एजम्पशन को चुपचाप तोड़ दिया गया है?

  • क्या रिवार्ड टर्म्स को अलग से लॉग किया जाता है, जिसमें सफलता दर के अलावा कोलिजन रेट, एनर्जी, इनपुट स्मूथनेस और स्टॉपिंग डिस्टेंस शामिल हैं?

  • क्या एक्शन रेंज, रेट लिमिट, वॉचडॉग और इमरजेंसी स्टॉप लर्नर से स्वतंत्र हैं?

  • क्या सिमुलेशन में फ्रिक्शन, मास, सेंसर डिले, लाइटिंग और पैकेट लॉस को रैंडमाइज्ड किया गया था, और क्या डिस्ट्रीब्यूशन गैप को वास्तविक लॉग पर मापा गया था?

  • क्या एक अनदेखे मूल्यांकन सेट को ट्रेनिंग डेटा से अलग रखा गया है? क्या विफलताओं को फ़िल्टर करने के बजाय शामिल किया गया है?

  • क्या किसी प्रक्रिया को पुनः आरंभ करने से वह सुरक्षित स्थिति में प्रवेश कर जाती है और किसी पुराने कमांड को दोहराने से बच जाती है?

सारांश

रीइन्फोर्समेंट लर्निंग किसी रोबोट को "सही गति" याद करने के लिए बाध्य नहीं करती है। यह एक मल्टी-डिसिप्लिनरी पैटर्न (एमडीपी) के रूप में अवस्थाओं, क्रियाओं, संक्रमणों और पुरस्कारों को परिभाषित करती है, फिर बेलमैन समीकरणों के साथ एक-एक चरण करके दीर्घकालिक मूल्य का अनुमान लगाती है। किसी सीखी गई नीति को सिमुलेशन से बाहर निकलने से पहले सिस्टम डिज़ाइन में अन्वेषण, रिवार्ड हैकिंग और हार्डवेयर सुरक्षा को शामिल करना आवश्यक है। इस श्रृंखला के अगले लेख क्यू-लर्निंग/डीक्यूएन, पॉलिसी ग्रेडिएंट्स, पीपीओ और एसएसी, इमिटेशन लर्निंग और सिम-टू-रियल की तुलना एक ही ढांचे के अंतर्गत करेंगे।

अपनी समझ की जाँच करें
क्या उच्चतम तात्कालिक पुरस्कार वाली क्रिया हमेशा सर्वोत्तम होती है?

भविष्य के पुरस्कार और संक्रमण उत्तर को बदल सकते हैं।

तत्काल मिलने वाले लाभ और विलंबित प्रतिफल में अंतर स्पष्ट करें। ## संदर्भ - [रिचर्ड एस. सटन और एंड्रयू जी. बार्टो, रीइन्फोर्समेंट लर्निंग: एक परिचय (द्वितीय संस्करण)](http://incompleteideas.net/book/the-book-2nd.html) - [ओपनएआई स्पिनिंग अप - आरएल में प्रमुख अवधारणाएँ](https://spinningup.openai.com/en/latest/spinningup/rl_intro.html) - [डेविड सिल्वर, रीइन्फोर्समेंट लर्निंग पाठ्यक्रम](https://www.davidsilver.uk/teaching/) - [आरओएस 2 आधिकारिक दस्तावेज़ीकरण](https://docs.ros.org/en/rolling/) - [रोबोटिक्स: विज्ञान और प्रणालियाँ - सार्वजनिक शोध पत्र](https://roboticsconference.org/)

What to read next

Continue the seriesक्यू-लर्निंग और डीक्यूएन — क्यू-टेबल से डीप रीइन्फोर्समेंट लर्निंग तकExplore another aspect of this fieldमल्टी-एजेंट रीइन्फोर्समेंट लर्निंग का परिचय — ऐसी दुनिया में अनुकूलन जहां दूसरा पक्ष भी सीख रहा हैExplore another aspect of this fieldπ0 की व्याख्या — फ्लो मैचिंग ने VLA क्रिया निर्माण को कैसे बदला