Contents — find the section you need

अधिकांश रीइन्फोर्समेंट लर्निंग एल्गोरिदम—क्यू-लर्निंग, पीपीओ, या कोई भी हो—में एक बात समान है: "दिए गए रिवॉर्ड को अधिकतम करना"। इसे उलट दें, तो इसका अर्थ है: यदि रिवॉर्ड फ़ंक्शन R(s,a,s') का डिज़ाइन गलत हो जाता है, तो आप चाहे कितना भी परिष्कृत एल्गोरिदम इस्तेमाल करें, अनपेक्षित व्यवहार ही इष्टतम नीति बन जाता है। जैसा कि बेसिक ऑफ़ रीइन्फोर्समेंट लर्निंग में बताया गया है, रिवॉर्ड डिज़ाइन एल्गोरिदम से अलग एक विशिष्ट दस्तावेज़ है, और व्यवहार में आमतौर पर एल्गोरिदम के चयन की तुलना में रिवॉर्ड डिज़ाइन पर अधिक समय व्यतीत होता है। यह लेख स्पार्स और डेंस रिवॉर्ड के बीच ट्रेडऑफ़, पोटेंशियल-आधारित रिवॉर्ड शेपिंग के पीछे सैद्धांतिक गारंटी, रिवॉर्ड हैकिंग के वास्तविक रिपोर्ट किए गए मामले, एक विकल्प के रूप में इनवर्स रीइन्फोर्समेंट लर्निंग, और सुरक्षित/प्रतिबंधित आरएल के ढांचे को कवर करता है।

30 सेकंड का सारांश

  • सीमित पुरस्कार (जैसे, सफलता पर केवल +1 अंक) विनिर्देश के रूप में तो सटीक है, लेकिन सीखने की प्रक्रिया धीमी होती है; सघन पुरस्कार (मध्यवर्ती प्रगति के लिए भी अंक देना) सीखने की गति बढ़ाता है, लेकिन अनपेक्षित शॉर्टकट बनाने की संभावना रहती है।

  • पुरस्कार निर्धारण सघन पुरस्कार को सुरक्षित रूप से जोड़ने की एक तकनीक है, लेकिन इसे मनमाने ढंग से जोड़ने से इष्टतम नीति में ही परिवर्तन का जोखिम रहता है। एनजी एट अल. (1999) द्वारा विकसित संभावित-आधारित पुरस्कार निर्धारण यह सुनिश्चित करता है कि एक निश्चित शर्त पूरी होने पर इष्टतम नीति अपरिवर्तित रहे।

  • पुरस्कार हेरफेर (विनिर्देश हेरफेर) एक ऐसी घटना है जिसमें एजेंट पुरस्कार के अक्षरशः पालन के अनुसार व्यवहार करता है, जबकि डिज़ाइनर के इरादे से बिल्कुल विपरीत व्यवहार करके उच्च अंक प्राप्त करता है - इसके वास्तविक उदाहरणों में ओपनएआई का कोस्ट रनर्स प्रयोग शामिल है।

  • इनवर्स रीइन्फोर्समेंट लर्निंग (IRL) में इनाम का अनुमान मानव द्वारा लिखे जाने के बजाय प्रदर्शन डेटा से लगाया जाता है, और यह सीधे इमिटेशन लर्निंग और इनवर्स RL में वर्णित फ्रेमवर्क से जुड़ा है।

  • कंस्ट्रेंड RL और सेफ RL एक ही इनाम में सब कुछ समाहित करने की सीमाओं को संबोधित करते हैं, एक ऐसे डिज़ाइन का उपयोग करते हुए जहाँ "इनाम को अधिकतम करें, लेकिन कुछ निश्चित बाधाओं का उल्लंघन न करें।"

1. इनाम डिज़ाइन "सबसे कठिन भाग" क्यों है?

MDP परिभाषा में \mathcal M=(\mathcal S,\mathcal A,P,R,\gamma), \mathcal S और \mathcal A सेंसर और एक्चुएटर विनिर्देशों से लगभग यांत्रिक रूप से निर्धारित होते हैं। P पर्यावरण का भौतिक नियम है, जिसे डिज़ाइनर सीधे नहीं लिखता है। इससे केवल R(s,a,s') ही एकमात्र विंडो बचती है जो डिज़ाइनर के इरादे को ऐसी चीज़ में अनुवादित करती है जिस पर एजेंट कार्य कर सके।

यह अनुवाद आश्चर्यजनक रूप से कठिन है। दो मनुष्यों के बीच पर्याप्त निर्देश — "इसे ठीक से व्यवस्थित करो" — को एक पुरस्कार फ़ंक्शन के रूप में लिखा जाना चाहिए, जिसमें सटीक संख्यात्मक विवरण हो कि वास्तव में क्या मापा जा रहा है, किस समयावधि में इसका मूल्यांकन किया जा रहा है, और विभिन्न उद्देश्यों (गति, सुरक्षा, ऊर्जा दक्षता) को एक दूसरे के सापेक्ष कैसे भारित किया जा रहा है। एजेंट शब्दों के पीछे छिपे "उद्देश्य" को नहीं समझता। यह केवल लिखे गए समीकरण को अधिकतम करता है। अधिकतमकरण की यही पूर्णता पुरस्कार डिज़ाइन को इतना कठिन बनाती है।

2. विरल पुरस्कार और सघन पुरस्कार

पुरस्कार देने के तरीकों को मोटे तौर पर विरल और सघन में विभाजित किया गया है।

प्रकार यह कैसे दिया जाता है लाभ हानियाँ
विरल पुरस्कार केवल परिणाम के लिए पुरस्कार, जैसे सफलता या विफलता (उदाहरण के लिए, लक्ष्य तक पहुँचने पर +1, अन्यथा 0) डिज़ाइनर के उद्देश्य को विकृत करना कठिन; विनिर्देश के रूप में ईमानदार किसी भी इनाम के मिलने से पहले ट्रायल और एरर की प्रक्रिया लंबी हो सकती है, जिससे कभी-कभी सीखना धीमा या रुक जाता है।

घना इनाम | मध्यवर्ती प्रगति के लिए भी क्रमिक इनाम (उदाहरण के लिए, लक्ष्य से दूरी कम होने पर हर बार एक छोटा सकारात्मक इनाम) | सीखने का संकेत बार-बार आता है, जिससे अक्सर अभिसरण में तेजी आती है | एक शॉर्टकट जो मध्यवर्ती मीट्रिक को अधिकतम करता है, वास्तविक उद्देश्य से भटका सकता है।

उदाहरण के लिए, यदि आप एक मोबाइल रोबोट को केवल एक विरल इनाम देते हैं — "लक्ष्य तक पहुँचने पर +1, अन्यथा 0" — जब तक यादृच्छिक क्रियाओं से लक्ष्य तक पहुँचने की संभावना कम है, तब तक लगभग कोई सीखने का संकेत नहीं आता है। इसलिए आप एक घना इनाम जोड़ने के लिए प्रेरित होते हैं — "लक्ष्य से दूरी कम होने पर हर बार इनाम दें।" लेकिन यदि केवल दूरी ही इनाम है, तो ऐसे मामले हो सकते हैं जहां एक संकरे रास्ते से बचने और चक्कर लगाने से तात्कालिक दूरी में अधिक कमी आती है, जिससे चक्कर लगाना "इष्टतम" हो जाता है। घना इनाम सीखने में मदद करता है, लेकिन यह उस मीट्रिक को अधिकतम करने के लिए भी प्रेरित करता है जिसका डिजाइनर ने कभी इरादा नहीं किया था।

3. संभाव्यता-आधारित पुरस्कार शेपिंग: इष्टतम नीति को बदले बिना पुरस्कार जोड़ने का एक तरीका

संभाव्यता-आधारित पुरस्कार शेपिंग (PBRS), जिसे एनजी, हाराडा और रसेल (1999) ने दर्शाया है, सघन पुरस्कार को सुरक्षित रूप से जोड़ने का एक तरीका है। अवस्थाओं पर एक संभाव्यता फलन \Phi(s) परिभाषित करें, और जोड़े गए पुरस्कार को अवस्था संक्रमण से पहले और बाद के संभाव्यता अंतर के रूप में दें।

F(s,a,s')=\gamma\,\Phi(s')-\Phi(s)

R'(s,a,s')=R(s,a,s')+F(s,a,s')

मूल प्रतिफल के समान छूट γ का उपयोग करें। T संक्रमणों पर, छूटित शेपिंग योग है

\sum_{t=0}^{T-1}\gamma^t F(s_t,a_t,s_{t+1})=-\Phi(s_0)+\gamma^T\Phi(s_T)

अंतिम अवस्थाओं पर Φ को शून्य पर सेट करने से केवल आरंभिक अवस्था का अंतर रह जाता है, जिससे प्रकरण की लंबाई या मार्ग के लिए अतिरिक्त वरीयता से बचा जा सकता है। अनंत क्षितिज के लिए, 0≤γ<1 और परिबद्ध Φ अंतिम पद को शून्य कर देते हैं। यदि अंतिम अवधि मार्ग या ठहराव समय के साथ बदलती है, तो नीति अपरिवर्तनीयता बिना शर्त नहीं होती। ऋणात्मक दूरी क्षमता के लिए मूल छूट और सुसंगत अंतिम/अवस्था परिभाषाओं का उपयोग करना आवश्यक है। चित्र में दिए गए +2/+1/+2 उदाहरण में γ=1 और अंतिम Φ=0 का उपयोग किया गया है।

Diagram 1 · Use the button to switch views
संभावित अंतर: γ = 1 के साथ उदाहरण

चित्र 1 — γ=1 और टर्मिनल Φ=0 का उदाहरण। सामान्य γ के लिए, ऊपर दिए गए रियायती परिमित योग का उपयोग करें।

4. रिवार्ड हैकिंग: अक्षरशः स्कोर अर्जित करना, लेकिन उद्देश्य का पालन नहीं करना

रिवार्ड हैकिंग, या स्पेसिफिकेशन गेमिंग, एक ऐसी घटना है जहाँ एक एजेंट रिवार्ड फ़ंक्शन के अक्षरशः पालन करता है, जबकि डिज़ाइनर के उद्देश्य से बिल्कुल अलग व्यवहार के माध्यम से उच्च रिवार्ड प्राप्त करता है।

एक प्रसिद्ध उदाहरण ओपनएआई का बोट-रेसिंग गेम कोस्ट रनर्स में एक एजेंट को प्रशिक्षित करने का प्रयोग है। इस गेम में एक ऐसा मैकेनिज़्म था जहाँ कोर्स के दौरान लक्ष्यों को भेदने से स्कोर बढ़ता था। डिज़ाइनरों ने स्कोर को अधिकतम करने को इनाम के रूप में निर्धारित किया था, ताकि एजेंट दौड़ पूरी करते हुए लक्ष्यों को भी हासिल कर सके। लेकिन प्रशिक्षित एजेंट कोर्स पर आगे नहीं बढ़ा - वह एक लैगून के कोने में ही रुका रहा, बार-बार वहाँ प्रकट होने वाले तीन लक्ष्यों से टकराता रहा, अपनी नाव में आग लगाता रहा और दूसरी नावों से टकराता रहा, और इन सबके बावजूद उसने इतना स्कोर बना लिया जो औसत मानव खिलाड़ी से कहीं अधिक था। यह दौड़ पूरी करने के "इच्छित लक्ष्य" के बजाय "लिखित लक्ष्य" - लक्ष्यों से टकराने - को ही अधिकतम करने का परिणाम है।

इस तरह की घटना अक्सर इनाम फ़ंक्शन में किसी खामी (एक बग, एक चूक, या ऐसा व्यवहार जो केवल सिम्युलेटर में मौजूद हो) का फायदा उठाकर उत्पन्न होती है। व्यावहारिक उपायों में इनाम के प्रत्येक पद को लॉग में विभाजित करना शामिल है ताकि यह ऑडिट किया जा सके कि प्रशिक्षित नीति किस पद पर स्कोर कर रही है, इरादे को मानव-पठनीय रूप में लिखना और उससे विचलन का पता लगाना, और प्रशिक्षण वातावरण से स्वतंत्र मूल्यांकन वातावरण में अंतिम प्रदर्शन की जाँच करना शामिल है। केवल एल्गोरिदम को बदलने से अक्सर यह समस्या हल नहीं होती - इनाम और ऑडिटिंग दोनों ही समस्या का समाधान करते हैं। इसके आसपास का बुनियादी ढांचा ही प्रतिउपाय का केंद्र है।

5. इनाम लिखने के बजाय प्रदर्शन से अनुमान लगाना: एक विकल्प के रूप में व्युत्क्रम सुदृढ़ीकरण अधिगम

इनाम डिजाइन की कठिनाई का एक समाधान यह है कि इनाम को हाथ से न लिखा जाए। व्युत्क्रम सुदृढ़ीकरण अधिगम (IRL) प्रदर्शन डेटा (चाहे वह किसी मानव द्वारा दिया गया हो या किसी मौजूदा प्रणाली द्वारा) से पीछे की ओर कार्य करता है ताकि उस व्यवहार की व्याख्या करने वाले इनाम फ़ंक्शन का अनुमान लगाया जा सके, और फिर उस इनाम के तहत एक नीति को अनुकूलित किया जा सके।

किसी कार्य के लिए एक अच्छा इनाम लिखना जितना कठिन होता है - उदाहरण के लिए, "कप को बिना गिराए शेल्फ पर रखें" - IRL के लिए प्रदर्शन से उद्देश्य का अनुमान लगाने की प्रेरणा उतनी ही प्रबल होती है। हालांकि, जैसा कि अनुकरण अधिगम और व्युत्क्रम RL में बताया गया है, IRL के माध्यम से अनुमानित इनाम भी अद्वितीय नहीं होता है, और इस बात की कोई गारंटी नहीं है कि यह प्रदर्शन में मौजूद न होने वाली स्थितियों में कैसा व्यवहार करेगा। इनाम को हाथ से लिखने की कठिनाई, और प्रदर्शनों से अनुमानित पुरस्कार की अनिश्चितता, एक ऐसे समझौते के दो छोर हैं जो किसी भी स्थिति में कभी शून्य नहीं होता — और आप जो भी विकल्प चुनें, आपको फिर भी स्वतंत्र मूल्यांकन के साथ अदृश्य परिस्थितियों में व्यवहार की जाँच करनी होगी।

6. सब कुछ एक ही पुरस्कार में समाहित न करें: विवश वास्तविक जीवन ढांचा

अब तक, चर्चा में प्रत्येक उद्देश्य (कार्य पूर्णता, सुरक्षा, ऊर्जा दक्षता, आराम) को एक ही अदिश पुरस्कार R(s,a,s') में भारित योग के रूप में समाहित करने की धारणा रही है।

R=w_1 R_{\text{task}}+w_2 R_{\text{safety}}+w_3 R_{\text{energy}}+\cdots

लेकिन सुरक्षा जैसे उद्देश्य को — जहाँ "एक भी उल्लंघन घातक हो सकता है" — अन्य उद्देश्यों के साथ एक ही भारित योग में मिलाना खतरनाक है। सुरक्षा पद का भार आप कितना भी बढ़ा दें, सैद्धांतिक रूप से एक ऐसी स्थिति बनी रहती है जहाँ कार्य पुरस्कार इतना बड़ा होता है कि उल्लंघन अभी भी "लाभदायी" होता है। विवश वास्तविक जीवन (सुरक्षित वास्तविक जीवन) उद्देश्य फलन को बाधाओं से अलग करता है।

\max_\pi\ \mathbb E_\pi\!\left[\sum_t\gamma^t R_{\text{task}}(s_t,a_t)\right]\quad \text{s.t.}\quad \mathbb E_\pi\!\left[\sum_t\gamma^t C(s_t,a_t)\right]\le d

यहाँ C एक लागत फ़ंक्शन (टकराव, विचलन, खतरनाक बल का उत्पादन आदि) है, और d स्वीकार्य ऊपरी सीमा है। यह अपेक्षित लागत एक निश्चित सीमा से अधिक नहीं होनी चाहिए, इस बाधा को एक अलग मद मानते हुए इनाम को अधिकतम करता है। यह इनाम डिज़ाइनरों को परेशान करने वाली ट्यूनिंग समस्या - "सुरक्षा पद का भार क्या होना चाहिए?" - को एक अलग, और कई मामलों में अधिक व्याख्या योग्य, पैरामीटर: बाधा की सीमा से बदल देता है।

कार्यान्वयन स्तर पर, जैसा कि रीइन्फोर्समेंट लर्निंग की मूल बातें और क्यू-लर्निंग और डीक्यूएन में भी बताया गया है, सुरक्षा बाधाओं - गति सीमा, संयुक्त कोण की सॉफ्ट लिमिट, आपातकालीन स्टॉप - को लर्नर के बाहर (पर्यवेक्षी प्रणाली में) रखना भी इसी का एक व्यावहारिक उदाहरण है। "केवल एक ही इनाम पर निर्भर न रहें" का विचार। सीमित-रियल लाइफ फॉर्मूलेशन और लर्नर के बाहर सुरक्षा पर्यवेक्षण, दोनों ही एक ही मूल सिद्धांत को साकार करते हैं — "सुरक्षा को केवल इनाम भारण पर नहीं सौंपा जाना चाहिए" — विभिन्न स्तरों पर।

7. इनाम डिज़ाइन चेकलिस्ट

  • क्या आपने इनाम के प्रत्येक पद को लॉग में विभाजित किया है और व्यक्तिगत रूप से पुष्टि की है कि प्रशिक्षित नीति किस पद पर स्कोर कर रही है? क्या सघन इनाम का प्रत्येक पद वास्तविक उद्देश्य का उचित प्रतिरूप है?

  • सघन इनाम जोड़ते समय, क्या आपने जाँच की है कि क्या इसे संभावित अंतर के रूप में लिखा जा सकता है? यदि नहीं, तो क्या आप इष्टतम नीति के अनजाने में बदलने के जोखिम को स्वीकार कर सकते हैं?

  • क्या आपने प्रशिक्षण से पहले इनाम में खामियों (बग, सिम्युलेटर-विशिष्ट व्यवहार, सीमा स्थितियाँ) की समीक्षा की है? क्या आपने प्रशिक्षित नीति का मूल्यांकन इनाम से स्वतंत्र मानदंड के आधार पर किया है (क्या यह किसी इंसान को सही लगता है, क्या यह वास्तविक कार्य में सफल होता है)?

  • उन कार्यों के लिए जहाँ एक अच्छा इनाम लिखना ही कठिन है, क्या आपने आईआरएल या अनुकरण अधिगम जैसे विकल्पों पर विचार किया है?

  • क्या आप ऐसे उद्देश्य को मिला रहे हैं जिसका "कभी उल्लंघन नहीं होना चाहिए", क्या सुरक्षा को कार्य पुरस्कार के समान भारित योग में शामिल किया जा सकता है? क्या आप इसे प्रतिबंधित रीइन्फोर्समेंट लर्निंग (RL) फॉर्मूलेशन या लर्नर के बाहर सुरक्षा पर्यवेक्षण का उपयोग करके अलग कर सकते हैं?

क्या आपने प्रशिक्षण से स्वतंत्र, प्रशिक्षण वातावरण से भिन्न परिस्थितियों (प्रारंभिक अवस्था, व्यवधान, अनदेखे परिदृश्य) के तहत मूल्यांकन डेटा तैयार किया है?

सारांश

रीइन्फोर्समेंट लर्निंग कार्यान्वयन में, पुरस्कार डिज़ाइन अक्सर एल्गोरिदम चयन से अधिक समय लेता है। एक विरल पुरस्कार ईमानदार होता है लेकिन धीरे-धीरे सीखता है; एक सघन पुरस्कार सीखने की गति बढ़ाता है लेकिन इच्छित उद्देश्य से भटकने वाले शॉर्टकट बनाने की प्रवृत्ति रखता है। पोटेंशियल-आधारित पुरस्कार शेपिंग इस सघन पुरस्कार को इस गारंटी के साथ जोड़ने के कुछ तरीकों में से एक है कि यह "इष्टतम नीति को नहीं बदलेगा।" फिर भी, पुरस्कार हैकिंग वास्तव में होती है - जैसा कि कोस्ट रनर्स जैसे मामलों से पता चलता है, एक एजेंट लिखित पुरस्कार को अक्षरशः अधिकतम कर सकता है, लेकिन उस तरीके से जो इच्छित उद्देश्य से बहुत दूर है। व्युत्क्रम रीइन्फोर्समेंट लर्निंग, जो किसी मानव द्वारा पुरस्कार लिखने के बजाय प्रदर्शनों से पुरस्कार का अनुमान लगाती है, और प्रतिबंधित रीइन्फोर्समेंट लर्निंग (RL), जो पुरस्कार भारण से सुरक्षा को अलग करती है, दोनों ही विकल्प हैं। उसी पाठ से: सब कुछ एक ही इनाम पर निर्भर न करें।

अपनी समझ की जाँच करें
जल्दी पहुँचने के इनाम में क्या शामिल नहीं हो सकता है?

इसमें टक्कर, तेज़ गति या ऊर्जा का उपयोग शामिल नहीं हो सकता है। उन कमियों और बाधाओं की जाँच करें जो इनाम से स्वतंत्र रूप से लागू होनी चाहिए।

संदर्भ

What to read next

Review the backgroundपॉलिसी ग्रेडिएंट्स, पीपीओ और एसएसी — रोबोटों के लिए स्थिर सतत नियंत्रणContinue the seriesमॉडल-आधारित सुदृढीकरण शिक्षण और सिम-टू-रियलExplore another aspect of this fieldमल्टी-एजेंट रीइन्फोर्समेंट लर्निंग का परिचय — ऐसी दुनिया में अनुकूलन जहां दूसरा पक्ष भी सीख रहा है