Contents — find the section you need

क्यू-लर्निंग एक ऑफ-पॉलिसी रीइन्फोर्समेंट-लर्निंग विधि है जो प्रत्येक स्टेट-एक्शन युग्म के लिए एक मान को अपडेट करती है: "दीर्घकाल में इस विकल्प से कितना लाभ होगा?" एक छोटी भूलभुलैया को एक टेबल की मदद से हल किया जा सकता है, लेकिन कैमरा इमेज और कई जॉइंट्स के कारण वह टेबल बहुत बड़ी हो जाती है। डीप क्यू-नेटवर्क (डीक्यूएन) टेबल को एक न्यूरल नेटवर्क से बदल देता है और सहसंबंधित डेटा और स्व-संदर्भित अस्थिरता को कम करने के लिए एक्सपीरियंस रीप्ले और एक टारगेट नेटवर्क का उपयोग करता है।

30 सेकंड का सारांश

  • Q(s,a) स्टेट s में एक्शन a लेने के बाद अपेक्षित भविष्य का प्रतिफल है। सबसे बड़ा क्यू मान चुनना एक ग्रीडी पॉलिसी प्रदान करता है।

क्यू-लर्निंग अगले स्टेट में अधिकतम क्यू मान का उपयोग करता है, भले ही व्यवहार पॉलिसी ने किसी अन्य एक्शन का पता लगाया हो। यही इसकी ऑफ-पॉलिसी विशेषता है।

डीक्यूएन एक उच्च-आयामी अवलोकन, जैसे कि एक इमेज, को सीमित संख्या में असतत एक्शन के लिए क्यू मानों में मैप करता है। निरंतर टॉर्क के लिए विखंडन या एक्टर-क्रिटिक विधि की आवश्यकता होती है।

  • अनुभव रीप्ले पुराने ट्रांज़िशन को फेरबदल करता है, जबकि एक लक्ष्य नेटवर्क कई अपडेट के लिए लर्निंग लक्ष्य को लगभग स्थिर रखता है।

  • एक रोबोट को वेग, बल, धारा और आपातकालीन-रोकने की सीमाएँ लर्नर के बाहर रखनी चाहिए। उच्च पुरस्कार हार्डवेयर सुरक्षा का प्रमाण नहीं है।

1. Q मानों को एक तालिका में रखें

RL बेसिक्स प्राइमर के MDP में, स्थिति s में क्रिया a चुनने पर पुरस्कार r और अगली स्थिति s' प्राप्त होती है। Q-लर्निंग अज्ञात वातावरण का कोई स्पष्ट मॉडल P नहीं रखता है; यह केवल अनुभव (s,a,r,s') से Q मान को अपडेट करता है:

Q(s_t,a_t)\leftarrow Q(s_t,a_t)+\alpha\left[r_{t+1}+\gamma\max_{a'}Q(s_{t+1},a')-Q(s_t,a_t)\right]

कोष्ठक अस्थायी-अंतर (TD) त्रुटि है। सकारात्मक त्रुटि क्रिया के मूल्य को बढ़ाती है; नकारात्मक त्रुटि इसे घटाती है। \alpha लर्निंग रेट है और \gamma डिस्काउंट फैक्टर है। अंतिम अवस्था में, अगली अवस्था का मूल्य शून्य होता है।

Diagram 1 · Use the button to switch views
Q-learning: update the table from a transition

चित्र 1 — Q-लर्निंग, प्रेक्षित पुरस्कार और अधिकतम अगली-अवस्था मान से बने लक्ष्य की ओर पिछले मान को थोड़ा आगे बढ़ाती है।

एक 5×5 भूलभुलैया में केवल 25 अवस्थाएँ और चार क्रियाएँ होती हैं, इसलिए 100 तालिका प्रविष्टियाँ पर्याप्त हैं। ε-लालची अन्वेषण के साथ, अनुभव धीरे-धीरे लक्ष्य मान को भूलभुलैया में पीछे की ओर प्रसारित करते हैं। सीखने की दर को 1 पर सेट करने और किसी एक अनुभव पर पूरी तरह भरोसा करने से वह पर्यावरणीय शोर के प्रति संवेदनशील हो जाता है, इसलिए अनुभवों का औसत निकालने के लिए आमतौर पर 0 और 1 के बीच के मान का उपयोग किया जाता है।

2. ऑफ-पॉलिसी लर्निंग और ε-लालची अन्वेषण

लक्ष्य \max_{a'}Q(s',a') सबसे अच्छा अनुमानित एक्शन है, जरूरी नहीं कि वह एक्शन हो जो एक्सप्लोरिंग बिहेवियर पॉलिसी ने वास्तव में लिया हो। इसलिए, Q-लर्निंग एक ग्रीडी पॉलिसी सीख सकती है जबकि ε-ग्रीडी डेटा एकत्र करती है। स्टेट स्पेस को कवर करने के लिए एक बड़े ε से शुरू करें और इसे धीरे-धीरे कम करें। एक फिजिकल मशीन पर, केवल मान्य कैंडिडेट कमांड के भीतर ही रैंडमाइजेशन करें और कोलिजन मॉनिटरिंग को सर्वोच्च प्राथमिकता दें।

3. इमेज और निरंतर मानों के लिए टेबल क्यों विफल हो जाती है

यदि एक स्टेट कैमरा इमेज का प्रत्येक पिक्सेल है और प्रत्येक मोटर में 256 गति स्तर हैं, तो टेबल व्यावहारिक मेमोरी में फिट नहीं हो सकती। लगभग समान इमेज को भी असंबंधित स्टेट्स माना जाएगा। DQN एक न्यूरल नेटवर्क Q_\theta(s,a) के साथ टेबल का अनुमान लगाता है।

नेटवर्क एक इमेज को प्रत्येक असतत एक्शन के लिए एक Q मान से मैप करता है। ऊपर/नीचे/बाएँ/दाएँ के लिए, आउटपुट (Q(s,\mathrm{up}),Q(s,\mathrm{down}),Q(s,\mathrm{left}),Q(s,\mathrm{right})) है। हानि है

L(\theta)=\mathbb{E}_{(s,a,r,s')\sim D}\left[\left(y-Q_\theta(s,a)\right)^2\right],\qquad y=r+\gamma\max_{a'}Q_{\theta^-}(s',a')

जहाँ D रिप्ले बफर है और \theta^- लक्ष्य नेटवर्क से संबंधित है। टर्मिनल ट्रांज़िशन के लिए, y=r का उपयोग किया जाता है।

4. रिप्ले का अनुभव करें: सहसंबंधित लॉग्स को शफल करें

रोबोट लॉग्स अनुक्रमिक होते हैं: t और t+1 पर मौजूद फ्रेम लगभग एक जैसे दिखते हैं। आसन्न फ्रेमों से बना एक मिनी-बैच एक पक्षपाती ग्रेडिएंट उत्पन्न करता है। DQN (s_t,a_t,r_{t+1},s_{t+1},done) को रिप्ले बफर में संग्रहीत करता है और यादृच्छिक मिनी-बैचों का नमूना लेता है।

बफर डिज़ाइन लाभ लागत
एकसमान नमूनाकरण सरल, अस्थायी सहसंबंध को कमजोर करता है दुर्लभ विफलताओं का नमूना कम लिया जाता है
प्राथमिकता वाला रिप्ले बड़े TD त्रुटियों पर केंद्रित महत्व सुधार और बहीखाता की आवश्यकता है
निश्चित आकार का FIFO बदलते परिवेश का अनुसरण करता है पुरानी दुर्लभ विफलताएँ गायब हो जाती हैं
एपिसोड संग्रहण संरक्षित करता है सफलता/विफलता संदर्भ बैच पुनः सहसंबंधित हो सकते हैं

लर्निंग प्रीप्रोसेसिंग के साथ ऑडिट ट्रेल को ओवरराइट न करें। रॉ सेंसर टाइमस्टैम्प, अनुरोधित और वास्तव में सीमित क्रियाएं, और टकराव फ़्लैग को सामान्यीकृत प्रशिक्षण टेंसर से अलग से संग्रहीत करें।

5. लक्ष्य नेटवर्क: शिक्षक को विलंबित करें

यदि अद्यतन किया जा रहा एक ही नेटवर्क लक्ष्य y और भविष्यवाणी Q_\theta दोनों की गणना एक साथ करता है, तो लक्ष्य हर बार बदलता है। त्रुटि को कम करने के उद्देश्य से किया गया अद्यतन अगले लक्ष्य को भी बदल देता है, जिससे विचलन या दोलन होता है। DQN एक प्रतिलिपि Q_{\theta^-} रखता है और इसे प्रत्येक कुछ सौ या हज़ार अद्यतनों के बाद \theta^-\leftarrow\theta के रूप में सिंक्रनाइज़ करता है।

सिंक्रनाइज़ेशन अंतराल को बढ़ाने से लक्ष्य स्थिर हो जाता है लेकिन यह बासी हो जाता है। पोल्याक औसत एक सुगम विकल्प है:

\theta^-\leftarrow\tau\theta+(1-\tau)\theta^-

प्रयोग विन्यास में चयन, सिंक्रनाइज़ेशन अंतराल, हानि और Q-मान वितरण को रिकॉर्ड करें और लॉग।

6. अति-अनुमान और डबल डीक्यूएन

शोरगुल वाले अनुमानों पर अधिकतम मान लेने से उस क्रिया को प्राथमिकता मिलती है जो देखने में अधिक प्रतीत होती है। डबल डीक्यूएन क्रिया चयन और क्रिया मूल्यांकन को अलग करता है:

a^*=\arg\max_{a'}Q_\theta(s',a'),\qquad y=r+\gamma Q_{\theta^-}(s',a^*)

यह सभी पूर्वाग्रहों को दूर नहीं करता है, लेकिन यह अक्सर अस्थिर क्यू वृद्धि को कम करता है। एक गुम टर्मिनल फ्लैग, एक गलत एक्शन मास्क, या एक असंगत रिवार्ड स्केल समान दिख सकते हैं, इसलिए एल्गोरिदम बदलने से पहले डेटा का निरीक्षण करें।

7. रोबोट में डीक्यूएन का उपयोग कहाँ होता है

डीक्यूएन एक सीमित क्रिया सेट मानता है। स्टीयरिंग कोण या संयुक्त टॉर्क को अलग-अलग भागों में विभाजित करना एक मोटे प्रदर्शन के लिए काम कर सकता है, लेकिन महीन ग्रिड तेजी से बढ़ते हैं और झटकेदार कमांड बनाते हैं। DDPG, TD3, और SAC सीधे निरंतर क्रियाएँ आउटपुट करते हैं और अक्सर टॉर्क या हाइड्रोलिक-वाल्व नियंत्रण के लिए बेहतर होते हैं।

डीक्यूएन उच्च-स्तरीय विकल्पों के लिए उपयोगी बना रहता है: बाएँ या दाएँ लेन, ग्रैस्प कैंडिडेट A/B/C, या कम/मध्यम/उच्च गति मोड। परिणामी संदर्भ को PID या MPC को सौंप दें। निचली परत। PID लेख और MPC लेख बताते हैं कि निचली परत में सीमाएँ और निगरानीकर्ता कैसे रखें।

8. इनाम के अलावा अन्य वक्र बनाएँ

औसत एपिसोड इनाम के साथ सफलता दर, टकराव दर, एपिसोड की लंबाई, औसत और अधिकतम Q, TD त्रुटि और क्रिया आवृत्तियों को लॉग करें। बढ़ती टकराव दर के साथ बढ़ता इनाम आमतौर पर इनाम या समाप्ति बग का संकेत देता है। गिरते नुकसान के साथ विस्फोटित Q मान स्केल बेमेल, टर्मिनल फ़्लैग की कमी या गलत बूटस्ट्रैप लक्ष्य का सुझाव देता है।

मूल्यांकन वातावरण को प्रशिक्षण से अलग रखें। प्रकाश व्यवस्था, फर्श घर्षण, पेलोड, बाधा लेआउट और संचार विलंब बदलें। एक नीति जो सिम्युलेटर में सफल होती है लेकिन कैमरा एक्सपोज़र, मोटर डेड ज़ोन या बैटरी सैग को अनदेखा करती है, उसने हार्डवेयर पर DQN प्रदर्शन प्रदर्शित नहीं किया है।

कार्यान्वयन चेकलिस्ट

  1. स्थिति, असतत क्रिया, इनाम, टर्मिनल फ़्लैग और टाइमस्टैम्प को एक ही संक्रमण के रूप में संग्रहीत करें।

  2. ठीक करें और ε, लर्निंग रेट, डिस्काउंट, बफर साइज़, बैच साइज़ और टारगेट इंटरवल रिकॉर्ड करें।

  3. प्रयोग आईडी के आधार पर Q मान, TD त्रुटियाँ, हानि, सफलता/टकराव दर और क्रिया आवृत्तियों को ट्रैक करें।

  4. रिप्ले प्रीप्रोसेसिंग को रॉ ऑडिट लॉग से अलग रखें।

  5. एक्शन मास्क, टर्मिनल स्टेट्स, टाइमआउट और अमान्य सेंसर मानों का यूनिट-टेस्ट करें।

  6. सत्यापित करें कि लिमिट्स, वॉचडॉग्स और इमरजेंसी स्टॉप DQN से ऊपर रहें और नेटवर्क ड्रॉपआउट की स्थिति में भी काम करें।

  7. प्रशिक्षण से अनदेखे हालातों और विफलताओं को दूर रखें।

सारांश

Q-लर्निंग बेलमैन ऑप्टिमैलिटी समीकरण को एक टेबल अपडेट में बदल देता है, जिसके लिए किसी ज्ञात डायनामिक्स मॉडल की आवश्यकता नहीं होती है। DQN उस टेबल को एक नेटवर्क के साथ अनुमानित करता है, लेकिन अनुभव रिप्ले और एक टारगेट नेटवर्क आवश्यक हैं ताकि स्व-संदर्भित टारगेट शोर को न बढ़ाए। DQN एक उपयोगी असतत निर्णय परत है; निरंतर टॉर्क और सुरक्षा अन्य नियंत्रकों के अंतर्गत आते हैं। TD त्रुटियों, टकरावों, विलंबों और Q वितरणों को ट्रैक करना—न केवल रिवार्ड—एक शोध स्क्रिप्ट को ऑडिट करने योग्य रोबोट सिस्टम में बदल देता है।

अपनी समझ की जाँच करें
क्या एक बड़ा Q-मान एक बड़े वास्तविक रिवार्ड की गारंटी देता है?

Q अपेक्षित प्रतिफल का एक अनुमान है। अपरिचित अवस्थाएँ या क्रियाएँ बड़े अनुमान त्रुटियाँ उत्पन्न कर सकती हैं।

संदर्भ

What to read next

Review the backgroundरीइन्फोर्समेंट लर्निंग की मूल बातें — एमडीपी, बेलमैन समीकरण और रोबोट के लिए एक्सप्लोरेशनContinue the seriesपॉलिसी ग्रेडिएंट्स, पीपीओ और एसएसी — रोबोटों के लिए स्थिर सतत नियंत्रणExplore another aspect of this fieldमल्टी-एजेंट रीइन्फोर्समेंट लर्निंग का परिचय — ऐसी दुनिया में अनुकूलन जहां दूसरा पक्ष भी सीख रहा है