Contents — find the section you need

क्यू-लर्निंग और डीक्यूएन एक सीमित क्रिया सेट में से चयन करते हैं। हालांकि, पहिए की गति, ड्रोन का थ्रस्ट या मैनिपुलेटर का टॉर्क निरंतर होता है। पॉलिसी-ग्रेडिएंट विधियाँ एक पॉलिसी \pi_\theta को अपडेट करती हैं जो निरंतर क्रियाओं पर एक वितरण आउटपुट करती है। एक्टर-क्रिटिक एक क्रिटिक जोड़ता है जो उन क्रियाओं का मूल्यांकन करता है; पीपीओ और एसएसी रोबोट अनुसंधान में व्यापक रूप से उपयोग किए जाने वाले व्यावहारिक स्थिरीकरण को जोड़ते हैं।

30-सेकंड का सारांश

  • पॉलिसी ग्रेडिएंट्स अपेक्षित प्रतिफल J(\theta) को सीधे बढ़ाते हैं। वे निरंतर क्रियाओं को स्वाभाविक रूप से संभालते हैं, लेकिन एकल-प्रक्षेपवक्र अनुमानों में उच्च विचरण होता है।

  • एक्टर-क्रिटिक एक मूल्य अनुमान को आधार रेखा के रूप में उपयोग करता है। एडवांटेज यह मापता है कि क्या कोई क्रिया समान स्थिति में औसत क्रिया से बेहतर थी।

  • पीपीओ पुरानी और नई नीतियों के बीच संभाव्यता अनुपात को क्लिप करता है ताकि एक अपडेट बहुत अधिक आगे न बढ़ सके। यह सीधा है, लेकिन ऑन-पॉलिसी डेटा का पुन: उपयोग करना कठिन है।

  • एसएसी इनाम और पॉलिसी एन्ट्रॉपी दोनों को अधिकतम करता है। यह नीति से इतर है, रीप्ले का उपयोग करता है, और निरंतर नियंत्रण के लिए व्यावहारिक रूप से उपयुक्त है।

दोनों में से कोई भी विधि सुरक्षा सीमाएँ प्रदान नहीं करती है। एक्शन बाउंड, रेट लिमिट, लो-लेवल पीआईडी/एमपीसी और आपातकालीन स्टॉप को लर्नर से बाहर रखें।

1. नीति का सीधा अनुकूलन

Diagram 1 · Use the button to switch views
Actor–Critic: update the policy from experience

चित्र 1 — एक्टर एक सतत वितरण प्रस्तावित करता है और क्रिटिक प्रतिफल का मूल्यांकन करता है। हार्डवेयर पर, क्रिया सीधे टॉर्क तक जाने के बजाय एक सत्यापित निम्न-स्तरीय नियंत्रक से होकर गुजरती है।

एक स्टोकेस्टिक नीति \pi_\theta(a\mid s) के लिए, अपेक्षित प्रतिफल J(\theta)=\mathbb{E}_{\pi_\theta}[G_t] का ग्रेडिएंट लॉग प्रायिकता के ग्रेडिएंट का उपयोग करके लिखा जा सकता है:

\nabla_\theta J(\theta)=\mathbb{E}_{\pi_\theta}\left[\nabla_\theta\log\pi_\theta(a_t\mid s_t)\,G_t\right]

उच्च प्रतिफल देने वाली क्रियाएँ अधिक संभावित हो जाती हैं। क्योंकि G_t शोरगुलयुक्त और विलंबित है, इसलिए एक स्थिति-निर्भर बेसलाइन को घटाया जाता है। b(s_t) अपेक्षित ग्रेडिएंट को बदले बिना विचरण को कम करता है:

\nabla_\theta J(\theta)=\mathbb{E}\left[\nabla_\theta\log\pi_\theta(a_t\mid s_t)\,(G_t-b(s_t))\right]

2. लाभ और अभिनेता-आलोचक

आलोचक V_\phi(s) सीखता है और A_t=Q(s_t,a_t)-V(s_t) का उपयोग करके अनुमान लगाता है कि कोई क्रिया स्थिति औसत से बेहतर थी या नहीं। एक-चरणीय TD सन्निकटन है:

\hat A_t=r_{t+1}+\gamma V_\phi(s_{t+1})-V_\phi(s_t)

सामान्यीकृत लाभ अनुमान (GAE) कई चरणों को एक पूर्वाग्रह-विचरण हाइपरपैरामीटर \lambda के साथ जोड़ता है। जैसे-जैसे \lambda एक के करीब आता है, यह एक लंबे क्षितिज और कम पूर्वाग्रह लेकिन उच्च विचरण का उपयोग करता है। एक तीव्र अभिवृत्ति लूप के लिए, बेंचमार्क सेटिंग की नकल करने के बजाय कार्य के वास्तविक विलंब और समय पैमाने का उपयोग करें।

अभिनेता हानि है:

L_\pi=-\mathbb{E}[\log\pi_\theta(a_t\mid s_t)\hat A_t]

और आलोचक वर्ग मान त्रुटि को न्यूनतम करता है:

L_V=\mathbb{E}[(V_\phi(s_t)-\hat V_t)^2]

जब एक छवि एनकोडर साझा किया जाता है, एक ग्रेडिएंट दोनों अनुमानों को बदल देता है। अलग-अलग लर्निंग रेट, ग्रेडिएंट क्लिपिंग और एक निश्चित ऑब्ज़र्वेशन-नॉर्मलाइज़ेशन रिकॉर्ड विफलताओं का निदान आसान बनाते हैं।

3. पीपीओ: पॉलिसी को एक साथ बहुत अधिक न बदलें

ऑन-पॉलिसी पॉलिसी ग्रेडिएंट वर्तमान पॉलिसी के साथ एक रोलआउट एकत्र करते हैं। इसे बहुत अधिक अपडेट के लिए पुन: उपयोग करने से नई पॉलिसी डेटा वितरण से दूर हो जाती है। पीपीओ पुरानी पॉलिसी \pi_{\theta_{old}} और नई पॉलिसी के बीच एक प्रायिकता अनुपात बनाता है,

r_t(\theta)=\frac{\pi_\theta(a_t\mid s_t)}{\pi_{\theta_{old}}(a_t\mid s_t)}

और क्लिप्ड ऑब्जेक्टिव को अधिकतम करता है

L^{CLIP}=\mathbb{E}\left[\min\left(r_t\hat A_t,\operatorname{clip}(r_t,1-\epsilon,1+\epsilon)\hat A_t\right)\right]

सकारात्मक लाभ अपनी प्रायिकता को असीमित रूप से नहीं बढ़ा सकते हैं, और नकारात्मक लाभ इसे असीमित रूप से नहीं घटा सकते हैं। एक छोटा \epsilon रूढ़िवादी है; एक बड़ा \epsilon अधिक साहसिक अपडेट की अनुमति देता है। क्लिपिंग एक सुरक्षा बाधा नहीं है, इसलिए संयुक्त, गति और बल सीमाएँ अभी भी अलग-अलग हैं।

एक कार्यान्वयन एक निश्चित रोलआउट एकत्र करता है, लाभ को सामान्य करता है, और कई मिनी-बैच युगों को प्रशिक्षित करता है। पुराने लॉग को सहेजें। प्रायिकताएँ, टाइमआउट को वास्तविक टर्मिनल स्थिति से अलग करती हैं, और मूल्यांकन के समय सामान्यीकरण सांख्यिकी को स्थिर करती हैं। अन्यथा, समान भार वाले दो रन अलग-अलग व्यवहार कर सकते हैं।

4. एसएसी: इनाम और एन्ट्रॉपी

सॉफ्ट एक्टर-क्रिटिक (एसएसी) भविष्य के इनाम में एक उद्देश्य के रूप में नीति एन्ट्रॉपी \mathcal{H}(\pi) जोड़ता है:

J(\pi)=\mathbb{E}\left[\sum_t\gamma^t\left(r_t+\alpha\mathcal{H}(\pi(\cdot\mid s_t))\right)\right]

एन्ट्रॉपी पद समान रूप से अच्छी क्रियाओं को बहुत जल्दी एक में समाहित होने से रोकता है, और एक तापमान \alpha के रूप में कार्य करता है जो अन्वेषण को सक्रिय रखता है। एसएसी ऑफ-पॉलिसी है और एक रीप्ले बफर का उपयोग करता है, इसलिए प्रत्येक वास्तविक-विश्व संक्रमण का पुन: उपयोग किया जा सकता है। इससे नमूना दक्षता में सुधार होता है, लेकिन बासी डेटा, इनाम पैमाना और तापमान ट्यूनिंग मायने रखते हैं।

निरंतर क्रिया के लिए, एक्टर एक गाऊसीयन का माध्य \mu_\theta(s) और मानक विचलन \sigma_\theta(s) आउटपुट करता है, फिर इसे टैन्ह या किसी अन्य रूपांतरण के साथ सीमाओं में मैप करता है। लॉग प्रायिकता को उस रूपांतरण के जैकोबियन सुधार की आवश्यकता होती है। ट्विन क्यू नेटवर्क और छोटा क्यू अनुमान अतिप्रत्याशन को कम करते हैं। तय करें कि परिनियोजन नियतात्मक माध्य का उपयोग करता है या अन्वेषण शोर को बनाए रखता है।

5. पीपीओ या एसएसी का चयन

पहलू पीपीओ एसएसी
डेटा ऑन-पॉलिसी रोलआउट ऑफ-पॉलिसी रीप्ले
अन्वेषण नीति वितरण और एन्ट्रॉपी बोनस एन्ट्रॉपी उद्देश्य का हिस्सा है
नमूना दक्षता कम से मध्यम अक्सर अधिक
मुख्य त्रुटियाँ लॉग-संभावना, टर्मिनल फ़्लैग, क्लिपिंग क्यू अतिप्रत्याशन, इनाम पैमाना, टैन्ह सुधार
विशिष्ट फिट कई समानांतर सिमुलेटर निरंतर टॉर्क और सीमित हार्डवेयर डेटा

पीपीओ अक्सर स्थिर होता है जब कई सिमुलेटेड वातावरण समानांतर रूप से चल सकते हैं। एसएसी आकर्षक हो सकता है जब प्रत्येक वास्तविक संक्रमण महंगा हो। दोनों में से कोई भी विधि सेंसर विलंब, मोटर डेड ज़ोन या एक्चुएटर संतृप्ति को स्वचालित रूप से मॉडल नहीं करती है।

6. सिम-टू-रियल एक सीमा है, स्विच नहीं

द सिमुलेशन और वास्तविकता के बीच का अंतर द्रव्यमान और घर्षण, प्रतिलोम, एक्सपोज़र और सेंसर शोर, नेटवर्क विलंब, बैटरी का झुकाव, फर्श की सामग्री और प्रकाश व्यवस्था के कारण होता है। डोमेन रैंडमाइजेशन इन मापदंडों का नमूना लेता है ताकि नीति किसी एक आदर्श मान पर अत्यधिक निर्भर न हो जाए। सीमा को हार्डवेयर से मापा जाना चाहिए; असंभव स्थितियों को रैंडमाइज करने से प्रशिक्षण और भी कठिन हो जाता है।

चरणबद्ध स्थानांतरण अधिक सुरक्षित है: (1) शुद्ध सिमुलेशन, (2) गति के बिना वास्तविक सेंसर लॉग को पुनः चलाना, (3) पहिए ऊपर उठाकर कम-शक्ति परीक्षण, (4) एक साफ फर्श पर सीमित गति और बल, और (5) स्वयं कार्य। अनुरोधित क्रिया को उस क्रिया से अलग से लॉग करें जिसे सुरक्षा सीमांकक ने वास्तव में पार कर लिया है। सिम-टू-रियल पहचान और मूल्यांकन का एक पुनरावृत्ति चक्र है, न कि एक एकल परिनियोजन बटन।

7. सुरक्षा और मूल्यांकन

पीपीओ क्लिपिंग और एसएसी एन्ट्रॉपी टकराव को नहीं रोकते हैं। स्वतंत्र मॉनिटर को गति, त्वरण, संयुक्त कोण, संपर्क बल, हाइड्रोलिक दबाव, धारा और तापमान की जांच करनी चाहिए। अमान्य अवलोकन, NaN, समाप्त टाइमस्टैम्प या संचार में रुकावट होने पर, मॉनिटर को एक सुरक्षित स्थानांतरण का आदेश देना चाहिए। रोकें। जोखिम कम होने पर इसे एक अलग प्रक्रिया या MCU में डालें।

इनाम के अलावा, सफलता दर, टकराव दर, अधिकतम विचलन, रुकने की दूरी, ऊर्जा, क्रिया की सुगमता, अनुमान विलंबता और सुरक्षा-सीमितकर्ता हस्तक्षेप दर को मापें। बार-बार हस्तक्षेप के साथ उच्च सफलता दर का अर्थ है कि नीति सीमितकर्ता पर निर्भर करती है। कई यादृच्छिक सीड के साथ रन दोहराएं और केवल औसत ही नहीं, बल्कि विचरण और सबसे खराब स्थितियों की रिपोर्ट करें।

कार्यान्वयन चेकलिस्ट

  1. क्रिया इकाइयों, सीमाओं, tanh/clip क्रम और लॉग-संभावना सुधारों का परीक्षण करें।

  2. PPO के लिए, पुरानी लॉग संभावनाओं, लाभ और टर्मिनल बनाम टाइमआउट फ़्लैग को सहेजें।

  3. SAC के लिए, रीप्ले वितरण, ट्विन Q मान, तापमान \alpha और इनाम पैमाने की निगरानी करें।

  4. प्रयोग ID द्वारा प्रीप्रोसेसिंग, सामान्यीकरण, सीड, भार और पर्यावरण मापदंडों को पिन करें।

  5. निम्न-स्तरीय PID/MPC, दर सीमा, वॉचडॉग और आपातकालीन स्टॉप को लर्नर से स्वतंत्र रखें।

  6. निष्क्रिय के लिए स्टॉप शर्तें परिभाषित करें। प्रत्येक ट्रांज़िशन से पहले लॉग, कम पावर और सामान्य संचालन की जाँच करें।

  7. सफलता, टकराव, लिमिटर हस्तक्षेप, विलंबता, ऊर्जा और अधिकतम विचलन को एक साथ रिकॉर्ड करें।

सारांश

पॉलिसी ग्रेडिएंट्स सीधे एक सतत क्रिया वितरण को अनुकूलित करते हैं। एक्टर-क्रिटिक भिन्नता को कम करने के लिए एडवांटेज का उपयोग करता है; पीपीओ अपडेट को क्लिप करता है; एसएसी अन्वेषण और डेटा दक्षता में सुधार के लिए एन्ट्रॉपी और रीप्ले का उपयोग करता है। इनमें से कोई भी हार्डवेयर अनिश्चितता या सुरक्षा को स्वयं हल नहीं करता है। एक सत्यापित निम्न-स्तरीय नियंत्रक, एक स्वतंत्र मॉनिटर, चरणबद्ध स्थानांतरण और सबसे खराब स्थिति का मूल्यांकन एल्गोरिदम का हिस्सा होते हैं जब एक सीखी गई नीति सिमुलेशन से बाहर निकलती है।

अपनी समझ की जाँच करें
क्या पीपीओ क्लिपिंग सुरक्षित व्यवहार की गारंटी देता है?

यह अनुकूलन उद्देश्य को नियंत्रित करता है, भौतिक सुरक्षा बाधाओं को नहीं। प्रशिक्षण स्थिरता और क्रिया सुरक्षा का अलग-अलग मूल्यांकन करें।

संदर्भ

What to read next

Review the backgroundक्यू-लर्निंग और डीक्यूएन — क्यू-टेबल से डीप रीइन्फोर्समेंट लर्निंग तकContinue the seriesरिवॉर्ड डिज़ाइन की बुनियादी बातें — वास्तविक जीवन में "किस चीज़ को अधिकतम करना है" यह सबसे कठिन हिस्सा क्यों हैExplore another aspect of this fieldमल्टी-एजेंट रीइन्फोर्समेंट लर्निंग का परिचय — ऐसी दुनिया में अनुकूलन जहां दूसरा पक्ष भी सीख रहा है