Contents — find the section you need
क्यू-लर्निंग और डीक्यूएन एक सीमित क्रिया सेट में से चयन करते हैं। हालांकि, पहिए की गति, ड्रोन का थ्रस्ट या मैनिपुलेटर का टॉर्क निरंतर होता है। पॉलिसी-ग्रेडिएंट विधियाँ एक पॉलिसी \pi_\theta को अपडेट करती हैं जो निरंतर क्रियाओं पर एक वितरण आउटपुट करती है। एक्टर-क्रिटिक एक क्रिटिक जोड़ता है जो उन क्रियाओं का मूल्यांकन करता है; पीपीओ और एसएसी रोबोट अनुसंधान में व्यापक रूप से उपयोग किए जाने वाले व्यावहारिक स्थिरीकरण को जोड़ते हैं।
30-सेकंड का सारांश
-
पॉलिसी ग्रेडिएंट्स अपेक्षित प्रतिफल J(\theta) को सीधे बढ़ाते हैं। वे निरंतर क्रियाओं को स्वाभाविक रूप से संभालते हैं, लेकिन एकल-प्रक्षेपवक्र अनुमानों में उच्च विचरण होता है।
-
एक्टर-क्रिटिक एक मूल्य अनुमान को आधार रेखा के रूप में उपयोग करता है। एडवांटेज यह मापता है कि क्या कोई क्रिया समान स्थिति में औसत क्रिया से बेहतर थी।
-
पीपीओ पुरानी और नई नीतियों के बीच संभाव्यता अनुपात को क्लिप करता है ताकि एक अपडेट बहुत अधिक आगे न बढ़ सके। यह सीधा है, लेकिन ऑन-पॉलिसी डेटा का पुन: उपयोग करना कठिन है।
-
एसएसी इनाम और पॉलिसी एन्ट्रॉपी दोनों को अधिकतम करता है। यह नीति से इतर है, रीप्ले का उपयोग करता है, और निरंतर नियंत्रण के लिए व्यावहारिक रूप से उपयुक्त है।
दोनों में से कोई भी विधि सुरक्षा सीमाएँ प्रदान नहीं करती है। एक्शन बाउंड, रेट लिमिट, लो-लेवल पीआईडी/एमपीसी और आपातकालीन स्टॉप को लर्नर से बाहर रखें।
1. नीति का सीधा अनुकूलन
चित्र 1 — एक्टर एक सतत वितरण प्रस्तावित करता है और क्रिटिक प्रतिफल का मूल्यांकन करता है। हार्डवेयर पर, क्रिया सीधे टॉर्क तक जाने के बजाय एक सत्यापित निम्न-स्तरीय नियंत्रक से होकर गुजरती है।
एक स्टोकेस्टिक नीति \pi_\theta(a\mid s) के लिए, अपेक्षित प्रतिफल J(\theta)=\mathbb{E}_{\pi_\theta}[G_t] का ग्रेडिएंट लॉग प्रायिकता के ग्रेडिएंट का उपयोग करके लिखा जा सकता है:
उच्च प्रतिफल देने वाली क्रियाएँ अधिक संभावित हो जाती हैं। क्योंकि G_t शोरगुलयुक्त और विलंबित है, इसलिए एक स्थिति-निर्भर बेसलाइन को घटाया जाता है। b(s_t) अपेक्षित ग्रेडिएंट को बदले बिना विचरण को कम करता है:
2. लाभ और अभिनेता-आलोचक
आलोचक V_\phi(s) सीखता है और A_t=Q(s_t,a_t)-V(s_t) का उपयोग करके अनुमान लगाता है कि कोई क्रिया स्थिति औसत से बेहतर थी या नहीं। एक-चरणीय TD सन्निकटन है:
सामान्यीकृत लाभ अनुमान (GAE) कई चरणों को एक पूर्वाग्रह-विचरण हाइपरपैरामीटर \lambda के साथ जोड़ता है। जैसे-जैसे \lambda एक के करीब आता है, यह एक लंबे क्षितिज और कम पूर्वाग्रह लेकिन उच्च विचरण का उपयोग करता है। एक तीव्र अभिवृत्ति लूप के लिए, बेंचमार्क सेटिंग की नकल करने के बजाय कार्य के वास्तविक विलंब और समय पैमाने का उपयोग करें।
अभिनेता हानि है:
और आलोचक वर्ग मान त्रुटि को न्यूनतम करता है:
जब एक छवि एनकोडर साझा किया जाता है, एक ग्रेडिएंट दोनों अनुमानों को बदल देता है। अलग-अलग लर्निंग रेट, ग्रेडिएंट क्लिपिंग और एक निश्चित ऑब्ज़र्वेशन-नॉर्मलाइज़ेशन रिकॉर्ड विफलताओं का निदान आसान बनाते हैं।
3. पीपीओ: पॉलिसी को एक साथ बहुत अधिक न बदलें
ऑन-पॉलिसी पॉलिसी ग्रेडिएंट वर्तमान पॉलिसी के साथ एक रोलआउट एकत्र करते हैं। इसे बहुत अधिक अपडेट के लिए पुन: उपयोग करने से नई पॉलिसी डेटा वितरण से दूर हो जाती है। पीपीओ पुरानी पॉलिसी \pi_{\theta_{old}} और नई पॉलिसी के बीच एक प्रायिकता अनुपात बनाता है,
और क्लिप्ड ऑब्जेक्टिव को अधिकतम करता है
सकारात्मक लाभ अपनी प्रायिकता को असीमित रूप से नहीं बढ़ा सकते हैं, और नकारात्मक लाभ इसे असीमित रूप से नहीं घटा सकते हैं। एक छोटा \epsilon रूढ़िवादी है; एक बड़ा \epsilon अधिक साहसिक अपडेट की अनुमति देता है। क्लिपिंग एक सुरक्षा बाधा नहीं है, इसलिए संयुक्त, गति और बल सीमाएँ अभी भी अलग-अलग हैं।
एक कार्यान्वयन एक निश्चित रोलआउट एकत्र करता है, लाभ को सामान्य करता है, और कई मिनी-बैच युगों को प्रशिक्षित करता है। पुराने लॉग को सहेजें। प्रायिकताएँ, टाइमआउट को वास्तविक टर्मिनल स्थिति से अलग करती हैं, और मूल्यांकन के समय सामान्यीकरण सांख्यिकी को स्थिर करती हैं। अन्यथा, समान भार वाले दो रन अलग-अलग व्यवहार कर सकते हैं।
4. एसएसी: इनाम और एन्ट्रॉपी
सॉफ्ट एक्टर-क्रिटिक (एसएसी) भविष्य के इनाम में एक उद्देश्य के रूप में नीति एन्ट्रॉपी \mathcal{H}(\pi) जोड़ता है:
एन्ट्रॉपी पद समान रूप से अच्छी क्रियाओं को बहुत जल्दी एक में समाहित होने से रोकता है, और एक तापमान \alpha के रूप में कार्य करता है जो अन्वेषण को सक्रिय रखता है। एसएसी ऑफ-पॉलिसी है और एक रीप्ले बफर का उपयोग करता है, इसलिए प्रत्येक वास्तविक-विश्व संक्रमण का पुन: उपयोग किया जा सकता है। इससे नमूना दक्षता में सुधार होता है, लेकिन बासी डेटा, इनाम पैमाना और तापमान ट्यूनिंग मायने रखते हैं।
निरंतर क्रिया के लिए, एक्टर एक गाऊसीयन का माध्य \mu_\theta(s) और मानक विचलन \sigma_\theta(s) आउटपुट करता है, फिर इसे टैन्ह या किसी अन्य रूपांतरण के साथ सीमाओं में मैप करता है। लॉग प्रायिकता को उस रूपांतरण के जैकोबियन सुधार की आवश्यकता होती है। ट्विन क्यू नेटवर्क और छोटा क्यू अनुमान अतिप्रत्याशन को कम करते हैं। तय करें कि परिनियोजन नियतात्मक माध्य का उपयोग करता है या अन्वेषण शोर को बनाए रखता है।
5. पीपीओ या एसएसी का चयन
| पहलू | पीपीओ | एसएसी |
|---|---|---|
| डेटा | ऑन-पॉलिसी रोलआउट | ऑफ-पॉलिसी रीप्ले |
| अन्वेषण | नीति वितरण और एन्ट्रॉपी बोनस | एन्ट्रॉपी उद्देश्य का हिस्सा है |
| नमूना दक्षता | कम से मध्यम | अक्सर अधिक |
| मुख्य त्रुटियाँ | लॉग-संभावना, टर्मिनल फ़्लैग, क्लिपिंग | क्यू अतिप्रत्याशन, इनाम पैमाना, टैन्ह सुधार |
| विशिष्ट फिट | कई समानांतर सिमुलेटर | निरंतर टॉर्क और सीमित हार्डवेयर डेटा |
पीपीओ अक्सर स्थिर होता है जब कई सिमुलेटेड वातावरण समानांतर रूप से चल सकते हैं। एसएसी आकर्षक हो सकता है जब प्रत्येक वास्तविक संक्रमण महंगा हो। दोनों में से कोई भी विधि सेंसर विलंब, मोटर डेड ज़ोन या एक्चुएटर संतृप्ति को स्वचालित रूप से मॉडल नहीं करती है।
6. सिम-टू-रियल एक सीमा है, स्विच नहीं
द सिमुलेशन और वास्तविकता के बीच का अंतर द्रव्यमान और घर्षण, प्रतिलोम, एक्सपोज़र और सेंसर शोर, नेटवर्क विलंब, बैटरी का झुकाव, फर्श की सामग्री और प्रकाश व्यवस्था के कारण होता है। डोमेन रैंडमाइजेशन इन मापदंडों का नमूना लेता है ताकि नीति किसी एक आदर्श मान पर अत्यधिक निर्भर न हो जाए। सीमा को हार्डवेयर से मापा जाना चाहिए; असंभव स्थितियों को रैंडमाइज करने से प्रशिक्षण और भी कठिन हो जाता है।
चरणबद्ध स्थानांतरण अधिक सुरक्षित है: (1) शुद्ध सिमुलेशन, (2) गति के बिना वास्तविक सेंसर लॉग को पुनः चलाना, (3) पहिए ऊपर उठाकर कम-शक्ति परीक्षण, (4) एक साफ फर्श पर सीमित गति और बल, और (5) स्वयं कार्य। अनुरोधित क्रिया को उस क्रिया से अलग से लॉग करें जिसे सुरक्षा सीमांकक ने वास्तव में पार कर लिया है। सिम-टू-रियल पहचान और मूल्यांकन का एक पुनरावृत्ति चक्र है, न कि एक एकल परिनियोजन बटन।
7. सुरक्षा और मूल्यांकन
पीपीओ क्लिपिंग और एसएसी एन्ट्रॉपी टकराव को नहीं रोकते हैं। स्वतंत्र मॉनिटर को गति, त्वरण, संयुक्त कोण, संपर्क बल, हाइड्रोलिक दबाव, धारा और तापमान की जांच करनी चाहिए। अमान्य अवलोकन, NaN, समाप्त टाइमस्टैम्प या संचार में रुकावट होने पर, मॉनिटर को एक सुरक्षित स्थानांतरण का आदेश देना चाहिए। रोकें। जोखिम कम होने पर इसे एक अलग प्रक्रिया या MCU में डालें।
इनाम के अलावा, सफलता दर, टकराव दर, अधिकतम विचलन, रुकने की दूरी, ऊर्जा, क्रिया की सुगमता, अनुमान विलंबता और सुरक्षा-सीमितकर्ता हस्तक्षेप दर को मापें। बार-बार हस्तक्षेप के साथ उच्च सफलता दर का अर्थ है कि नीति सीमितकर्ता पर निर्भर करती है। कई यादृच्छिक सीड के साथ रन दोहराएं और केवल औसत ही नहीं, बल्कि विचरण और सबसे खराब स्थितियों की रिपोर्ट करें।
कार्यान्वयन चेकलिस्ट
-
क्रिया इकाइयों, सीमाओं, tanh/clip क्रम और लॉग-संभावना सुधारों का परीक्षण करें।
-
PPO के लिए, पुरानी लॉग संभावनाओं, लाभ और टर्मिनल बनाम टाइमआउट फ़्लैग को सहेजें।
-
SAC के लिए, रीप्ले वितरण, ट्विन Q मान, तापमान \alpha और इनाम पैमाने की निगरानी करें।
-
प्रयोग ID द्वारा प्रीप्रोसेसिंग, सामान्यीकरण, सीड, भार और पर्यावरण मापदंडों को पिन करें।
-
निम्न-स्तरीय PID/MPC, दर सीमा, वॉचडॉग और आपातकालीन स्टॉप को लर्नर से स्वतंत्र रखें।
-
निष्क्रिय के लिए स्टॉप शर्तें परिभाषित करें। प्रत्येक ट्रांज़िशन से पहले लॉग, कम पावर और सामान्य संचालन की जाँच करें।
-
सफलता, टकराव, लिमिटर हस्तक्षेप, विलंबता, ऊर्जा और अधिकतम विचलन को एक साथ रिकॉर्ड करें।
सारांश
पॉलिसी ग्रेडिएंट्स सीधे एक सतत क्रिया वितरण को अनुकूलित करते हैं। एक्टर-क्रिटिक भिन्नता को कम करने के लिए एडवांटेज का उपयोग करता है; पीपीओ अपडेट को क्लिप करता है; एसएसी अन्वेषण और डेटा दक्षता में सुधार के लिए एन्ट्रॉपी और रीप्ले का उपयोग करता है। इनमें से कोई भी हार्डवेयर अनिश्चितता या सुरक्षा को स्वयं हल नहीं करता है। एक सत्यापित निम्न-स्तरीय नियंत्रक, एक स्वतंत्र मॉनिटर, चरणबद्ध स्थानांतरण और सबसे खराब स्थिति का मूल्यांकन एल्गोरिदम का हिस्सा होते हैं जब एक सीखी गई नीति सिमुलेशन से बाहर निकलती है।
क्या पीपीओ क्लिपिंग सुरक्षित व्यवहार की गारंटी देता है?
यह अनुकूलन उद्देश्य को नियंत्रित करता है, भौतिक सुरक्षा बाधाओं को नहीं। प्रशिक्षण स्थिरता और क्रिया सुरक्षा का अलग-अलग मूल्यांकन करें।
टिप्पणियाँ
पहले लॉग इन करें।
अभी कोई डेटा नहीं है।