Contents — find the section you need
निष्कर्ष
मॉडल-आधारित रीइन्फोर्समेंट लर्निंग (RL) एक विश्व मॉडल \hat f सीखती है, जो स्थिति और क्रिया को अनुमानित अगली स्थिति से मैप करता है, इसके भीतर क्रिया अनुक्रमों का परीक्षण करता है, और हार्डवेयर पर केवल एक पर्यवेक्षित क्रिया लागू करता है। मॉडल-मुक्त विधियाँ सीधे इनाम से नीति सीखती हैं; MBRL अधिक डेटा-कुशल हो सकती है और बाधाओं को व्यक्त कर सकती है, लेकिन मॉडल त्रुटि केवल सिम्युलेटर-आधारित सफलता का कारण बन सकती है। RL मूल बातें, Q-लर्निंग, PPO/SAC, और MPC देखें।
विश्व मॉडल और योजना
चित्र 1 — डस्ककॉइल द्वारा निर्मित वैचारिक SVG, मापा गया सिस्टम डेटा नहीं।
\hat s_{t+1}=\hat f_\theta(s_t,a_t) सीखें और एक रीसीडिंग-हॉराइजन उद्देश्य को अनुकूलित करें:
सिमुलेशन-से-वास्तविक, पहचान और सुरक्षा
लंबे रोलआउट में एक-चरणीय त्रुटियां बढ़ती जाती हैं। समूह अनिश्चितता का अनुमान लगा सकते हैं; योजनाकार उच्च-भिन्नता वाले क्षेत्रों से बच सकते हैं और छोटे क्षितिज का उपयोग कर सकते हैं। डोमेन यादृच्छिकीकरण द्रव्यमान, घर्षण, विलंब, सेंसर शोर, प्रकाश और कैमरा स्थिति को बदलता है। सिस्टम पहचान जड़त्व, घर्षण, मोटर स्थिरांक और विलंबता को मापती है ताकि ये सीमाएं मनमानी के बजाय तर्कसंगत हों।
लॉगिंग से कम गति वाले छाया नियंत्रण और फिर सीमित पर्यवेक्षित परीक्षणों की ओर बढ़ें। आपातकालीन स्टॉप, स्वतंत्र गति/बल/तापमान मॉनिटर, संचार हानि स्टॉपिंग और मानव पृथक्करण को सीखी गई नीति से बाहर रखें। सामान्य विफलताओं में निश्चित-घर्षण सिमुलेशन शामिल हैं। व्हील स्लिप, लाइटिंग ओवरफिट, कंपन पैदा करने वाली रिवॉर्ड हैकिंग, और अस्थिरता पैदा करने वाली अनमॉडल देरी। उल्लंघन की संख्या, स्टॉपिंग डिस्टेंस, अनिश्चितता-प्रेरित परहेज़, और सबसे खराब स्थिति का व्यवहार—केवल औसत रिवॉर्ड ही नहीं, रिपोर्ट करें।
मॉडल-मुक्त और मॉडल-आधारित भूमिकाएँ
मॉडल-मुक्त RL किसी नीति या मान को सीधे अनुभव से अपडेट करता है। यह तब उपयोगी होता है जब संपर्क गतिकी को मॉडल करना कठिन होता है, लेकिन प्रत्येक सुधार में वास्तविक परीक्षण लग सकते हैं। MBRL प्रत्येक ट्रांज़िशन का पुन: उपयोग करके एक प्रेडिक्टर को प्रशिक्षित करता है और उस प्रेडिक्टर में कई संभावित अनुक्रमों का मूल्यांकन करता है। यदि प्रेडिक्टर में एक व्यवस्थित पूर्वाग्रह है, तो प्लानर केवल सिम्युलेटर-आधारित शॉर्टकट को अनुकूलित करता है।
| पहलू | मॉडल-मुक्त | मॉडल-आधारित |
|---|---|---|
| हार्डवेयर डेटा | कम से मध्यम दक्षता | मॉडल की सीमा के भीतर मध्यम से उच्च दक्षता |
| रनटाइम | अक्सर हल्की नीति अनुमान | प्रत्येक चक्र में रोलआउट और अनुकूलन |
| बाधाएँ | आमतौर पर एक अप्रत्यक्ष रिवॉर्ड/सुरक्षा परत | नियोजन समस्या में स्वाभाविक रूप से शामिल |
| मुख्य विफलता | से खराब एक्सट्रपलेशन विरल डेटा | दीर्घकालिक मॉडल त्रुटि |
सामान्य फिट | जटिल संपर्क और दृश्य नीतियां | अल्पकालिक गति, ऊर्जा और तापीय नियोजन |
हाइब्रिड स्टैक आम हैं: एक सीखी हुई नीति संभावित मापदंडों का प्रस्ताव करती है, एक सीखा हुआ मॉडल अल्पकालिक मापदंड का पूर्वानुमान लगाता है, और एमपीसी गति, बल और धारा संबंधी बाधाओं को लागू करता है। एल्गोरिदम को प्रतिस्थापन के रूप में मानने के बजाय, समय और सुरक्षा संबंधी जिम्मेदारियों को निर्धारित करने के लिए पीपीओ/एसएसी लेख और एमपीसी लेख का उपयोग करें।
अनिश्चितता को एक संख्या में समाहित न करें
ज्ञान संबंधी अनिश्चितता अनुपलब्ध प्रशिक्षण डेटा से उत्पन्न होती है; यादृच्छिक अनिश्चितता अपरिवर्तनीय सेंसर और पर्यावरण भिन्नता से उत्पन्न होती है। एक समूह विचरण पहले के लिए एक उपयोगी संकेत है, लेकिन एक समूह अभी भी समान पूर्वाग्रह साझा कर सकता है। जब पूर्वानुमानित विचरण एक सीमा से अधिक हो जाता है, तो मापदंड को छोटा करें, गति कम करें, एक क्लासिकल नियंत्रक पर स्विच करें, या कोई अन्य डेटा एकत्र करें। योजना बनाने से पहले अवलोकन करें। तैनाती से पहले इस परहेज नीति को स्पष्ट रूप से निर्दिष्ट किया जाना चाहिए।
एक-चरण अवशिष्ट e_t=s_{t+1}-\hat s_{t+1} के लिए, माध्य वर्ग त्रुटि के अतिरिक्त लॉग क्वांटाइल और सबसे खराब स्थितियों का विश्लेषण करें। कम औसत त्रुटि संपर्क से ठीक पहले एक बड़ी त्रुटि को छिपा सकती है। संभाव्यता पूर्वानुमान अंतराल को कभी भी सुरक्षा प्रमाणपत्र के रूप में न लें; स्वतंत्र टक्कर, बल, तापमान और धारा मॉनिटर रखें।
डिज़ाइन पहचान प्रयोग
सिस्टम पहचान एक प्रयोग डिज़ाइन समस्या है, न कि एक एकल अंशांकन। एक मोटर के लिए, स्थैतिक घर्षण, विभिन्न गतियों पर जड़त्व, भार-निर्भर टॉर्क और संचार राउंड-ट्रिप विलंब को अलग-अलग मापें। एक हाइड्रोलिक एक्चुएटर के लिए, दबाव, प्रवाह, सिलेंडर वेग, तेल तापमान और वाल्व कमांड को एक ही घड़ी पर टाइमस्टैम्प करें। डेटा को दिन, तल, पेलोड, प्रकाश और तापमान के आधार पर विभाजित करें—यादृच्छिक पड़ोसी फ़्रेमों के आधार पर नहीं—ताकि अंतिम सेट वास्तव में अदृश्य हो।
एक छोटा संख्यात्मक अंतर्ज्ञान
एक 1 किलोग्राम की गाड़ी पर विचार करें जिसका वेग प्रत्येक 0.1u से बदलता है घर्षण-मुक्त मॉडल पाँच चरणों में u=1 के लिए 0.5\,\mathrm{m/s} वेग वृद्धि का अनुमान लगाता है। यदि वास्तविक कार्ट घर्षण के कारण प्रति चरण 0.02\,\mathrm{m/s} खो देता है, तो पाँच-चरण त्रुटि 0.1\,\mathrm{m/s} तक पहुँच जाती है। एक छोटा क्षितिज, ऑनलाइन पहचान, गति बाधा में मार्जिन और माप से पुनः नियोजन इस सरल मॉडल को उपयोगी बनाए रखते हैं।
प्रकाशन हेतु साक्ष्य
समीकरणों के साथ-साथ, प्रशिक्षण अवधि, सेंसर दर, विलंब, यादृच्छिक बीज, पर्यावरण पैरामीटर, सॉल्वर समयसीमा और फ़ॉलबैक नीति को भी बनाए रखें। भविष्यवाणी अवशेषों, बाधा उल्लंघनों, रुकने की दूरी और अनिश्चितता-प्रेरित अनुपस्थिति को उसी प्रयोग आईडी द्वारा प्लॉट करें जो पुरस्कार है। यदि कच्चे लॉग साझा नहीं किए जा सकते हैं, तो अनाम सांख्यिकी, सिमुलेशन सेटिंग्स, इकाइयाँ और एक संदर्भ तिथि प्रकाशित करें ताकि दावे का दायरा जाँच योग्य बना रहे।
समझ
टिप्पणियाँ
पहले लॉग इन करें।
अभी कोई डेटा नहीं है।