Contents — find the section you need

निष्कर्ष

मॉडल-आधारित रीइन्फोर्समेंट लर्निंग (RL) एक विश्व मॉडल \hat f सीखती है, जो स्थिति और क्रिया को अनुमानित अगली स्थिति से मैप करता है, इसके भीतर क्रिया अनुक्रमों का परीक्षण करता है, और हार्डवेयर पर केवल एक पर्यवेक्षित क्रिया लागू करता है। मॉडल-मुक्त विधियाँ सीधे इनाम से नीति सीखती हैं; MBRL अधिक डेटा-कुशल हो सकती है और बाधाओं को व्यक्त कर सकती है, लेकिन मॉडल त्रुटि केवल सिम्युलेटर-आधारित सफलता का कारण बन सकती है। RL मूल बातें, Q-लर्निंग, PPO/SAC, और MPC देखें।

विश्व मॉडल और योजना

Diagram 1 · Use the button to switch views
observationsworld modelMPC/policysafety monitor

चित्र 1 — डस्ककॉइल द्वारा निर्मित वैचारिक SVG, मापा गया सिस्टम डेटा नहीं।

\hat s_{t+1}=\hat f_\theta(s_t,a_t) सीखें और एक रीसीडिंग-हॉराइजन उद्देश्य को अनुकूलित करें:

a_{t:t+H}^*=\arg\max\sum_{k=0}^{H-1}\gamma^k\hat r(\hat s_{t+k},a_{t+k})-\lambda C(\hat s,a)
केवल पहली क्रिया निष्पादित की जाती है, फिर सिस्टम का पुनः अवलोकन किया जाता है। बाधाएँ C टक्कर, जोड़, तापमान, गति या वर्तमान सीमाओं का प्रतिनिधित्व कर सकती हैं। यहाँ s स्थिति है और a क्रिया है; मॉडल अगली स्थिति का पूर्वानुमान लगाता है और \pi(a|s) क्रियाएं प्रस्तावित कर सकता है। सीखा गया इनाम \hat r_\theta(s_t,a_t) का मूल्यांकन समय t पर क्षितिज H के दौरान किया जाता है। नीचे दिए गए संख्यात्मक उदाहरण में 1\,\mathrm{kg} द्रव्यमान और u इनपुट वाली एक गाड़ी का उपयोग किया गया है।

सिमुलेशन-से-वास्तविक, पहचान और सुरक्षा

लंबे रोलआउट में एक-चरणीय त्रुटियां बढ़ती जाती हैं। समूह अनिश्चितता का अनुमान लगा सकते हैं; योजनाकार उच्च-भिन्नता वाले क्षेत्रों से बच सकते हैं और छोटे क्षितिज का उपयोग कर सकते हैं। डोमेन यादृच्छिकीकरण द्रव्यमान, घर्षण, विलंब, सेंसर शोर, प्रकाश और कैमरा स्थिति को बदलता है। सिस्टम पहचान जड़त्व, घर्षण, मोटर स्थिरांक और विलंबता को मापती है ताकि ये सीमाएं मनमानी के बजाय तर्कसंगत हों।

लॉगिंग से कम गति वाले छाया नियंत्रण और फिर सीमित पर्यवेक्षित परीक्षणों की ओर बढ़ें। आपातकालीन स्टॉप, स्वतंत्र गति/बल/तापमान मॉनिटर, संचार हानि स्टॉपिंग और मानव पृथक्करण को सीखी गई नीति से बाहर रखें। सामान्य विफलताओं में निश्चित-घर्षण सिमुलेशन शामिल हैं। व्हील स्लिप, लाइटिंग ओवरफिट, कंपन पैदा करने वाली रिवॉर्ड हैकिंग, और अस्थिरता पैदा करने वाली अनमॉडल देरी। उल्लंघन की संख्या, स्टॉपिंग डिस्टेंस, अनिश्चितता-प्रेरित परहेज़, और सबसे खराब स्थिति का व्यवहार—केवल औसत रिवॉर्ड ही नहीं, रिपोर्ट करें।

मॉडल-मुक्त और मॉडल-आधारित भूमिकाएँ

मॉडल-मुक्त RL किसी नीति या मान को सीधे अनुभव से अपडेट करता है। यह तब उपयोगी होता है जब संपर्क गतिकी को मॉडल करना कठिन होता है, लेकिन प्रत्येक सुधार में वास्तविक परीक्षण लग सकते हैं। MBRL प्रत्येक ट्रांज़िशन का पुन: उपयोग करके एक प्रेडिक्टर को प्रशिक्षित करता है और उस प्रेडिक्टर में कई संभावित अनुक्रमों का मूल्यांकन करता है। यदि प्रेडिक्टर में एक व्यवस्थित पूर्वाग्रह है, तो प्लानर केवल सिम्युलेटर-आधारित शॉर्टकट को अनुकूलित करता है।

पहलू मॉडल-मुक्त मॉडल-आधारित
हार्डवेयर डेटा कम से मध्यम दक्षता मॉडल की सीमा के भीतर मध्यम से उच्च दक्षता
रनटाइम अक्सर हल्की नीति अनुमान प्रत्येक चक्र में रोलआउट और अनुकूलन
बाधाएँ आमतौर पर एक अप्रत्यक्ष रिवॉर्ड/सुरक्षा परत नियोजन समस्या में स्वाभाविक रूप से शामिल
मुख्य विफलता से खराब एक्सट्रपलेशन विरल डेटा दीर्घकालिक मॉडल त्रुटि

सामान्य फिट | जटिल संपर्क और दृश्य नीतियां | अल्पकालिक गति, ऊर्जा और तापीय नियोजन |

हाइब्रिड स्टैक आम हैं: एक सीखी हुई नीति संभावित मापदंडों का प्रस्ताव करती है, एक सीखा हुआ मॉडल अल्पकालिक मापदंड का पूर्वानुमान लगाता है, और एमपीसी गति, बल और धारा संबंधी बाधाओं को लागू करता है। एल्गोरिदम को प्रतिस्थापन के रूप में मानने के बजाय, समय और सुरक्षा संबंधी जिम्मेदारियों को निर्धारित करने के लिए पीपीओ/एसएसी लेख और एमपीसी लेख का उपयोग करें।

अनिश्चितता को एक संख्या में समाहित न करें

ज्ञान संबंधी अनिश्चितता अनुपलब्ध प्रशिक्षण डेटा से उत्पन्न होती है; यादृच्छिक अनिश्चितता अपरिवर्तनीय सेंसर और पर्यावरण भिन्नता से उत्पन्न होती है। एक समूह विचरण पहले के लिए एक उपयोगी संकेत है, लेकिन एक समूह अभी भी समान पूर्वाग्रह साझा कर सकता है। जब पूर्वानुमानित विचरण एक सीमा से अधिक हो जाता है, तो मापदंड को छोटा करें, गति कम करें, एक क्लासिकल नियंत्रक पर स्विच करें, या कोई अन्य डेटा एकत्र करें। योजना बनाने से पहले अवलोकन करें। तैनाती से पहले इस परहेज नीति को स्पष्ट रूप से निर्दिष्ट किया जाना चाहिए।

एक-चरण अवशिष्ट e_t=s_{t+1}-\hat s_{t+1} के लिए, माध्य वर्ग त्रुटि के अतिरिक्त लॉग क्वांटाइल और सबसे खराब स्थितियों का विश्लेषण करें। कम औसत त्रुटि संपर्क से ठीक पहले एक बड़ी त्रुटि को छिपा सकती है। संभाव्यता पूर्वानुमान अंतराल को कभी भी सुरक्षा प्रमाणपत्र के रूप में न लें; स्वतंत्र टक्कर, बल, तापमान और धारा मॉनिटर रखें।

डिज़ाइन पहचान प्रयोग

सिस्टम पहचान एक प्रयोग डिज़ाइन समस्या है, न कि एक एकल अंशांकन। एक मोटर के लिए, स्थैतिक घर्षण, विभिन्न गतियों पर जड़त्व, भार-निर्भर टॉर्क और संचार राउंड-ट्रिप विलंब को अलग-अलग मापें। एक हाइड्रोलिक एक्चुएटर के लिए, दबाव, प्रवाह, सिलेंडर वेग, तेल तापमान और वाल्व कमांड को एक ही घड़ी पर टाइमस्टैम्प करें। डेटा को दिन, तल, पेलोड, प्रकाश और तापमान के आधार पर विभाजित करें—यादृच्छिक पड़ोसी फ़्रेमों के आधार पर नहीं—ताकि अंतिम सेट वास्तव में अदृश्य हो।

एक छोटा संख्यात्मक अंतर्ज्ञान

एक 1 किलोग्राम की गाड़ी पर विचार करें जिसका वेग प्रत्येक 0.1u से बदलता है घर्षण-मुक्त मॉडल पाँच चरणों में u=1 के लिए 0.5\,\mathrm{m/s} वेग वृद्धि का अनुमान लगाता है। यदि वास्तविक कार्ट घर्षण के कारण प्रति चरण 0.02\,\mathrm{m/s} खो देता है, तो पाँच-चरण त्रुटि 0.1\,\mathrm{m/s} तक पहुँच जाती है। एक छोटा क्षितिज, ऑनलाइन पहचान, गति बाधा में मार्जिन और माप से पुनः नियोजन इस सरल मॉडल को उपयोगी बनाए रखते हैं।

प्रकाशन हेतु साक्ष्य

समीकरणों के साथ-साथ, प्रशिक्षण अवधि, सेंसर दर, विलंब, यादृच्छिक बीज, पर्यावरण पैरामीटर, सॉल्वर समयसीमा और फ़ॉलबैक नीति को भी बनाए रखें। भविष्यवाणी अवशेषों, बाधा उल्लंघनों, रुकने की दूरी और अनिश्चितता-प्रेरित अनुपस्थिति को उसी प्रयोग आईडी द्वारा प्लॉट करें जो पुरस्कार है। यदि कच्चे लॉग साझा नहीं किए जा सकते हैं, तो अनाम सांख्यिकी, सिमुलेशन सेटिंग्स, इकाइयाँ और एक संदर्भ तिथि प्रकाशित करें ताकि दावे का दायरा जाँच योग्य बना रहे।

अपनी जाँच करें

समझ