लेख
तकनीक बनाएँ, परखें और उसका विश्लेषण करें। कार्यान्वयन, प्रयोग और शोध से उसके काम करने के सिद्धांत समझें।
← अध्ययन मार्गदर्शिका

रीइन्फोर्समेंट लर्निंग — अध्ययन मार्गदर्शिका

रीइन्फोर्समेंट लर्निंग — व्यवस्थित अध्ययन पथों से बुनियादी सिद्धांतों से व्यावहारिक उपयोग तक पहुँचें।

व्यवस्थित अध्ययन पथों से बुनियादी सिद्धांतों से व्यावहारिक उपयोग तक पहुँचें।

  1. Fundamentals · 7 मिनट में पढ़ें

    रीइन्फोर्समेंट लर्निंग की मूल बातें — एमडीपी, बेलमैन समीकरण और रोबोट के लिए एक्सप्लोरेशन

    रीइन्फोर्समेंट लर्निंग एक बंद लूप है जिसमें एक एजेंट प्रेक्षणों से क्रियाएँ चुनता है और विलंबित पुरस्कारों को अधिकतम करता है। यह परिचय एमडीपी, मूल्य कार्यों, नीतियों, बेलमैन समीकरणों, अन्वेषण बनाम दोहन, पुरस्कार डिजाइन और सिमुलेशन से वास्तविक रोबोट तक के पथ की व्याख्या करता है।

  2. Fundamentals · 6 मिनट में पढ़ें

    क्यू-लर्निंग और डीक्यूएन — क्यू-टेबल से डीप रीइन्फोर्समेंट लर्निंग तक

    क्यू-लर्निंग बेलमैन इष्टतमता लक्ष्य के साथ क्रिया मूल्यों को अपडेट करती है। यह प्रारंभिक परिचय सारणीबद्ध क्यू-टेबल से डीप क्यू-नेटवर्क तक के मार्ग का अनुसरण करता है, जिसमें अनुभव पुनर्प्रस्तुति, लक्ष्य नेटवर्क, अति-अनुमान और रोबोट स्टैक में सुरक्षित स्थान निर्धारण की व्याख्या की गई है।

  3. Fundamentals · 6 मिनट में पढ़ें

    पॉलिसी ग्रेडिएंट्स, पीपीओ और एसएसी — रोबोटों के लिए स्थिर सतत नियंत्रण

    पॉलिसी ग्रेडिएंट्स सीधे पॉलिसी को अपडेट करते हैं ताकि स्टीयरिंग, थ्रस्ट और जॉइंट टॉर्क निरंतर बने रहें। यह लेख एक्टर-क्रिटिक, पीपीओ और एसएसी को आपस में जोड़ता है, फिर सिम-टू-रियल ट्रांसफर के लिए क्लिपिंग, एंट्रोपी रेगुलराइजेशन, मूल्यांकन और सुरक्षा सीमा को कवर करता है।

  4. Fundamentals · 10 मिनट में पढ़ें

    रिवॉर्ड डिज़ाइन की बुनियादी बातें — वास्तविक जीवन में "किस चीज़ को अधिकतम करना है" यह सबसे कठिन हिस्सा क्यों है

    रीइन्फोर्समेंट लर्निंग के कार्यान्वयन में, अक्सर रिवॉर्ड-फंक्शन का डिज़ाइन ही परिणाम निर्धारित करता है, न कि एल्गोरिदम। यह लेख स्पार्स बनाम डेंस रिवॉर्ड, पोटेंशियल-आधारित रिवॉर्ड शेपिंग की पॉलिसी इनवेरिएंस, रिवॉर्ड हैकिंग के वास्तविक मामले, इनवर्स रीइन्फोर्समेंट लर्निंग और कंस्ट्रेंड आरएल को व्यवस्थित रूप से प्रस्तुत करता है।

  5. Fundamentals · 5 मिनट में पढ़ें

    मॉडल-आधारित सुदृढीकरण शिक्षण और सिम-टू-रियल

    वास्तविक मशीनों के लिए विश्व मॉडल, पूर्वानुमान त्रुटि, एमपीसी, डोमेन यादृच्छिकीकरण, सिस्टम पहचान और सुरक्षा निगरानी।

  6. Fundamentals · 7 मिनट में पढ़ें

    पुनर्बलन अधिगम का परिचय: अनुकरण अधिगम और व्युत्क्रम पुनर्बलन अधिगम

    व्यवहार क्लोनिंग, डैगर और व्युत्क्रम सुदृढ़ीकरण अधिगम में, पुरस्कारों को परिभाषित करना कठिन होने पर प्रदर्शन विधियों का उपयोग किया जाता है। यह प्रारंभिक परिचय सहचर परिवर्तन, पुरस्कार अनुमान, वीएलए कनेक्शन, मूल्यांकन, सुरक्षा और डेटा स्रोत को शामिल करता है।

  7. Fundamentals · 13 मिनट में पढ़ें

    π0 की व्याख्या — फ्लो मैचिंग ने VLA क्रिया निर्माण को कैसे बदला

    फिजिकल इंटेलिजेंस के π0 के लिए एक स्रोत-आधारित तकनीकी मार्गदर्शिका: पालीगेम्मा वीएलएम और समर्पित एक्शन एक्सपर्ट, सशर्त प्रवाह मिलान के साथ निरंतर क्रिया निर्माण, सात प्रकार के रोबोटों में क्रॉस-एम्बोडिमेंट प्रशिक्षण, और आरटी-2 और ओपनवीएलए जैसे ऑटोरेग्रेसिव वीएलए मॉडल से अंतर।

  8. Fundamentals · 10 मिनट में पढ़ें

    मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग का परिचय — ऐसी दुनिया में अनुकूलन जहां दूसरा पक्ष भी सीख रहा है

    जब एक से अधिक एजेंट एक ही समय में सीखते हैं, तो एकल-एजेंट एमडीपी मान्य नहीं रह जाता। यह लेख समीकरणों और आरेखों के साथ गैर-स्थिरता, सहकारी/प्रतिस्पर्धी/मिश्रित सेटिंग्स, सीटीडीई, क्रेडिट-असाइनमेंट समस्या, एमएडीडीपीजी और क्यूएमआईएक्स को व्यवस्थित करता है।

Search this field →