Contents — find the section you need
कई विज़न-लैंग्वेज-एक्शन (VLA) मॉडल छवियों, भाषा और क्रियाओं को एक टोकन अनुक्रम के रूप में दर्शाते हैं और अगले टोकन की भविष्यवाणी एक-एक करके करते हैं। फिजिकल इंटेलिजेंस द्वारा 2024 में घोषित π0 (पाई-शून्य) क्रिया-उत्पादन तंत्र को ही बदल देता है: क्रियाओं को स्वतः प्रतिगामी रूप से टोकनाइज़ करने के बजाय, यह सशर्त प्रवाह मिलान के साथ एक सतत क्रिया खंड उत्पन्न करता है। यह लेख "π0: सामान्य रोबोट नियंत्रण के लिए एक विज़न-लैंग्वेज-एक्शन प्रवाह मॉडल" (ब्लैक, ब्राउन, ड्रिएस एट अल., फिजिकल इंटेलिजेंस, arXiv:2410.24164) नामक शोधपत्र में वर्णित डिज़ाइन का चरण-दर-चरण विश्लेषण करता है।
यह लेख मूल शोधपत्र (arXiv:2410.24164) और पालीगेम्मा शोधपत्र (arXiv:2407.07726) में दिए गए विवरणों पर आधारित है।
0. आप क्या सीखेंगे
- RT-2 और OpenVLA जैसे ऑटोरेग्रेसिव VLA मॉडल की तुलना में π0 में क्या परिवर्तन होते हैं
- पालीगेम्मा VLM बैकबोन और समर्पित “एक्शन एक्सपर्ट” एक साथ कैसे काम करते हैं
- कंडीशनल फ्लो मैचिंग कैसे क्रियाएं उत्पन्न करता है, जिसमें अनुमान के समय यूलर इंटीग्रेशन शामिल है
- सात प्रकार के रोबोटों में विषम क्रॉस-एम्बोडिमेंट प्रशिक्षण को कैसे संभाला जाता है
- प्री-ट्रेनिंग और पोस्ट-ट्रेनिंग को दो चरणों वाली प्रक्रिया में क्यों विभाजित किया गया है
1. निष्कर्ष: π0 क्या है?
π0 एक सामान्य प्रयोजन वाला रोबोट नियंत्रण मॉडल है जो एक पूर्व-प्रशिक्षित विज़न-लैंग्वेज मॉडल (पालीगेम्मा) और एक समर्पित एक्शन एक्सपर्ट को जोड़ता है। यह मॉडल सशर्त प्रवाह मिलान के माध्यम से निरंतर क्रिया खंड उत्पन्न करता है। एक ही मॉडल कैमरा छवियों, प्राकृतिक भाषा निर्देश और रोबोट की संयुक्त स्थिति को प्राप्त करता है, और फिर एक साथ 50 तक के भावी चरणों को कवर करने वाला एक क्रिया अनुक्रम आउटपुट करता है। इसे सात अलग-अलग रोबोट प्लेटफार्मों के डेटा पर पूर्व-प्रशिक्षित किया गया है, यह कुछ कार्यों को शून्य-शॉट में निष्पादित कर सकता है, और अपेक्षाकृत कम डेटा के साथ सूक्ष्म-ट्यूनिंग के माध्यम से नए कार्यों के अनुकूल होने के लिए डिज़ाइन किया गया है।
2. प्रवाह मिलान के साथ क्रियाएँ क्यों उत्पन्न करें?
RT-2 और OpenVLA जैसे प्रारंभिक VLA निरंतर क्रिया मानों (संयुक्त कोण, वेग, आदि) को पूर्वनिर्धारित बिन्स में विभाजित करते हैं और उन्हें अन्यथा अप्रयुक्त भाषा-मॉडल शब्दावली टोकन को असाइन करते हैं। इससे छवियों, भाषा और क्रियाओं को एक टोकन अनुक्रम के रूप में संभाला जा सकता है। यह दृष्टिकोण लागू करने में सरल है, लेकिन इसकी दो सीमाएँ हैं। पहली बात तो यह है कि चूंकि क्रियाएं एक-एक टोकन करके उत्पन्न होती हैं, इसलिए उच्च आवृत्ति और उच्च आयामी क्रिया अनुक्रमों को उत्पन्न करने में समय लग सकता है। दूसरी बात यह है कि विखंडन क्रिया स्थान का एक मोटा अनुमान है, जिससे कपड़ा मोड़ने या तरल पदार्थ डालने जैसी सहज और सटीक गतियों का प्रतिनिधित्व करना कठिन हो जाता है, जहां विरूपण और संपर्क महत्वपूर्ण होते हैं।
π0 क्रिया टोकनीकरण से बचकर और प्रवाह मिलान (एक प्रसार-मॉडल परिवार) का उपयोग करके, क्रिया प्रतिनिधित्व के माध्यम से एक ही बार में 50 चरणों का निरंतर क्रिया खंड उत्पन्न करके इन दोनों बिंदुओं का समाधान करता है। यह शोधपत्र स्पष्ट रूप से इस डिज़ाइन को 50 हर्ट्ज़ तक की आवृत्तियों पर अत्यधिक निपुण कार्यों और क्रिया खंडों को संभालने के तरीके के रूप में प्रस्तुत करता है।
3. इसमें क्या शामिल है?
π0 को तीन प्रकार के इनपुट प्राप्त होते हैं:
- छवियां o_t : कई कैमरा दृश्यों से RGB छवियां (कॉन्फ़िगरेशन के आधार पर अधिकतम तीन दृश्य)
- भाषा निर्देश : एक प्राकृतिक भाषा में कार्य विवरण, जैसे "शर्ट मोड़ें"
- प्रोप्रियोसेप्शन q_t : एक स्थिति वेक्टर, जैसे रोबोट के जोड़ों के कोण
इन सभी को एक साथ एक अवलोकन o_t = [I_t^1, \dots, I_t^n, \ell_t, q_t] के रूप में माना जाता है। रोबोट कॉन्फ़िगरेशन के अनुसार कैमरा संख्या और जोड़ों की स्वतंत्रता की डिग्री भिन्न होती है, इसलिए आयामों को संरेखित करने के लिए पैडिंग और मास्किंग की आवश्यकता होती है, जैसा कि नीचे वर्णित है।
4. क्या भविष्यवाणी की जाती है?
आउटपुट एक एक्शन चंक A_t = [a_t, a_{t+1}, \dots, a_{t+H-1}] है जिसमें वर्तमान समय से आगे की H=50 क्रियाएं शामिल हैं। एक ऑटोरेग्रेसिव मॉडल के विपरीत जो एक समय में एक एक्शन टोकन उत्पन्न करता है, π0 पूरे चंक को एक साथ उत्पन्न करता है। फ्लो मैचिंग के माध्यम से इस चंक को जनरेट करना π0 का मुख्य विचार है।
5. मूल संरचना
π0 एक प्रीट्रेन्ड VLM (PaliGemma) को एक्शन जनरेशन के लिए विशेष रूप से डिज़ाइन किए गए एक छोटे "एक्शन एक्सपर्ट" के साथ चलाता है। ये दोनों ट्रांसफॉर्मर एक ही लेयर में समानांतर रूप से काम करते हैं।
क्या क्रिया उत्पन्न करने वाला मॉडल बिना अनुकूलन के किसी अज्ञात रोबोट को संचालित कर सकता है?
जोड़ विन्यास, क्रिया निरूपण, अवलोकन और प्रशिक्षण-डेटा इंटरफ़ेस का मिलान होना आवश्यक है। आधारभूत मॉडल होने का अर्थ यह नहीं है कि वह बिना समायोजन के संगत है।
6. घटकों का तकनीकी विवरण
पालीगेम्मा बैकबोन और एक्शन एक्सपर्ट
वीएलएम बैकबोन को पालीगेम्मा से आरंभ किया गया है, जिसकी घोषणा Google ने 2024 में की थी। पालीगेम्मा एक सिग्लिप-सो400एम विज़न एनकोडर को जेम्मा-2बी भाषा मॉडल के साथ मिलाकर 3बी-पैरामीटर वीएलएम बनाता है। इसका उद्देश्य इंटरनेट-स्तरीय प्रीट्रेनिंग से प्राप्त दृश्य और भाषा ज्ञान को रोबोट-क्रिया निर्माण में स्थानांतरित करना है।
पालीगेम्मा (लगभग 3 अरब पैरामीटर) के अतिरिक्त, π0 में लगभग 300 मिलियन पैरामीटर वाला एक्शन एक्सपर्ट भी शामिल है: एक छोटा ट्रांसफ़ॉर्मर जिसकी चौड़ाई 1024 और MLP आयाम 4096 है। पालीगेम्मा की बात करें तो, इसकी संबंधित चौड़ाई 2048, गहराई 18 परतें और MLP आयाम 16384 हैं। इस प्रकार, संपूर्ण π0 मॉडल में लगभग 3.3 अरब पैरामीटर हैं।
महत्वपूर्ण बात यह है कि ये दो पूरी तरह से स्वतंत्र नेटवर्क नहीं हैं जो साथ-साथ चल रहे हैं। वे अलग-अलग टोकन प्रकारों के लिए अलग-अलग पैरामीटर सेट का उपयोग करते हैं, जबकि ट्रांसफ़ॉर्मर की परतें समान होती हैं। पालीगेम्मा छवि और भाषा टोकन को संभालता है, जबकि एक्शन एक्सपर्ट स्थिति और शोर-युक्त क्रिया टोकन को संभालता है; साझा परतों में ब्लॉक-वार कारण ध्यान के माध्यम से उनके बीच सूचना का आदान-प्रदान होता है। क्रिया टोकन अपने ब्लॉक के भीतर द्विदिश रूप से एक-दूसरे पर ध्यान दे सकते हैं, लेकिन प्रशिक्षण की बाधा उन्हें भविष्य की जानकारी देखने से रोकती है। यह विशेषज्ञों के मिश्रण के विचार से मिलता-जुलता है और एक ही मॉडल को असतत भाषा आउटपुट (क्रॉस-एंट्रोपी के साथ प्रशिक्षित) और सतत क्रिया आउटपुट (फ्लो-मैचिंग लॉस के साथ प्रशिक्षित) को संयोजित करने की अनुमति देता है।
सशर्त फ्लो मैचिंग के साथ क्रिया निर्माण
π0 सशर्त फ्लो मैचिंग के साथ क्रियाएँ उत्पन्न करता है, जो प्रसार-आधारित जनरेटिव विधियों के परिवार से संबंधित है। प्रशिक्षण के दौरान, वास्तविक क्रिया खंड A_t और गाऊसी शोर \epsilon \sim \mathcal{N}(0, I) को समय पैरामीटर \tau \in [0,1] के साथ रैखिक रूप से मिश्रित किया जाता है ताकि शोर वाली क्रिया A_t^\tau बनाई जा सके।
A_t^\tau को वास्तविक क्रिया A_t की ओर ले जाने के लिए अनुसरण की जाने वाली लक्ष्य दिशा को निम्नानुसार परिभाषित किया गया है।
एक्शन एक्सपर्ट को एक नेटवर्क v_\theta(A_t^\tau, o_t) के रूप में प्रशिक्षित किया जाता है जो अवलोकन o_t और शोरगुल वाले एक्शन A_t^\tau से इस लक्ष्य वेक्टर फ़ील्ड का पूर्वानुमान लगाता है। हानि पूर्वानुमानित और लक्ष्य वेक्टर फ़ील्ड के बीच वर्ग त्रुटि है।
अनुमान के समय, सैंपलिंग शुद्ध शोर A_t^{\tau=0} = \epsilon से शुरू होती है। एक फॉरवर्ड यूलर विधि पूर्वानुमानित वेक्टर फ़ील्ड को \tau=0 से \tau=1 तक एकीकृत करती है, जिससे अंतिम एक्शन चंक तैयार होता है।
यह शोधपत्र \delta = 0.1 या 10 एकीकरण चरणों का उपयोग करके \tau=0 से \tau=1 तक जाता है। जबकि RT-2/OpenVLA में ऑटोरेग्रेसिव टोकन जनरेशन एक्शन चंक की लंबाई के लिए अनुक्रमिक डिकोडिंग को दोहराता है, π0 पूरे चंक को 10 अपडेट चरणों में परिष्कृत करता है। इसलिए अपडेट की संख्या चंक की लंबाई के साथ नहीं बढ़ती है, जो इसकी गति के लाभ का व्यावहारिक स्रोत है।
क्रॉस-एम्बोडिमेंट लर्निंग — विभिन्न रोबोटों पर एक ही मॉडल को प्रशिक्षित करना
π0 का प्रशिक्षण डेटा सात अलग-अलग रोबोट प्लेटफॉर्म को कवर करता है: UR5e, बाइमैनुअल UR5e, Franka, बाइमैनुअल Trossen, बाइमैनुअल ARX और AgileX, मोबाइल Trossen और मोबाइल ARX, और मोबाइल Fibocom। कैमरों की संख्या 2-3 है, जबकि स्वतंत्रता की डिग्री की संख्या रोबोट के आधार पर 7 से 17 तक होती है।
इस विषम डेटा को एक मॉडल में प्रस्तुत करने के लिए, π0 निम्नलिखित सामान्यीकरण लागू करता है:
-
स्टेट वेक्टर q_t और एक्शन वेक्टर a_t को प्रशिक्षण डेटा (18 आयाम) में अधिकतम डिग्री ऑफ़ फ़्रीडम तक पैड किया जाता है। कम डिग्री ऑफ़ फ़्रीडम वाले रोबोट अप्रयुक्त प्रविष्टियों के लिए शून्य पैडिंग का उपयोग करते हैं।
-
तीन से कम कैमरों वाले रोबोट के लिए, लुप्त छवि स्लॉट को मास्क किया जाता है ताकि ध्यान तंत्र उन स्थितियों को अनदेखा कर दे।
-
चूंकि नमूना गणना कार्य और रोबोट संयोजन के अनुसार काफी भिन्न होती है, इसलिए n नमूनों वाले संयोजन के लिए नमूनाकरण को n^{0.43} द्वारा भारित किया जाता है। इससे डेटा-समृद्ध कार्यों का प्रभुत्व कम हो जाता है।
संपूर्ण प्रशिक्षण सेट में लगभग 900 मिलियन टाइम स्टेप्स, या लगभग 10,000 घंटे का डेटा शामिल है: फिजिकल इंटेलिजेंस का 68 कार्यों और सात रोबोटों से प्राप्त अपना डेटा, साथ ही ओपन एक्स-एम्बोडिमेंट (OXE), ब्रिज v2 और DROID जैसे सार्वजनिक डेटासेट।
दो-चरणीय प्रशिक्षण विधि — पूर्व-प्रशिक्षण और पश्चात-प्रशिक्षण
π0 प्रशिक्षण को मोटे तौर पर दो चरणों में विभाजित किया गया है। पूर्व-प्रशिक्षण में पूर्ण, विशाल और विविध डेटासेट का उपयोग किया जाता है। यह कार्यों के नामों और खंड एनोटेशन का उपयोग करता है जो निष्पादन को कई सेकंड की इकाइयों में विभाजित करते हैं ताकि व्यापक आधारभूत ज्ञान का निर्माण हो सके। पश्चात-प्रशिक्षण में उच्च-गुणवत्ता वाले, सुनियोजित डेटा का उपयोग किया जाता है जो किसी विशेष कार्य पर केंद्रित होता है ताकि उस आधारभूत ज्ञान को वांछित व्यवहार में परिवर्तित किया जा सके।
शोध पत्र इस विभाजन का एक विशिष्ट कारण बताता है: "यदि हम केवल उच्च-गुणवत्ता वाले डेटा पर प्रशिक्षण देते, तो मॉडल विफलताओं से उबरना नहीं सीख पाता।" पूर्व-प्रशिक्षण में विविध निष्पादन डेटा, जो हमेशा परिपूर्ण नहीं होता, मॉडल को गलतियाँ होने पर उनसे उबरने का अनुभव प्रदान करता है। प्रशिक्षण के बाद प्राप्त उच्च-गुणवत्ता वाला डेटा, इच्छित परिशुद्धता के साथ लक्ष्य कार्य को निष्पादित करने की क्षमता को और बेहतर बनाता है।
पारंपरिक प्रसार मॉडल के बजाय प्रवाह मिलान क्यों?
डीडीपीएम (डीनोइज़िंग डिफ्यूजन प्रोबेबिलिस्टिक मॉडल) जैसे मानक प्रसार मॉडल एक अरैखिक पथ मानते हैं जो धीरे-धीरे शोर जोड़ता और हटाता है, और अक्सर इसमें दसियों या सैकड़ों पुनरावृत्ति चरणों की आवश्यकता होती है। π0 में सशर्त प्रवाह मिलान इसके बजाय एक रैखिक-गाऊसी संभाव्यता पथ का उपयोग करता है जो शोर \epsilon और वास्तविक क्रिया A_t को एक सीधी रेखा ( A_t^\tau = \tau A_t + (1-\tau)\epsilon ) से जोड़ता है। क्योंकि पथ सीधा है, सीखने के लिए सदिश क्षेत्र सरल है, और एकीकरण चरणों की एक छोटी संख्या (π0 में 10) उपयोगी सटीकता के साथ लक्ष्य क्रिया तक पहुँच सकती है। यह शोध पत्र इसे वास्तविक समय के करीब गति से उच्च-आवृत्ति, उच्च-आयामी क्रिया खंडों को उत्पन्न करने के लिए एक व्यावहारिक विकल्प के रूप में प्रस्तुत करता है।
7. π0 अन्य VLA क्रिया-उत्पादन विधियों से कैसे भिन्न है
VLA क्रिया-उत्पादन को तीन व्यापक श्रेणियों में वर्गीकृत किया जा सकता है।
| पहलू | ऑटोरेग्रेसिव टोकनाइज़ेशन (RT-2, OpenVLA) | डिफ्यूजन हेड (जैसे Octo) | फ्लो मैचिंग (π0) |
|---|---|---|---|
| क्रिया प्रतिनिधित्व | एक-एक करके टोकन के रूप में अनुमानित असतत क्रिया मान | ट्रांसफॉर्मर आउटपुट पर आधारित डिफ्यूजन प्रक्रिया के माध्यम से उत्पन्न सतत मान | फ्लो मैचिंग के माध्यम से उत्पन्न सतत मान |
| उत्पादन पुनरावृत्तियों की संख्या | चंक की लंबाई के साथ बढ़ती है; लंबे चंक धीमे होते हैं | डिफ्यूजन चरणों की संख्या पर निर्भर करता है | एकीकरण चरणों की संख्या कम होती है; π0 में 10 चरण होते हैं |
| उच्च आवृत्ति, निपुण गति के लिए उपयुक्तता | असततकरण एक बाधा बन सकता है | सुचारू आउटपुट संभव है, लेकिन कई चरण विलंबता बढ़ाते हैं | उच्च आवृत्ति वाले चंक्स (50 हर्ट्ज़ तक) अपेक्षाकृत तेज़ी से उत्पन्न करता है |
कार्यान्वयन में सरलता | सरल: भाषा-मॉडल शब्दावली का विस्तार करें | एक समर्पित प्रसार हेड की आवश्यकता | एक समर्पित एक्शन एक्सपर्ट और वेक्टर-फील्ड डिज़ाइन की आवश्यकता |
कम्प्यूटेशनल लागत | अनुक्रमिक डिकोडिंग ओवरहेड अधिक | प्रसार चरणों के आधार पर मध्यम से उच्च | अपेक्षाकृत कम क्योंकि इसमें कम चरण लगते हैं |
कार्यान्वयन में कठिनाई | अपेक्षाकृत कम; मौजूदा एलएलएम अवसंरचना पुन: प्रयोज्य है | मध्यम | उच्च; पैरामीटर साझाकरण और हानि डिज़ाइन दो आउटपुट प्रकारों तक सीमित हैं |
ऑटोरेग्रेसिव टोकनाइज़ेशन को लागू करना सरल है, लेकिन एक्शन चंक के बढ़ने के साथ अनुक्रमिक डिकोडिंग विलंबता को बढ़ाती है। एक प्रसार हेड सुचारू निरंतर मान उत्पन्न करता है, लेकिन इसके लिए बहु-चरणीय उत्पादन प्रक्रिया की आवश्यकता होती है। π0 इन दोनों दृष्टिकोणों के बीच स्थित है: यह निरंतर मानों को संभालता है और साथ ही निश्चित, कम संख्या में एकीकरण चरणों में संपूर्ण एक्शन चंक उत्पन्न करता है। इमिटेशन लर्निंग के परिप्रेक्ष्य से, BC (बिहेवियर क्लोनिंग) और DAgger अवलोकन से क्रिया तक मैपिंग सीखने की प्रक्रिया का वर्णन करते हैं, जबकि π0 एक बड़े VLM और एक समर्पित जनरेटिव हेड का उपयोग करके उस मैपिंग का एक कार्यान्वयन है। इसके मूल सिद्धांतों के लिए “इमिटेशन लर्निंग और इनवर्स रीइन्फोर्समेंट लर्निंग” देखें।
8. इसकी चुनौतियाँ / कठिन वातावरण
पेपर में दिए गए मूल्यांकन सार्वभौमिक गारंटी के बजाय व्यापक रुझान दर्शाते हैं। कई वास्तविक कार्यों (शर्ट मोड़ना, मेज साफ करना, किराने का सामान पैक करना और टोस्टर से ब्रेड निकालना) पर, बिना फाइन-ट्यूनिंग के प्रीट्रेन्ड बेस मॉडल, OpenVLA और Octo जैसे मौजूदा बेसलाइन की तुलना में काफी अधिक सफलता दर दिखाता है। π0 विशेष रूप से शर्ट मोड़ने जैसे कार्यों में विश्वसनीय है, जहाँ OpenVLA और Octo काफी पीछे रह जाते हैं। हालाँकि, यह अंतर पूर्व-प्रशिक्षण डेटा के पैमाने और विविधता को भी दर्शाता है, इसलिए केवल प्रवाह मिलान से संबंधित लाभ को अलग करना कठिन है।
यह शोधपत्र एक प्रत्यक्ष सीमा भी बताता है: प्रशिक्षण में दर्शाए गए कार्यों के जितना करीब कोई कार्य होता है, उतना ही अधिक लाभ होता है; उस वितरण से बहुत दूर के कार्य प्रशिक्षण के बाद के डेटा की गुणवत्ता और मात्रा पर अधिक निर्भर करते हैं। बॉक्स को असेंबल करना या अंडे पैक करना जैसे लंबे, बहु-चरणीय कार्यों के लिए, रिपोर्ट की गई सफलता अपेक्षाकृत उच्च हो सकती है, लेकिन कुछ क्षेत्र अभी भी सरल एकल-क्रिया कार्यों में देखी गई लगभग पूर्ण सफलता दर से कम हैं।
अधिक सामान्यतः, क्रॉस-एम्बोडिमेंट लर्निंग के लिए शून्य-पैडिंग स्वचालित रूप से एक ऐसे रोबोट पर लागू नहीं होती है जिसमें पूरी तरह से नई डिग्री-ऑफ-फ्रीडम कॉन्फ़िगरेशन हो जो प्रशिक्षण में अनुपस्थित थी। इसके अलावा, प्रवाह-मिलान एकीकरण चरणों (10) की संख्या निश्चित है,, जो यह सीमित करता है कि अनुमान-समय उपयोगकर्ता गति-सटीकता ट्रेड-ऑफ को कितनी बारीकी से समायोजित कर सकते हैं।
9. व्यवहार में इसका चुनाव कैसे करें
एक सामान्य प्रयोजन वाले मैनिपुलेशन रोबोट के लिए, जिसे एक ही मॉडल से कई कार्यों को संभालना होता है*, π0 एक मजबूत प्रारंभिक बिंदु है: इसका डिज़ाइन कुछ शून्य-शॉट व्यवहार और अपेक्षाकृत कम डेटा के साथ फाइन-ट्यूनिंग का समर्थन करता है। फिजिकल इंटेलिजेंस ने ओपनपीआई रिपॉजिटरी के माध्यम से इसके वेट्स और कोड को ओपनसोर्स कर दिया है, जिससे कस्टम रोबोट के साथ प्रयोग करना आसान हो गया है।
कपड़ा मोड़ने या तरल पदार्थ डालने जैसे कार्यों के लिए, जहाँ संपर्क और सुचारू प्रक्षेप पथ महत्वपूर्ण होते हैं*, एक फ्लो-मैचिंग मॉडल (या ऑक्टो जैसा डिफ्यूजन-हेड मॉडल) असतत क्रिया टोकन पर निर्भर ऑटोरेग्रेसिव वीएलए की तुलना में बेहतर विकल्प हो सकता है।
यदि लक्ष्य केवल कम विलंबता पर सरल पिक-एंड-प्लेस कार्यों को करना है, तो π0 के 3.3 बिलियन पैरामीटर अत्यधिक हो सकते हैं। एक हल्का, कार्य-विशिष्ट अनुकरण मॉडल, जैसे कि एक छोटा बीसी-आधारित नेटवर्क, कार्यान्वयन और परिचालन लागत का बेहतर संतुलन प्रदान कर सकता है।
यदि कोई एक विशिष्ट रोबोट निश्चित कार्यों का समूह निष्पादित करेगा, तो कार्य-विशिष्ट डेटा पर एक संकीर्ण मॉडल को प्रशिक्षित करना π0 जैसे बड़े पूर्व-प्रशिक्षित मॉडल का उपयोग करने की तुलना में अधिक कुशल हो सकता है। एक सामान्य मॉडल और एक विशिष्ट मॉडल के बीच चुनाव लक्षित कार्यों की विविधता और एकत्रित किए जा सकने वाले डेटा की मात्रा पर निर्भर करता है।
π0.5, π0.6 और π0.7 जैसे नए संस्करणों, व्यापक VLA परिदृश्य और LIBERO बेंचमार्क पर प्रतिस्पर्धा के लिए, “VLA Technology Trends” देखें। BC/DAgger में अनुकरण अधिगम, व्युत्क्रम सुदृढ़ीकरण अधिगम और सहचर-स्थानांतरण समस्या की नींव के लिए, “Imitation Learning and Inverse Reinforcement Learning” देखें।
10. तीन पंक्तियों में सारांश
-
π0 एक ही ट्रांसफ़ॉर्मर परतों में पालीगेम्मा वीएलएम (3B) और एक समर्पित एक्शन एक्सपर्ट (300M) चलाता है, जो सशर्त प्रवाह मिलान के साथ निरंतर एक्शन चंक्स उत्पन्न करता है।
-
यह A_t^\tau = \tau A_t + (1-\tau)\epsilon से लक्ष्य वेक्टर फ़ील्ड u = \epsilon - A_t का अनुमान लगाता है, फिर अनुमान के समय 50-चरण एक्शन चंक उत्पन्न करने के लिए 10 यूलर एकीकरण चरणों का उपयोग करता है। यह ऑटोरेग्रेसिव टोकनाइज़ेशन से मुख्य अंतर है, जिसका डिकोडिंग चंक के बढ़ने के साथ धीमा हो जाता है।
-
यह शून्य पैडिंग और भारित सैंपलिंग के साथ सात रोबोट प्रकारों पर प्रशिक्षण देता है, फिर सामान्यता और कार्य-विशिष्ट प्रदर्शन को संतुलित करने के लिए उच्च-गुणवत्ता वाले पोस्ट-ट्रेनिंग डेटा से विविध पूर्व-प्रशिक्षण डेटा को अलग करता है।
संदर्भ
- π0: सामान्य रोबोट नियंत्रण के लिए एक विज़न-लैंग्वेज-एक्शन फ्लो मॉडल (arXiv:2410.24164)
- π0 पेपर, ar5iv पूर्ण पाठ
- π0 आधिकारिक PDF (फिजिकल इंटेलिजेंस)
- π0: फिजिकल इंटेलिजेंस आधिकारिक ब्लॉग
- PaliGemma: स्थानांतरण के लिए एक बहुमुखी 3B VLM (arXiv:2407.07726)
- फिजिकल इंटेलिजेंस ओपनपीआई गिटहब रिपॉजिटरी
क्या क्रिया उत्पन्न करने वाला मॉडल बिना अनुकूलन के किसी अज्ञात रोबोट को संचालित कर सकता है?
जोड़ विन्यास, क्रिया निरूपण, अवलोकन और प्रशिक्षण-डेटा इंटरफ़ेस का मिलान होना आवश्यक है। आधारभूत मॉडल होने का अर्थ यह नहीं है कि वह बिना समायोजन के संगत है।
टिप्पणियाँ
पहले लॉग इन करें।
अभी कोई डेटा नहीं है।