Contents — find the section you need

पोज़ एस्टिमेशन से 2D जॉइंट्स (u,v), 3D जॉइंट्स, या ऑब्जेक्ट रोटेशन R और ट्रांसलेशन t का अनुमान लगाया जा सकता है। प्रोजेक्शन को \tilde p\sim K[R|t]P के रूप में लिखा जा सकता है। कैलिब्रेशन, ऑक्लूज़न, बाएँ-दाएँ अस्पष्टता और समय संरेखण नेटवर्क आर्किटेक्चर जितने ही महत्वपूर्ण हैं।

Diagram 1 · Use the button to switch views
Image keypoint estimationAn image is transformed to feature heatmaps and keypoint or pose coordinates.imagefeatures/heatmapskeypoints/pose

आरेख: डस्ककॉइल, अवधारणात्मक। यह पहचान या निगरानी के उपयोग को अधिकृत नहीं करता है।

हीटमैप या कोऑर्डिनेट रिग्रेशन, PnP और टेम्परल फ़िल्टरिंग का उपयोग करें। अवरोध, प्रकाश, वस्त्र, सहायक उपकरण और जनसांख्यिकी के आधार पर PCK, OKS या रीप्रोजेक्शन त्रुटि का मूल्यांकन करें। लोगों के सामने उपयोग के लिए, सहमति और उद्देश्य निर्दिष्ट करें। सीमा निर्धारण, प्रतिधारण और त्रुटियों के लिए मानवीय समीक्षा।

विधियाँ और निर्देशांक फ्रेम

2D मानव मुद्रा के लिए, एक नेटवर्क प्रत्येक जोड़ के लिए हीटमैप का अधिकतम मान चुन सकता है, निर्देशांकों का सीधा प्रतिगमन कर सकता है, पहचान के बाद एक समय में एक व्यक्ति का अनुमान लगा सकता है (ऊपर से नीचे), या एक पूर्ण छवि से सभी व्यक्तियों को संबद्ध कर सकता है (नीचे से ऊपर)। 6D वस्तु मुद्रा के लिए, PnP ज्ञात 3D बिंदुओं और छवि पत्राचार से घूर्णन और अनुवाद का अनुमान लगाता है। एक घूर्णन R\in SO(3) R^TR=I,\det R=1 का पालन करता है; प्रत्यक्ष यूलर-कोण प्रतिगमन में विलक्षणताएँ और असंतुलन होते हैं, इसलिए मानकीकृत चतुर्भुज या सतत 6D निरूपणों का उपयोग किया जाता है।

आउटपुट विशिष्ट उपयोग मीट्रिक विफलता
2D कीपॉइंट मुद्रा विश्लेषण, यूआई पीसीके, ओकेएस अवरोध, बाएँ-दाएँ स्वैप

3डी कंकाल | गति विश्लेषण, रोबोट अनुकरण | एमपीजेपीई | गहराई अस्पष्टता, कैमरा त्रुटि |

6डी ऑब्जेक्ट पोज़ | ग्रैस्पिंग, एआर | एडीडी, रीप्रोजेक्शन त्रुटि | समरूपता, परावर्तन, पीएनपी आउटलायर्स |

डेटा और विफलता प्रबंधन

अवरोध, बैकलाइट, दर्पण, एकाधिक व्यक्ति, सहायक उपकरण, वस्त्र, शरीर का आकार, त्वचा की उपस्थिति और कैमरे की ऊँचाई का अलग-अलग मूल्यांकन करें। उच्च औसत ओकेएस, गिरने का पता लगाने या सहयोगी-रोबोट बचाव के लिए आवश्यक सबसे खराब विलंबता और चूक दर को सिद्ध नहीं करता है। सहमति के बिना पहचान या भावना अनुमान के लिए कीपॉइंट्स का पुन: उपयोग न करें। उद्देश्य सीमा, प्रतिधारण, पहुँच नियंत्रण, विलोपन और अपील प्रक्रियाओं को परिभाषित करें।

कार्यान्वयन में, आंतरिक और बाह्य को कैलिब्रेट करें और फ्रेम, इकाई, टाइमस्टैम्प और विश्वास को दस्तावेज़ित करें। जब विश्वास कम हो, तो इंटरपोलेशन को सत्य न मानें: रोबोट को धीमा करें, रोकें या मानव समीक्षा का अनुरोध करें। अस्थायी स्मूथिंग जिटर को कम करता है लेकिन विलंब बढ़ाता है, जिसे स्टॉपिंग दूरी में प्रतिबिंबित किया जाना चाहिए।

  1. कार्य के लिए आउटपुट, टॉलरेंस और लेटेंसी परिभाषित करें।

  2. विशेषताओं, अवरोध और प्रकाश के आधार पर मूल्यांकन को विभाजित करें।

  3. कैलिब्रेशन, कोऑर्डिनेट ट्रांसफ़ॉर्म और PnP आउटलायर्स को लॉग करें।

  4. कम आत्मविश्वास, कैमरा ड्रॉपआउट और पास आते लोगों के लिए स्टॉप नियमों का परीक्षण करें।

  5. COCO कीपॉइंट्स मूल्यांकन

कैलिब्रेशन और समय नेटवर्क से बाहर हैं

पोज़ त्रुटि केवल नेटवर्क की समस्या नहीं है। गलत फोकल लेंथ या प्रिंसिपल पॉइंट एक दृष्टिगत रूप से सही बिंदु को 3D में गलत बना देता है। प्रशिक्षण और अनुमान में विरूपण क्रम, आकार परिवर्तन/क्रॉप, मूल और पिक्सेल-केंद्र कन्वेंशन को समान रखें। कैमरा गति और कंपन के साथ एक्सट्रिंसिक्स बदलते हैं, इसलिए एक कैलिब्रेशन पर हमेशा के लिए भरोसा करने के बजाय संदर्भ लक्ष्य के विरुद्ध रीप्रोजेक्शन त्रुटि की पुनः जाँच करें।

एकाधिक कैमरों या IMU के साथ, फ़्रेम से पहले टाइमस्टैम्प सत्यापित करें। 30-fps फ़्रेम का एक विलंब एक फ्रेम को स्थानांतरित कर सकता है। तेज़ हाथ या उपकरण काफ़ी हद तक। हार्डवेयर समय, प्राप्ति समय, अनुमान पूर्णता समय और इंटरपोलेशन के लिए उपयोग किए गए नमूनों को संग्रहित करें। एक सुंदर रूप से सुचारू प्रक्षेप पथ भी टकराव से बचाव के लिए बहुत देर हो सकती है।

पाइपलाइन विकल्प

पाइपलाइन लाभ गणना/डेटा आवश्यकता मुख्य विफलता
मोनोक्युलर 2D सस्ता और सरल 2D लेबल, एक कैमरा अज्ञात गहराई, अवरोध
मोनोक्युलर 3D सरल स्थापना 3D पूर्वधारणाएँ, बड़ा डेटा डोमेन से बाहर कैप्चर, स्केल

मल्टी-व्यू ट्रायंगुलेशन | ज्यामितीय 3D बाधा | सिंक, अंशांकन, दृश्य | गलत पत्राचार, दृश्य से बाहर |

RGB-D | प्रत्यक्ष गहराई | गहराई सेंसर, सीमा | परावर्तन, सूर्य का प्रकाश, गहराई का अभाव |

कीपॉइंट्स + PnP | CAD का उपयोग करता है | 3D पत्राचार, आंतरिक मान | समरूपता, आउटलायर्स, विकृत लेआउट |

सामान्यीकरण लक्ष्य के आकार और स्थिति के आधार पर 2D त्रुटि, 3D इकाइयों और फ्रेम के आधार पर। सममित वस्तुओं के लिए, एक मानक घूर्णन से तुलना करने पर भौतिक रूप से सही स्थिति गलत मानी जा सकती है; समरूपता-जागरूक ADD-S या रीप्रोजेक्शन का उपयोग करें और ग्रैस्प क्लीयरेंस का मूल्यांकन करें। औसत त्रुटि के अतिरिक्त 95वें पर्सेंटाइल, चूक, उच्च-विश्वास त्रुटियाँ और एंड-टू-एंड विलंबता की रिपोर्ट करें।

विफलता का मामला: एक विश्वसनीय बाएँ-दाएँ दर्पण

दर्पण, पीछे से दृश्य और स्व-अवरोध बाएँ-दाएँ अदला-बदली किए गए कंकाल को ज्यामितीय रूप से संभावित बना सकते हैं। स्मूथिंग कई फ्रेमों के लिए त्रुटि को स्थिर कर सकती है। अभिविन्यास, दृश्य संकेत, कई परिकल्पनाएँ और गति सीमा को संयोजित करें; केवल अस्थि-लंबाई बाधाओं पर निर्भर न रहें। सुरक्षा अनुप्रयोगों में, उच्च विश्वास प्रमाण नहीं है—अदला-बदली का पता लगाने और एक स्वतंत्र सेंसर के साथ असहमति को रोकने की स्थिति के रूप में उपयोग करें।

पुनरुत्पादनीय कार्यान्वयन प्रक्रिया

  1. एक आरेख और परीक्षण डेटा के साथ छवि, कैमरा, विश्व और रोबोट फ्रेम को स्थिर करें।

  2. आकार बदलने के बाद कीपॉइंट ट्रांसफ़ॉर्म का राउंड-ट्रिप परीक्षण करें। पैडिंग और ऑग्मेंटेशन, जिसमें ज्ञात सब-पिक्सेल त्रुटि भी शामिल है।

  3. PnP RANSAC थ्रेशोल्ड और न्यूनतम बिंदु सेट करें; इनलायर्स, रीप्रोजेक्शन त्रुटि और धनात्मक गहराई की जाँच करें।

  4. स्थिर, चलने, तीव्र गति, अवरोध, छवि-किनारे और कैमरा ड्रॉपआउट मामलों को विलंबता के साथ रिकॉर्ड करें।

  5. कम विश्वास, अचानक कंकाल विरूपण, अंशांकन विचलन और उलटे समय पर स्टॉप और पुनः आरंभीकरण का परीक्षण करें।

  6. यदि मूल फ़्रेम संग्रहीत हैं, तो उद्देश्य, पहुँच, प्रतिधारण, अनामकरण और विलोपन का दस्तावेजीकरण करें।

पोज़ एक अवलोकन परिकल्पना है, न कि किसी व्यक्ति की पहचान, इरादा या स्थिति। फ़्रेम, समय और अनिश्चितता को डाउनस्ट्रीम में पास करें ताकि डाउनस्ट्रीम सिस्टम "अज्ञात" को सुरक्षित रूप से संभाल सकें।

एनोटेशन गुणवत्ता और परिचालन ऑडिट

एनोटेशन में भी अनिश्चितता होती है। संयुक्त कपड़ों के नीचे छिपे केंद्र, ढकी हुई कलाईयाँ और सममित वस्तु अभिविन्यास, एनोटेटरों के बीच भिन्न होते हैं। दृश्यमान, ढकी हुई और फ्रेम से बाहर की स्थितियों को अलग-अलग संग्रहित करें; अस्पष्टता को एक कठोर लेबल में डालने के बजाय एनोटेटर की असहमति, परिभाषा संशोधन और प्रक्षेपित बिंदुओं को बनाए रखें। वास्तविक छवि को अलग रखें ताकि कृत्रिम सामग्री और प्रकाश संकेत हावी न हो सकें।

प्रत्येक छवि को हमेशा के लिए सहेजे बिना संचालन की निगरानी की जा सकती है। विश्वास, लुप्त जोड़ गणना, पुनर्प्रक्षेपण त्रुटि, विलंबता, कैमरा स्थिति और स्टॉप को एकत्रित करें; केवल घटना डेटा को थोड़े समय के लिए, पहुँच-नियंत्रित अवधि के लिए रखें। मॉडल अपडेट पर, समान वीडियो को पुनः चलाएँ और खतरनाक क्षेत्रों में ड्रॉप-आउट लंबाई, बाएँ-दाएँ स्वैप और सबसे खराब त्रुटि की तुलना करें, फिर कैमरा बदलने के बाद पुनः अंशांकन करें।

अपनी समझ की जाँच करें
क्या 2D जोड़ विशिष्ट रूप से 3D का निर्धारण करते हैं? पोज़?

गहराई अस्पष्ट बनी हुई है। इसे हल करने के लिए उपयोग किए गए अतिरिक्त दृश्यों, गहराई मापों या शरीर-मॉडल संबंधी मान्यताओं की जाँच करें।

What to read next

Review the backgroundSegFormer के लिए एक विस्तृत मार्गदर्शिका — बिना पोजीशनल एनकोडिंग वाला ट्रांसफ़ॉर्मर सेगमेंटेशन के लिए क्यों कारगर हैContinue the seriesमशीन लर्निंग का परिचय: जनरेटिव मॉडलExplore another aspect of this fieldस्थानीय एलएलएम का बेंचमार्क: प्रथम प्रतिक्रिया, उत्पादन दर और मेमोरी