Contents — find the section you need

मशीन लर्निंग डेटा से एक फ़ंक्शन को ट्यून करने की तकनीक है जो इनपुट x को पूर्वानुमान \hat y=f_\theta(x) में बदल देती है। महत्वपूर्ण बात किसी उच्च-सटीकता वाले मॉडल का नाम नहीं है, बल्कि यह परिभाषित करना है कि क्या पूर्वानुमान करना है, त्रुटियों की लागत को कैसे मापना है, और क्या तैनाती में समान परिस्थितियाँ बनाए रखी जा सकती हैं।

मूल बातें और डेटा विभाजन

प्रशिक्षण सेट पर अनुभवजन्य हानि को न्यूनतम करें:

\hat\theta=\arg\min_\theta\frac1n\sum_{i=1}^n\ell(f_\theta(x_i),y_i)+\lambda\Omega(\theta).

वर्गीकरण के लिए क्रॉस-एंट्रोपी प्रतिनिधि है, प्रतिगमन के लिए वर्ग त्रुटि। प्रशिक्षण, सत्यापन और अंतिम परीक्षण को इकाई, वीडियो या समय के आधार पर विभाजित करें ताकि डुप्लिकेट और भविष्य की जानकारी लीक न हो। जैसे ही आप परीक्षण सेट को देखते हैं और सेटिंग्स को समायोजित करते हैं, यह एक सत्यापन सेट बन जाता है और सामान्यीकरण को मापने में सक्षम नहीं रहता है।

Diagram 1 · Use the button to switch views
Machine learning lifecycleCollection, audit, training, evaluation, deployment, and monitoring form a feedback loop.collectaudit/splittrain/validatedeploy/evaluatemonitor

आरेख: डस्ककॉइल, एक मापित प्रदर्शन परिणाम के बजाय एक अवधारणात्मक आरेख।

विफलता कारण प्रतिक्रिया
केवल प्रशिक्षण सफलता ओवरफिट या लीकेज ऑडिट विभाजन और नियमितीकरण
तैनाती के बाद गिरावट बदलाव इनपुट की निगरानी और पुनर्मूल्यांकन
असमान त्रुटियाँ डेटा असंतुलन स्तरीकृत मूल्यांकन और संग्रह

मूल्यांकन और सुरक्षा

दुर्लभ खतरों के लिए केवल सटीकता अपर्याप्त है; परिशुद्धता, रिकॉल, अंशांकन, उपसमूह प्रदर्शन, विलंबता, अनुपलब्ध इनपुट और वितरण बदलाव का निरीक्षण करें। उच्च जोखिम वाले आउटपुट को अंतिम प्राधिकारी बनने के बजाय किसी व्यक्ति या सुरक्षित बैकअप को भेजा जाना चाहिए।

अपनी समझ की जाँच करें
क्या उच्च प्रशिक्षण सटीकता वास्तविक दुनिया के प्रदर्शन को स्थापित करती है?

सामान्यीकरण को अलग से मापें। बार-बार आने वाले विषयों या अतिव्यापी समय अवधियों के कारण होने वाले रिसाव से बचने के लिए परिनियोजन स्थितियों के अनुसार डेटा को विभाजित करें।

संदर्भ

समस्या परिभाषा से विशेषताओं तक

“मांग का पूर्वानुमान” और “विसंगतियों का पता लगाना” विनिर्देश नहीं हैं। परिभाषित करें कि कौन, किस कटऑफ पर कौन सी जानकारी उपलब्ध है, समय सीमा क्या है, और कौन सी त्रुटियाँ स्वीकार्य हैं। लक्ष्य समय t के बाद दर्ज की गई विशेषता रिसाव है। केवल प्रशिक्षण डेटा पर ही प्रीप्रोसेसिंग सांख्यिकी, इम्पुटेशन और शब्दावली को फिट करें। मानकीकरण x'=(x-\mu)/\sigma मान्य है। केवल तभी जब \mu,\sigma को प्रशिक्षण विभाजन से सीखा जाता है।

एक आधारभूत मान महत्वपूर्ण है: कल का मान, एक नियम, रैखिक प्रतिगमन, या एक छोटा ट्री जिसे एक जटिल मॉडल द्वारा हराया नहीं जा सकता, परिचालन लागत को उचित नहीं ठहराता। सटीकता के साथ ही फ़ीचर उपलब्धता, विलंबता, मॉडल आकार, रखरखावकर्ता और विफलता फ़ॉलबैक की तुलना एक ही तालिका में करें।

सामान्यीकरण, पूर्वाग्रह और परिवर्तन

कम अनुभवजन्य हानि का अर्थ यह नहीं है कि परिनियोजन वितरण \mathbb E_{(x,y)\sim p_{deploy}}[\ell] के तहत अपेक्षित हानि कम होगी। सहचर परिवर्तन इनपुट को बदलता है; अवधारणा विचलन लेबल के अर्थ को बदलता है। मौसम, हार्डवेयर संशोधन, संचालन नियम, उपयोगकर्ता व्यवहार और सेंसर की विफलता दोनों का कारण बनते हैं। एक निश्चित परीक्षण के बजाय समय, क्षेत्र, विशेषता और उपकरण के आधार पर स्तरीकृत मूल्यांकन रखें।

मूल्यांकन प्रश्न चूकने की संभावना
सटीकता कुल कितने सही हैं? दुर्लभ-श्रेणी चूक
परिशुद्धता/पुनः उत्तर क्या अलर्ट विश्वसनीय और कैप्चर किए गए हैं? सीमा लागत
अंशांकन क्या प्रायिकता आवृत्ति से मेल खाती है? उच्च-विश्वास त्रुटियाँ
समय सीमा क्या यह भविष्य में काम करेगा? मौसमी और नीतिगत परिवर्तन
विशेषता स्लाइस त्रुटियाँ किसे प्राप्त होती हैं? छोटे नमूने की अनिश्चितता

परिनियोजन और विफलता प्रबंधन

परिनियोजन से पहले, इनपुट स्कीमा, इकाइयाँ, रेंज, अनुपलब्धता और फ़ीचर वितरण को मान्य करें। तय करें कि अनुपयोगी आउटपुट किसी पुरानी भविष्यवाणी, नियम या मानव द्वारा नियंत्रित किया जाएगा या नहीं। फ़ीडबैक लूप की निगरानी करें: अनुशंसाएँ जोखिम को बदलती हैं, और डिटेक्टर निरीक्षण आवृत्ति को बदलते हैं, ताकि नया डेटा स्वाभाविक रूप से नमूना न लिया जाए।

डेटा अनुबंध, संस्करणित और पुनरुत्पादनीय प्रशिक्षण, शैडो ऑपरेशन, चरणबद्ध रोलआउट, प्रदर्शन/निष्पक्षता/विलंबता निगरानी और तत्काल रोलबैक का उपयोग करें। उच्च जोखिम वाले निर्णयों के लिए, मॉडल को अंतिम प्राधिकारी बनाने के बजाय किसी व्यक्ति को साक्ष्य, विश्वास और अनुपलब्ध इनपुट दिखाएँ।

  1. भविष्यवाणी कटऑफ़ और उपलब्ध फ़ीचर का ऑडिट करें।

  2. एक बेसलाइन और स्वतंत्र परीक्षण को स्थिर करें।

  3. मेट्रिक्स को त्रुटि लागत और सुरक्षा आवश्यकताओं से मैप करें।

  4. अनुपलब्ध डेटा, शिफ्ट और एडवर्सरियल का परीक्षण करें। इनपुट।

  5. संचालन में मॉनिटरिंग थ्रेशहोल्ड, स्टॉप और रिट्रेनिंग अनुमोदन शामिल करें।

  6. डेटासेट के लिए डेटाशीट

  7. मॉडल रिपोर्टिंग के लिए मॉडल कार्ड

अनिश्चितता को निर्णयों से अलग करें

मॉडल की प्रायिकता कोई क्रिया नहीं है। रखरखाव अलर्ट के लिए, थ्रेशहोल्ड निर्धारित करने से पहले विफलता प्रायिकता को स्टॉप लॉस, मिस लॉस और निरीक्षण लागत से मैप करें। यदि आधार विफलता दर बदलती है, तो सर्वोत्तम थ्रेशहोल्ड भी बदल जाता है। विश्वसनीयता आरेख और ब्रियर स्कोर की जाँच करें, और प्लैट या आइसोटोनिक कैलिब्रेशन को केवल सत्यापन डेटा पर ही लागू करें; कैलिब्रेटर को मॉडल के साथ वर्शन करें।

पूर्वानुमान अंतराल और एन्सेम्बल स्प्रेड उपयोगी हैं, लेकिन गारंटी नहीं हैं। वितरण से बाहर का इनपुट, सेंसर की विफलता और प्रतिकूल उदाहरण अनिश्चितता अनुमान को ही बाधित कर सकते हैं। इनपुट वैधता, OOD फ़्लैग, विश्वास और व्यावसायिक नियमों को अलग-अलग संकेतों के रूप में पास करें; जब कोई भी असुरक्षित हो, तो मानवीय समीक्षा या सुरक्षित डिफ़ॉल्ट चुनें।

लर्निंग रिजीम का चयन

रिजीम शिक्षक सूचना उपयुक्त मामला मूल्यांकन चेतावनी

पर्यवेक्षित | प्रत्येक इनपुट के लिए लेबल | स्पष्ट वर्गीकरण/प्रतिगमन | लेबल की गुणवत्ता और रिसाव |

अपर्यवेक्षित | आमतौर पर कोई लेबल नहीं | संरचना और विसंगति उम्मीदवार | क्लस्टरिंग के बाद अर्थ निर्दिष्ट न करें |

स्व-पर्यवेक्षित | डेटा से प्रॉक्सी कार्य | बड़ा अनलेबल कॉर्पस | अनुगामी मूल्यांकन और ओवरलैप |

अर्ध-पर्यवेक्षित | कुछ लेबल और अनलेबल | महंगा एनोटेशन | छद्म-लेबल त्रुटि प्रवर्धन |

पुनर्बलन | पुरस्कार और अंतःक्रिया | अनुक्रमिक निर्णय | सिम्युलेटर अंतर और सुरक्षित अन्वेषण |

लेबल जोड़ने की लागत की तुलना मॉडल को जटिल बनाने की लागत से करें। अपर्यवेक्षित क्लस्टर स्वचालित रूप से मानवीय विशेषताएँ नहीं होते हैं, और कमजोर छद्म-लेबल पूर्वाग्रह को बढ़ा सकते हैं। ट्रैक करें कि प्रत्येक लेबल को किसने, कब और किस प्रक्रिया से मापा।

विफलता का मामला: यादृच्छिक विभाजन भविष्य को जानता है

एक मशीन से ओवरलैपिंग कंपन विंडो को यादृच्छिक रूप से विभाजित करना यह ट्रेन और टेस्ट में लगभग समान मानों को शामिल करता है। विफलता के बाद असाइन किया गया रखरखाव कोड या पूरी अवधि में गणना किया गया औसत भी भविष्य की जानकारी लीक कर सकता है। मशीन आईडी और समय के आधार पर विभाजित करें, और पूर्वानुमान के समय उपलब्ध रिकॉर्ड से सुविधाओं की पुनः गणना करें। लीकेज से बढ़ाए गए स्कोर की तुलना में कम लेकिन सटीक स्कोर परिनियोजन के अधिक निकट होता है।

न्यूनतम कार्यान्वयन प्रक्रिया

  1. उपयोगकर्ताओं, लक्ष्य, अवलोकन कटऑफ, क्रिया और त्रुटि लागत को एक विशिष्ट तालिका में रखें।

  2. स्रोत, सहमति/अधिकार, अनुपलब्धता का कारण, इकाइयाँ, आवृत्ति और लेबलिंग प्रक्रिया का ऑडिट करें।

  3. कोड में समूह/समय विभाजन को ठीक करें और डुप्लिकेट हैश और आईडी प्रतिच्छेदन की स्वचालित रूप से जाँच करें।

  4. नियमों और सरल मॉडलों को आधार रेखा के रूप में रखें और सशर्त विश्वास अंतराल की रिपोर्ट करें।

  5. प्रीप्रोसेसिंग, मॉडल, कैलिब्रेशन और थ्रेशोल्ड को एक पाइपलाइन के रूप में सहेजें; अंतिम डेटा का एक बार मूल्यांकन करें।

  6. इनपुट गुणवत्ता, विलंबता, अस्वीकृति और डाउनस्ट्रीम परिणामों की निगरानी करते हुए शैडो, सीमित रिलीज़ और चरणबद्ध रोलआउट करें।

  7. पुनः प्रशिक्षण ट्रिगर, अनुमोदक, रोलबैक संस्करण, घटना सूचना और सेवानिवृत्ति का दस्तावेजीकरण करें। स्थिति।

पुनः प्रशिक्षण स्वतः सुधार नहीं है। पुराने और नए डेटा की तुलना एक ही निश्चित सेट पर करें और नए समय अवधियों और उपकरणों के लिए एक चुनौती सेट जोड़ें। प्रदर्शन, सांख्यिकीय अनिश्चितता, गणना लागत, सुरक्षा और परिचालन भार की एक साथ समीक्षा करें।

What to read next

Continue the seriesमशीन लर्निंग का परिचय: न्यूरल नेटवर्क की मूल बातेंExplore another aspect of this fieldस्थानीय एलएलएम का बेंचमार्क: प्रथम प्रतिक्रिया, उत्पादन दर और मेमोरीExplore another aspect of this fieldऑब्जेक्ट डिटेक्शन और सिमेंटिक सेगमेंटेशन का प्रारंभिक परिचय — किसी छवि से "कौन सी वस्तु कहाँ है" यह समझना