ailiteracynepal 🇳🇵
पाठ आकार

अध्याय ६ · खण्ड I · 26 मिनेट

डाटासेटमा पूर्वाग्रह कहाँबाट छिर्छ

पूर्वाग्रह एकल लुकेको कुरा होइन। यो साना पूर्वनिर्धारित — के सङ्कलन गरियो, कसलाई रेकर्ड गरियो, के बहिष्कार गरियो — को परिवार हो जसले चुपचाप तपाईंको मोडेललाई गलत निष्कर्षतर्फ औंल्याउँछ। प्रवेश बिन्दु जान्नाले सही प्रश्न सोध्न दिन्छ।

डाटासेटमा पूर्वाग्रह विरलै जानाजान हुन्छ। यो झन्डै सधैं ती-समयमा-बचाव-गर्न-योग्य साना छनोटको सङ्कलित नतिजा हो: कुन जनसङ्ख्याको सर्वेक्षण गर्ने, कुन फारम फिल्ड समावेश गर्ने, कुन रेकर्ड डिजिटाइज गर्ने, कुन आउटलायर हटाउने। प्रत्येक छनोटले मामूली झुकाव ल्याउँछ। डाटा मोडेलमा पुग्दा, झुकाव सङ्कलित भएर प्रणालीगत विकृति बनेका हुन्छन् — र दिइएको डाटाबाट इमानदारीसाथ सिक्ने मोडेल ती विकृतिलाई स्केलमा बढाउने द्रुत मेसिन बन्छ। यो खण्ड पूर्वाग्रह कहाँबाट छिर्छ र ल्यापटप छाडेर बाहिर निस्कनुअघि चिन्ने नक्सा हो।

पूर्वाग्रहका चरण छन्

अध्याय 1, खण्ड 3 बाट डाटासेटको जीवन सम्झनुहोस् — उत्पादन, क्याप्चर, भण्डारण, निकालन, तयारी, तालिम। ती हरेक चरणमा पूर्वाग्रह छिर्न सक्छ। कुन चरण समस्याको स्रोत हो थाहा पाउँदा कहाँ सुधार्ने भन्छ।

उत्पादनमा: घटना आफै असमान रूपमा वितरित हुन्छन्। ललितपुरको ऋण अधिकारीले डोतीको ऋण अधिकारीभन्दा बढी साना-व्यवसाय ऋण दिन्छन् — मोडेल गलत भएकाले होइन, ललितपुरमा बढी साना व्यवसाय भएकाले। “हामीले गरेका ऋण” को कुनै पनि डाटासेटले यो प्रतिबिम्बित गर्छ।

क्याप्चरमा: फारममा सही विकल्प छैनन्। तीन ड्रपडाउन छनोट भएको “पेसा” फिल्डले चिया पसले र तरकारी विक्रेता र दर्जीलाई उही "साना व्यवसाय" बाल्टीमा बाध्य पार्छ। मोडेलले एउटा श्रेणी देख्छ जहाँ तीन थिए।

भण्डारणमा: केही रेकर्ड राखिन्छन्, अरू राखिँदैनन्। ऋण अधिकारीको ऋणीको पारिवारिक अवस्थाबारेका नोटहरू छ महिनापछि डाटाबेसले फ्याँक्न सक्छ। सङ्कलन गरिएको जानकारी तपाईंलाई डाटा पुग्नुअघि नै गएको हुन्छ।

निकालनमा: क्वेरी फिल्टरले केही रेकर्ड बहिष्कार गर्छ। “मलाई पछिल्ला दुई वर्षका सबै ऋण देखाउनुहोस्” ले अझै सक्रिय भए पनि दुई वर्षभन्दा पुराना लामो-अवधि ऋणलाई चुपचाप बहिष्कार गर्छ।

तयारीमा: तपाईंका सफा गर्ने निर्णयले पङ्क्ति हटाउँछ वा परिमार्जन गर्छ। आउटलायर हटाउनु, नाम सामान्यीकरण गर्नु, छुटेका मान भर्नु — यीमध्ये हरेक सानो पूर्वाग्रह छनोट हो। अधिकांश बचाव गर्न योग्य छन्। कागजात गर्नुहोस्।

तालिम र इन्फरेन्समा: सफा डाटासँग पनि, मोडेलले कुन ढाँचा सिक्ने र कसरी तौलने भन्ने छनोट आफैमा एक प्रकारको छनोट हो। हामी यो यहाँ ओगट्दैनौं; Course 03 ले सम्बोधन गर्छ।

मुख्य अन्तर्दृष्टि: तपाईं, निर्माताले, डाटासेट पाउँदा, यो पहिले नै चार-पाँच चरण छनोटबाट गुज्रिसकेको हुन्छ। तपाईंको काम ती सबैको डाउनस्ट्रिममा छ।

पाँच सामान्य पूर्वाग्रह, नामसहित

कुनै पनि परियोजनामा बोक्न सकिने पूर्वाग्रहको कार्यगत शब्दावली।

छनोट पूर्वाग्रह

डाटा वास्तविक जनसङ्ख्याको अप्रतिनिधि उपसमूहबाट सङ्कलन गरिएको थियो। सफल ऋणको माइक्रोफाइनान्स डाटासेट (किनभने असफल आवेदन रेकर्ड गरिएनन्) ले तपाईंलाई कसले अस्वीकृत हुने थियो बताउँदैन। दर्ता गरिएका व्यापारीहरूको NEPSE-व्यापारी डाटासेटले अनौपचारिक व्यापारबारे केही बताउँदैन।

कसरी देख्ने: सोध्नुहोस् “यो डाटासेटबाट को वा के छुटिराखेको छ?”। डाटाले आफ्ना अनुपस्थिति घोषणा गर्दैन; तपाईंले कल्पना गर्नुपर्छ।

बाँचेको पूर्वाग्रह

तपाईंसँग भएका रेकर्ड केवल ती हुन् जुन रेकर्ड हुन बाँचे। “सफल निर्यातकर्ता” को डाटासेटले निर्यात कोसिस गरेर असफल भएको हरेक व्यवसाय लुकाउँछ। “ग्र्याजुएट” को डाटासेटले छाड्ने हरेक विद्यार्थी लुकाउँछ। मोडेलले “बाँच्ने ढाँचा” सिक्छ तर “सफलताका ढाँचा” का रूपमा व्याख्या गरिन्छ।

कसरी देख्ने: सोध्नुहोस् “यो डाटासेटमा हुन अस्तित्वका लागि के सत्य हुनुपर्थ्यो?”। समावेशका सर्तले मोडेलले के देख्छ आकार दिन्छ।

पुष्टि पूर्वाग्रह

डाटा सङ्कलन वा लेबल कुनै परिकल्पना समर्थन गर्ने कसैले गरेका थिए। विद्यार्थीहरूको “संलग्नता” मूल्याङ्कन गर्ने शिक्षकले अनजानमा आफूजस्तै विद्यार्थीलाई बढी मूल्याङ्कन गर्न सक्छन्। “विश्वसनीयता” मूल्याङ्कन गर्ने ऋण अधिकारीले अनजानमा पहिलेका सफल ऋणीजस्तै ऋणीलाई पक्षपात गर्न सक्छन्।

कसरी देख्ने: सोध्नुहोस् “कसले निर्णय गरे, र तिनी के भेट्न खोज्दै थिए?”। कुनै पनि मानवीय-लेबल गरिएको डाटासेटले लेबलरका धारणा बोक्छ।

नमुना पूर्वाग्रह

डाटा नमुना लिने तरिका समूहहरूमा फरक छ। बागमतीमा मात्र गरिएको विद्यालय सर्वेक्षणले तपाईंलाई बागमती डाटा, बस्। तर यदि फ्रेमिङ ढिलो छ भने यो “नेपाल डाटा” का रूपमा रिपोर्ट गर्न सकिन्छ।

कसरी देख्ने: सोध्नुहोस् “नमुना प्रक्रिया के थियो, र के सबै समूह तिनको वास्तविक आकारका अनुपातमा प्रतिनिधित्व छन्?”। उत्तर विरलै “हो” हुन्छ।

मापन पूर्वाग्रह

केही मापन गर्ने उपकरण वा प्रक्रिया समूहहरूमा असमान छ। अधिकांशमा हल्का-छाला अनुहारमा तालिम दिइएको अनुहार पहिचान प्रणालीले प्राविधिक रूपमा “अनुहार” मापन गरिरहेको छ तर वास्तवमा “तालिममा अधिक-प्रतिनिधित्व भएका विशेषता भएका अनुहार पत्ता लगाउने क्षमता” मापन गरिरहेको छ। मापन आफै पूर्वाग्रही छ।

कसरी देख्ने: सोध्नुहोस् “के तपाईंले तैनाती गर्ने हरेक समूहका लागि मापन प्रक्रिया उस्तै छ?”। यदि शुद्धता समूहहरूमा प्रणालीगत रूपमा फरक छ भने, मापन पूर्वाग्रही छ।

छोटो नेपाली हिँडाइ

ललितपुरको माइक्रोफाइनान्स संस्थाले कर्णाली प्रदेशमा डिफल्ट-पूर्वानुमान मोडेल तैनात गर्न चाहन्छ। हरेक पूर्वाग्रह हिँडाउनुहोस्:

  • छनोट पूर्वाग्रह: ललितपुर डाटासेटमा केवल ललितपुर-क्षेत्रका ऋणी छन्। कर्णालीका फरक अर्थतन्त्र (बढी कृषि, कम खुदरा), फरक डिफल्ट ढाँचा, र अझ पातलो बैङ्किङ इतिहास छ। तालिम डाटाले तैनाती जनसङ्ख्या प्रतिनिधित्व गर्दैन।
  • बाँचेको पूर्वाग्रह: डाटासेटमा स्वीकृत भएका ऋण मात्र छन्। ललितपुरका अधिकारीले अस्वीकार गरेका जुनसुकै — जो उत्तम कर्णाली ऋणी हुन सक्थे — डाटामा छैनन्।
  • पुष्टि पूर्वाग्रह: ललितपुर अधिकारीहरूले गरेका “विश्वसनीयता” मूल्याङ्कनले ललितपुर सांस्कृतिक मानदण्ड — “विश्वसनीय ऋणी” कस्तो देखिन्छ र सुनिन्छ — प्रतिबिम्बित गर्छन्। कर्णाली मानदण्ड फरक छन्।
  • नमुना पूर्वाग्रह: ललितपुरभित्र पनि, अधिकारीको शाखा शहरमा भएकाले शहरी ऋणी अधिक-नमुनाकृत थिए। ग्रामीण ललितपुर ऋणी — जो जनसांख्यिक रूपमा कर्णाली ऋणीसँग नजिक छन् — कम-प्रतिनिधित्व छन्।
  • मापन पूर्वाग्रह: डिफल्ट अधिकारीको फलोअप आवृत्तिमा निर्भर घटना (छुटेका भुक्तानी) ले मापन गरिएको थियो। कर्णाली तैनातीमा कम फलोअप हुनेछ, त्यसैले उही अन्तर्निहित डिफल्ट व्यवहार फरक तरिकाले मापन गरिनेछ।

यीमध्ये प्रत्येक वास्तविक, नामकरण गरिएको, सम्बोधनयोग्य समस्या हो। तिनलाई स्वीकार गर्नु पहिलो चरण हो। केहीलाई सुधार्न सकिन्छ (तैनातीअघि कर्णाली डाटा सङ्कलन)। केहीलाई कम गर्न सकिन्छ (समूह-जागरुक मूल्याङ्कन प्रयोग गर्ने)। केही आन्तरिक छन् र रिपोर्ट गर्दा इमानदारी चाहिन्छ (तपाईंको लेख-अपमा सीमा खण्डहरू)।

तपाईंले वास्तवमै के गर्न सक्नुहुन्छ

केही मूर्त बानी जसले पूर्वाग्रह चाँडै पक्रन्छन्:

डाटाको मूल कागजात गर्नुहोस्। आफ्नो data/README.md मा, हरेक स्तम्भ कहाँबाट आयो, कसले सङ्कलन गर्‍यो, कहिले, र के बहिष्कार गरियो उल्लेख गर्नुहोस्। भविष्यको तपाईंलाई, र डाटा पढ्ने जुनसुकैलाई यो चाहिन्छ।

मोडेल प्रति-समूह मूल्याङ्कन गर्नुहोस्। 87% समग्र शुद्धता भएको मोडेल बागमतीमा 92% र कर्णालीमा 71% हुन सक्छ। समग्र सङ्ख्या रिपोर्ट गर्नुअघि सधैं उपसमूहले शुद्धता गणना गर्नुहोस्।

for province in y_test.index.get_level_values("province").unique():
    mask = y_test.index.get_level_values("province") == province
    print(province, accuracy_score(y_test[mask], predictions[mask]))

confusion मेट्रिक्स हेर्नुहोस्, शुद्धता मात्र होइन। शुद्धताले असमानता लुकाउँछ। सबैका लागि “डिफल्ट छैन” पूर्वानुमान गर्ने मोडेल डिफल्ट डाटाको 5% भएमा 95% शुद्ध हुनेछ — र पूर्ण रूपमा बेकार। प्रति-कक्षा precision, recall, र F1 ले यो प्रकट गर्छन्।

डोमेन विशेषज्ञसँग कुरा गर्नुहोस्। डाटाले प्रतिनिधित्व गर्ने जनसङ्ख्यासँग वास्तवमै काम गर्ने कसैले तपाईंले देख्न नसक्ने पूर्वाग्रह देख्नेछ। कर्णाली ऋणीहरूमा मोडेलका पूर्वानुमान समीक्षा गर्न कर्णालीका ऋण अधिकारीसँग आधा घण्टाले हप्ताको सांख्यिकीय विश्लेषणभन्दा बढी पूर्वाग्रह पक्रनेछ।

आफ्नो बुझाइ जाँच्नुहोस्

Quick check

एक टिमले बागमती विद्यालयहरूको डाटामा विद्यालय-छाड्ने पूर्वानुमान मोडेल तालिम दिन्छ र 86% शुद्धता रिपोर्ट गर्छ। तिनी राष्ट्रिय रूपमा तैनात गर्न लाग्दैछन्। तैनातीअघि सबैभन्दा महत्त्वपूर्ण सोध्ने प्रश्न के हो?

Quick check

तपाईं 'सफल नेपाली टेक स्टार्टअप' को डाटासेट स्टार्टअप सफलता पूर्वानुमान गर्ने परियोजनाका लागि समीक्षा गर्दै हुनुहुन्छ। टिम सदस्यले देख्छिन् कि डाटासेटको *हरेक* पङ्क्तिले अझै सञ्चालनमा रहेको स्टार्टअप प्रतिनिधित्व गर्छ। यो कुन प्रकारको पूर्वाग्रह हो, र यसको परिणाम के हो?

अब के आउँछ

पूर्वाग्रह डाटा कामका मानवीय आयाममध्ये एक हो। अर्को खण्ड अर्को हो: गोपनीयता, सहमति, र व्यक्तिगत डाटा। नेपालमा विशेष गरी, यी अवधारणा विकसित हुँदै छन् — नयाँ कानुन, नयाँ मानदण्ड, नयाँ चेतना — र व्यक्तिगत डाटासँग काम गर्ने निर्माताका जिम्मेवारी वास्तविक, बढ्दै गएका, र स्पष्ट शब्दमा बुझ्न लायक छन्।