अध्याय २ · खण्ड I · 16 मिनेट
पूर्वाग्रह कहाँबाट आउँछ — डाटा, डिजाइनर, तैनाती
पूर्वाग्रह मोडलले बोकेको एउटै दोष होइन; यो तीन फरक ढोकाहरूबाट छिर्छ, र एउटा मात्रै ढोका बन्द गरेर "न्यायपूर्ण" बनाएको दाबी गर्ने प्रणालीहरू नै सबैभन्दा बढी असफल हुन्छन्।
जब कुनै मोडल अन्यायपूर्ण व्यवहार गर्छ, अधिकांश टोलीको पहिलो प्रतिक्रिया मोडल नै हेर्ने हुन्छ। तिनीहरू वेटहरू छाप्छन्, थ्रेसहोल्ड बदल्छन्, कुन लस फङ्सन बढी “तटस्थ” छ भनेर तर्क गर्छन्। तर अन्यायका वास्तविक स्रोतहरू प्रायः तिनीहरूको पछाडि हुन्छन्, अगाडि होइन — मोडल बन्नुभन्दा धेरै अगाडि सङ्कलन गरिएको डाटामा, डिजाइनरहरूले के अनुमान गर्न लायक छ भन्ने रोजाइमा, र मोडलले अन्ततः भेट्ने कोठा, फोन र भाषाहरूमा। पूर्वाग्रह भनेको मोडलले समातेको कुनै एक भाइरस होइन। यो तीन फरक कुरा हो, तीन फरक ढोकाबाट छिर्ने, र एउटा मात्रै ढोका बन्द गरेको टोली नै घर सुरक्षित छ भनेर सबैभन्दा बढी विश्वस्त हुने टोली हो।
१. डाटा — मोडलले देखाइएको संसार सिक्छ, वास्तविक संसार होइन
मोडलको नेपालबारे कुनै राय हुँदैन। कुनै कुराबारे राय नै हुँदैन। यससँग जे छ त्यो एउटा ठूलो उदाहरणको थुप्रो हो, र त्यो थुप्रोभित्रको ढाँचा पुनरुत्पादन गर्ने बानी। थुप्रो एकातिर ढल्किएको छ भने मोडल पनि उतै ढल्किन्छ। थुप्रो कुनै कुरामा मौन छ भने मोडल पनि मौन हुन्छ — वा त्यो भन्दा खराब, आत्मविश्वासका साथ गलत हुन्छ।
एउटा बैङ्कको ऋण-डिफल्ट मोडल कल्पना गर्नुहोस् जुन काठमाडौं उपत्यकामा अधिकांश शाखा भएको बैङ्कको दश वर्षको रेकर्डमा तालिम दिइएको छ। ऐतिहासिक डाटाले ऐतिहासिक चलनलाई प्रतिबिम्बित गर्नेछ — ललितपुर र भक्तपुरमा स्वीकृत भएका ग्राहक, सप्तरी र बझाङमा अस्वीकृत भएका ग्राहक, पहिले नै कसले ऋण पायो भन्ने आधारमा बनेका पुनर्भुक्तानी ढाँचा। “डिफल्ट जोखिमको अनुमान गर्नुहोस्” भन्दा, मोडलले उपत्यका बाहिरबाट हुनु नराम्रो परिणामसँग सम्बन्धित छ भन्ने सिक्नेछ — ग्रामीण ऋणीहरू जोखिमपूर्ण भएर होइन, बैङ्कले ऐतिहासिक रूपमा उनीहरूलाई सानो ऋण नराम्रो सर्तमा दिएर पछि नतिजा हेरेर। मोडल अनुमान गरिरहेको होइन। यो बैङ्कको पुराना प्राथमिकतालाई वस्तुनिष्ठ देखिने सङ्ख्यामा परिणत गरिरहेको छ।
यो सबैभन्दा कम बुझिएको पूर्वाग्रह स्रोत हो, किनकि यो मोडलभन्दा पहिले नै अस्तित्वमा हुन्छ। तपाईंले बागमतीको सबैभन्दा सतर्क इन्जिनियर भर्ना गर्नुहोस्, सबैभन्दा सफा पाइपलाइन दिनुहोस्, उसले बनाएको प्रणालीले पनि विगतलाई इमानदारीपूर्वक पुनरुत्पादन गर्नेछ। अन्यायपूर्ण विगतको इमानदार पुनरुत्पादन तटस्थता होइन। यो अन्यायलाई संरक्षण गर्ने अहिलेसम्म आविष्कार भएको सबैभन्दा प्रभावकारी तरिका हो।
२. डिजाइनर — कसैले के मान्य हुने भनेर छानेकै छ
प्रत्येक मोडलले हजारौं साना मानवीय निर्णयहरू आफ्नो हड्डीमा बोकेर हिँडेको हुन्छ, र तीमध्ये अधिकांश कुनै कोड लेखिनुअघि नै गरिएका हुन्छन्। कसैले के समस्या समाधान गर्न लायक छ भनेर निर्णय गर्यो। कसैले सफलता कस्तो देखिनेछ भनेर निर्णय गर्यो। कसैले कुन फिचर सङ्कलन गर्ने, कुन हटाउने, असली सङ्केत उपलब्ध नहुँदा कुन प्रोक्सी स्वीकार गर्ने भनेर निर्णय गर्यो। यी निर्णयहरूमध्ये कुनै पनि तपाईंले निरीक्षण गर्न सक्ने तरिकाले मोडल “भित्र” हुँदैनन् — यिनीहरू त्यसको माथिल्लो स्रोतमा हुन्छन्, डाटासेट र लस फङ्सन र तैनाती योजनामा गाडिएका।
काठमाडौंको एउटा सफ्टवेयर कम्पनीको कर्मचारी छनोटको उदाहरण लिनुहोस्। डिजाइनरले निर्णय गर्छ कि “राम्रो इन्जिनियर” लाई “कम्पनीमा दुई वर्षभन्दा बढी टिकेको र कम्तीमा एक पटक बढुवा पाएको” भनेर परिभाषित गरिनेछ। यो उचित लाग्छ। तर नेपाली टेक क्षेत्रमा महिलाहरू छिटो छोड्छन् — उनीहरू कमजोर इन्जिनियर भएर होइन, बिहे गरेर, श्रीमानसँग सरेर, फिर्ता आउँदा त्यति स्वागत नहुने कम्पनीहरूमा मातृत्व बिदा लिएर। डिजाइनरको लेबल छनोटले कुनै डाटा हेरिनुअघि नै मोडलमा लैङ्गिक दण्ड लेखेको हुन्छ। मोडलले भनेकै काम गरिरहेको छ। अन्याय भनेकोमा छ।
फिचर छनोटमा पनि उस्तै लागू हुन्छ। “यस सूचीमा भएको कलेजबाट उत्तीर्ण” लाई फिचरको रूपमा प्रयोग गर्ने मोडलले प्रभावमा, त्रिभुवन-सम्बद्ध ग्रामीण क्याम्पसका स्नातकहरू काठमाडौं विश्वविद्यालयका स्नातकहरूभन्दा फरक वर्गका हुन् भनेर निर्णय गरेको हुन्छ। “निरन्तर रोजगारीका वर्षहरू” प्रयोग गर्ने मोडलले बच्चा हुर्काउन तीन वर्ष छुट्टी लिएकी महिलालाई नलिने पुरुषभन्दा कमजोर उम्मेदवार ठहर्याएको हुन्छ। डिजाइनरले महिलासँग अन्याय गर भनेर लेखेन। उसले एउटा फिचर लेख्यो जुन महिला हुनुसँग सम्बन्धित छ, र मोडलले बाँकी काम गर्यो।
३. तैनाती — मोडल भनेको त्यो अन्ततः पुगेको कोठा हो
प्रयोगशालामा सुन्दर ढङ्गले काम गर्ने मोडल पठाएको क्षणमै गहिरो रूपमा अन्यायपूर्ण हुन सक्छ। कारण के हो भने न्यायपूर्णता मोडल मात्रको गुण होइन — यो मोडलले जनसङ्ख्यासँग भेट्दा बन्ने गुण हो। जनसङ्ख्या बदल्नुहोस्, न्यायपूर्णता पनि बदलिन्छ।
अङ्ग्रेजी सपोर्ट टिकटमा तालिम दिइएको र खल्तीभित्र तैनात गरिएको ग्राहक-सहायता च्याटबट प्राविधिक दृष्टिले राम्रो मोडल हो। अङ्ग्रेजीमा प्रश्न सोध्नुहोस्, राम्रोसँग जवाफ दिन्छ। समस्या के हो भने खल्तीका प्रयोगकर्ताहरूको उल्लेखनीय अंश रोमन नेपाली, देवनागरी, वा मिश्रित कोड-स्विच गरिएको लिपिमा लेख्न बढी सहज छ। ती प्रयोगकर्ताहरूले अङ्ग्रेजीमा सहज प्रयोगकर्ताभन्दा खराब जवाफ पाउँछन् — ढिलो, अझ अस्पष्ट, बढी एस्केलेसन हुने। मोडल बदलिएन। राख्ने ठाउँबाट अन्याय जन्मियो।
अनुहार पहिचान मोडलहरूले अझ स्पष्ट कथा भन्छन्। मुख्य रूपमा हल्का छालाका अनुहारमा तालिम दिइएको मोडल — जस्तो कि अधिकांश ठूला सार्वजनिक अनुहार डाटासेट हुन् — गाढा छालामा कम सही हुन्छ। त्यो मोडल बिर्गन्जको सीमामा तैनात गर्नुहोस् र तपाईंले एउटा प्रणाली बनाउनुभएको हुन्छ जसले मधेसी नागरिकलाई खस-आर्य नागरिकभन्दा बढी समातेर राख्छ — मनसायले होइन, तालिम डाटाको भौतिकीले फरक जनसङ्ख्यासँग भेट्दा। प्रयोगशालाका सङ्ख्या ठीक थिए। तैनातीका सङ्ख्या अन्याय हुन्।
“हामीले त्यो भेरिएबल हटायौं” बचाउ होइन
यो सम्पूर्ण कुराकानीमा सबैभन्दा सामान्य, सबैभन्दा आश्वस्त बनाउने, सबैभन्दा गलत वाक्य हो: हामीले लिङ्ग कोलम तालिम डाटाबाट हटायौं, त्यसैले मोडलले लिङ्गको आधारमा भेदभाव गर्न सक्दैन। त्यही वाक्य जात, क्षेत्र, धर्मका साथ पनि प्रस्तुत गरिन्छ। यो हरेक पटक गलत हुन्छ, र एउटै कारणले गलत हुन्छ: संरक्षित विशेषताबारे जानकारी प्रायः त्यो विशेषताको लेबल भएको कोलममा मात्रै बस्दैन। यो प्रोक्सीमा बस्छ — विशेषतासँग सम्बन्धित फिचरहरू, कहिलेकाहीं धेरै बलियो, विशेषता आफैं अदृश्य भए पनि।
लिङ्ग हटाउनुहोस्, मोडलले “एक्स्ट्राकरिकुलरको सूची”बाट सिक्छ, किनभने नेपाली विद्यालयमा केटा र केटीलाई फरक एक्स्ट्राकरिकुलरमा धकेलिन्छ। जात हटाउनुहोस्, मोडलले थर, गाउँको हुलाक नम्बर, पढेको विद्यालयको नामबाट सिक्छ। क्षेत्र हटाउनुहोस्, मोडलले आवेदकको लेखिएको नेपालीमा भएको बोलीका सङ्केत वा आवेदन आएको IP रेन्जबाट सिक्छ। संरक्षित विशेषता स्प्रेडसिटको एउटै कोलम होइन — यो लगभग हरेक अन्य कोलममा बुनिएको हुन्छ, र परिणाम अनुमान गरेबापत पुरस्कृत हुने मोडलले त्यो बुनाइलाई जहाँ जान्छ त्यहीँ पछ्याउँछ।
एकमात्र इमानदार प्रतिक्रिया कठिन छ: तालिमपछि, विश्वास गर्न मिल्ने डाटामा, मोडलको व्यवहार समूह अनुसार नाप्नुहोस्। यदि यसले समूहहरूलाई फरक व्यवहार गर्छ भने तपाईंलाई समस्या छ — र कोलम हटाउनु समाधान होइन, यो समस्या लगातार जारी रहँदा अदृश्य बनाउने तरिका मात्रै हो।
आफ्नो बुझाइ जाँच्नुहोस्
छोटो जाँच
—एक नेपाली बैङ्कले आफ्नै दश वर्षको स्वीकृति र पुनर्भुक्तानी रेकर्डमा ऋण-डिफल्ट मोडल तालिम दिन्छ। मोडलले बागमतीका भन्दा कर्णालीका आवेदकहरूको बढी अंश अस्वीकार गर्न सुझाव दिन्छ। यहाँ कुन पूर्वाग्रह स्रोत सबैभन्दा स्पष्ट देखिन्छ?
छोटो जाँच
—कर्मचारी छनोट उपकरण बनाउने टोलीले भन्छ: “हामीले लिङ्ग, जात, र क्षेत्र हाम्रा फिचरहरूबाट हटायौं, त्यसैले मोडल ती विशेषताहरूमा पूर्वाग्रही हुन सक्दैन।” यो बचाउ किन प्रायः गलत हुन्छ?
अब के आउँछ
पूर्वाग्रह छिर्ने तीन ढोका थाहा पाउनु सजिलो भाग हो। कठिन भाग चाहिँ यो देशमा पूर्वाग्रहले लिने विशिष्ट आकारहरू पहिचान गर्नु हो — थर-जात-प्रोक्सी, बागमती-केन्द्रित कर्मचारी डाटा, मैथिली र तामाङमा भाषा मोडलको अन्तराल, मधेसका कारोबारलाई बढी आक्रामक रूपमा फ्ल्याग गर्ने फ्रड मोडलहरू। अर्को खण्डले ती आकारहरूलाई ठोस बनाउँछ।