ailiteracynepal 🇳🇵
पाठ आकार

अध्याय १ · खण्ड I · 20 मिनेट

मोडेलको गुणस्तर डाटाजति मात्र किन हो

खराब डाटामा तालिम दिइएको मोडेल आत्मविश्वासी गलत जवाफको द्रुत मेसिन हो। यो प्रत्येक काम गर्ने एआई प्रणालीको केन्द्रीय, बारम्बार बिर्सिने तथ्य हो। अहिले नै आत्मसात् गर्नुहोस् र बाँकी Course 02 लाई बिन्दु हुन्छ।

आधुनिक एआईको सबैभन्दा बारम्बार दोहोरिने, सबैभन्दा बिर्सिने, सबैभन्दा महँगो पाठ यो हो: मोडेल डाटाको तल बस्छ। संसारको सबैभन्दा ठूलो, सबैभन्दा आधुनिक, सबैभन्दा सुन्दर ट्युन गरिएको मोडेल हुनसक्छ — र यदि पछाडिको डाटा गलत, पूर्वाग्रही, वा अप्रतिनिधि छ भने, मोडेलले बकवास उत्पादन गर्छ, आत्मविश्वासका साथ, स्केलमा। पूरै यो पाठ्यक्रम अस्तित्वमा छ किनभने एआईसँग निर्माण गर्न सिक्ने झन्डै सबैले डाटा कामलाई स्किप गर्ने प्रयास गर्छन्, र त्यसो गर्ने झन्डै सबैले पछि भुक्तान गर्छन्।

फोहोर भित्र, आत्मविश्वासी फोहोर बाहिर

मोडेल भनेको इनपुटलाई आउटपुटमा नक्साङ्कन गर्ने मेसिन हो। यो उदाहरणबाट त्यो नक्साङ्कन सिक्छ। यदि तपाईंले यसलाई “ऋण आवेदन र तिनले डिफल्ट गरे कि गरेनन्” का दश हजार उदाहरण देखाउनुभयो भने, यसले केही सिक्नेछ। के सिक्छ भन्ने पूर्ण रूपमा तपाईंले देखाएको कुरामा निर्भर हुन्छ।

यदि तपाईंको ऋण डाटासेट केवल काठमाडौंबाट आउँछ भने, मोडेललाई दोतीमा डिफल्ट कस्तो देखिन्छ थाहा छैन। यदि तपाईंको तालिम लेबलले 0.4% पङ्क्तिमा लाख र करोड अल्मलिए भने, मोडेललाई थाहा छैन यो कुन आयाममा काम गर्दैछ। यदि तपाईंको डाटा केवल 2024 बाट सङ्कलन गरिएको थियो भने — स्थिर मनसुनको वर्ष — मोडेलले खडेरी-वर्षको डिफल्ट कहिल्यै देखेन, र पहिलो पटक भेट्दा गलत हुनेछ।

यीमध्ये कुनै पनि मोडेलका बग होइनन्। यी डाटा दिइएको कुरालाई मोडेलले इमानदारीसाथ प्रतिबिम्बित गरेका हुन्।

परियोजना डुबाउने तीन वास्तविक तरिका

छ महिनामा आफ्नै काम वा हेडलाइनहरूबाट चिन्न सक्ने विफलता मोडहरूको छोटो, इमानदार सूची।

प्रतिनिधित्व मेल नभएको। तालिम डाटाले प्रणाली प्रयोग हुने जनसङ्ख्या प्रतिनिधित्व गर्दैन। युरोपेली अनुहारमा तालिम दिइएको अनुहार पहिचान, काठमाडौंमा तैनात। अमेरिकी बिरामीमा तालिम दिइएको मेडिकल एआई, नेपालीमा प्रयोग। काठमाडौं उपत्यका नामहरूमा तालिम दिइएको नेपाली NER (नामित अस्तित्व पहिचान), कर्णाली प्रदेश नामहरूमा तैनात। मोडेलले आफ्नो काम गर्दैछ; डाटासेटले यसलाई असफल पार्‍यो।

लेबल शोर। “जमिनी सत्य” लेबल गलत छन्। थकित क्लर्कले “टिप्पणीसहित स्वीकृत” र “शर्तसहित स्वीकृत” अलमल्याएको ऋण डाटासेट। “मधुमेह छैन” भनी लेबल गरिएका केही बिरामीहरूलाई वास्तवमा निदान नभएको मधुमेह भएको मेडिकल डाटासेट। 5% वैध इमेललाई असामान्य वर्ण भएकाले स्प्याम लेबल गरिएको स्प्याम डाटासेट। गलत लेबल → गलत सिकाइ।

वितरण सर्ने। डाटा आएको संसार र प्रणाली तैनात भएको संसार उही होइन। 2019 NEPSE मूल्यमा तालिम दिइएको मोडेललाई 2025 NEPSE मूल्य कस्तो देखिन्छ थाहा छैन। महामारीअघिको डाटामा तालिम दिइएको माग-पूर्वानुमान मोडेललाई महामारीको किनमेलबारे थाहा छैन। डाटा सङ्कलनको समयमा सटीक थियो; संसार सर्‍यो।

प्रत्येकको आकार उही छ: मोडेल ठीक छ; डाटा-देखि-तैनाती खाडल घातक छ। निर्माताको काम यी खाडलहरू अपेक्षा गर्नु र वरिपरि डिजाइन गर्नु हो।

एउटा कार्यगत नेपाली उदाहरण

मान्नुहोस्, तपाईं तराईको माइक्रोफाइनान्स संस्थाका लागि सानो ऋण-डिफल्ट पूर्वानुमान मोडेल बनाउँदै हुनुहुन्छ। तपाईंसँग विगत ऋणहरूको CSV छ: ऋणीको जिल्ला, ऋण रकम (रुपैयाँमा), तिर्ने इतिहास, डिफल्ट फ्ल्याग।

ध्यानले डाटा हेरेर मात्र पक्रने पाँचवटा वास्तविक कुरा जुन अन्यथा मोडेललाई डुबाउँथे:

  1. रकम कहिलेकाहीं लाखमा छ। 4% पङ्क्ति 5 (अर्थ रु 5 लाख) भनी प्रविष्ट गरिएका छन्, 500000 होइन। मोडेलले स्तम्भ हेर्दा ती ऋणीले रु 5 ऋण लिएर डिफल्ट गरेको ठान्थ्यो। विनाशकारी।
  2. जिल्ला नाम चार तरिकाले हिज्जे गरिएका छन्। “Morang”, “morang”, “Morang District”, “मोरङ”। मोडेलले यिनलाई चार फरक जिल्ला ठानेर सिकाइ बाँडछ, कुनै एकमा पनि पर्याप्त सिग्नल नपाउँदै।
  3. केही डिफल्ट छुटेका छन्। 2024 का ऋण जुन अझै आफ्नो अवधि सकाएका छैनन् “डिफल्ट नभएको” लेबल गरिएका छन् — किनभने तिनले अहिलेसम्म डिफल्ट गरेका छैनन्। मोडेलले हालैका ऋणले कहिल्यै डिफल्ट गर्दैनन् भनी सिक्थ्यो, जुन सत्यको ठीक उल्टो हो।
  4. एक अधिकारीका ऋण दोब्बर दरमा डिफल्ट गर्छन्। किनभने ती अधिकारीले एउटै खडेरी-प्रवण जिल्ला कभर गर्छन्। मोडेलले अधिकारी नै पूर्वानुमानकर्ता हो भनी सिक्थ्यो, वास्तवमा भूगोल हो।
  5. लेबल केवल सकिएका ऋणबाट सङ्कलन गरिएको थियो। आधिकारिक डिफल्ट अवस्थाबिना नै राइट-अफ भएका ऋण (ऋणी हराएको कारण, भनौँ) डाटासेटमा छँदै छैनन्। मोडेलले “हराउने” परिणाम कहिल्यै देखेन।

मोडेलमा डाटा खुवाएर शुद्धता हेर्दा यीमध्ये कुनै पनि तपाईंले पक्रनुहुन्न। डाटा हेरेर मात्र पक्रनुहुन्छ। यो पूरै पाठ्यक्रमको केन्द्रीय सीप यही हो।

यो पाठ्यक्रम के हो, एक अनुच्छेदमा

Course 02 Course 01 को अनाकर्षक जुम्ल्याहा हो। Course 01 मा तपाईंले मोडेल बोलाउने र तिनलाई कार्यक्रममा तार जोड्ने सिक्नुभयो। यो पाठ्यक्रममा तपाईं आधार सिक्नुहुन्छ — डाटा कहाँबाट आउँछ (अध्याय 2), तपाईंले भेटेको कुरा कसरी सफा गर्ने (अध्याय 3), तपाईंसँग के छ कसरी बुझ्ने (अध्याय 4), मोडेलका लागि कसरी तयार पार्ने (अध्याय 5), र तपाईंको हातमा पुगेका मानिसहरूलाई हानि नगरीकन यो सबै कसरी गर्ने (अध्याय 6)। मोडेल आफै Course 03 सम्म देखापर्दैन। त्यो ढिलाइ नै बिन्दु हो।

आफ्नो बुझाइ जाँच्नुहोस्

Quick check

ललितपुरको टिमले तीन वर्षको काठमाडौं उपत्यका माइक्रोफाइनान्स डाटामा ऋण-डिफल्ट मोडेल तालिम दिन्छिन्। मोडेल प्रमाणीकरणमा राम्रोसँग प्रदर्शन गर्छ। तिनले कर्णाली प्रदेशमा तैनात गर्छिन् र शुद्धता बिग्रिन्छ। यो खण्डको भाषामा सम्भावित कारण के हो?

Quick check

तपाईं नेपाली-देवनागरी OCR डाटासेट समीक्षा गर्दै हुनुहुन्छ र 5,000 जमिनी-सत्य लेबलमध्ये 200 स्पष्ट रूपमा गलत छन् (एक 'क' लाई 'ख' लेबल गरिएको, आदि) भन्ने देख्नुहुन्छ। यो डाटासेटमा तालिम दिइएको मोडेलले परीक्षण सेटमा 92% शुद्धता देखाउँछ। सम्भावित रूपमा के सत्य हो?

अब के आउँछ

यदि तपाईंले परिकल्पना स्वीकार गर्नुहुन्छ — कि डाटा गुणस्तरले सबै कुरा निर्णय गर्छ — बाँकी पाठ्यक्रम उपकरण-पेटी हो। अध्याय 1 का अर्को दुई खण्डले तपाईंले भेट्ने डाटाका प्रकार (सङ्ख्या, पाठ, छवि, समय) र डाटासेटको जीवन सङ्कलनदेखि मोडेलसम्म कस्तो देखिन्छ ओगट्छन्। अनि अध्याय 2 ले विशिष्ट हुन्छ: वास्तविक डाटा ल्याउन कहाँ जाने, र जहाँबाट ल्याउनुहुन्छ त्यहाँका नियम नतोडी कसरी ल्याउने।

अघि बढ्नुअघि सानो गृहकार्य: तपाईंले वास्तवमै छुनुभएको एउटा डाटासेट सम्झनुहोस् — तपाईंको बैङ्क स्टेटमेन्ट CSV, कक्षा सूची, विद्यार्थी ग्रेडको Google Sheet। तीनवटा सम्भावित गलत कुरा अनुमान गर्नुहोस्। हामी अध्याय 3 मा त्यो अनुमान क्यालिब्रेसन अभ्यासका रूपमा प्रयोग गर्नेछौं।