अध्याय १ · खण्ड III · 22 मिनेट
डाटासेटको जीवन: सङ्कलनदेखि मोडेलसम्म
बीरगन्जको क्लर्कले सङ्ख्या लेख्नेदेखि त्यो सङ्ख्याले मोडेलको पूर्वानुमानमा प्रभाव पार्ने यात्रामा छ चरण छन्। चरणहरू बुझ्नु — र कुन चरण बिग्रिरहेको छ — राम्रो निर्माता र निराश निर्माताबीचको फरक हो।
डाटासेट देखापर्दैनन्। तिनी उत्पादन हुन्छन् — मानिसले, प्रणालीले, सेन्सरले — र स्रोतबाट मोडेलसम्मको बाटोमा पहिचानयोग्य क्रमबाट जान्छन्। यो पाठ्यक्रममा तपाईंले भेट्ने अधिकांश डाटा समस्याहरूलाई विशिष्ट चरणसम्म पछ्याउन सकिन्छ। कुन चरण समस्याको स्रोत हो थाहा पाउँदा निदान समय दिनबाट मिनेटमा झर्छ। यो खण्डले छ चरण हिँडाउँछ, चलिरहेको उदाहरणका रूपमा एउटा नेपाली माइक्रोफाइनान्स ऋण-डिफल्ट रेकर्डसँग।
चरण 1 — उत्पादन
संसारमा वास्तविक केही हुन्छ। बीरगन्जको ऋण अधिकारी ऋणीसँग बस्छिन् र रु 80,000 ऋण स्वीकृत गर्छिन्। ऋणीसँग चिया पसल छ। तिर्ने तालिका 18 महिनासम्म मासिक हो। यो डाटा हो: एउटा स्वीकृति, एउटा सम्झौता, एउटा तिर्ने योजना।
यो चरणमा के सत्य छ ध्यान दिनुहोस्:
- डाटा विशिष्ट वास्तविक-संसार घटनासँग जोडिएको छ।
- यो अस्तित्वमा छ, तर अझै Python अर्थमा “डाटा” बनेको छैन — यो कागजी काम, कुराकानी, हात मिलाउने हो।
- यस चरणमा लेखिएको जे पनि अधिकारीले रेकर्ड गर्न रोजेको र फारममा ठाउँ भएको कुरालाई प्रतिबिम्बित गर्नेछ। यहाँ नलेखिएको कुनै पनि कुरा सधैंका लागि हराउँछ।
चरण 2 — क्याप्चर
कसैले लेख्छ। अधिकारीले कागजको फारम भर्छिन्, वा ट्याबलेटमा टाइप गर्छिन्, वा क्लर्कलाई बोलाएर लेखाउँछिन्। रु 80,000 “रकम” लेबल भएको सेलमा सङ्ख्या बन्छ। ऋणीको जिल्ला “जिल्ला” लेबल भएको सेलमा स्ट्रिङ बन्छ।
क्याप्चर त्यो ठाउँ हो जहाँ अधिकांश फोहोर-डाटा समस्या जन्मन्छन्:
- अधिकारीले एक पङ्क्तिमा
80000टाइप गर्छिन् र अर्कोमा80,000र तेस्रोमा80k। - जिल्ला कहिलेकाहीं
Parsaर कहिलेकाहींBirgunj(पर्साको शहर)। - चिया पसल व्यवसाय फरक पङ्क्तिमा
tea stall,Tea Stall,chiya pasal, रचिया पसललेखिन्छ। - संरचित जानकारी भएको तिर्ने तालिका एकल स्वतन्त्र-पाठ टिप्पणी फिल्डमा कोचिन्छ।
यस पाठ्यक्रमले तपाईंलाई सुधार्न सिकाउने झन्डै हरेक समस्या यहीँबाट सुरु हुन्छ।
चरण 3 — भण्डारण
क्याप्चर गरिएको डाटा कतै जान्छ। स्प्रेडसिट। SQL डाटाबेस। महिनामा एक पटक डिजिटाइज हुने हस्तलिखित खाताबही। Google Drive फोल्डरमा बसेको कागज फारमको फोटो।
भण्डारण त्यो ठाउँ हो जहाँ डाटाले आफ्नो आकार प्राप्त गर्छ — के स्तम्भ छन्, के प्रकार छन्, मिति स्ट्रिङ हुन् कि वास्तविक मिति, रकम पूर्णाङ्क हुन् कि कोमासहितको स्ट्रिङ। दुई वर्षअघि परियोजना छाडेर गएको कसैले गरेका भण्डारण निर्णयले तपाईंलाई सधैं सताउँछन्।
यहाँ के बिग्रन सक्छ:
- रकमका लागि डाटाबेस स्तम्भ
INTEGERहोइनVARCHAR(20)हो, त्यसैले रकम पाठका रूपमा भण्डारण हुन्छ र अंकगणित रोकिन्छ। - एन्कोडिङ UTF-8 होइन Latin-1 मा सेट छ, र देवनागरी नाम
??????वापà¥à¤à¤¤à¥à¤ªमा बिग्रन्छन्। - “मेटाइएको” फ्ल्याग पछि परियोजनामा थपिन्छ तर पुराना पङ्क्तिमा
NULLहुन्छ, जुनFalseजत्तिकै अर्थ राख्छ तर केही क्वेरीले फरक तरिकाले व्यवहार गर्छन्।
तपाईंले यो भण्डारण पढ्न कोड लेख्नुहुनेछ; कोड भण्डारणले कसरी काम गर्छ भन्ने तपाईंको बुझाइ जति राम्रो मात्र हुनेछ।
चरण 4 — निकालन
कसैले डाटालाई तपाईंले काम गर्न सकिने फाइलमा निर्यात गर्छ। यो सामान्यतया डाटा तपाईंको डेस्कमा पुग्ने क्षण हो। डाटाबेसबाट CSV डाउनलोड, Signal मा कसैले पठाएको .xlsx, API बाट JSON डम्प।
निकालनको आफ्नो विफलता मोडहरू छन्:
- टुङ्ग्याएको। निर्यात औजार 65,000 पङ्क्तिमा सीमित थियो किनभने पुरानो Excel ले त्यतिमात्र सम्हाल्न सक्थ्यो, तर 80,000 पङ्क्ति छन्।
- ढाँचा रूपान्तरण नोक्सान। निर्यात गरेको मेसिनको स्थानीयतामा मिति पुन: ढाँचाबद्ध हुन्छन् —
4/5/2026मा अप्रिल 5 (US) वा मे 4 (UK) हुनसक्छ। - मौन एन्कोडिङ छनोट। CSV प्राविधिक रूपमा UTF-8 हो तर Windows Excel ले बचाएको थियो, जसले BOM (Byte Order Mark) हालिदिन्छ जुन केही Python औजारले थाम्न सक्दैनन्।
- तपाईंलाई नभनी नमुना लिने। कसैले तपाईंलाई “डाटासेट” दिन्छन् तर वास्तवमा “डाटासेटको नमुना” दिए किनभने पूरा इमेल गर्न ठूलो थियो।
समय बचाउने अनुशासन: डाटा यसको मूल रूप र तपाईंले पाएको फाइलबीच के गरियो लिखित रूपमा सधैं सोध्नुहोस्। “मैले Export मात्र क्लिक गरेँ” जस्तो इमानदार उत्तरले पनि उपयोगी केही भन्छ (यो पूर्वनिर्धारित निर्यात थियो, अनुकूलित क्वेरी होइन)।
चरण 5 — तयारी
तपाईं — निर्माता — डाटा सफा गर्नुहुन्छ। चरण 2 र 3 का फोहोर कुरा सुधार्नुहोस्। चरण 4 का निर्यात विशेषता सम्हाल्नुहोस्। पाठ सामान्यीकरण गर्नुहोस्, मिति पार्स गर्नुहोस्, छुटेका मान सम्हाल्नुहोस्, दायरा प्रमाणित गर्नुहोस्, डुप्लिकेट हटाउनुहोस्। मोडेलका लागि फिचर इन्जिनियर गर्नुहोस्।
यो यो पाठ्यक्रमको अध्याय 3 र 5 को काम हो। यो झन्डै हरेक एआई परियोजनाको सबैभन्दा ठूलो एकल समय-लागत हो। नयाँ परियोजना कति समय लाग्ने अनुमान सोधिएका वरिष्ठ डाटा इन्जिनियरहरूले मानसिक रूपमा बजेटको 60-80% यो चरणमा छुट्याउँछन् र दशकौँदेखि गरिरहेका छन्। सङ्ख्या तल आउँदैन।
चरण 6 — तालिम र इन्फरेन्स
सफा, तयार डाटा अन्ततः मोडेललाई भेट्छ। मोडेलले यसमा तालिम लिन्छ, ढाँचा सिक्छ, र पछि नयाँ डाटामा पूर्वानुमान गर्न सोधिन्छ। चरण 1-5 का महिनौँको काम यस चरणमा सफल वा असफल हुन्छ — तर चरण 6 को सफलता वा असफलता पूर्ण रूपमा चरण 1-5 मा भएको कुराले निर्धारण गर्छ।
यदि तपाईंले चरण 5 मा एकाइ-जाँच बिर्सनुभयो भने, तपाईंको मोडेलले डिफल्टको गलत अनुमान गर्छ। यदि तपाईंले चरण 3 मा एन्कोडिङ बग छुटाउनुभयो भने, तपाईंको मोडेलले देवनागरी नामहरूबारे कहिल्यै केही सिकेन। यदि तपाईंले चरण 4 मा नमुना लिने बारेमा सोध्नुभएन भने, तपाईंको “उत्कृष्ट” मोडेल केवल नमुना लिइएको उपसमूहमा उत्कृष्ट हो र उत्पादनमा बिग्रन सक्छ।
मोडेल सस्तो भाग हो। डाटा काम महँगो, ढिलो, महत्त्वपूर्ण भाग हो। यो क्रम कारण हो।
यो चरण नक्सा किन महत्त्वपूर्ण छ
जब चरण 6 मा केही गलत हुन्छ — तपाईंको मोडेल काम गरिरहेको छैन, शुद्धता खराब छ, पूर्वानुमान अनौठा छन् — सहज प्रतिक्रिया मोडेल सुधार्ने हो। ठूलो नेटवर्क, बढी कम्प्युट, फरक आर्किटेक्चर। झन्डै सधैं, वास्तविक समस्या माथिल्लो स्ट्रिममा हुन्छ: फोहोर क्याप्चर (चरण 2), बिग्रिएको भण्डारण (चरण 3), बिग्रिएको निर्यात (चरण 4), वा स्किप गरिएको तयारी (चरण 5)। उपचार सत्य कहाँ हराएको थियो भेट्न चरणहरूमा फर्केर हिँड्ने हो।
तपाईंले काम गर्ने वरिष्ठ मानिसहरूले यो नक्सा आफ्नो दिमागमा बोक्छन्। तिनले डाटा समस्या निदान गर्न मानसिक रूपमा चरणहरू फर्केर खाडल भेट्छन्। यो नक्सा अहिले नै आफ्नो दिमागमा राख्नुहोस् र केवल मोडेलबारे सोच्ने साथीहरूभन्दा छिटो निदान गर्नुहुनेछ।
आफ्नो बुझाइ जाँच्नुहोस्
Quick check
—तपाईंको ऋण-डिफल्ट मोडेलले कर्णाली ऋणीहरूमा धेरै कम-आत्मविश्वासी पूर्वानुमान उत्पादन गरिरहेको छ। डाटा चरणहरू फर्केर हिँड्दा, कुन प्रश्नले *सबैभन्दा सम्भावित* मूल कारण सतहमा ल्याउँछ?
Quick check
—टिम सदस्यले तपाईंलाई CSV फाइल दिएर 'यो डाटा हो' भन्छिन्। यो खण्डले सिफारिस गर्ने अनुशासनअनुसार, तुरुन्तै लिखित रूपमा सोध्ने सबैभन्दा उपयोगी प्रश्न के हो?
अब के आउँछ
तपाईंसँग अब नक्सा छ। अध्याय 2 निकालन चरण 4 बाट सुरु हुन्छ — निर्माताको पक्षबाट: वास्तविक डाटा पाउन कहाँ जाने, तपाईंले भेटेको कुरा कसरी पढ्ने, API कसरी बोलाउने, र स्क्र्यापिङले के अनुमति दिन्छ र दिँदैन। अध्याय 2 को अन्त्यसम्ममा तपाईंले आफ्नो पहिलो वास्तविक डाटासेट जङ्गलबाट सफा Python नोटबुकमा सारिसक्नुभएको हुनेछ, निरीक्षण, सफा गर्न, र बुझ्न तयार।