अध्याय ६ · खण्ड III · 22 मिनेट
अरूले विश्वास गर्न सक्ने डाटासेट दस्तावेज गर्ने
कागजात गरिएको डाटासेट अडिट गर्न, पुन: प्रयोग गर्न, र सुधार्न मिल्छ। कागजात नभएको डाटासेट एक-पटकको प्रयोग हो। दुई छोटा कागजात — डाटासेट कार्ड र प्रति-स्तम्भ डाटा शब्दकोश — ले सबै फरक पार्छन्। अधिकांश निर्माताले स्किप गर्छन्। नगर्नेहरूसँग चुपचाप महाशक्ति हुन्छ।
डाटासेट सफा गर्ने, बुझ्ने, र तयार पार्ने काममा हप्तौं लाग्छ। त्यो डाटासेट कागजात गर्ने काममा एक घण्टा लाग्छ। र झन्डै कसैले गर्दैन। नतिजा यो छ कि हरेक परियोजना शून्यबाट सुरु हुन्छ — उही संस्थाभित्रका परियोजना, उही अन्तर्निहित डाटा प्रयोग गर्ने परियोजनाहरूले पनि — किनभने कसैले के सत्य थियो लेखेन। यो खण्डले Course 02 बन्द गर्दछ एक-पटकको सफा गर्ने कामलाई पुन: प्रयोगयोग्य सम्पत्तिमा बदल्ने कागजात अनुशासनसँग।
कागजात नभएको डाटा छ महिनापछि किन बेकार हुन्छ
परिदृश्य: छ महिनापछि, टिम सदस्यले तपाईंले सफा गरेको ऋण डाटासेट उत्तराधिकारमा पाउँछन्। तिनी data/clean/loans.csv खोल्छन्। तिनले log_loan_amount नामको स्तम्भ देख्छन्। तिनलाई तुरुन्तै तीन प्रश्न आउँछन्:
- अन्तर्निहित एकाइ के हो (NPR? लाख?)?
- “log” को यहाँ अर्थ के हो — प्राकृतिक लग? आधार-10?
- यो रूपान्तरण किन लागू गरियो?
कागजातबिनै, तिनले प्रयास-र-त्रुटिले, वा झन् खराब, अनुमानले उत्तर पुन: व्युत्पन्न गर्छन्। तिनको छ घण्टा समय, हरेक स्तम्भमा उही प्रश्न भएको गुणनले।
कागजातसँग, तिनले एक लाइन पढ्छन् र अघि बढ्छन्। छ मिनेट।
कागजात स्किप गर्ने वास्तविक लागत यो हो। यो स्किप गर्ने रोज्ने व्यक्तिबाहेक सबैले तिर्छ।
झन्डै सबै कुरा ओगट्ने दुई कागजात
पूर्ण कागजात अनुशासनलाई केवल दुई कलाकृति चाहिन्छ।
कागजात 1 — डाटासेट कार्ड। डाटासेटलाई समग्रमा व्याख्या गर्ने एकल Markdown फाइल (data/clean/DATASET_CARD.md)। आधा पृष्ठ, संरचित।
कागजात 2 — डाटा शब्दकोश। हरेक स्तम्भ प्रकार, एकाइ, स्रोत, र व्याख्यासहित सूचीबद्ध गर्ने तालिका (प्रायः CSV वा डाटासेट कार्डको खण्ड)। प्रति स्तम्भ एक पङ्क्ति।
सँगै यिनलाई पहिलो पटक लेख्न एक घण्टा लाग्छ, पछिका सम्पादनपछि अद्यावधिक गर्न पन्ध्र मिनेट लाग्छ, र भविष्यका पाठकका 90% प्रश्नको उत्तर दिन्छन्।
डाटासेट कार्ड टेम्प्लेट
यसलाई सुरुवात बिन्दुका रूपमा प्रयोग गर्नुहोस्। data/clean/DATASET_CARD.md का रूपमा बचाउनुहोस्:
# Loans — Cleaned Microfinance Dataset
## Source
Loans data from [Institution Name], received as `loans_raw.xlsx`
on 2026-03-12 from [Contact Person]. Original file contained
12,847 loan applications across 7 provinces, dates 2022-01 to
2026-02. Original file preserved at `data/raw/loans_raw.xlsx`.
## What this dataset is
One row per loan application. Includes borrower characteristics
(pseudonymised), loan terms, and outcome flags. The pseudonymisation
mapping is in `data/secrets/pseudonym_map.csv` (NOT in version control).
## Cleaning applied
1. Whitespace stripped and case normalised on `district` and `vendor`.
2. Manual district-name mapping applied (see `data/mappings/district_canonical.csv`).
3. 142 rows with negative loan amounts flagged in `is_suspicious`;
not removed.
4. 38 exact duplicates dropped (probably double-entered).
5. BS dates converted to AD using `nepali-datetime`; original BS
string preserved in `date_bs`.
6. Loan amounts converted to consistent NPR (some rows were in lakhs).
## Known limitations
- Records before 2022-01 were not included in the source export.
- Karnali Province is under-represented (only 4% of rows vs ~6%
population share). Inferences about Karnali should be treated
cautiously.
- The `occupation` column has 1,247 unique strings and has not yet
been mapped to a small canonical set; some analyses will need
the manual mapping pass first.
- 'defaulted' is the institution's own classification, not an
external definition; it includes some rows where the loan was
formally rolled over rather than written off.
## Personal data and permissions
- Identifying columns (name, citizenship number, phone) were
dropped during cleaning. They survive only in `data/raw/`,
which is gitignored and access-controlled.
- The institution's data-sharing agreement permits use for
internal modelling and academic research. Commercial use
requires renewed permission.
## How to use
Splits are pre-computed in `data/splits/`. The recommended starting
script is `notebooks/02_load_and_split.ipynb`.
## Contact
For questions, contact [Your Name] <you@example.com>.
Last updated: 2026-06-27.
यो पूरै ढाँचा हो। आठ छोटा खण्ड, प्रत्येकले भविष्यका पाठकले सोध्ने प्रश्नको उत्तर दिँदै।
डाटा शब्दकोश टेम्प्लेट
सरल तालिका, प्रति स्तम्भ एक पङ्क्ति। data/clean/DATA_DICTIONARY.csv का रूपमा बचाउनुहोस्:
column,type,unit,source,description
borrower_id,string,,derived,Pseudonymised borrower identifier (SHA-256 of citizenship + salt)
loan_amount,integer,NPR,raw,Loan principal in Nepali rupees
log_loan_amount,float,log(NPR+1),derived,Natural log of (loan_amount + 1) — for skew correction
district,string,,raw,Canonical district name (see data/mappings/district_canonical.csv)
province,string,,derived,Province inferred from district lookup
occupation,string,,raw,Free-text occupation as recorded by loan officer
application_date_ad,date,AD,derived,Converted from date_bs; primary date column for analysis
application_date_bs,string,BS,raw,Original Bikram Sambat string from source
defaulted,boolean,,raw,True if loan classified as defaulted by source institution
is_suspicious,boolean,,derived,True if loan_amount < 0 (likely data error; not auto-removed)
अब पाठकलाई कुनै पनि स्तम्भको प्रकार के हो, एकाइ के हो, कहाँबाट आयो, र अर्थ के हो थाहा हुन्छ। टाइप गर्न पाँच मिनेट; परियोजनाको जीवनभर हजारौं मिनेट बचत।
सबै सँगै बाँध्ने README
डाटा फोल्डरको सिरमा अझ छोटो data/README.md जसले नयाँ पाठकलाई अभिमुख गराउँछ:
# Data — Loans project
Cleaned: data/clean/loans.csv (see DATASET_CARD.md)
Raw: data/raw/loans_raw.xlsx (gitignored — request from team lead)
Splits: data/splits/ (joblib files; load with joblib.load)
Quick start: open notebooks/02_load_and_split.ipynb.
पाँच लाइन। नयाँ व्यक्तिलाई के कहाँ छ र कहाँबाट सुरु गर्ने भन्छ। पूरै करियरको परियोजना अनबोर्डिङलाई यो जस्तो फाइलको उपस्थितिले मित्रवत् बनाउन सकिन्छ।
संस्करण र अद्यावधिक
डाटासेट बदलिन्छन्। सफा गर्ने स्क्रिप्ट सुधारिन्छ। स्रोत संस्थाबाट एक थप महिनाको डाटासहित नयाँ निर्यात आउँछ। बग भेटिन्छ र सुधारिन्छ।
तीन साना बानीले यो सम्हाल्छन्:
1. डाटासेटको नाम वा बाटो संस्करण गर्नुहोस्। loans.csv मा अधिलेखन गर्नुको सट्टा data/clean/loans_v2.csv। जब मोडेल v1 मा तालिम दिइएको थियो, तपाईं अझै पुन: उत्पादन गर्न सक्नुहुन्छ।
2. DATASET_CARD मिति राख्नुहोस्। डाटासेटमा हरेक परिवर्तनलाई तलको “changelog” खण्डमा लाइन मिल्छ।
## Changelog
- 2026-06-27 (v2): added 2026-03 to 2026-05 data; recomputed
district mappings to fix Sunsari/Sunsari Pi confusion.
- 2026-03-12 (v1): initial cleaning of source data.
3. डाटा सँगै डाटा शब्दकोशको स्न्यापसट लिनुहोस्। जब loans_v2.csv बन्छ, DATA_DICTIONARY_v2.csv यससँगै बस्छ। भविष्यको तपाईंले दुई तुलना गरेर के बदलियो देख्न सक्नुहुन्छ।
उद्योग मानकका रूपमा डाटासेट कार्डबारे टिप्पणी
हामीले भर्खर लेखेको कुरा प्रायः डाटाशीट वा डाटासेट कार्ड भनिन्छ — शैक्षिक कागजात (Timnit Gebru को “Datasheets for Datasets”, 2018) मा प्रस्तावित ढाँचा र Hugging Face, Google, र अन्य प्रमुख डाटा प्रकाशकहरूले अपनाएका। ठ्याक्कै ढाँचा अभ्यासभन्दा कम महत्त्वपूर्ण छ। माथिको टेम्प्लेटलाई सुरुवात बिन्दुका रूपमा प्रयोग गर्नुहोस्; आफ्नो टिमको आवश्यकताका लागि अनुकूलन गर्नुहोस्।
बाह्य रूपमा प्रकाशन गर्ने डाटासेटका लागि — Hugging Face मा, सार्वजनिक रिपोमा, कागजातमा — स्थापित ढाँचा प्रयोग गर्नाले तपाईंको कामलाई कहिल्यै नदेखेका मानिसहरूलाई फेला पार्न र पुन: प्रयोग गर्न मिल्छ। उही न्यूनतम जानकारी; अनुसन्धानकर्ता र अन्य निर्माताले अपेक्षा गर्ने तरिकामा प्रस्तुत।
Course 02 बन्द गर्दै
यो Course 02 को अन्त्य हो। तपाईं API बोलाउन र JSON पार्स गर्न जान्ने व्यक्तिका रूपमा पाठ्यक्रम सुरु गर्नुभयो। तपाईं डाटा कहाँबाट आउँछ, यो कसरी गलत हुन्छ, कसरी सफा गर्ने, कसरी बुझ्ने, मोडेलका लागि कसरी तयार गर्ने, र डाटाका मानिसहरू र पछि डाटासँग काम गर्ने मानिसहरू दुवैलाई सम्मान गर्ने तरिकामा यो सबै कसरी गर्ने जान्ने व्यक्तिका रूपमा छोड्दै हुनुहुन्छ।
काम परियोजनामा कालक्रमिक रूपमा पहिलो होइन — तपाईं सामान्यतया हिस्सेदारसँग कुरा गरेर र समस्या छानेर सुरु गर्नुहुन्छ — तर यो काम हो जुनले डाउनस्ट्रिममा सबै कुरा ठोस छ कि छैन निर्णय गर्छ। Course 03 ले तयार डाटा लिन्छ र अन्ततः मोडेलको अगाडि राख्छ। मोडेलहरू प्रभावशाली देखिनेछन्। यतिसम्ममा तपाईंलाई थाहा छ तिनी दिइएको डाटा जतिकै मात्र प्रभावशाली हुन्। तपाईंले गाह्रो भाग गर्नुभयो।
Course 03 सुरु
Course 03 मा — मेसिन लर्निङ, हातमा — तपाईंले अन्ततः आफ्ना पहिला वास्तविक मोडेल तालिम दिनुहुनेछ। SMS स्प्याम हो कि होइन निर्णय गर्ने वर्गीकरणकर्ता। काठमाडौंमा भाडा पूर्वानुमान गर्ने रिग्रेसन। मोडेल पहिले साना हुनेछन्, अनि ठूला। प्रत्येकले यो पाठ्यक्रमको बारेमा रहेको तयार, सफा, बाँडिएको, कागजात गरिएको डाटा प्रयोग गर्नेछ। प्रत्येक तपाईंले भर्खर सिकेको कामको गुणस्तरमा सफल वा असफल हुनेछ।
तयार हुँदा, पृष्ठ पल्टाउनुहोस्।