अध्याय १ · खण्ड II · 24 मिनेट
डाटाका प्रकार: सङ्ख्या, पाठ, छवि, समय
चार आकारले तपाईंले भेट्ने झन्डै हरेक डाटासेट ओगट्छन्। प्रत्येकका आफ्ना विशेषता छन्, आफ्नै फोहोर हुने तरिका छन्, र आफ्नै मोडेलका लागि तयार पार्ने तरिका छन्। कुन आकार समातिरहनुभएको छ थाहा पाउँदा कुन औजार समात्ने थाहा हुन्छ।
यो पाठ्यक्रममा — र निर्माताका रूपमा तपाईंको कार्य-जीवनमा — तपाईंले छुने झन्डै हरेक डाटासेट चार आधारभूत प्रकारको कुनै संयोजन हो: सङ्ख्या, पाठ, छवि, र समय। यिनी फरक तरिकाले व्यवहार गर्छन्। फरक तरिकाले बिग्रन्छन्। फरक तरिकाले सफा हुन्छन्। मोडेललाई फरक तरिकाले खुवाइन्छन्। प्रत्येकलाई कसरी चिन्ने पन्ध्र मिनेट सिक्दा पछि हप्तौं अल्मलिनबाट जोगिन्छ, जब सङ्ख्यात्मक देखिने स्तम्भ वास्तवमा टाइपोसहितको मिति स्ट्रिङ हुनसक्छ, वा पाठ्य देखिने स्तम्भ वास्तवमा खराब इन्कोड गरिएको सानो छवि।
सङ्ख्या
सबैभन्दा परिचित आकार। गन्ती, रकम, अनुपात, अङ्क। ऋण रकम, तापक्रम पढाइ, NEPSE बन्द, परीक्षा अङ्क, घरमा बच्चाको सङ्ख्या।
“सङ्ख्या” भित्र दुई महत्त्वपूर्ण उप-भेद:
निरन्तर बनाम अलग्गै। तापक्रम 22.3°C हुनसक्छ; परीक्षा अङ्क सामान्यतया पूर्ण सङ्ख्या हो; गन्ती सधैं पूर्ण सङ्ख्या हो। अलग्गै मानहरू सङ्ख्यात्मक देखिए पनि कहिलेकाहीं श्रेणी जस्तै व्यवहार गर्छन् — 1-5 को Likert मापदण्ड गणितीय रूपमा “सङ्ख्या” हो तर वास्तवमा पाँच श्रेणी जस्तै हो। फरक छुट्याउने प्रश्न: 3 र 4 बीचको फरकले 4 र 5 बीचको फरक जति नै अर्थ राख्छ? तापक्रमका लागि, हो। “सन्तुष्टि रेटिङ” का लागि, बहसयोग्य।
अनुपात बनाम अन्तराल। केही सङ्ख्याहरूको अर्थपूर्ण शून्य हुन्छ (उचाइ, तौल, NPR), अरूको हुँदैन (सेल्सियस तापक्रम)। मोडेलका लागि डाटा स्केल गर्दा फरक महत्त्वपूर्ण हुन्छ — NPR लाई 2 ले गुणन गर्नुको अर्थ छ; 20°C लाई 2 ले गुणन गर्नुको अर्थ छैन।
सङ्ख्या कसरी बिग्रिन्छ:
- गलत एकाइ (रुपैयाँ बनाम लाख बनाम करोड — एउटै स्तम्भमा तीनै छन्)
- गलत शुद्धता (केही पङ्क्ति पूर्णाङ्क, केहीमा 6 दशमलव)
- शून्यका रूपमा छुटेको (मान वास्तवमा अज्ञात भएको ठाउँमा शून्य — विनाशकारी)
- खराब आउटलायर (
124°Cतापक्रम जुन वास्तवमा सेन्सर विफलता हो)
पाठ
भाषा मोडेलहरूका कारण सबैभन्दा छिटो महत्त्वमा बढेको आकार। नाम, ठेगाना, स्वतन्त्र टिप्पणी, उत्पादन विवरण, समाचार लेख, कुराकानीका ट्रान्सक्रिप्ट।
पाठ एकल सबैभन्दा फोहोर डाटा प्रकार हो। नेपाली डाटासेटमा “शहर नाम” को एउटै स्तम्भले समावेश गर्न सक्छ:
Kathmandu,KATHMANDU,kathmandu(केस)Kathmandu,Kathmandu, Nepal,KTM(फरक रूप)काठमाडौं,कान्तिपुर(देवनागरी, पुरानो नामसहित)Kathmandu,Kathmandu(पुच्छर/अगाडिको खाली ठाउँ)- खाली स्ट्रिङ, शाब्दिक “unknown”,
NA,N/A,null
यी सबै उही ठाउँ हुन्। यीमध्ये कुनै पनि एउटै स्ट्रिङ होइनन्। पाठ सफा गर्ने — विशेष गरी नेपाली पाठ — अध्याय 3 को अधिकांश हो।
छवि
रसिदका फोटो, नागरिकता प्रमाणपत्रको स्क्यान, NEPSE उद्धरणको स्क्रिनसट, धान खेतका उपग्रह टाइल, एक्स-रे। पिक्सेल ग्रिडमा व्यवस्थित, प्रति पिक्सेल तीन सङ्ख्या (रातो, हरियो, नीलो) — वा ग्रेस्केलका लागि प्रति पिक्सेल एक सङ्ख्या।
अधिकांश समय अधिकांश निर्माताका लागि, छवि डाटा कच्चा सङ्ख्याका रूपमा आउँदैन। यो फाइलका रूपमा आउँछ: receipt-2026-06-23.jpg, xray-001.png। तपाईं तिनलाई पुस्तकालय (PIL / Pillow, वा OpenCV) ले लोड गर्नुहुन्छ र पुस्तकालयले कच्चा पिक्सेल एरेलाई मित्रवत् इन्टरफेस पछाडि लुकाउँछ।
छवि डाटाका आफ्नै बिग्रने तरिका छन्:
- रिजोल्युसन मेल नभएको। केही रसिद 4000×3000, केही 480×640 छन्। अधिकांश मोडेललाई निश्चित इनपुट साइज चाहिन्छ।
- अभिमुखीकरण। फोन क्यामेराले अभिमुखीकरण मेटाडाटा इम्बेड गर्छन् जुन केही पुस्तकालयले मान्छ र केहीले मान्दैन। एउटै छवि एउटा औजारमा सीधा र अर्कोमा उल्टो देखिन्छ।
- उज्यालो र गुणस्तर। डाटासेटको आधा राम्रोसँग प्रकाशित भित्री स्क्यान; आधा कमजोर प्रकाशित बाहिरी फोन स्न्याप। एउटामा तालिम दिइएको मोडेल अर्कोमा संघर्ष गर्छ।
- व्यक्तिगत रूपमा पहिचान योग्य सामग्री। रसिद फोटोमा क्यासियरको अनुहार समावेश हुन्छ। स्क्यान गरिएको नागरिकताले सबै देखाउँछ। तपाईंले चाहनुहुन्न भने पनि संवेदनशील।
हामीले छविलाई Course 01 मा छोटकरीमा छुयौं (Tesseract OCR)। Course 02 छवि-केन्द्रित मोडेलिङमा गहिरो जाँदैन — त्यो Course 03 मा बस्छ। तर परियोजना योजना बनाउँदा आकार अस्तित्वमा छ भन्ने थाहा हुनु महत्त्वपूर्ण हुन्छ।
समय
सबैभन्दा कम सम्मान गरिएको डाटा प्रकार। टाइमस्ट्याम्प, अवधि, मिति, पुनरावृत्ति।
समय देखिनेभन्दा गाह्रो छ किनभने यसमा अन्य प्रकारमा नभएको संरचना छ:
- धेरै पात्रो। नेपाली डाटासेटले विक्रम सम्बत् (BS) र AD मिति नियमित रूपमा मिसाउँछन्।
2080-04-15भन्ने स्तम्भले कुनै पनि अर्थ राख्न सक्छ — र सही उत्तर सन्दर्भमा निर्भर हुन्छ।2080 BS = 2023 AD(लगभग)। यदि तपाईंले गलत पात्रो मान्नुभयो भने, तपाईंको सबै समय-आधारित विश्लेषण ~57 वर्ष पर हुन्छ। - टाइम जोन। नेपाल UTC+05:45 मा छ — पृथ्वीका 45-मिनेट अफसेट भएका थोरै ठाउँमध्ये एक। API ले कहिलेकाहीं UTC समय फिर्ता गर्छन्। यदि तपाईंले तिनलाई नेपाल समय ठान्नुभयो भने, करिब छ घण्टा पर हुनुहुन्छ, जुन घटनालाई गलत दिनमा राख्न पर्याप्त छ।
- दानवृत्ति। “यो कहिले भयो?” को अर्थ मिति, हप्ताको दिन, घण्टा, मिनेट, सेकेन्ड हुनसक्छ। तपाईंको समस्यालाई वास्तवमै आवश्यक पर्ने दानवृत्ति छान्नुहोस्; त्योभन्दा बढी भण्डारण नगर्नुहोस्।
- खाडल र क्रम। छुटेका दिन भएको समय-शृङ्खला धोकेबाज छ। आधा दिन छुटेको बेला दिनहरूमा सरल औसत गलत हुन्छ।
चारै प्रकारसहित वास्तविक नेपाली उदाहरण
खल्ती स्टेटमेन्टको एउटा महिनाले तपाईंलाई चारै दिन्छ:
- सङ्ख्या: NPR मा कारोबार रकम।
- पाठ: विक्रेता नाम, कहिलेकाहीं देवनागरी, कहिलेकाहीं रोमन, कहिलेकाहीं दुवै — र उही विक्रेताका लागि पनि पङ्क्तिहरूमा असंगत।
- छवि: केही पङ्क्तिका लागि स्क्यान गरिएको रसिद संलग्न (नामले उल्लेख गरिएको jpg/png फाइल)।
- समय: नेपाल समयमा कारोबार टाइमस्ट्याम्प, रातिको ढिलो सुरु भएर भोलिपल्ट निपटान हुनेका लागि किनार केसहरूसहित।
यो डाटामा गम्भीर परियोजना — भनौँ, “यस महिना मेरो पैसा कहाँ गयो सारांश गर्ने” — ले चारै प्रकार छुनुपर्छ। सङ्ख्यालाई एकाइ-जाँच चाहिन्छ। विक्रेता नामलाई सामान्यीकरण चाहिन्छ। रसिद छविलाई OCR चाहिन सक्छ। टाइमस्ट्याम्पलाई दिनको सीमा र टाइमजोन वरिपरि सावधानी चाहिन्छ। यीमध्ये कुनै पनि मोडेल होइन। सबै काम हुन्।
आफ्नो बुझाइ जाँच्नुहोस्
Quick check
—नेपाली सर्वेक्षण डाटासेटको एउटा स्तम्भमा `2080-04-15` मान छ। थप सन्दर्भबिना, यसबारे सबैभन्दा सटीक के भन्न मिल्छ?
Quick check
—तपाईं खल्ती-शैलीका कारोबारको नयाँ डाटासेटको स्किमा डिजाइन गर्दै हुनुहुन्छ। डाटासेटको एकल पङ्क्तिलाई कुन प्रकारको संयोजनले सबैभन्दा राम्रोसँग वर्णन गर्छ?
अब के आउँछ
तपाईंसँग चार आकार दिमागमा छन्। अर्को खण्डले डाटासेटको जीवन — “बीरगन्जको क्लर्कले सङ्ख्या लेखेको” बाट “त्यो सङ्ख्या अब तालिम दिइएको मोडेलमा फिचर हो” सम्मको यात्रा — हिँडाउँछ। त्यो यात्रा बुझ्नु डाटालाई कच्चा सामग्रीका रूपमा र वास्तविक केहीको इमानदार प्रतिनिधित्वका रूपमा व्यवहार गर्नेबीचको फरक हो। दुवै दृष्टिकोण उपयोगी छन्। कुनै पनि पूर्ण सत्य होइन।