ailiteracynepal 🇳🇵
पाठ आकार

अध्याय ६ · खण्ड II · 26 मिनेट

नेपालमा गोपनीयता, सहमति, र व्यक्तिगत डाटा

व्यक्तिगत डाटा पहिचानयोग्य व्यक्तिबारेको डाटा हो। यसँग काम गर्नु — कानुन अझै परिपक्व हुँदै गरेको न्यायाधिकारमा पनि — वास्तविक नैतिक र कानुनी जिम्मेवारी बोक्छ। निर्माताका लागि छोटो क्षेत्र-गाइड।

जुन क्षण तपाईंको डाटासेटमा नाम, फोन नम्बर, नागरिकता नम्बर, अनुहार, वा सटीक स्थान समावेश हुन्छ, त्यो क्षण तपाईं डाटासँग मात्र काम गर्दै हुनुहुन्न — तपाईं वास्तविक मानिसहरूको जानकारीसँग काम गर्दै हुनुहुन्छ, र तपाईंका निर्णयले तिनका लागि वास्तविक परिणाम ल्याउँछन्। यो खण्ड पूर्ण कानुनी मार्गदर्शक होइन; नेपालको कानुन विकसित हुँदै छ, र व्यावसायिक तैनातीलाई छुने कुनै पनि कुराका लागि वास्तविक वकिलसँग परामर्श गर्नुपर्छ। तर हरेक निर्माताले बोक्ने निर्णय, सरसफाइ, र नैतिकताको आधार छ, र यो खण्डको विषय त्यही आधार हो।

व्यक्तिगत डाटा भनेर के गन्ने

उपयोगी कार्यगत परिभाषा: व्यक्तिगत डाटा कुनै पनि जानकारी हो जुन प्रत्यक्ष वा अरू डाटासँग संयोजनमा प्रयोग गरेर विशिष्ट व्यक्ति पहिचान गर्न सकिन्छ।

स्पष्ट केस:

  • पूरा नाम, नागरिकता नम्बर, राहदानी नम्बर, इजाजतपत्र नम्बर
  • फोन नम्बर, इमेल ठेगाना, भौतिक ठेगाना
  • जन्म मिति, जन्म स्थान
  • बायोमेट्रिक डाटा: अनुहार फोटो, औंलाछाप, आवाज रेकर्डिङ
  • वित्तीय खाता नम्बर
  • स्वास्थ्य रेकर्ड, निदान, औषधि निर्देशन

कम-स्पष्ट केस जसले निर्मातालाई गार्डबाहिर पार्छन्:

  • नामबिना पनि विशिष्ट रूपमा पहिचान गर्ने संयोजन। (लिङ्ग + जन्म मिति + जिल्लाले थोरै मानिसहरूलाई पहिचान गर्न सक्छ; पर्याप्त सानो समुदायमा, केवल जन्म मिति र जिल्ला पनि सक्छ।)
  • समयसँगै सटीक GPS निर्देशाङ्क (आउजाउ ढाँचाले घर र कार्यस्थल प्रकट गर्छ)।
  • ब्राउजिङ इतिहास, खोज क्वेरी।
  • पृष्ठभूमिमा अनुहार समावेश गर्ने फोटो, ती विषय नभए पनि।
  • आवाज रेकर्डिङ — आधुनिक प्रणालीले केही सेकेन्डबाट वक्ता पहिचान गर्न सक्छन्।

किनाराका केसमा मद्दत गर्ने सिद्धान्त: यदि डाटासेट हटाउनाले वास्तविक व्यक्ति पहिचान वा लक्षित हुन रोक्छ भने, डाटासेटमा व्यक्तिगत डाटा छ। तदनुसार व्यवहार गर्नुहोस्।

आत्मसात् गर्नुपर्ने चार सिद्धान्त

कार्यगत नैतिक आधार। कुनै पनि एक्लै पर्याप्त छैन; सँगै यिनी सुरुवात स्थिति हुन्।

सहमति

व्यक्तिलाई थाहा हुनुपर्छ कि तिनको डाटा सङ्कलन भइरहेको छ, यो के का लागि प्रयोग गरिनेछ, र अस्वीकार गर्ने अर्थपूर्ण क्षमता हुनुपर्छ। अर्थपूर्ण भन्नाले वास्तविक, सूचित, र रद्द गर्न योग्य — सेवा सर्तको 4,000-शब्दको लुकेको चेकबक्स होइन।

अरूबाट प्राप्त डाटासेटका लागि, सोध्नुहोस्: के यो डाटासेटका मानिसहरूले तपाईंले प्रयोग गर्न लागेको तरिकामा प्रयोग गरिने सहमति दिएका थिए? यदि बैङ्कले तपाईंलाई ग्राहक कारोबार डाटा दियो भने, के ग्राहकले यसमा एआई प्रयोग गर्ने सहमति दिएका थिए? प्रायः कानुनी उत्तर “हो, सानो प्रिन्टमा” हो, र नैतिक उत्तर “तिनलाई थाहै थिएन” हो। दुवै उत्तर महत्त्वपूर्ण छन्।

न्यूनीकरण

केवल आवश्यक डाटा सङ्कलन गर्नुहोस्। यदि तपाईंको मोडेललाई age_bucket (30 भन्दा कम, 30-50, 50 भन्दा माथि) मात्र चाहिन्छ भने, date_of_birth सङ्कलन नगर्नुहोस्। यदि तपाईंको मोडेललाई province मात्र चाहिन्छ भने, street_address सङ्कलन नगर्नुहोस्। थप डाटा थप दायित्व हो — तपाईंलाई भण्डारण गर्न, तपाईंलाई लीक हुन, कसैले दुरुपयोग गर्न।

जब तपाईंले आवश्यकभन्दा बढी समावेश गर्ने डाटा प्राप्त गर्नुहुन्छ, तपाईंको पाइपलाइनमा सकेसम्म चाँडो अनावश्यक स्तम्भ हटाउनुहोस्। हटाइएको कागजात गर्नुहोस्।

उद्देश्य सीमा

एक उद्देश्यका लागि सङ्कलन गरिएको डाटा नवीकृत सहमतिबिनै अर्को उद्देश्यका लागि प्रयोग गर्नुहुन्न। माइक्रोफाइनान्स संस्थाहरूलाई जोखिम मूल्याङ्कनमा मद्दत गर्न सङ्कलन गरिएको ऋण-डिफल्ट डाटा मार्केटिङ मोडेल तालिम दिन प्रयोग गर्नुहुन्न, डाटा प्राविधिक रूपमा उपलब्ध भए पनि। उद्देश्य सीमाले मानिसहरूलाई असल विश्वासमा साझा गरेको डाटा पछि तिनको विरुद्ध प्रयोग हुनबाट जोगाउँछ।

सुरक्षा

व्यक्तिगत डाटा सुरक्षित हुनुपर्छ। आराम अवस्थामा इन्क्रिप्ट गरिएको, सुरक्षित च्यानलबाट प्रसारण गरिएको, पहुँच नियन्त्रण भएको ठाउँमा मात्र भण्डारण गरिएको। तपाईंको डेस्कमा ग्राहक डाटाको CSV लीक हुन प्रतीक्षारत छ। साना डाटासेटले पनि आधारभूत सरसफाइ योग्य छन्:

  • व्यक्तिगत डाटालाई कहिल्यै git मा कमिट नगर्नुहोस्, निजी रिपोमा पनि होइन।
  • व्यक्तिगत डाटा कहिल्यै इमेल संलग्नकका रूपमा नपठाउनुहोस्।
  • व्यक्तिगत डाटा साझा ड्राइभमा कहिल्यै अनइन्क्रिप्ट भण्डारण नगर्नुहोस्।
  • काम सकिएपछि, राख्ने कागजात गरिएको कारण नभए डाटा मेटाउनुहोस्।

नेपाल-विशिष्ट विचार

नेपालमा कानुनी परिदृश्य सर्दैछ। गोपनीयता ऐन 2018 र व्यक्तिगत गोपनीयता नियमावली 2020 ले आधारभूत सुरक्षा स्थापना गर्छन्। आगामी डाटा संरक्षण ऐन (2026 मा मस्यौदामा) बलियो र बढी स्पष्ट हुने अपेक्षा गरिएको छ। आज जान्न लायक विशिष्टता:

  • नागरिकता र राहदानी स्क्यान उच्च संवेदनशील छन्। केही हजारको पनि लीकले वास्तविक हानि — ठगी, प्रतिरूपण, सतावट — सिर्जना गर्छ। यिनलाई छुने कुनै पनि परियोजनालाई अत्यन्त हेरचाहसँग व्यवहार गर्नुहोस्।
  • स्वास्थ्य डाटा अलग्गै र कडा रूपमा नियमन हुन्छ। बिरामी रेकर्ड, औषधि निर्देशन, वा निदानसँग काम गर्न, अनुसन्धान सन्दर्भमा पनि, स्पष्ट नैतिक समीक्षा चाहिन्छ।
  • बच्चाहरूको डाटा अधिकांश न्यायाधिकारमा थप सुरक्षासहित व्यवहार गरिन्छ, र नेपाल यो दिशामा सर्दैछ। पहिचानयोग्य विद्यार्थी समावेश गर्ने विद्यालय डाटासेटलाई संरक्षकको सहमति चाहिन्छ।
  • जात र जातीयता संवेदनशील श्रेणी हुन् जुन भेदभाव गर्न प्रयोग हुन सक्छन् (र भएका छन्)। यिनलाई फिचरका रूपमा प्रयोग गर्ने मोडेलले भेदभाव कोड गर्ने जोखिम हुन्छ। प्रायः सही चाल नसङ्कलन गर्ने वा प्रयोग नगर्ने हो — र तिनका प्रतिनिधिको लागि सक्रिय रूपमा अडिट गर्ने हो।
  • सीमापार डाटा प्रवाह बढ्दो छानबिनमा छ। आज नेपाली व्यक्तिगत डाटालाई US-होस्ट गरिएको क्लाउड सेवामा भण्डारण गर्नु प्रायः ठीक छ तर दुई वर्षमा नहुन सक्छ; पोर्टेबिलिटीसँग निर्माण गर्नुहोस्।

व्यवहारिक सरसफाइ ढाँचा

तपाईं र तपाईंको डाटाका मानिसहरू दुवैलाई सुरक्षा दिने मूर्त बानी।

सकेसम्म चाँडो छद्मनामकरण गर्नुहोस्। पहिचान गर्ने स्तम्भहरूलाई अनियमित ID ले बदल्नुहोस्। नक्शा अलग्गै, सुरक्षित फाइलमा राख्नुहोस्।

import hashlib

def pseudonymise(citizenship_number: str, salt: str) -> str:
    return hashlib.sha256((salt + citizenship_number).encode()).hexdigest()[:12]

df["borrower_id"] = df["citizenship_number"].apply(lambda c: pseudonymise(c, "your_salt"))
df = df.drop(columns=["citizenship_number", "full_name", "phone"])

यसपछि, डाटासेटको borrower_id साल्टबिनै उल्टाउन मिल्दैन — र मूल पहिचान गर्ने स्तम्भ गयो। साल्टलाई .env मा राख्नुहोस्, git मा कहिल्यै होइन।

सानो स्वीकार्य समूहमा सङ्कलन गर्नुहोस्। सटीक ठेगानाको सट्टा, नगरपालिका वा जिल्ला प्रयोग गर्नुहोस्। ठ्याक्कै उमेरको सट्टा, बाल्टी प्रयोग गर्नुहोस्। टाइमस्ट्याम्पको सट्टा, हप्ताको दिन प्रयोग गर्नुहोस्।

पहुँच अडिट गर्नुहोस्। यदि तपाईंको टिमले डाटासेट साझा गर्छ भने, कसले र कहिले पहुँच गर्‍यो लग गर्नुहोस्। सानो फोल्डर अनुमति जाँच केही नभन्दा राम्रो हो।

मेटाउने योजना राख्नुहोस्। परियोजना सुरु गर्नुअघि निर्णय गर्नुहोस्: यो सकेपछि, डाटाको के हुन्छ? पूर्वनिर्धारित “राख्ने कागजात गरिएको कारण नभए मेटाउने” हुनुपर्छ।

डाटासेट संयोजन गर्न सावधान हुनुहोस्। अलग्गै कम-जोखिम भएका दुई डाटासेट सँगै पहिचान गर्ने हुन सक्छन्। “विद्यालयद्वारा विद्यार्थी” को सूची ठीक छ। “विद्यालय र जन्म मितिद्वारा विद्यार्थी” को सूची धेरै बढी पहिचान गर्ने हो — र दुई संयोजनले पहिचान पुन: सिर्जना गर्छ।

कहिले अस्वीकार गर्ने

कहिलेकाहीं असहज सिद्धान्त: हरेक परियोजना बनाउनु पर्दैन। केही परियोजना, वैध भए पनि, खराब विचार हुन्। विद्यालयमा कुन बच्चा छाड्ने सम्भावना छ पूर्वानुमान गर्ने मोडेल र पूर्वानुमान शिक्षकहरूसँग साझा गर्ने ले मद्दत गर्न सक्छ; उही मोडेलले रोजगारदातासँग साझा गर्दा हानि गर्छ। निजी सुरक्षित सुविधाका लागि अनुहार पहिचान प्रणाली उपयुक्त हुन सक्छ; सार्वजनिक चोकमा उही प्रणाली केही फरक हो।

उपयोगी परीक्षण: यदि डाटाका मानिसहरूले तिनको डाटा कसरी प्रयोग भइरहेको छ देख्न सक्थे भने, के तिनी खुसी हुन्थे? यदि उत्तर “होइन” हो, वा “तिनले बुझ्ने थिएनन्” हो, वा “तिनी रिसाउने थिए” हो भने, परियोजनालाई पुन: विचार गर्नुहोस्।

निर्माताको सबैभन्दा महत्त्वपूर्ण व्यावसायिक सीप, अन्त्यमा, “म त्यो बनाउँदिनँ” भन्ने क्षमता हो। यो दुर्लभ छ। अभ्यास गर्न योग्य छ।

आफ्नो बुझाइ जाँच्नुहोस्

Quick check

एक टिमलाई पूरा नाम, नागरिकता नम्बर, फोन नम्बर, ठेगाना, ऋण रकम, पेसा, र डिफल्ट फ्ल्याग भएको माइक्रोफाइनान्स आवेदनको CSV दिइएको छ। लक्ष्य डिफल्ट पूर्वानुमान मोडेल बनाउने हो। निम्न मध्ये सबैभन्दा उपयुक्त पहिलो चाल कुन हो?

Quick check

विद्यालय NGO ले तपाईंको टिमलाई विद्यार्थी रेकर्ड प्रयोग गरेर छाड्ने पूर्वानुमान मोडेल बनाउन भन्छ जसमा नाम, उमेर, परिवार आय, जात, र परीक्षा अङ्क छन्। टिमले जातलाई फिचरका रूपमा प्रयोग गर्न योजना गर्छ किनभने यसले छाड्नेसँग सहसम्बन्ध देखाउँछ। जातलाई फिचरका रूपमा प्रयोग *नगर्ने* सबैभन्दा बलियो तर्क के हो?

अब के आउँछ

यो पाठ्यक्रमको अन्तिम खण्ड त्यो कुराबारे हो जुन सुख्खा सुनिन्छ र वास्तवमा तपाईंको करियरको सबैभन्दा उच्च-लिभरेज अभ्यासमध्ये एक हो: तपाईंले कहिल्यै नदेखेको कसैले — भविष्यको सहकर्मी, नियामक, अडिटर, अनुसन्धानकर्ता — बुझ्न, विश्वास गर्न, र तपाईंको सबै काम पुन: सिर्जना नगरीकन प्रयोग गर्न सकोस् भनेर डाटासेट कागजात गर्ने। यो अधिकांश निर्माताले स्किप गर्ने भाग हो। यो राम्रोसँग गर्ने थोरैले आफ्नो भारभन्दा धेरै बढी प्रहार गर्छन्।