अध्याय ५ · खण्ड I · 16 मिनेट
न्यूरल नेटवर्कको आधार
न्यूरन एक कार्य हो। नेटवर्क धेरै कार्य एकसाथ जोडिएका हुन्। बाँकी सबै — चाटजीपीटी, छवि जनरेटर, आधुनिक OCR — माथिको विवरण मात्र हो।
एकल कृत्रिम न्यूरन एउटा गणितीय कार्य मात्र हो। यसले केही इनपुट लिन्छ, प्रत्येकलाई भारले गुणन गर्छ, जोड्छ, र परिणामलाई सानो दायरामा खुम्च्याउँछ। त्यति नै हो। न्यूरल नेटवर्क यस्ता न्यूरनको ठूलो सङ्ग्रह हो, तहहरूमा संगठित। प्रसिद्ध सबै कुरा — चाटजीपीटी, छवि जनरेटर, तपाईंको फोनको OCR — यिनै दुई टुक्रा र धेरै अंकगणितबाट बनेका छन्।
यो खण्डमा हामी सुरुदेखि एक न्यूरन बनाउने छौं, खल्ती ठगी विशेषतालाई इनपुट प्रयोग गरेर। एक पटक न्यूरन स्पष्ट रूपमा देख्नुभयो भने बाँकी डीप लर्निङ यसैको ठूलो रूप हो।
न्यूरन भनेको कार्य हो
मान्नुहोस् हामी खल्ती कारोबारको ठगी हुने सम्भावना तीन विशेषताका आधारमा अनुमान गर्न सानो मोडेल चाहन्छौं:
रकम— रूपैयाँमा कारोबारको आकार।दिनको_समय— ० (राति ३ बजे) देखि १ (दिउँसो ३ बजे) मा एन्कोड गरिएको।नयाँ_यन्त्र— १, यदि यो यन्त्र यस प्रयोगकर्ताका लागि पहिले देखिएको थिएन भने; ०, देखिएको थियो भने।
एकल न्यूरनले ० र १ बीचको स्कोर निकाल्छ — स्कोर बढ्दै जाँदा न्यूरनले “ठगी” भनेको हुन्छ।
न्यूरनले यो गर्छ:
स्कोर = खुम्च्याउने(w₁ × रकम + w₂ × दिनको_समय + w₃ × नयाँ_यन्त्र + b)
त्यो नै पूरै गणना हो। प्रत्येक इनपुटलाई भार (w₁, w₂, w₃) ले गुणन गरिन्छ। नतिजा जोडिन्छन्, स्थिर पूर्वाग्रह b थपिन्छ। अन्त्यमा, योगलाई एक्टिभेसन कार्य — “खुम्च्याउने” — बाट पठाइन्छ, जसले कुनै पनि वास्तविक अंकलाई ० र १ बीचको मानमा बदल्छ।
यस्तो आउटपुटका लागि सामान्य खुम्च्याउने सिग्मोइड हो: ठूला धनात्मक १ नजिक हुन्छन्; ठूला ऋणात्मक ० नजिक हुन्छन्; शून्य ०.५ हुन्छ। एक्टिभेसन कार्यले न्यूरनलाई गैर-रैखिक व्यवहार गर्न दिन्छ। यो बिना न्यूरनको नेटवर्क रैखिक रिग्रेसनभन्दा शक्तिशाली हुँदैन।
भारको अर्थ के?
लाखौं ऐतिहासिक कारोबारमा तालिमपछि, न्यूरनले उपयोगी ढाँचा समात्ने भारमा बस्छ। मान्नुहोस् हाम्रो ठगी न्यूरनका लागि:
w₁ = 0.0001(कारोबारको प्रति रूपैयाँ)w₂ = −1.2(समयको प्रति एकाइ — दिउँसो स्कोर घटाउँछ)w₃ = 2.0(नयाँ यन्त्र दृढ ठगी सङ्केत)b = −0.5(“ठगी होइन” तर्फ सानो झुकाव)
अब कारोबार आउँछ: रू. ५०,०००, राति ४ बजे (दिनको_समय = ०.१), नयाँ यन्त्रबाट।
कच्चा = 0.0001 × 50,000 + (−1.2) × 0.1 + 2.0 × 1 + (−0.5) कच्चा = 5 − 0.12 + 2 − 0.5 = 6.38
यो ठूलो धनात्मक अंक हो। सिग्मोइडबाट खुम्चाएपछि (जसले ठूला धनात्मकलाई १ नजिक मिल्छ), न्यूरनले ०.९९८ स्कोर फर्काउँछ। न्यूरनले उच्च विश्वासका साथ यसलाई ठगी भनिरहेको छ।
उही कारोबार परिचित यन्त्र (नयाँ_यन्त्र = 0) बाट दिउँसो ३ बजे (दिनको_समय = 1) आएको भए, कच्चा मान:
कच्चा = 5 + (−1.2) − 0 + (−0.5) = 3.3
अझै धनात्मक (ठूलो कारोबार हो), तर सानो। सिग्मोइडपछि, स्कोर ०.९६ जति। अझै शंकास्पद, तर कम।
एकल न्यूरनले — भार छनोटद्वारा — धेरै विशेषतालाई एकल सम्भाव्यता-जस्तो स्कोरमा संयोजन गर्न सिकेको छ। यो न्यूरनको पूरै काम हो।
एक न्यूरन किन पुग्दैन
माथिको ठगी न्यूरनले रैखिक-त्यसपछि-खुम्च्याउने गरिरहेको छ। “रैखिक” भाग रैखिक रिग्रेसनजस्तै हो। “खुम्च्याइएको” भागले अन्तमा एक गैर-रैखिकता थप्छ।
यो सरल वर्गीकरणका लागि राम्रो छ, तर यसको कडा सीमा छ। एकल न्यूरनले रैखिक रूपमा छुट्टिने ढाँचा मात्र सिक्न सक्छ — विशेषता-स्पेसमा एउटै सीधा रेखा कोरेर एकातिर ठगी र अर्कातिर ठगी-होइन राख्न सकिने ढाँचा।
धेरै वास्तविक ढाँचा रैखिक छुट्टिँदैनन्। राति ३ बजे परिचित यन्त्रबाट धेरै सानो रकमको ठगी दिउँसो नयाँ यन्त्रबाट ठूलो रकमको ठगीभन्दा फरक ढाँचा हो। एकल न्यूरनले एकैचोटि दुई फरक ढाँचा प्रतिनिधित्व गर्न सक्दैन।
समाधान — तहहरूमा धेरै न्यूरन प्रयोग गर्ने। एउटा तहको आउटपुट अर्कोको इनपुट बन्छ। प्रत्येक तहले अघिल्लो तहबाट अलि अग्लो स्तरको ढाँचा निकाल्न सक्छ। पर्याप्त तहसहित, नेटवर्कले हामीसँग डाटा भएको लगभग कुनै पनि कार्य प्रतिनिधित्व गर्न सक्छ।
यो न्यूरल नेटवर्क को मूल विचार हो — र तह सङ्ख्या ठूलो हुँदा डीप लर्निङको।
सानो नेटवर्क
मान्नुहोस् एक न्यूरनको साटो हामी लुकेको तह मा तीन न्यूरन प्रयोग गर्छौं, प्रत्येकले उही तीन इनपुट विशेषता हेर्छन् तर फरक भारसहित। प्रत्येक न्यूरनले फरक “किसिमको” ठगी पत्ता लगाउन सिकेको छ:
- न्यूरन १: रकम ठूलो हुँदा उच्च स्कोर।
- न्यूरन २: नयाँ यन्त्र + अनौठो समय हुँदा उच्च स्कोर।
- न्यूरन ३: रकम सानो तर छोटो समयमा धेरै कारोबार हुँदा उच्च स्कोर।
तिनीहरूका तीन आउटपुट अन्तिम न्यूरनको इनपुट बन्छन् जसले — सिकिएको भारसहित — तिनलाई संयोजन गरेर अन्तिम ठगी सम्भाव्यता निकाल्छ।
“तालिम” चारै न्यूरनका सबै भार एकसाथ खोज्नु मात्र हो, ताकि नेटवर्कको अन्तिम आउटपुट लेबल लगाइएको तालिम डाटासँग मिलोस्। भारको सङ्ख्या छिटो बढ्छ, तर एल्गोरिथम रैखिक रिग्रेसनकै हो: तालिम डाटामा त्रुटि परिभाषित गर्नुहोस्, त्यो घटाउने भार खोज्नुहोस्।
“तालिम” ले वास्तवमा के गर्छ
रैखिक रिग्रेसन अध्यायमा हामीले ग्रेडियन्ट डिसेन्ट उल्लेख गरेका थियौं — त्रुटि घटाउने दिशामा भारलाई एकपटक थोरै परिवर्तन गर्ने। यो उही एल्गोरिथमले तपाईंले सुनेका हरेक न्यूरल नेटवर्क तालिम दिन्छ। एउटा भिन्नता — नेटवर्कमा, त्रुटिलाई तहहरूमा पछाडि पठाइनुपर्छ ताकि प्रत्येक भारको योगदान पत्ता लगाउन सकियोस्। त्यो पछाडिको प्रवाहलाई ब्याकप्रोप्यागेसन भनिन्छ — अर्को खण्डको विषय।
अर्को खण्डअघि तपाईंले दिमागमा राख्नुपर्ने कुरा — न्यूरनको आधारभूत आकार र नेटवर्कको आधारभूत आकार। ठूला सबै कुरा — चाटजीपीटीका १७५ अर्ब प्यारामिटर, जेमिनाईको छवि उत्पादन, तपाईंको फोनको OCR — उही आकारका हुन्, धेरै बढी न्यूरन र धेरै बढी अंकगणितसहित मात्र।
नेपालका लागि यो किन महत्त्वपूर्ण छ
आश्चर्यजनक सङ्ख्याका व्यावहारिक नेपाली एआई समस्याहरू धेरै सानो न्यूरल नेटवर्क — केही सय न्यूरनसहित, ल्यापटपमा मिनेटमा तालिम — ले हल हुन्छन्। देवनागरी अक्षर वर्गीकरण, ग्राहक फिडब्याकमा भावना, क्रेडिट आवेदनको डिफल्ट सम्भावना। एआई “विशाल मोडेल” को प्रश्न हो भन्ने मिथक धेरैजसो गलत हो। सही मोडेल काम पूरा गर्ने सबैभन्दा सानो हो।
प्रचार, अवश्य, अर्को तरिकाले छ। प्रेसलाई अर्ब-प्यारामिटर मोडेलका कथा चाहिन्छ। काम गर्ने नेपाली एआई पसलहरूमा वास्तविकता प्राय: साना डाटासेटमा साना नेटवर्क हो, साना उपयोगी कुरा एकदम राम्रोसँग गर्ने। न्यूरनको आधारभूत आकार थाहा पाउनु पछिल्लो सही पढ्न र पहिलोको अति-बिक्री देख्नका लागि पर्याप्त छ।
आफ्नो बुझाइ जाँच्नुहोस्
छोटो जाँच
—न्यूरल नेटवर्कको एकल कृत्रिम न्यूरनले के गर्छ?
अब के?
हामीसँग न्यूरन र सानो नेटवर्क छ। अर्को खण्ड नेटवर्कले आफ्ना भार कसरी खोज्छ — ब्याकप्रोप्यागेसन एल्गोरिथम — र आधुनिक एआई पछाडिको वास्तुकलामा आधारभूत नेटवर्कलाई बदल्ने तहका प्रकारबारे हो।