ailiteracynepal 🇳🇵
पाठ आकार

अध्याय ५ · खण्ड III · 16 मिनेट

उन्नत न्यूरल नेटवर्क प्रविधि

छविका लागि कन्भोलुसन, भाषाका लागि ट्रान्सफर्मर — तपाईंले सुनेका लगभग हरेक प्रणाली पछाडिका दुई वास्तुकलात्मक विचार।

विगत पन्ध्र वर्षका दुई वास्तुकलात्मक विचार — तपाईंले अन्तरक्रिया गरेका लगभग हरेक प्रसिद्ध एआई प्रणालीका लागि जिम्मेवार छन्। कन्भोलुसन ले छवि पहिचान काम लाग्ने बनायो, र त्यसमार्फत तपाईंको फोनको देवनागरी OCR। ट्रान्सफर्मर ले भाषा काम लाग्ने बनायो, र त्यसमार्फत चाटजीपीटी, क्लड, जेमिनाई, गुगल ट्रान्सलेट, र लगभग हरेक आधुनिक चाटबट पछाडिको इन्जिन।

मूल अनुसन्धान पत्र पढ्नु पर्दैन। प्रत्येकका लागि एक-अनुच्छेद अन्तर्ज्ञान र प्रत्येक कुन समयमा सही उपकरण हो थाहा पाउनुपर्छ। यो खण्डले त्यही दिन्छ।

एक विचारमा कन्भोलुसन

छवि पढ्ने नायभ पूर्ण-जडित न्यूरल नेटवर्कले अनौठो काम गर्छ: यसले प्रत्येक पिक्सेललाई अरू हरेकबाट स्वतन्त्र ठान्छ। न्यूरनलाई पिक्सेल (५, ७) पिक्सेल (५, ८) को छेउमा छ भन्ने थाहै हुँदैन। बढी समझदार वास्तुकलाले स्थानिक संरचना प्रयोग गर्छ।

त्यही कन्भोलुसनल न्यूरल नेटवर्क (CNN) ले गर्ने हो। प्रत्येक न्यूरनले पूरै छवि हेर्नुको साटो, CNN ले छविमा सानो फिल्टर घुमाउँछ। फिल्टर भारको सानो टुक्रा हो — मानौं ३×३ — जसले आफूले समेटेको प्रत्येक स्थानका लागि एक अंक निकाल्छ। हरेक स्थानमा फिल्टर लागू गरेपछि, तपाईंसँग विशेषता-प्रतिक्रियाको नयाँ “छवि” हुन्छ।

फिल्टरले के पत्ता लगाउँछ? तालिमपछि यसका भारले जे पत्ता लगाउन सिकेका छन्। तालिमपछि:

  • केही फिल्टर किनारा-पहिचानकर्ता बन्छन् (ठाडो रेखा भएको ठाउँमा उच्च प्रतिक्रिया; अरूतिर कम)।
  • केही कुना-पहिचानकर्ता बन्छन्।
  • केही विशेष बनावटका पहिचानकर्ता।

CNN को अर्को तहले पहिलोको आउटपुटमा थप फिल्टर लागू गर्छ। तिनले किनाराको संयोजन — वक्र, जोडनी — देख्छन्। त्यसपछिको तहले तिनको संयोजन देख्छ — साना आकार। अन्तिम तहसम्म पुग्दा नेटवर्कले वस्तुका भाग — क अक्षरको टाउको, ध को फन्दा, ज्ञ को स्ट्रोक — मा प्रतिक्रिया दिइरहेको हुन्छ।

यही कारण CNN छविमा राम्रो छ: वास्तुकला आफै ले प्रायर ज्ञान एन्कोड गर्छ कि छविमा स्थानिक संरचना छ र उही दृश्य ढाँचा कुनै पनि स्थानमा देखिन सक्छ।

CNN ले नेपालमा के चलाउँछ

  • देवनागरी OCR। तपाईंको फोनको अक्षर वर्गीकरणकर्ता CNN हो। यसले दशौं हजार लेबल लगाइएका देवनागरी अक्षर छविबाट प्रत्येक अक्षर हस्तलेखन शैली, फन्ट, र प्रकाशमा कस्तो देखिन्छ सिक्यो।
  • बाली रोग पहिचान। धानको पातको फोटो — कृषि डाटामा तालिम पाएको सानो CNN ले — स्वस्थ, ब्लास्ट-संक्रमित, ब्याक्टेरियल ब्लाइट, आदिमा वर्गीकरण गर्न सक्छ। फोनमा चल्ने सानो।
  • लाइसेन्स प्लेट पढाइ। देवनागरी-र-अंकको लिपिसहितको नेपाली ट्राफिक प्लेट हरेक आधुनिक पार्किङ प्रणालीको पछाडिको CNN ले पढ्छ।

यिनैमध्ये कुनै पनि ठूलो मोडेल हुनुपर्दैन। केही लाख प्यारामिटरसहितको CNN, ल्यापटप GPU मा घण्टामा तालिम, पर्याप्त छ।

एक विचारमा ट्रान्सफर्मर

भाषा क्रमिक छ। वाक्य शब्दहरूको क्रम हो; प्रत्येक शब्दको अर्थ वरिपरिका अरूमा निर्भर हुन्छ। २०१७ अघि, भाषाका न्यूरल नेटवर्कले शब्दहरू एक पटकमा एक प्रशोधन गर्थे, अवस्था जम्मा गर्दै — आवर्ती न्यूरल नेटवर्क (RNN) नामक मोडेल वर्ग। तिनले काम गर्थे, तर तालिम दिन ढिलो थिए र लामो-दूरीका निर्भरतासँग समस्या थियो (वाक्यको सुरुको शब्दले अन्त्यको शब्दमा प्रभाव पार्ने)।

२०१७ मा गुगल अनुसन्धाताहरूले परिचय गराएको ट्रान्सफर्मर ले क्रमिक प्रशोधनलाई एटेन्सन (attention) ले बदल्यो। मूल विचार: कुनै एक शब्द प्रशोधन गर्दा, नेटवर्कलाई इनपुटका हरेक अरू शब्दलाई एटेन्ड — हेर्न — एकैचोटि अनुमति छ, प्रत्येक कति सान्दर्भिक छ भनेर तौलिने। गणितमा यो धेरै भारित योग हो, CNN ले कन्भोलुसन तह बनाएजसरी थुप्रिएको।

यो प्राविधिक सुनिन्छ, तर व्यावहारिक नतिजा विशाल छ। ट्रान्सफर्मरहरू समानान्तरमा तालिम दिन सकिन्छ (एक शब्दको प्रशोधनले अघिल्लोको पर्खनुपर्दैन)। तिनले लामो-दूरीका निर्भरता सजिलै सञ्चालन गर्छन्। र — सबैभन्दा महत्त्वपूर्ण — तिनी स्केल हुन्छन्। पर्याप्त डाटा हुँदा ट्रान्सफर्मरको आकार दोब्बर पार्दा भरोसायोग्य रूपमा राम्रो मोडेल आउँछ। CNN स्केल हुन्छन्; ट्रान्सफर्मर अझ राम्रो स्केल हुन्छन्।

२०२६ का हरेक प्रसिद्ध भाषा मोडेल ट्रान्सफर्मर हुन्: चाटजीपीटी, क्लड, जेमिनाई, गुगल ट्रान्सलेटको नेपाली मोडेलको अन्तर्निहित इन्जिन, देवनागरी वाक्-देखि-पाठ, नेपाली पाठ-देखि-वाक्। वास्तुकला आकारमा उस्तै हो; फरक स्केल, तालिम डाटा, र तालिमपछिको परिष्करणमा।

ट्रान्सफर्मरले के गर्छन्, के गर्दैनन्

ट्रान्सफर्मरहरू यिनमा असाधारण छन्:

  • क्रम-देखि-क्रम कार्य: अनुवाद, सारांश, कोड उत्पादन।
  • भाषा मोडेलिङ: सन्दर्भ दिँदा अर्को शब्द अनुमान।
  • उत्तर इनपुटमा बसेको प्रश्नको उत्तर।

तिनी यिनमा जादूगर होइनन्:

  • सत्य। ट्रान्सफर्मरले उचित देखिने पाठ अनुमान गर्छ। त्यो पाठ साँचो हो कि होइन तालिम डाटा र तालिमपछिको कार्य हो, वास्तुकलाको होइन।
  • लामो शृङ्खलामा सटीक तर्क। ट्रान्सफर्मरले तर्क ढाँचाको नक्कल गर्छन्, तर शृङ्खला लामो हुँदा विश्वासका साथ गलत उत्तर दिन्छन्।
  • आफूलाई के थाहा छैन थाहा पाउने। ट्रान्सफर्मरसँग क्यालिब्रेट गरिएको अनिश्चितता छैन। तिनले कहिल्यै नदेखेको नेवारी इतिहासबारेको प्रश्नलाई कण्ठ गरेजति विश्वासका साथ उत्तर दिनेछन्।

यसैले ट्रान्सफर्मर प्रयोग गर्ने हरेक तैनाथ प्रणालीसँग रक्षाहरू पनि छन्: रिट्रिभल (मोडेलको स्मृतिको साटो डाटाबेसमा उत्तर खोज्ने), विश्वास थ्रेसहोल्ड, मानव-भित्र-लूपको समीक्षा। वास्तुकला शक्तिशाली छ; यो पूर्ण एआई प्रणाली होइन।

आधुनिक नेपाली एआई प्रणालीको द्रुत संरचना

ठोस बनाउन: पोखराको अस्पतालले तैनाथ गरेको नेपाली-भाषा चाटबट कल्पना गर्नुहोस्, जसले बिरामीका अपोइन्टमेन्ट र औषधि सम्बन्धी प्रश्नको उत्तर दिन्छ।

  • स्वर इनपुट। सानो CNN-र-RNN संयोजनले बोलिएको नेपालीलाई पाठमा बदल्छ। नेपाली अडियो डाटामा तालिम।
  • भाषा बुझाइ। ट्रान्सफर्मर (बजेट अनुसार सानो वा ठूलो) ले बिरामीको पाठ प्रश्न पढ्छ र उनीहरूले के चाहन्छन् भन्ने संरचनात्मक प्रतिनिधित्व निकाल्छ।
  • रिट्रिभल। प्रणालीले अस्पतालको वास्तविक डाटाबेसमा उत्तर खोज्छ — ट्रान्सफर्मरको भारमा होइन।
  • भाषा उत्पादन। ट्रान्सफर्मरले प्राप्त उत्तरलाई शिष्ट नेपाली वाक्यमा बदल्छ।
  • स्वर आउटपुट। छुट्टै मोडेलले वाक्यलाई बोलिएको नेपालीमा फर्काउँछ।

पूरै प्रणाली पाँच साना मोडेलहरूको सहकार्य हो। कुनै पनि GPT-वर्गको होइन। प्रत्येकलाई आफै तालिम, अडिट, र अद्यावधिक गर्न सकिन्छ। वास्तविक, काम गर्ने एआई यस्तो देखिन्छ — एउटा विशाल मस्तिष्क होइन, विशेष भागहरूको सानो समूह।

आफ्नो बुझाइ जाँच्नुहोस्

छोटो जाँच

२०२६ मा चाटजीपीटी, क्लड, र गुगल ट्रान्सलेटको नेपाली मोडेलजस्ता भाषा मोडेलका लागि प्रमुख वास्तुकला कुन हो?

अब के?

हामी न्यूरल नेटवर्क अध्याय यहीँ बन्द गर्छौं। हामी एकल न्यूरनबाट हरेक प्रसिद्ध एआई प्रणाली पछाडिको वास्तुकलासम्म यात्रा गर्‍यौं। अन्तिम अध्याय — प्रभावहरू — इन्जिनियरिङबाट पछाडि हट्छ र नेपालका लागि महत्त्वपूर्ण प्रश्नहरू सोध्छ: कसले फाइदा पाउँछ, कसलाई हानि हुन्छ, कसले निर्णय गर्छ, र यी उपकरणहरू राम्रोसँग प्रयोग गर्न खोज्ने देशले एआई साक्षरताबाट के अपेक्षा गर्ने।