अध्याय ३ · खण्ड III · 16 मिनेट
नायभ बेज वर्गीकरण
एउटै सेताम्मे बोर्डमा अट्ने वास्तविक उपयोगी एआई प्रविधि — जसले दुई दशकसम्म स्पाम फिल्टर चलायो।
नायभ बेज सबैभन्दा सरल व्यावहारिक एआई वर्गीकरणकर्ता हो। यसले स्पष्ट गलत मान्यतामा बेजको नियम लागू गर्छ: प्रत्येक प्रमाण अरूबाट स्वतन्त्र छ। आश्चर्य के भने यो नायभ मान्यताले स्पाम फिल्टर गर्न, कागजात वर्गीकरण गर्न, सपोर्ट टिकट छुट्याउन, र ट्विटको भाषा ट्याग गर्न पर्याप्त राम्रोसँग काम गर्छ।
यो उत्तम पहिलो मोडेल पनि हो। बीस लाइनको पाइथनमा लागू गर्न सकिन्छ। नियामकलाई बुझाउन सकिन्छ। नोटबुकमा अडिट गर्न सकिन्छ। २०२६ का धेरैजसो “एआई” तैनाथीहरू ठूलो भाषा मोडेलभन्दा नायभ बेजबाट राम्रोसँग सेवित हुन्थे — तर तिनलाई प्रेस विज्ञप्ति पाइँदैनथ्यो।
उदाहरण: एसएमएस स्पाम वर्गीकरण
एक सानो नेपाली टेलिकमलाई स्पाम एसएमएस सन्देशहरू फ्ल्याग गर्न चाहिएको छ। उनीहरूसँग ऐतिहासिक सन्देशहरूको डाटासेट छ, प्रत्येक “स्पाम” वा “ह्याम” (स्पाम होइन) भनेर लेबल लगाइएको। नयाँ सन्देश आउँदा प्रणालीले त्यो स्पाम हुने सम्भाव्यता निकाल्नुपर्छ।
बेजको नियम कथन यो हो:
P(स्पाम | सन्देश) समानुपातिक छ P(सन्देश | स्पाम) × P(स्पाम) को।
प्रायर P(स्पाम) सजिलो छ: ऐतिहासिक सन्देशको स्पाम अंश गन्नुहोस्। मान्नुहोस् सबै सन्देशको २०% स्पाम छ, त्यसैले P(स्पाम) = 0.2 र P(ह्याम) = 0.8।
लिकलिहुड P(सन्देश | स्पाम) गाह्रो भाग हो। सन्देश शब्दहरूको क्रम हो। सम्भावित सन्देशको खगोलीय संख्या छ। प्रत्येकलाई पर्याप्त पटक देखेर सम्भाव्यता अनुमान गर्न सक्दैनौं।
यहीँ “नायभ” प्रवेश गर्छ।
नायभ मान्यता
नायभ बेजले मान्छ — वर्ग दिँदा सन्देशका हरेक शब्द अरू हरेक शब्दबाट स्वतन्त्र हुन्छन्। स्पाम सन्देशमा “विजेता” शब्द देखिँदा “चिट्ठा” पनि देखिन्छ कि देखिँदैन भन्ने तपाईंलाई थाहै हुँदैन। ती स्वतन्त्र छन्।
यो स्पष्ट रूपमा, अपमानजनक तरिकाले, गलत छ। वास्तविक सन्देशमा व्याकरण हुन्छ; शब्दहरू एकअर्कामा निर्भर हुन्छन्। “विजेता” र “चिट्ठा” स्पाममा सम्भावनाले भन्दा धेरै सँगै देखिन्छन्।
तर मान्यता यति सजिलो छ कि हामी प्रयोग गर्छौं। स्वतन्त्रतासँग, लिकलिहुड एक-शब्द सम्भाव्यताको गुणनमा फैल्छ:
P(सन्देश | स्पाम) ≈ P(शब्द₁ | स्पाम) × P(शब्द₂ | स्पाम) × … × P(शब्दₙ | स्पाम)
र ती एक-शब्द सम्भाव्यता तालिम सेटका स्पाम सन्देशमा शब्द गनेर सजिलै अनुमान गर्न सकिन्छ।
उदाहरण
मान्नुहोस् हाम्रो तालिम सेटले यो बताउँछ:
- स्पाम सन्देशका २५% शब्द “विजेता” हुन्। (P(विजेता | स्पाम) = 0.25।)
- ह्याम सन्देशका १% शब्द “विजेता” हुन्। (P(विजेता | ह्याम) = 0.01।)
- ३०% स्पाम सन्देशमा “चिट्ठा” हुन्छ। (P(चिट्ठा | स्पाम) = 0.30।)
- ०.५% ह्याम सन्देशमा “चिट्ठा” हुन्छ। (P(चिट्ठा | ह्याम) = 0.005।)
नयाँ सन्देश आउँछ: “तपाईं विजेता हुनुहुन्छ। आफ्नो चिट्ठा पुरस्कार दाबी गर्नुहोस्।”
हामीलाई चाहिएको छ P(स्पाम | सन्देश) र P(ह्याम | सन्देश)। नायभ स्वतन्त्रताअन्तर्गत:
- P(सन्देश | स्पाम) ∝ 0.25 × 0.30 × (अरू शब्द) = 0.075 × (अरू शब्द)।
- P(सन्देश | ह्याम) ∝ 0.01 × 0.005 × (अरू शब्द) = 0.00005 × (अरू शब्द)।
प्रायरले गुणन (P(स्पाम) = 0.2, P(ह्याम) = 0.8):
- स्पामको स्कोर: 0.075 × 0.2 = 0.015।
- ह्यामको स्कोर: 0.00005 × 0.8 = 0.00004।
स्पाम झन्डै ३७५ गुणा फरकले जित्छ। वर्गीकरणकर्ताले विश्वासका साथ यसलाई स्पाम भन्छ, र सही हो। अरू शब्दहरू — “तपाईं”, “हुनुहुन्छ”, “आफ्नो”, “दाबी”, “पुरस्कार” — ले अंकहरू समायोजन गर्छन्, तर विजेता र चिट्ठा शब्दले पहिले नै फैसला सुनाइसकेका छन्।
त्यति नै हो पूरै एल्गोरिथम। प्रत्येक वर्गमा शब्द आवृत्ति गन्नुहोस्। नायभ स्वतन्त्रतासहित बेजको नियम लागू गर्नुहोस्। उच्चतम स्कोरको वर्ग छान्नुहोस्।
व्यवहारमा किन काम लाग्छ
नायभ बेजका तीन गुण छन् जसले यसलाई आश्चर्यजनक रूपमा उपयोगी बनाउँछन्।
छिटो। तालिम भनेको गन्ती हो। निष्कर्ष भनेको गुणन हो। दुवै डाटाको आकारसँग रैखिक छन्। १० लाख एसएमएसमा नायभ बेज फिल्टर ल्यापटपमा सेकेन्डमा तालिम पाउँछ।
पारदर्शी। हरेक शब्दको योगदान जाँच्न सकिन्छ। वर्गीकरणकर्ताले सन्देश फ्ल्याग गर्यो भने कुन शब्दले स्पामतर्फ धकेलियो र कति, सोध्न सकिन्छ। डीप न्यूरल नेटवर्कसँग यो असम्भव छ।
टिकाउ। तालिम सेट सानो वा फोहोर भए पनि नायभ बेजले उचित प्रदर्शन गर्छ। उपयोगी हुन यसलाई लाखौं उदाहरण चाहिँदैन।
देवनागरी एसएमएसमा स्पाम फिल्टरिङ सुरु गर्ने नेपाली टेलिकमका लागि यो अत्यन्तै महत्त्वपूर्ण छ। उनीहरूसँग केही लाख लेबल सन्देश छन्, केही अर्ब होइन। नियामकका लागि प्रणाली अडिट गर्नुपर्छ। स्प्यामरले रणनीति बदल्दा मिनेटमा फेरि तालिम दिनुपर्छ, हप्तामा होइन। नायभ बेज सही उपकरण हो, ट्रान्सफर्मर होइन।
नायभ बेज कहाँ चुक्छ
तीन असफलता मोड बुझ्न जरुरी छ।
-
दृढ निर्भर विशेषता। “ज्वरो” र “उच्च तापक्रम” प्रायः उही विशेषता हुने स्वास्थ्य रेकर्ड वर्गीकरण गर्नुपर्ने मोडेलमा नायभ स्वतन्त्रताले दोहोरो गन्ती गर्छ। संयुक्त उपस्थितिलाई अति-भार दिन्छ।
-
नदेखेका शब्द। तालिममा कहिल्यै नआएको परीक्षण शब्दको नायभ अनुमानमा शून्य सम्भाव्यता हुन्छ। शून्यले सम्पूर्ण गुणन मार्छ। समाधान हो स्मुदिङ: प्रत्येक शब्दमा सानो छद्म-गन्ती थप्नुहोस्, ताकि कुनै पनि शब्दको सम्भाव्यता ठ्याक्कै शून्य नहोस्।
-
सूक्ष्म वर्ग। नायभ बेजले व्यङ्ग्य, भावना, वा धेरै शब्दहरूको सन्दर्भ बुझ्न आवश्यक कुनै कुरा सिक्दैन। ती कामका लागि धनी मोडेल चाहिन्छ — तर तिनलाई पनि नायभ बेजविरुद्ध मापन गर्नुपर्छ, किनकि यो यति सजिलो तैनाथ हुन्छ कि बेन्चमार्क अग्लो हुन्छ।
ठूलो तस्बिर
नायभ बेजमा पूरै खण्ड किन खर्च गर्यौं? — पुरानो मायाले होइन। यो भयो — नायभ बेज एउटा पूर्ण एआई प्रणाली हो जुन तपाईंको दिमागमा अट्न सक्छ। डाटाबाट तैनाथीसम्म हरेक चरण एक पन्नामा अट्छ। यो बुझेपछि तपाईंले हामी भेट्ने प्रत्येक वर्गीकरणकर्ताको आकार बुझ्नुहुन्छ, र प्रभावशाली देखिने अरू मोडेलहरूलाई तुलना गर्ने आधार पाउनुहुन्छ।
एआई खरिदमा सामान्य गल्ती हो — नवीनतम, सबैभन्दा ठूलो मोडेल सही ठान्नु। सही मोडेल त्यो हो जुन काम पूरा गर्ने सबैभन्दा सानो हो। धेरै वास्तविक नेपाली प्रयोग केसमा — स्पाम फिल्टरिङ, भाषा पहिचान, हेल्पडेस्क रुटिङ, ग्राहक फीडब्याकमा भावना — नायभ बेज सबैभन्दा सानो हो।
आफ्नो बुझाइ जाँच्नुहोस्
छोटो जाँच
—नायभ बेजलाई 'नायभ' किन भनिन्छ?
छोटो जाँच
—नेपाली टेलिकम टोलीसँग २,००,००० लेबल लगाइएका एसएमएस सन्देश छन् र अडिट गर्न सकिने, छिटो पुनर्तालिम दिन सकिने, नियामकलाई बुझाउन सकिने स्पाम फिल्टर चाहिएको छ। पहिलो छनोट सबैभन्दा बचाव गर्न मिल्ने कुन हो?
अब के?
हामी सम्भाव्यता अध्याय यहीँ बन्द गर्छौं। अध्याय ४ ले हामीले सिकेका सबै कुरालाई बेग्लै नामअन्तर्गत पुन: फ्रेम गर्छ: मेसिन लर्निङ। तपाईंले देख्नुहुनेछ कि नायभ बेज डाटाबाट सिक्ने धेरै तरिकामध्ये एक हो, र विधिको छनोट तपाईंसँग कस्तो डाटा छ र कस्तो प्रश्न सोध्दै हुनुहुन्छ भन्नेमा निर्भर हुन्छ।