अध्याय १ · खण्ड I · 20 मिनेट
LLM API ले के दिन्छ (र के दिँदैन)
कुनै कोडअघि, LLM API बोलाउँदा तपाईं वास्तवमै केका लागि तिरिरहनुभएको छ बुझ्नुहोस् — मोडेलले के गर्न सक्छ र सक्दैन, कस्तो latency र लागत अपेक्षा गर्ने, र कस्ता सीमाहरू वरिपरि योजना बनाउने।
Course 01 ले सबैभन्दा सानो सम्भाव्य LLM कल परिचय गरायो। यो पाठ्यक्रम गहिरो जान्छ। हामी फेरि कोडमा नछुनुअघि, Claude, GPT, वा Gemini बोलाउँदा तपाईंले वास्तवमै के पाउनुहुन्छ भन्ने इमानदार तस्बिर — API ले वास्तवमै के गरिरहेको छ, मोडेलले के गर्न सक्छ र सक्दैन, र तपाईंले निर्माण गर्ने हरेक अनुप्रयोगलाई आकार दिने बाधाहरू। यो खण्ड स्किप गर्नुहोस् र तपाईं आफ्ना धारणाहरूको विरुद्धमा डिजाइन गर्नुहुनेछ; पढ्नुहोस् र तपाईं वास्तविकताको विरुद्धमा डिजाइन गर्नुहुनेछ।
तपाईंले वास्तवमै के पाउनुहुन्छ
आधुनिक LLM API त्यो सेवा हो जसले पाठको टुक्रा (प्रम्प्ट) लिन्छ र पाठको टुक्रा (प्रतिक्रिया) फिर्ता दिन्छ। त्यो सरल सम्झौताको पछाडि सयौँ अर्ब पारामिटर भएको भाषा मोडेल कसैको GPU मा चलिरहेको हुन्छ। मोडेललाई सार्वजनिक इन्टरनेटबाट trillions टोकनको पाठमा तालिम दिइएको छ, र प्रदायकले सहयोगी, इमानदार, र उचित रूपमा सुरक्षित हुन fine-tune गरेको छ।
तपाईंले पठाउनुहुन्छ: HTTPS मार्फत तपाईंको प्रम्प्ट, केही सेटिङ (temperature, max tokens), र तपाईंको API की भएको अनुरोध।
तपाईंले प्राप्त गर्नुहुन्छ: उत्पादित पाठ, केही metadata (कति टोकन खपत भयो, मोडेल स्वाभाविक रूपमा रोकियो कि सीमामा पुग्यो), र — महत्त्वपूर्ण — बिल भएको प्रतिक्रिया।
2026 मा तीन ठूला प्रदायकहरू:
- Anthropic — Claude परिवार (Haiku, Sonnet, Opus)। ध्यानले तर्क र सफा structured output का लागि परिचित।
- OpenAI — GPT परिवार (GPT-4o, GPT-4.1, GPT-5)। सबैभन्दा फराकिलो इकोसिस्टम, सबैभन्दा धेरै तेस्रो-पक्ष औजार।
- Google — Gemini परिवार (Flash, Pro)। बलियो multimodal समर्थन, Google Cloud सँग कडा एकीकरण।
यो पाठ्यक्रमको बाँकीमा हामी उदाहरणमा Anthropic को Claude प्रयोग गर्छौँ, किनकि API सफा छ र मोडेल बहुभाषी काममा (नेपाली सहित) बलिया छन्। सबै कुरा अन्य प्रदायकहरूमा सानो नामकरण फेराइका साथ सर्छ।
मोडेलले वास्तवमै के गर्न सक्छ
आधुनिक LLM ले राम्रोसँग गर्ने कुराहरूको छोटो, इमानदार सूची:
- अनुवाद मुख्य भाषाहरूबीच सक्षम रूपमा, नेपाली ↔ अंग्रेजी उच्च गुणस्तरमा सहित।
- सारांश लामो पाठलाई छोटो पाठमा, तपाईंले तोकेको जुनसुकै लम्बाइमा।
- पुनःलेखन पाठलाई फरक शैली, टोन, वा दर्जमा।
- निकालन असंरचित पाठबाट संरचित जानकारी (ठेगानाबाट नाम, रसिदबाट रकम)।
- वर्गीकरण पाठलाई श्रेणीहरूको विरुद्ध (spam/ham, sentiment, विषय)।
- उत्तर प्रश्नहरूको जब उत्तर सामान्य ज्ञान वा तपाईंले प्रदान गरेको पाठमा हुन्छ।
- तर्क मध्यम बहु-चरणीय समस्याहरूमार्फत (गणित शब्द समस्या, नीति निर्णय)।
- सिर्जना सिर्जनात्मक पाठ — कथा, नेपाली कविता, मार्केटिङ कपी।
- कोड लेखन अधिकांश मुख्यधाराका प्रोग्रामिङ भाषाहरूमा।
- निर्देशन पालन ध्यानले, विशेष गरी जब तिनी विशिष्ट हुन्छन्।
यदि कुनै काम यी परिवारहरू मध्ये एउटामा फिट हुन्छ भने, LLM सामान्यतया सही औजार हो।
मोडेलले भरपर्दो रूपमा के गर्न सक्दैन
LLM ले राम्रोसँग नगर्ने कुराहरूको सूची छोटो र बढी महत्त्वपूर्ण छ:
- सटीक रूपमा गणना। तिनले अंकगणित अनुमान गर्न सक्छन् तर जटिल गणनामा अचम्मलाग्दा गल्तीहरू गर्छन्। वास्तविक क्याल्कुलेटर वा कोडमा पुग्नुहोस्।
- इन्टरनेट वा तपाईंका फाइलहरूमा पहुँच। पूर्वनिर्धारित रूपमा, मोडेलले तपाईंले प्रम्प्टमा राखेको मात्र देख्छ। यसले ब्राउज गर्न सक्दैन, तपाईंको डाटाबेस हेर्न सक्दैन, आजको मौसम जाँच्न सक्दैन। ती क्षमताहरू थप्ने (RAG, tool use) अध्याय 5 र 6 को बारेमा हो।
- पहिलेको कुराकानी सम्झन। तपाईंले इतिहास पुन: नपठाएसम्म हरेक API कल फ्रेस सुरु हुन्छ। अध्याय 3 ले memory ओगट्छ।
- हालैका तथ्यहरू जान्न। तालिम डाटाको cutoff हुन्छ — सामान्यतया केही महिनादेखि एक वर्षसम्म पुरानो। गत हप्ताको समाचारबारे सोध्नुहोस् र मोडेलले बनाउनेछ वा अस्वीकार गर्नेछ।
- 100% पटक भरपर्दो रूपमा नियम पालन। ध्यानले प्रम्प्ट गरे पनि, मोडेलहरूले कहिलेकाहीँ निर्देशनहरू बेवास्ता गर्छन्। बलिया प्रणालीहरू बनाउन यो हुन्छ भन्ने मानेर सम्हाल्नुपर्छ।
- तिनीहरूलाई थाहा भएको र अनुमान गरेको बीच आत्मविश्वासपूर्वक भेद। LLM हरूले hallucinate गर्छन् — आत्मविश्वासी-सुनिने पाठ उत्पादन गर्छन् जुन तथ्यगत रूपमा गलत छ। यो केन्द्रीय विफलता मोड हो जुन तपाईंले वरिपरि डिजाइन गर्नुपर्छ।
लागत र latency, इमानदारीसँग
हरेक वास्तविक अनुप्रयोगलाई आकार दिने दुई बाधा:
लागत। LLM प्रदायकहरूले टोकनद्वारा (प्रत्येक लगभग शब्दको ¾) मूल्य लगाउँछन्। Input टोकन र output टोकनको फरक मूल्य हुन्छ। 2025 को अन्त्यसम्म, Claude Haiku करिब $0.25 प्रति million input टोकन र $1.25 प्रति million output टोकन छ; Sonnet करिब $3 / $15; Opus करिब $15 / $75 छ। मूल्य तल जान्छन् तर सापेक्षिक ढाँचा टिक्छ — साना, सस्ता मोडेल अधिकांश कामका लागि उत्कृष्ट छन्, र तपाईंले महँगो मोडेल केवल गुणस्तर लागतभन्दा बढी महत्त्वपूर्ण भएको बेला मात्र प्रयोग गर्नुहुन्छ।
Haiku सँगको सामान्य छोटो कुराकानी कल (केही सय टोकन भित्र, केही सय बाहिर) को लागत सेन्टको सानो अंश हो। Sonnet सँगको ठूलो RAG कल (retrieved सन्दर्भको बीस हजार टोकन भित्र, पाँच सय बाहिर) को लागत करिब $0.07 हो। Haiku सँग प्रति महिना दस लाख साना कलको लागत केही सय डलरको क्रममा हुन्छ। तदनुसार बजेट गर्नुहोस्।
Latency। आधुनिक LLM API हरूले छोटो प्रम्प्टका लागि सामान्यतया 1-5 सेकेन्डमा प्रतिक्रिया दिन्छन्, लामोका लागि लामो। अन्तरक्रियात्मक UI का लागि, यो “typing…” सूचकसँग पर्याप्त छिटो छ। वास्तविक-समय प्रणाली (trading, फोन कल) का लागि यो धेरै ढिलो छ — साना local मोडेल वा साँघुरा प्रविधि प्रयोग गर्नुहोस्।
नेपाली आयाम
विशेष गरी नेपाली अनुप्रयोगहरूका लागि:
- नेपाली बुझ्ने: Claude Sonnet र माथिका उत्कृष्ट छन्। Claude Haiku सरल कामका लागि उचित छ तर कहिलेकाहीँ idiomatic नेपाली गलत पढ्छ। GPT-4o र Gemini Pro तुलनीय छन्।
- नेपाली उत्पादन: सबै शीर्ष मोडेलले धाराप्रवाह देवनागरी नेपाली उत्पादन गर्छन्। कहिलेकाहीँ तिनीहरू प्रतिक्रियाको बीचमा अंग्रेजीमा सर्छन्, जुन तपाईंले सामान्यतया कडा प्रम्प्टले सुधार्न सक्नुहुन्छ।
- रोमानीकृत नेपाली (“Nepglish”): मोडेलले उचित रूपमा सम्हाल्छन् तर कहिलेकाहीँ ध्वन्यात्मक भिन्नताबीच अल्मल हुन्छन्। प्रम्प्टमा स्पष्ट disambiguation ले मद्दत गर्छ।
- नेपाल-विशिष्ट तथ्यहरू: कभरेज असमान छ। क्रिकेट, राजनीति, र NEPSE ठीक छन्; जिल्ला-स्तरीय विवरण असमान छन्। सटीक स्थानीय उत्तरका लागि RAG प्रायः आवश्यक हुन्छ।
- लागत: नेपाली पाठले यसको अंग्रेजी समकक्षभन्दा करिब दोब्बर टोकन प्रयोग गर्छ, किनभने देवनागरी अक्षरहरू कम कुशलतापूर्वक tokenise हुन्छन्। तदनुसार बजेट योजना बनाउनुहोस्।
यो वास्तविक हो, सैद्धान्तिक होइन — यसले तपाईंले नेपालका लागि निर्माण गर्ने हरेक अनुप्रयोगलाई असर गर्नेछ।
यो पाठ्यक्रमले के ओगट्छ
Course 04 को बाँकी LLM सँग निर्माण गर्ने व्यवहारिक कला हो:
- अध्याय 1 — आधारभूत: पहिलो कल, temperature, लागत।
- अध्याय 2 — उत्पादनसँग सम्पर्कमा टिक्ने प्रम्प्ट लेख्ने; structured output; त्रुटि सम्हाल्ने।
- अध्याय 3 — memory: बहु-टर्न कुराकानी काम गराउने; नेपाली चाटबट बनाउने।
- अध्याय 4 — embeddings: पाठलाई भेक्टरमा बदल्ने, अर्थले खोज्ने।
- अध्याय 5 — RAG: मोडेललाई तपाईंका आफ्ना कागजातमा आधार दिने।
- अध्याय 6 — काम गर्ने सहायक: डिजाइन, औजार, मूल्याङ्कन।
अन्त्यसम्म तपाईंले वास्तविक नेपाली AI सहायक निर्माण गरिसक्नुहुनेछ, इमानदारीसँग मूल्याङ्कन गर्नुहुनेछ, र यसको दायरा, सुरक्षा, र सीमाबारे जानीजानी निर्णयहरू गरिसक्नुभएको हुनेछ। Course 01 ले तपाईंलाई hello-world LLM कल दियो। Course 04 ले तपाईंलाई शिप गर्न सकिने उत्पादन दिन्छ।
आफ्नो बुझाइ जाँच्नुहोस्
Quick check
—एक टिम सदस्यले काठमाडौं-केन्द्रित चाटबट प्रस्ताव गर्छ जसले 'आजको NEPSE बन्द कति छ?' अन्य कुनै औजारबिना सिधै LLM बोलाएर उत्तर दिन्छ। यो डिजाइनको मौलिक समस्या के हो?
Quick check
—नेपाली रसिद-सारांशकर्ता बनाइरहेको एक साथीले हरेक कलका लागि Claude Opus प्रयोग गर्न चाहन्छ किनकि 'यो सबैभन्दा बलियो मोडेल हो।' व्यवहारिक प्रतिक्रिया के हो?
अब के आउँछ
LLM API के हो र होइन तपाईंलाई थाहा छ। अर्को खण्ड पहिलो वास्तविक कल हो — Course 01 अध्याय 5 खण्ड 2 कै आकार, तर हरेक argument ले के गर्छ, टोकन कसरी गनिन्छन्, र तपाईंलाई केका लागि शुल्क लगाइँदैछ भन्नेको ध्यानले हिँडाइ। खण्ड 2 को अन्त्यसम्म तपाईं कुनै पनि API कल निरीक्षण गर्न र यसको लागत के हुनेछ भन्ने पूर्वानुमान गर्न सक्षम हुनुहुनेछ।