ailiteracynepal 🇳🇵
पाठ आकार

अध्याय २ · खण्ड I · 20 मिनेट

हरेक call को वास्तविक लागत

हरेक LLM call को एक वास्तविक मूल्य छ, र त्यो मूल्य model द्वारा, prompt आकार द्वारा, र output लम्बाइ द्वारा फरक हुन्छ। प्रति call वास्तविक economics बुझ्नु हरेक टिकाउ AI उत्पादको जग हो — र किन परियोजनाहरू चुपचाप बर्बाद हुँदैनन्।

पहिलो पटक मोडेल call निःशुल्क लाग्दछ। तपाईंले prompt टाइप गर्नुहुन्छ, जवाफ पाउनुहुन्छ, र कसैले तपाईंलाई बिल दिँदैन। बिल अवस्थित छ — तपाईंले भर्खरै देख्नुभएको छैन। जब तपाईंको service ले real traffic सम्हाल्दछ, प्रति call त्यो अदृश्य cost एक टिकाउ उत्पाद र मासिक आश्चर्य बीचको फरक बन्दछ। यो खण्ड कसरी cost वास्तवमै compute गरिन्छ, तपाईंले खर्च गर्नुअघि यसलाई कसरी अनुमान गर्ने, र तपाईंको traffic बढ्दै जाँदा यसलाई कसरी ईमानदार राख्ने भन्ने हो।

Pricing model

LLM providers ले tokens मा मूल्य निर्धारण गर्दछन्, queries मा होइन। एक token लगभग 4 characters English वा 2-3 characters Devanagari Nepali हो — तर तपाईंले कहिल्यै अनुमान गर्नुहुँदैन। Provider ले सटीक रूपमा गन्दछ।

हरेक call को दुई components छन्:

  • Input tokens — तपाईंले पठाउने सबै कुरा: system prompt, conversation history, retrieved documents, प्रयोगकर्ताको प्रश्न।
  • Output tokens — मोडेलले फर्काउने कुरा।

प्रत्येकको लागि फरक दरहरू, र model द्वारा फरक दरहरू। 2026 को अन्तसम्मको दरहरू:

ModelInput (per 1M tokens)Output (per 1M tokens)
Claude Opus 4.7$15.00$75.00
Claude Sonnet 4.6$3.00$15.00
Claude Haiku 4.5$0.25$1.25
GPT-4.1$2.50$10.00
GPT-4.1 mini$0.15$0.60
OpenAI text-embedding-3-small$0.02

Output input भन्दा 4-5× बढी महँगो छ। लामो जवाफहरूको cost लाग्दछ। Verbose system prompts को cost लाग्दछ। दोहोर्याइएको conversation history को cost लाग्दछ।

एक ठोस गणना

RAG प्रयोग गर्ने नेपाली नीति Q&A बोट लिनुहोस्:

  • System prompt: 400 tokens।

  • Retrieved documents (3 chunks × ~500 tokens): 1,500 tokens।

  • Conversation history (अन्तिम 2 exchanges): 400 tokens।

  • प्रयोगकर्ताको प्रश्न: 50 tokens।

  • कुल input: 2,350 tokens।

  • जवाफ: ~200 tokens output।

Claude Sonnet 4.6 प्रयोग गर्दै:

Input:  2,350 × $3  / 1,000,000  = $0.00705
Output: 200   × $15 / 1,000,000  = $0.00300
Per call:                          $0.01005  (≈ Rs 1.30)

हरेक call ≈ Rs 1.30। एकल मा दृश्यमान छैन। Scale मा धेरै दृश्यमान:

  • 100 प्रयोगकर्ता × 10 calls/day × 30 days = 30,000 calls/month = Rs 39,000/month
  • 1,000 प्रयोगकर्ता × 10 calls/day × 30 days = 300,000 calls/month = Rs 390,000/month

त्यो हाइपोथेटिकल होइन। त्यो त्यस्तै traffic स्तरमा वास्तविक महिना-अन्त invoice हो, जबसम्म तपाईंले cost नियन्त्रण गर्नुभएन।

Cost कहाँ लुक्दछ

तीन सामान्य ठाउँहरू जहाँ परियोजनाहरूले अनजानमा आवश्यकभन्दा बढी खर्च गर्दछन्:

1. अत्यन्त लामो system prompts।

एक 2,000-token system prompt हरेक request मा charge हुन्छ। यदि तपाईंले quality नबिगारेर यसलाई 400 tokens मा घटाउनुभयो भने, तपाईंले system-prompt cost को 80% बचत गर्नुहुन्छ — जुन प्राय: कुल cost को 30-40% हुन्छ। System prompts छाँट्नु LLM उत्पादमा सबैभन्दा उच्च-ROI गतिविधिहरू मध्ये एक हो।

2. बढ्दो conversation history।

हरेक नयाँ turn ले messages array मा append गर्दछ। Chat को turn 10 मा 5,000 tokens history हुन सक्दछ — र त्यो history मोडेललाई पठाइन्छ हरेक turn। Course 04 Chapter 3 (sliding window, summarisation) बाट techniques ले सिधै यसलाई नियन्त्रण गर्दछन्।

3. अनावश्यक रूपमा verbose outputs।

यदि तपाईंको उत्पादलाई निबन्धहरू आवश्यक छैन भने, 3-sentence जवाफहरू माग्नुहोस्। API call मा max_tokens=200 एक hard ceiling हो — मोडेलले यसलाई पार गर्न सक्दैन। यसलाई सेट गर्नुहोस्। एक default max_tokens=4000 जब तपाईंलाई सधैँ 200 मात्र चाहिन्छ, एक slow leak हो।

Cost lever को रूपमा Model choice

एकल सबैभन्दा ठूलो cost lever भनेको तपाईंले कुन मोडेल call गर्नुहुन्छ। एक Q&A bot को लागि:

ModelCost per call (2,350 in + 200 out)
Claude Opus 4.7$0.050
Claude Sonnet 4.6$0.010
Claude Haiku 4.5$0.001
GPT-4.1 mini$0.0005

दस गुणा cost differences। र धेरै कार्यहरूको लागि, Haiku 4.5 लगभग Sonnet 4.6 सँग indistinguishable छ — तपाईं प्राय: जवाफहरू फरक बताउन सक्नुहुन्न। “म सबैभन्दा स्मार्ट मोडेल चाहन्छु” भन्ने default assumption महँगो छ र विरलै आवश्यक हुन्छ।

सही प्रश्न हो: मेरो कार्यको लागि स्वीकार्य जवाफहरू उत्पादन गर्ने सबैभन्दा सानो, सस्तो मोडेल कुन हो? यसलाई सामान्य leaderboard मा होइन, आफ्नो वास्तविक queries मा benchmark गर्नुहोस्। Course 05 Chapter 4 ले ठीक यो evaluation discipline कभर गर्दछ।

खर्च गर्नुअघि अनुमान गर्ने

हरेक गम्भीर परियोजनाले एउटा spreadsheet राख्नुपर्दछ — शाब्दिक रूपमा, कोड लेख्नुभन्दा अघि — अपेक्षित traffic स्तरहरूमा मासिक cost project गर्ने। Rows: input_tokens, output_tokens, model, price/M_input, price/M_output, calls_per_month, cost। Columns: निराशावादी, अपेक्षित, आशावादी traffic।

नमूना:

Assumptions:
- 1,000 daily active users
- 8 queries per user per day
- System prompt: 400 tokens
- Retrieved context: 1,500 tokens
- History: 400 tokens
- Query: 50 tokens
- Output: 200 tokens
- Model: Sonnet 4.6

Per call:
- Input: 2,350 tokens × $3/M = $0.00705
- Output: 200 tokens × $15/M = $0.00300
- Total: $0.01005

Per month:
- Calls: 1,000 × 8 × 30 = 240,000
- Cost: 240,000 × $0.01005 = $2,412 (≈ Rs 312,000)

If we switch to Haiku 4.5:
- Cost: 240,000 × $0.00095 = $228 (≈ Rs 30,000)
- Savings: 90%

त्यो spreadsheet, बनाउन एक घण्टा, “मलाई मोटो अर्थ छ” र “मलाई ठ्याक्कै थाहा छ अर्को महिनाको invoice के हुनेछ” बीचको फरक हो।

Nepal-विशिष्ट cost note

Devanagari पाठको rougher tokenization दर छ अंग्रेजी भन्दा — मोटामोटी 2-3 characters प्रति token vs. 4 characters प्रति token अंग्रेजीको लागि। एक 500-word नेपाली अनुच्छेद प्राय: 700-800 tokens हो; उही अनुच्छेद अंग्रेजीमा 500-600 tokens हो।

व्यवहारिक रूपमा: नेपाली workloads अंग्रेजी equivalent भन्दा प्रति character 20-30% धेरै cost लाग्दछन्। ठूलो factor होइन, तर real। यसलाई आफ्नो spreadsheet मा समावेश गर्नुहोस्।

प्रति call मात्र होइन, प्रति प्रयोगकर्ता cost

उत्पाद निर्णयहरूको लागि वास्तवमै महत्त्वपूर्ण metric हो प्रति प्रयोगकर्ता प्रति महिना cost (CPM)। यदि तपाईंको मासिक cost Rs 300,000 छ र तपाईंसँग 3,000 प्रयोगकर्ताहरू छन् भने, त्यो प्रति प्रयोगकर्ता प्रति महिना Rs 100 हो। यसलाई हरेक प्रयोगकर्ता तपाईंलाई (revenue, अप्रत्यक्ष value, strategic value) कति value छ त्यसमा तुलना गर्नुहोस्।

एक free tier जुन Rs 100/user/month cost लाग्दछ र 100,000 निःशुल्क प्रयोगकर्ताहरूलाई सर्भ गर्दछ त्यो Rs 10 million/महिना हो। त्यो free tier होइन — त्यो runway drain हो। CPM लाई अघि नै बुझ्नुले तपाईंलाई तपाईंको economics फिट गर्न उत्पाद (कुन मोडेल, कुन caching, कुन limits) design गर्न दिन्छ, विपरीत होइन।

आफ्नो बुझाइ जाँच्नुहोस्

Quick check

एक टिमले 3,000-token system prompt लेख्दछ किनकि 'बढी context ले मोडेललाई राम्रोसँग व्यवहार गर्न लगाउँछ।' तिनीहरूले के तिरिरहेका छन्, र तिनीहरूले के गर्नुपर्दछ?

Quick check

तपाईं एक policy Q&A bot को लागि Claude Opus 4.7 र Claude Haiku 4.5 बीच छनोट गर्दै हुनुहुन्छ। Opus 4.7 प्रति call लगभग 50× बढी cost लाग्दछ। सही निर्णय प्रक्रिया के हो?

अब के आउँछ

तपाईंलाई थाहा छ हरेक call को cost के हो। अर्को: कसरी सुनिश्चित गर्ने कि एउटा प्रयोगकर्ता, एउटा bug, वा एउटा viral क्षणले तपाईंले तिर्न सक्ने भन्दा बढी खर्च गर्न सक्दैन। Budgets, caps, र quotas — hard limits जुन केही गलत हुँदा तपाईंको service alive राख्दछन्।