अध्याय ६ · खण्ड III · 24 मिनेट
इमानदारीसँग नतिजा प्रस्तुत गर्ने
कुनै पनि ML परियोजनाको स्किप गर्न सजिलो र सबैभन्दा उच्च-लिभरेज भाग। सङ्ख्या, चार्ट, सीमाबद्धता, र तपाईं के अर्को build गर्नुहुन्थ्यो — पाँच मिनेटमा कसैले पढ्न सक्ने गरी राखिएको। अनुशासन जसले तपाईंको काम तपाईंको ल्यापटपभन्दा बाहिर महत्त्व राख्न सक्छ।
तपाईंसँग तालिम प्राप्त, ट्युन गरिएको, प्रमाणित मोडेल छ। तपाईंको ल्यापटप बाहिर कसैलाई अझै यसबारे थाहा छैन। अन्तिम र सबैभन्दा कम मूल्यवान् ML सीप भनेको मोडेल यसरी प्रस्तुत गर्ने हो कि stakeholder, नियामक, सहकर्मी — जुनसुकैले तपाईंले के बनाउनुभयो बुझ्न, तिनले विश्वास गर्नुपर्छ कि गर्नुपर्दैन न्याय गर्न, र मोडेलका पूर्वानुमानमा उपयुक्त रूपमा कार्य गर्न सक्छन्। यो खण्ड इमानदार, उपयोगी ML रिपोर्टको अनुशासन हो। ध्यानले लेखिएको आधा पृष्ठले अर्को हप्ता ट्युन गरेभन्दा बढी फरक पार्छ।
नतिजाले चाहिने पाँच कुरा
कार्यरत रिपोर्टमा पाँच तत्त्व हुन्छन्, क्रममा। कुनै पनि एउटा स्किप गर्नुहोस् र रिपोर्ट या त अप्रेरणादायक वा भ्रामक हुन्छ।
- फ्रेमिङ recap। यो कसका लागि हो? यो कुन निर्णयलाई सूचित गर्छ?
- हेडलाइन मेट्रिक र यसको आधार। एउटा भरपर्दो सङ्ख्या।
- प्रति-समूह विवरण। मोडेल कहाँ राम्रोसँग काम गर्छ? कहाँ गर्दैन?
- सीमाबद्धता। मोडेललाई के थाहा छैन? कहिले प्रयोग गर्नुहुन्न?
- अर्को कदम। अर्को हप्ता, अर्को महिना भए तपाईं के गर्नुहुन्थ्यो?
त्यो पूरै रिपोर्ट हो। यो एक पृष्ठमा फिट हुन्छ। बाँकी समर्थन विवरण हो।
कार्यगत रिपोर्ट — NEPSE दिशा पूर्वानुमानकर्ता
इमानदार, उपयोगी एक-पृष्ठ कस्तो देखिन्छ:
# NEPSE Direction Predictor — Model Report v1.0
Author: Your Name
Date: 2026-06-29
## Framing
This model is built for a small retail investor who wants a directional
hint on whether tomorrow's NEPSE will be up or down. It is not a buy
signal. It is one input among many. The framing document is in
`docs/framing.md`.
## Results
- 5-fold time-series CV F1: 0.62 (± 0.03)
- Test set F1 (held out, last 250 days): 0.49
- Baseline (always predict up): F1 = 0.61
- Sample size: 1,243 trading days, of which 250 in test.
The gap between CV and test F1 reflects market-regime shift in 2026
(see "Limitations"). The model marginally beats baseline on the CV
period but underperforms on the test set — likely the dominant signal
is regime change rather than model weakness.
## Per-period performance
20-day rolling F1 on the test set:
- Q1 2026: 0.58 (markets steady)
- Q2 2026: 0.41 (high volatility, policy news)
The model is most reliable in steady markets and least reliable during
high-volatility news-driven days — exactly the days where directional
prediction matters most. This is the central caveat for any user.
## Limitations
1. The model has seen 5 years of data. The training period does not
include comparable events to those in Q2 2026. Predictions during
regime shifts should not be trusted.
2. The model uses only price-based features (returns, volatility,
moving averages). It has no information about news flow, policy
announcements, or macroeconomic indicators — all of which drive
short-term direction.
3. The model is *directional* — it does not predict magnitude. A
"predicted up" day can still see a 0.1% gain or a 4% gain.
4. The model will deteriorate as the market evolves. It should be
retrained at least monthly, ideally weekly.
## Next steps
If we had another week:
- Add news-sentiment features from public Nepali financial news.
- Add a meta-model that predicts when the base model should be trusted
(calibration / confidence model).
- Build a small daily-update pipeline that retrains and publishes the
prediction at 6 AM with the prior day's close baked in.
If we had another month:
- Replace point predictions with calibrated probabilities and
explicit uncertainty bands.
- A/B test the directional hint UX with real users to measure whether
it helps decisions.
त्यो पूरै document हो। Stakeholders यसलाई पढ्छन्। तिनले यसमा निर्णय गर्छन्। यो के काम गर्छ र के गर्दैन बारे इमानदार छ।
विश्वास कमाउने चार्ट
तीन चार्टले हरेक रिपोर्टमा आफ्नो लगत तिर्छन्।
चार्ट 1 — actual vs predicted (रिग्रेसन) वा confusion matrix (वर्गीकरण)
रिग्रेसनका लागि: वास्तविक y लाई पूर्वानुमानित y विरुद्ध स्क्याटर प्लट, y=x सन्दर्भ रेखासहित। पाठकलाई मोडेल कहाँ पूर्वाग्रही छ देख्न दिन्छ।
वर्गीकरणका लागि: कक्षा नामसहित लेबल गरिएको 2×2 (वा N×N) confusion matrix को heatmap। पाठकलाई मोडेलले कुन गल्ती गरिरहेको छ देख्न दिन्छ।
चार्ट 2 — समयसँगै / प्रति समूह प्रदर्शन
समय-शृङ्खला मोडेलका लागि: 20-दिन windowसँग परीक्षण सेटभर rolling F1 (वा MAE)। पाठकलाई प्रदर्शन कहिले लगातार छ र कहिले होइन देख्न दिन्छ।
समूहीकृत समस्याका लागि: नमुना आकार annotations सँग प्रति-समूह F1 (वा MAE) को bar chart। पाठकलाई कुन समूहलाई राम्रोसँग सेवा गरिएको छ र कुनलाई गरिएको छैन देख्न दिन्छ।
चार्ट 3 — Calibration (सम्भाव्य वर्गीकरणकर्ताका लागि)
सम्भावना उत्पादन गर्ने कुनै पनि वर्गीकरणकर्ताका लागि: विश्वसनीयता आरेख देखाउँदै पूर्वानुमानित सम्भावना वास्तविक आवृत्तिसँग कति राम्रोसँग मेल खान्छ। “up को 70% सम्भावना” भन्ने मोडेल ती दिनहरूमा 70% सही हुनुपर्छ। यदि वास्तविक 55% छ भने, मोडेल overconfident छ — जुन प्रयोगकर्ताले सम्भावनामा आधारित निर्णय लिँदा महत्त्वपूर्ण छ।
from sklearn.calibration import calibration_curve
import matplotlib.pyplot as plt
probs = model.predict_proba(X_test)[:, 1]
prob_true, prob_pred = calibration_curve(y_test, probs, n_bins=10)
plt.plot(prob_pred, prob_true, marker="o")
plt.plot([0, 1], [0, 1], "k--", alpha=0.5)
plt.xlabel("Predicted probability")
plt.ylabel("Actual probability")
plt.title("Calibration")
plt.show()
Calibration प्लट पढ्नु overconfident वा underconfident मोडेल पत्ता लगाउने एकल सबैभन्दा छिटो तरिका हो। यो हरेक सम्भाव्य रिपोर्टमा पर्छ।
गैर-प्राविधिक पाठकका लागि लेख्ने
ML रिपोर्टिङमा सबैभन्दा गाह्रो सीप F1 के हो थाहा नभएका पाठकका लागि लेख्ने हो। छोटो अनुवाद मार्गदर्शक:
- “F1 of 0.62” → “मोडेलले माथि पूर्वानुमान गर्ने दिनहरूमध्ये, 60% वास्तवमा माथि जान्छन्, र मोडेलले वास्तवमै माथि जाने दिनहरूको लगभग 65% समात्छ।”
- “MAE of 4,200 NPR” → “सामान्य पूर्वानुमान त्रुटि लगभग रु 4,200 छ — पूर्वानुमान सामान्यतया वास्तविक भाडाबाट रु 4,000 भित्र हुन्छन्।”
- “AUC of 0.78” → “यदि हामीले सूचक माथि गएको अनियमित दिन र सूचक तल गएको अनियमित दिन छान्यौं भने, मोडेलले लगभग 78% पटक माथि जाने दिनमा उच्च सम्भावना असाइन गर्थ्यो।”
शङ्कामा हुँदा, सादा-भाषा संस्करण प्रयोग गर्नुहोस्। प्राविधिक पाठकका लागि कोष्ठकमा प्राविधिक नाम थप्नुहोस्।
इमानदार रिपोर्टले तपाईंको करियरका लागि के गर्छ
तीन वास्तविक फाइदा — कुनै पनि कामको भित्रबाट देखिँदैन:
-
Stakeholders ले तपाईंलाई विश्वास गर्छन्। जब तपाईं सीमाबद्धतासँग सुरु गर्नुहुन्छ, श्रोता आराम गर्छ — तिनलाई थाहा हुन्छ तपाईं खराब समाचार लुकाउनुहुन्न। पहिलो गाह्रो परियोजना जहाँ यो तपाईंलाई विश्वास कमाउनेछ त्यसले वर्षौंसम्म प्रतिफल दिनेछ।
-
तपाईं आफ्ना गल्ती समात्नुहुन्छ। “मोडेल उच्च-volatility अवधिमा बिग्रन्छ” लेख्नाले तपाईंलाई यो जाँच्न बाध्य पार्छ। प्रायः तपाईं प्रक्रियामा अझ खराब विफलता मोड पत्ता लगाउनुहुन्छ।
-
रिपोर्ट तपाईंको पोर्टफोलियो बन्छ। फ्रेमिङ, नतिजा, सीमाबद्धता, र चार्टसहितको सफा एक-पेज नियुक्ति व्यवस्थापकका लागि 50-लाइन प्रभावशाली-शुद्धता स्निपेटभन्दा बढी compelling हुन्छ। यसले न्याय देखाउँछ।
Course 03 बन्द गर्दै
यो Course 03 को अन्त्य हो। तपाईंले पाठ्यक्रम अरूले तालिम दिएका मोडेल बोलाउन सक्ने व्यक्तिका रूपमा सुरु गर्नुभयो। तपाईं यस्तो व्यक्तिका रूपमा छाड्दै हुनुहुन्छ जसले:
- scikit-learn सँग आफ्नै वर्गीकरणकर्ता र रिग्रेसर तालिम दिन्छन्।
- Precision, recall, confusion matrices, र cross-validation सँग इमानदारीसाथ मूल्याङ्कन गर्छन्।
- Overfitting पहिचान गरेर सुधार्छन्।
- परीक्षण डाटा लीक नगरी हाइपरपारामिटर ट्युन गर्छन्।
- नाम र निर्णयसहित वास्तविक समस्याहरूलाई प्रयोगकर्ताका लागि फ्रेम गर्छन्।
- केवल प्रशंसा होइन, विश्वास कमाउने नतिजा रिपोर्ट गर्छन्।
यी छ सीप, संयोजनमा, कनिष्ठ-देखि-मध्यम ML अभ्यासकर्ताको कार्यरत योग्यता हो। संसारको अधिकांशसँग यी छैनन्। तपाईंसँग छन्।
Course 04 सुरु हुन्छ — भाषा मोडेलसँग निर्माण
Classical ML tabular डाटामा इन्जिनियर गरिएका फिचरसँग सुन्दर रूपमा काम गर्छ। यो भाषा, कुराकानी, सारांश, वा खुला-अन्त्य उत्पादन सम्हाल्ने आधुनिक तरिका होइन। त्यसका लागि, तपाईंलाई ठूला भाषा मोडेल चाहिन्छ — र त्यो Course 04, भाषा मोडेलसँग निर्माण, को बारेमा हो।
तपाईंले आधुनिक निर्माताको बाटो सिक्नुहुनेछ: कोडमा प्रम्प्ट गर्ने, संरचित आउटपुट पाउने, टर्नमा मोडेललाई memory दिने, embeddings सँग semantic search, retrieval-augmented generation, र सानो, वास्तविक-संसारको नेपाली प्रयोग-केसका लागि AI सहायकको ध्यानले निर्माण। आकार परिचित हुनेछ — ल्याउने, तयार पार्ने, बोलाउने, प्रयोग गर्ने — तर मोडेल अब ChatGPT-कक्षा हो, उपकरण-पेटी अब anthropic वा openai हो, र तपाईंले build गर्न सक्ने कुराको दायरा विशाल रूपमा विस्तार हुन्छ।
Course 02 र Course 03 ले build गरेको आधार — सफा डाटा, इमानदार मूल्याङ्कन, ध्यानले फ्रेमिङ — LLM-आधारित परियोजनामा classical ML मा जस्तै लागू हुन्छ। Course 04 ले तपाईंलाई पहिले नै थाहा भएको सबै leverage गर्छ।
तयार हुँदा, पृष्ठ पल्टाउनुहोस्।