पाठ 25 / 25
Revision: Cheat Sheet और Self-Check
पूरे कोर्स के safeguards, metrics और cost लीवर की दोहराई करें।
Cheat sheet
विफलता प्रकार: hallucination, हानिकारक सामग्री, privacy leak, पक्षपात, दुरुपयोग, अति-निर्भरता। Safeguards: model के चारों ओर परतें; thresholds के साथ moderation; PII छिपाएँ; उत्तर ground करें और "मुझे नहीं पता" की अनुमति दें; under- और over-refusal मापें। दुरुपयोग: injection के विरुद्ध संरचनात्मक बचाव; tokens के आधार पर rate limits। ज़िम्मेदारी: slice metrics, data minimisation, system card, उच्च-जोखिम में इंसानी निगरानी। Evaluation: यथार्थपूर्ण held-out set; precision, recall, F1; confidence intervals; kappa से judges जाँचें; z-test के साथ A/B; CI में regression। Monitoring: versioned traces, percentiles, alerts। Cost: tokens × क़ीमत; route; cache; trim; budgets और अलग keys।
इंटरव्यू में पूछे जाने वाले सवाल
इन्हें समझाने को तैयार रहें: Q&A bot में hallucination कैसे घटाएँगे, moderation filter में precision-recall trade-off, accuracy भ्रमित क्यों कर सकती है, LLM judge को कैसे जाँचेंगे, कैसे जानेंगे कि version B सचमुच बेहतर है, और गुणवत्ता घटाए बिना LLM बिल कम करने के तीन तरीक़े।
त्वरित जाँच: हानिकारक-सामग्री filter 99% सटीक है क्योंकि सिर्फ़ 1% संदेश हानिकारक हैं और वह कुछ भी चिह्नित नहीं करता। समस्या क्या है?
- वह बहुत तेज़ है
- उसका precision बहुत ऊँचा है
- दुर्लभ हानिकारक वर्ग के लिए उसका recall शून्य है
- कुछ ग़लत नहीं
Answer
दुर्लभ हानिकारक वर्ग के लिए उसका recall शून्य है — Accuracy दुर्लभ वर्ग की विफलता छिपाती है; recall उसे उजागर करता है।
त्वरित जाँच: दो versions 25 test मामलों पर 90% और 88% स्कोर करते हैं। आपको क्या निष्कर्ष निकालना चाहिए?
- अंतर का कोई असली प्रमाण नहीं; और मामले इकट्ठे करें
- Version A साफ़ तौर पर बेहतर है
- Version B साफ़ तौर पर बेहतर है
- Scores की तुलना नहीं हो सकती
Answer
अंतर का कोई असली प्रमाण नहीं; और मामले इकट्ठे करें — इतने कम मामलों में confidence intervals काफ़ी ओवरलैप करते हैं, इसलिए अंतर शोर के भीतर है।
त्वरित जाँच: कौन-सा बदलाव सावधानी से करने पर गुणवत्ता घटाए बिना LLM ख़र्च घटाता है?
- Monitoring बंद करना
- Evaluation set हटाना
- Context लंबाई दोगुनी करना
- गुणवत्ता परखने के बाद आसान अनुरोध छोटे model को भेजना
Answer
गुणवत्ता परखने के बाद आसान अनुरोध छोटे model को भेजना — Routing, caching और trimming ख़र्च घटाते हैं, और आपका evaluation set पुष्टि करता है कि गुणवत्ता बनी रही।