पाठ 25 / 25

Revision: Cheat Sheet और Self-Check

पूरे कोर्स के safeguards, metrics और cost लीवर की दोहराई करें।

Cheat sheet

विफलता प्रकार: hallucination, हानिकारक सामग्री, privacy leak, पक्षपात, दुरुपयोग, अति-निर्भरता। Safeguards: model के चारों ओर परतें; thresholds के साथ moderation; PII छिपाएँ; उत्तर ground करें और "मुझे नहीं पता" की अनुमति दें; under- और over-refusal मापें। दुरुपयोग: injection के विरुद्ध संरचनात्मक बचाव; tokens के आधार पर rate limits। ज़िम्मेदारी: slice metrics, data minimisation, system card, उच्च-जोखिम में इंसानी निगरानी। Evaluation: यथार्थपूर्ण held-out set; precision, recall, F1; confidence intervals; kappa से judges जाँचें; z-test के साथ A/B; CI में regression। Monitoring: versioned traces, percentiles, alerts। Cost: tokens × क़ीमत; route; cache; trim; budgets और अलग keys।

इंटरव्यू में पूछे जाने वाले सवाल

इन्हें समझाने को तैयार रहें: Q&A bot में hallucination कैसे घटाएँगे, moderation filter में precision-recall trade-off, accuracy भ्रमित क्यों कर सकती है, LLM judge को कैसे जाँचेंगे, कैसे जानेंगे कि version B सचमुच बेहतर है, और गुणवत्ता घटाए बिना LLM बिल कम करने के तीन तरीक़े।

त्वरित जाँच: हानिकारक-सामग्री filter 99% सटीक है क्योंकि सिर्फ़ 1% संदेश हानिकारक हैं और वह कुछ भी चिह्नित नहीं करता। समस्या क्या है?

  • वह बहुत तेज़ है
  • उसका precision बहुत ऊँचा है
  • दुर्लभ हानिकारक वर्ग के लिए उसका recall शून्य है
  • कुछ ग़लत नहीं
Answer

दुर्लभ हानिकारक वर्ग के लिए उसका recall शून्य है — Accuracy दुर्लभ वर्ग की विफलता छिपाती है; recall उसे उजागर करता है।

त्वरित जाँच: दो versions 25 test मामलों पर 90% और 88% स्कोर करते हैं। आपको क्या निष्कर्ष निकालना चाहिए?

  • अंतर का कोई असली प्रमाण नहीं; और मामले इकट्ठे करें
  • Version A साफ़ तौर पर बेहतर है
  • Version B साफ़ तौर पर बेहतर है
  • Scores की तुलना नहीं हो सकती
Answer

अंतर का कोई असली प्रमाण नहीं; और मामले इकट्ठे करें — इतने कम मामलों में confidence intervals काफ़ी ओवरलैप करते हैं, इसलिए अंतर शोर के भीतर है।

त्वरित जाँच: कौन-सा बदलाव सावधानी से करने पर गुणवत्ता घटाए बिना LLM ख़र्च घटाता है?

  • Monitoring बंद करना
  • Evaluation set हटाना
  • Context लंबाई दोगुनी करना
  • गुणवत्ता परखने के बाद आसान अनुरोध छोटे model को भेजना
Answer

गुणवत्ता परखने के बाद आसान अनुरोध छोटे model को भेजना — Routing, caching और trimming ख़र्च घटाते हैं, और आपका evaluation set पुष्टि करता है कि गुणवत्ता बनी रही।