पाठ 20 / 27

उत्तरों का मूल्यांकन: Faithfulness और Relevance

बने उत्तरों को शुद्धता, समर्थन और उपयोगिता पर score करें।

"अच्छा दिखता है" से आगे

हर उत्तर को कई आयामों पर score करें: संदर्भ उत्तर के विरुद्ध शुद्धता, retrieved संदर्भ के प्रति faithfulness/groundedness, सवाल के प्रति उत्तर की प्रासंगिकता, पूर्णता, जिन सवालों के उत्तर दस्तावेज़ों में नहीं हैं उन पर सही refusals (अपने set में कुछ शामिल करें), और citation सटीकता। LLM judge से rubric scoring अच्छी तरह scale होती है, पर नमूने पर मानव रेटिंग से उसका calibration करें, judge के पूर्वाग्रह (लंबे उत्तर पसंद करना) पर नज़र रखें और judge prompts स्थिर रखें। RAGAS या TruLens जैसे frameworks तैयार metrics देते हैं; उन्हें सहायक मानें, अंतिम सत्य नहीं। Dashboard में latency, लागत और user feedback (thumbs up/down) जोड़ें।

अनुत्तरणीय सवाल शामिल करें

10 से 20% ऐसे सवाल जोड़ें जिनका उत्तर दस्तावेज़ों में नहीं है। सही व्यवहार इनकार है, और कई systems ठीक यहीं विफल होते हैं।

त्वरित जाँच: Test set में अनुत्तरणीय सवाल क्यों शामिल करें?

  • Set छोटा करने के लिए
  • यह जाँचने के लिए कि system उत्तर गढ़ने की जगह मना करता है
  • Recall घटाने के लिए
  • Judges से बचने के लिए
Answer

यह जाँचने के लिए कि system उत्तर गढ़ने की जगह मना करता है — Refusal व्यवहार तभी दिखता है जब set में ऐसे सवाल हों जिन्हें मना किया जाना चाहिए।