पाठ 20 / 27
उत्तरों का मूल्यांकन: Faithfulness और Relevance
बने उत्तरों को शुद्धता, समर्थन और उपयोगिता पर score करें।
"अच्छा दिखता है" से आगे
हर उत्तर को कई आयामों पर score करें: संदर्भ उत्तर के विरुद्ध शुद्धता, retrieved संदर्भ के प्रति faithfulness/groundedness, सवाल के प्रति उत्तर की प्रासंगिकता, पूर्णता, जिन सवालों के उत्तर दस्तावेज़ों में नहीं हैं उन पर सही refusals (अपने set में कुछ शामिल करें), और citation सटीकता। LLM judge से rubric scoring अच्छी तरह scale होती है, पर नमूने पर मानव रेटिंग से उसका calibration करें, judge के पूर्वाग्रह (लंबे उत्तर पसंद करना) पर नज़र रखें और judge prompts स्थिर रखें। RAGAS या TruLens जैसे frameworks तैयार metrics देते हैं; उन्हें सहायक मानें, अंतिम सत्य नहीं। Dashboard में latency, लागत और user feedback (thumbs up/down) जोड़ें।
अनुत्तरणीय सवाल शामिल करें
10 से 20% ऐसे सवाल जोड़ें जिनका उत्तर दस्तावेज़ों में नहीं है। सही व्यवहार इनकार है, और कई systems ठीक यहीं विफल होते हैं।
त्वरित जाँच: Test set में अनुत्तरणीय सवाल क्यों शामिल करें?
- Set छोटा करने के लिए
- यह जाँचने के लिए कि system उत्तर गढ़ने की जगह मना करता है
- Recall घटाने के लिए
- Judges से बचने के लिए
Answer
यह जाँचने के लिए कि system उत्तर गढ़ने की जगह मना करता है — Refusal व्यवहार तभी दिखता है जब set में ऐसे सवाल हों जिन्हें मना किया जाना चाहिए।