# उत्तरों का मूल्यांकन: Faithfulness और Relevance — Retrieval-Augmented Generation (RAG)

Source: https://www.geekswithgeeks.com/hi/rag/e-answers

> बने उत्तरों को शुद्धता, समर्थन और उपयोगिता पर score करें।

## "अच्छा दिखता है" से आगे

हर उत्तर को कई आयामों पर score करें: संदर्भ उत्तर के विरुद्ध **शुद्धता**, retrieved संदर्भ के प्रति **faithfulness/groundedness**, सवाल के प्रति **उत्तर की प्रासंगिकता**, **पूर्णता**, जिन सवालों के उत्तर दस्तावेज़ों में नहीं हैं उन पर सही **refusals** (अपने set में कुछ शामिल करें), और **citation सटीकता**। **LLM judge** से rubric scoring अच्छी तरह scale होती है, पर नमूने पर मानव रेटिंग से उसका calibration करें, judge के पूर्वाग्रह (लंबे उत्तर पसंद करना) पर नज़र रखें और judge prompts स्थिर रखें। RAGAS या TruLens जैसे frameworks तैयार metrics देते हैं; उन्हें सहायक मानें, अंतिम सत्य नहीं। Dashboard में latency, लागत और user feedback (thumbs up/down) जोड़ें।

## अनुत्तरणीय सवाल शामिल करें

10 से 20% ऐसे सवाल जोड़ें जिनका उत्तर दस्तावेज़ों में नहीं है। सही व्यवहार इनकार है, और कई systems ठीक यहीं विफल होते हैं।

**Quiz:** Test set में अनुत्तरणीय सवाल क्यों शामिल करें?

- [ ] Set छोटा करने के लिए
- [x] यह जाँचने के लिए कि system उत्तर गढ़ने की जगह मना करता है
- [ ] Recall घटाने के लिए
- [ ] Judges से बचने के लिए

*Answer:* यह जाँचने के लिए कि system उत्तर गढ़ने की जगह मना करता है. Refusal व्यवहार तभी दिखता है जब set में ऐसे सवाल हों जिन्हें मना किया जाना चाहिए।
