# गुणवत्ता का मूल्यांकन: Datasets, Metrics, Tracing — LangChain / LlamaIndex

Source: https://www.geekswithgeeks.com/hi/langchain-llamaindex/p-eval

> वास्तविक उदाहरणों पर उत्तर और retrieval गुणवत्ता मापें।

## Golden set और traces

अपेक्षित उत्तरों या स्रोत दस्तावेज़ों सहित 50 से 200 वास्तविक सवालों का **dataset** बनाएँ, अनुत्तरणीय सवाल भी शामिल करके। **Retrieval** (recall@k, MRR) और **उत्तर** (शुद्धता, संदर्भ के प्रति faithfulness, प्रासंगिकता, सही refusals, citation सटीकता) मापें, जहाँ संभव exact जाँचों और खुले-अंत पाठ के लिए calibrated **LLM judge** से। Tools मदद करते हैं: **LangSmith** datasets और evaluators, LlamaIndex के evaluation modules, और RAGAS जैसे open-source विकल्प। हर score को **trace** से जोड़ें ताकि विफल मामला खोलकर retrieved chunks, अंतिम prompt और मॉडल उत्तर देख सकें। बदलाव जारी करने से पहले CI में set चलाएँ।

**Quiz:** हर evaluation score को trace से क्यों जोड़ें?

- [ ] Metrics से बचने के लिए
- [ ] विफलताएँ छिपाने के लिए
- [ ] Datasets हटाने के लिए
- [x] विफल मामलों के retrieved chunks, prompt और उत्तर देखने के लिए

*Answer:* विफल मामलों के retrieved chunks, prompt और उत्तर देखने के लिए. Score बताता है कि कुछ विफल हुआ; trace दिखाता है क्यों।
