पाठ 27 / 31

गुणवत्ता का मूल्यांकन: Datasets, Metrics, Tracing

वास्तविक उदाहरणों पर उत्तर और retrieval गुणवत्ता मापें।

Golden set और traces

अपेक्षित उत्तरों या स्रोत दस्तावेज़ों सहित 50 से 200 वास्तविक सवालों का dataset बनाएँ, अनुत्तरणीय सवाल भी शामिल करके। Retrieval (recall@k, MRR) और उत्तर (शुद्धता, संदर्भ के प्रति faithfulness, प्रासंगिकता, सही refusals, citation सटीकता) मापें, जहाँ संभव exact जाँचों और खुले-अंत पाठ के लिए calibrated LLM judge से। Tools मदद करते हैं: LangSmith datasets और evaluators, LlamaIndex के evaluation modules, और RAGAS जैसे open-source विकल्प। हर score को trace से जोड़ें ताकि विफल मामला खोलकर retrieved chunks, अंतिम prompt और मॉडल उत्तर देख सकें। बदलाव जारी करने से पहले CI में set चलाएँ।

त्वरित जाँच: हर evaluation score को trace से क्यों जोड़ें?

  • Metrics से बचने के लिए
  • विफलताएँ छिपाने के लिए
  • Datasets हटाने के लिए
  • विफल मामलों के retrieved chunks, prompt और उत्तर देखने के लिए
Answer

विफल मामलों के retrieved chunks, prompt और उत्तर देखने के लिए — Score बताता है कि कुछ विफल हुआ; trace दिखाता है क्यों।