पाठ 27 / 31
गुणवत्ता का मूल्यांकन: Datasets, Metrics, Tracing
वास्तविक उदाहरणों पर उत्तर और retrieval गुणवत्ता मापें।
Golden set और traces
अपेक्षित उत्तरों या स्रोत दस्तावेज़ों सहित 50 से 200 वास्तविक सवालों का dataset बनाएँ, अनुत्तरणीय सवाल भी शामिल करके। Retrieval (recall@k, MRR) और उत्तर (शुद्धता, संदर्भ के प्रति faithfulness, प्रासंगिकता, सही refusals, citation सटीकता) मापें, जहाँ संभव exact जाँचों और खुले-अंत पाठ के लिए calibrated LLM judge से। Tools मदद करते हैं: LangSmith datasets और evaluators, LlamaIndex के evaluation modules, और RAGAS जैसे open-source विकल्प। हर score को trace से जोड़ें ताकि विफल मामला खोलकर retrieved chunks, अंतिम prompt और मॉडल उत्तर देख सकें। बदलाव जारी करने से पहले CI में set चलाएँ।
त्वरित जाँच: हर evaluation score को trace से क्यों जोड़ें?
- Metrics से बचने के लिए
- विफलताएँ छिपाने के लिए
- Datasets हटाने के लिए
- विफल मामलों के retrieved chunks, prompt और उत्तर देखने के लिए
Answer
विफल मामलों के retrieved chunks, prompt और उत्तर देखने के लिए — Score बताता है कि कुछ विफल हुआ; trace दिखाता है क्यों।