पाठ 21 / 27
विफलता विश्लेषण: कहाँ टूटा?
Pipeline में पीछे चलकर बुरे उत्तर का निदान करें।
Pipeline में पीछे चलें
हर ग़लत उत्तर के लिए क्रम से पूछें: (1) क्या उत्तर दस्तावेज़ों में है भी? (2) क्या वह सही-सलामत extract और chunk हुआ? (3) क्या सही chunk retrieve हुआ (शीर्ष k में)? (4) क्या वह भेजे जाने लायक़ ऊँचा rank हुआ? (5) क्या prompt ने उसे साफ़ पेश किया? (6) क्या मॉडल ने उसे निष्ठा से उपयोग किया? अपने golden set पर चरण-अनुसार विफलताएँ गिनें; सबसे बड़ी श्रेणी बताती है कि निवेश कहाँ करें। आम सुधार: extraction bugs, chunk आकार, hybrid search, query rewriting, reranking, बेहतर निर्देश, मज़बूत मॉडल।
विफलता गणना
उदाहरण कि टीम 40 विफल सवालों को कैसे गिन सकती है ताकि तय हो पहले क्या ठीक करें। संख्याएँ उदाहरणात्मक हैं, मापी हुई नहीं।
Failure stage Count Fix to try first
answer not in the documents 4 add missing docs / better refusal
bad extraction (tables, scans) 6 improve parsing / OCR
right chunk not in top-k 18 hybrid search, chunking, rewrite
retrieved but ranked too low 7 reranker
retrieved and ranked, model misread 5 prompt, citations, stronger modelत्वरित जाँच: उत्तर ग़लत हो तो पहला सवाल क्या है?
- क्या मॉडल बहुत छोटा है?
- क्या उत्तर वास्तव में दस्तावेज़ों में है?
- क्या font पठनीय है?
- क्या server लाल है?
Answer
क्या उत्तर वास्तव में दस्तावेज़ों में है? — ज्ञान ही ग़ायब हो तो कोई retrieval या prompt बदलाव उसे ठीक नहीं कर सकता।