पाठ 5 / 27
दस्तावेज़ लोड करना और साफ़ करना
PDFs, web pages और office files से साफ़ पाठ निकालें।
Garbage in, garbage out
असली दस्तावेज़ बिखरे होते हैं। PDFs में headers, footers, पृष्ठ-संख्याएँ, दो स्तंभ और तालिकाएँ होती हैं जो गड़बड़ पाठ में निकलती हैं; web pages में menus और cookie banners; स्कैन फ़ाइलों को OCR चाहिए। Indexing से पहले साफ़ करें: boilerplate हटाएँ, encodings ठीक करें, headings और सूची-संरचना रखें, तालिकाओं को पठनीय रूप में बदलें (पंक्तियाँ पाठ या Markdown के रूप में), दोहराए दस्तावेज़ deduplicate करें और अप्रचलित संस्करण हटाएँ। निकाले पाठ का नमूना हमेशा ख़ुद देखें; कई "retrieval" समस्याएँ वास्तव में extraction समस्याएँ होती हैं।
अच्छा इनपुट, अच्छा index
साफ़ पाठ, समझदार chunks और उपयोगी metadata retrieval की गुणवत्ता तय करते हैं।
पाठ के साथ स्रोत रखें
पहले ही चरण से हर पाठ-टुकड़े के साथ फ़ाइल नाम, पृष्ठ संख्या, अनुभाग शीर्षक और URL रखें; citations के लिए चाहिए होंगे।
त्वरित जाँच: निकाले पाठ के नमूने क्यों देखें?
- Font आकार घटाने के लिए
- Extraction की ग़लतियाँ चुपचाप retrieval बिगाड़ती हैं
- मॉडल प्रशिक्षित करने के लिए
- GPU तेज़ करने के लिए
Answer
Extraction की ग़लतियाँ चुपचाप retrieval बिगाड़ती हैं — गड़बड़ तालिकाएँ या ग़ायब पाठ सही retrieve नहीं हो सकते।