पाठ 5 / 27

दस्तावेज़ लोड करना और साफ़ करना

PDFs, web pages और office files से साफ़ पाठ निकालें।

Garbage in, garbage out

असली दस्तावेज़ बिखरे होते हैं। PDFs में headers, footers, पृष्ठ-संख्याएँ, दो स्तंभ और तालिकाएँ होती हैं जो गड़बड़ पाठ में निकलती हैं; web pages में menus और cookie banners; स्कैन फ़ाइलों को OCR चाहिए। Indexing से पहले साफ़ करें: boilerplate हटाएँ, encodings ठीक करें, headings और सूची-संरचना रखें, तालिकाओं को पठनीय रूप में बदलें (पंक्तियाँ पाठ या Markdown के रूप में), दोहराए दस्तावेज़ deduplicate करें और अप्रचलित संस्करण हटाएँ। निकाले पाठ का नमूना हमेशा ख़ुद देखें; कई "retrieval" समस्याएँ वास्तव में extraction समस्याएँ होती हैं।

अच्छा इनपुट, अच्छा index

साफ़ पाठ, समझदार chunks और उपयोगी metadata retrieval की गुणवत्ता तय करते हैं।

तीन चरण: load, chunk, label।
चित्र 2.1 — Load, chunk और label।

पाठ के साथ स्रोत रखें

पहले ही चरण से हर पाठ-टुकड़े के साथ फ़ाइल नाम, पृष्ठ संख्या, अनुभाग शीर्षक और URL रखें; citations के लिए चाहिए होंगे।

त्वरित जाँच: निकाले पाठ के नमूने क्यों देखें?

  • Font आकार घटाने के लिए
  • Extraction की ग़लतियाँ चुपचाप retrieval बिगाड़ती हैं
  • मॉडल प्रशिक्षित करने के लिए
  • GPU तेज़ करने के लिए
Answer

Extraction की ग़लतियाँ चुपचाप retrieval बिगाड़ती हैं — गड़बड़ तालिकाएँ या ग़ायब पाठ सही retrieve नहीं हो सकते।