# दस्तावेज़ लोड करना और साफ़ करना — Retrieval-Augmented Generation (RAG)

Source: https://www.geekswithgeeks.com/hi/rag/i-load

> PDFs, web pages और office files से साफ़ पाठ निकालें।

## Garbage in, garbage out

असली दस्तावेज़ बिखरे होते हैं। PDFs में headers, footers, पृष्ठ-संख्याएँ, दो स्तंभ और तालिकाएँ होती हैं जो गड़बड़ पाठ में निकलती हैं; web pages में menus और cookie banners; स्कैन फ़ाइलों को **OCR** चाहिए। Indexing से पहले साफ़ करें: boilerplate हटाएँ, encodings ठीक करें, **headings और सूची-संरचना** रखें, तालिकाओं को पठनीय रूप में बदलें (पंक्तियाँ पाठ या Markdown के रूप में), दोहराए दस्तावेज़ **deduplicate** करें और अप्रचलित संस्करण हटाएँ। निकाले पाठ का नमूना हमेशा ख़ुद देखें; कई "retrieval" समस्याएँ वास्तव में extraction समस्याएँ होती हैं।

## अच्छा इनपुट, अच्छा index

साफ़ पाठ, समझदार chunks और उपयोगी metadata retrieval की गुणवत्ता तय करते हैं।

![तीन चरण: load, chunk, label।](assets/figures/rag/section-2-map.svg) — चित्र 2.1 — Load, chunk और label।

## पाठ के साथ स्रोत रखें

पहले ही चरण से हर पाठ-टुकड़े के साथ फ़ाइल नाम, पृष्ठ संख्या, अनुभाग शीर्षक और URL रखें; citations के लिए चाहिए होंगे।

**Quiz:** निकाले पाठ के नमूने क्यों देखें?

- [ ] Font आकार घटाने के लिए
- [x] Extraction की ग़लतियाँ चुपचाप retrieval बिगाड़ती हैं
- [ ] मॉडल प्रशिक्षित करने के लिए
- [ ] GPU तेज़ करने के लिए

*Answer:* Extraction की ग़लतियाँ चुपचाप retrieval बिगाड़ती हैं. गड़बड़ तालिकाएँ या ग़ायब पाठ सही retrieve नहीं हो सकते।
