# AI Crawlers और robots.txt — AI Visibility और LLM Brand Discovery

Source: https://www.geekswithgeeks.com/hi/ai-visibility/tech-crawlers-robots

> मुख्य AI user agents समझें और सोच-समझकर तय करें कि क्या allow या block करना है।

## अलग bots, अलग उद्देश्य

AI कंपनियाँ कई crawlers चलाती हैं। लिखते समय के उदाहरण: OpenAI **GPTBot** (model training), **OAI-SearchBot** (ChatGPT search के लिए indexing) और **ChatGPT-User** (user के अनुरोध पर लाना) उपयोग करता है; Anthropic **ClaudeBot**, **Claude-SearchBot** और **Claude-User**; Perplexity **PerplexityBot** और **Perplexity-User**; Google Gemini के लिए आपकी सामग्री के उपयोग को नियंत्रित करने को **Google-Extended** token देता है; **CCBot** Common Crawl है, जिसका डेटा कई models उपयोग करते हैं। नाम और व्यवहार बदलते हैं, इसलिए हर provider का दस्तावेज़ देखें। **robots.txt** स्वैच्छिक मानक है जिसे सुव्यवहारी crawlers मानते हैं। यह trade-off है: block करना सामग्री को training से बचा सकता है, पर search-शैली के crawlers block करने से आप retrieval पर निर्भर उत्तरों से हट सकते हैं। हर bot के लिए जानबूझकर तय करें।

## पहुँच योग्य और पढ़ने योग्य बनें

Crawlers आपके पन्नों तक न पहुँच सकें या न पढ़ सकें, तो बाक़ी कुछ मदद नहीं करेगा।

![चार जाँचें: अनुमत, rendered, संरचित, खोजने योग्य।](assets/figures/ai-visibility/section-3-map.svg) — चित्र 3.1 — अनुमत, rendered, संरचित और खोजने योग्य।

## नियम परखना, चलाकर

मैंने यह Python के `urllib.robotparser` से चलाया। GPTBot blog ला सकता है पर `/private/` नहीं; ClaudeBot पूरी तरह blocked है; PerplexityBot जैसे अन्य bots `*` नियम मानते हैं। संपादन के बाद अपनी असली robots.txt हमेशा इसी तरह परखें।

```python
from urllib import robotparser
robots = """User-agent: GPTBot
Disallow: /private/

User-agent: ClaudeBot
Disallow: /

User-agent: *
Disallow: /admin/
"""
rp = robotparser.RobotFileParser()
rp.parse(robots.splitlines())
for ua, path in (("GPTBot", "/blog/post"), ("GPTBot", "/private/x"),
                 ("ClaudeBot", "/blog/post"), ("PerplexityBot", "/blog/post"),
                 ("PerplexityBot", "/admin/")):
    print(ua, path, rp.can_fetch(ua, "https://example.com" + path))
```

Output:

```
GPTBot /blog/post True
GPTBot /private/x False
ClaudeBot /blog/post False
PerplexityBot /blog/post True
PerplexityBot /admin/ False
```

## robots.txt सुरक्षा नहीं है

यह bots से विनम्रता से कहता है; यह किसी दुर्भावनापूर्ण पक्ष को नहीं रोकता और निजी डेटा की रक्षा नहीं करता। जो सचमुच गोपनीय है वह authentication के पीछे हो, सिर्फ़ Disallow पंक्ति के पीछे नहीं।

**Quiz:** Search-शैली के AI crawlers block करने का एक trade-off क्या है?

- [ ] यह आपकी SEO गारंटी से सुधारता है
- [ ] आपकी साइट users के लिए तेज़ हो जाती है
- [x] आप live retrieval पर निर्भर उत्तरों से ग़ायब हो सकते हैं
- [ ] कुछ भी नहीं बदलता

*Answer:* आप live retrieval पर निर्भर उत्तरों से ग़ायब हो सकते हैं. Retrieval system आपके पन्ने न ला सके तो उन्हें उद्धृत नहीं कर सकता।
