पाठ 8 / 25
AI Crawlers और robots.txt
मुख्य AI user agents समझें और सोच-समझकर तय करें कि क्या allow या block करना है।
अलग bots, अलग उद्देश्य
AI कंपनियाँ कई crawlers चलाती हैं। लिखते समय के उदाहरण: OpenAI GPTBot (model training), OAI-SearchBot (ChatGPT search के लिए indexing) और ChatGPT-User (user के अनुरोध पर लाना) उपयोग करता है; Anthropic ClaudeBot, Claude-SearchBot और Claude-User; Perplexity PerplexityBot और Perplexity-User; Google Gemini के लिए आपकी सामग्री के उपयोग को नियंत्रित करने को Google-Extended token देता है; CCBot Common Crawl है, जिसका डेटा कई models उपयोग करते हैं। नाम और व्यवहार बदलते हैं, इसलिए हर provider का दस्तावेज़ देखें। robots.txt स्वैच्छिक मानक है जिसे सुव्यवहारी crawlers मानते हैं। यह trade-off है: block करना सामग्री को training से बचा सकता है, पर search-शैली के crawlers block करने से आप retrieval पर निर्भर उत्तरों से हट सकते हैं। हर bot के लिए जानबूझकर तय करें।
पहुँच योग्य और पढ़ने योग्य बनें
Crawlers आपके पन्नों तक न पहुँच सकें या न पढ़ सकें, तो बाक़ी कुछ मदद नहीं करेगा।
नियम परखना, चलाकर
मैंने यह Python के urllib.robotparser से चलाया। GPTBot blog ला सकता है पर /private/ नहीं; ClaudeBot पूरी तरह blocked है; PerplexityBot जैसे अन्य bots * नियम मानते हैं। संपादन के बाद अपनी असली robots.txt हमेशा इसी तरह परखें।
from urllib import robotparser
robots = """User-agent: GPTBot
Disallow: /private/
User-agent: ClaudeBot
Disallow: /
User-agent: *
Disallow: /admin/
"""
rp = robotparser.RobotFileParser()
rp.parse(robots.splitlines())
for ua, path in (("GPTBot", "/blog/post"), ("GPTBot", "/private/x"),
("ClaudeBot", "/blog/post"), ("PerplexityBot", "/blog/post"),
("PerplexityBot", "/admin/")):
print(ua, path, rp.can_fetch(ua, "https://example.com" + path))
Output:
GPTBot /blog/post True GPTBot /private/x False ClaudeBot /blog/post False PerplexityBot /blog/post True PerplexityBot /admin/ False
robots.txt सुरक्षा नहीं है
यह bots से विनम्रता से कहता है; यह किसी दुर्भावनापूर्ण पक्ष को नहीं रोकता और निजी डेटा की रक्षा नहीं करता। जो सचमुच गोपनीय है वह authentication के पीछे हो, सिर्फ़ Disallow पंक्ति के पीछे नहीं।
त्वरित जाँच: Search-शैली के AI crawlers block करने का एक trade-off क्या है?
- यह आपकी SEO गारंटी से सुधारता है
- आपकी साइट users के लिए तेज़ हो जाती है
- आप live retrieval पर निर्भर उत्तरों से ग़ायब हो सकते हैं
- कुछ भी नहीं बदलता
Answer
आप live retrieval पर निर्भर उत्तरों से ग़ायब हो सकते हैं — Retrieval system आपके पन्ने न ला सके तो उन्हें उद्धृत नहीं कर सकता।