
Get a counselling call
robots.txt क्या है? SEO में इसका काम और सही इस्तेमाल
robots.txt एक साधारण टेक्स्ट फ़ाइल है जो आपकी वेबसाइट के root में रहती है (जैसे example.com/robots.txt) और search engine crawlers को बताती है कि साइट के कौन से हिस्से वे crawl कर सकते हैं और कौन से नहीं. SEO में इसका मुख्य काम crawl traffic को मैनेज करना है, यानी Googlebot जैसे crawler को गैर-ज़रूरी pages पर जाने से रोकना ताकि सर्वर पर लोड कम रहे. एक बात याद रखें, यह किसी page को Google में index होने से रोकने का तरीका नहीं है.
अगर आप SEO और digital marketing सीख रहे हैं, तो robots.txt file उन पहली technical चीज़ों में से एक है जिसे समझना ज़रूरी है. यह देखने में छोटी सी फ़ाइल है, लेकिन एक गलत लाइन आपकी पूरी साइट को search results से गायब कर सकती है. इस गाइड में हम आसान हिंदी में समझेंगे कि robots.txt क्या है, SEO में यह क्यों मायने रखती है, यह कैसी दिखती है, और इसका सही इस्तेमाल कैसे करें.
robots.txt file क्या है?
robots.txt एक plain text फ़ाइल है जो Robots Exclusion Protocol का हिस्सा है. हर website के लिए यह फ़ाइल उसके main domain के root पर होती है. मतलब अगर आपकी साइट example.com है, तो फ़ाइल का पता example.com/robots.txt होगा.
इस फ़ाइल में आप crawler के लिए निर्देश लिखते हैं, जैसे किस folder को मत खोलो और sitemap कहाँ है. जब कोई search engine bot आपकी साइट पर आता है, तो सबसे पहले वह यही फ़ाइल पढ़ता है और फिर उसी हिसाब से आगे बढ़ता है.
SEO में robots.txt क्यों ज़रूरी है?
SEO में robots.txt का सबसे बड़ा फ़ायदा crawl traffic को कंट्रोल करना है. बड़ी साइटों पर सैकड़ों गैर-ज़रूरी URL होते हैं, जैसे admin pages, filter वाले pages, या internal search results. इन पर crawler का समय खर्च कराना फ़ायदेमंद नहीं होता. robots.txt से आप crawler को इन हिस्सों से दूर रखकर उसका ध्यान अपने असली, कमाई वाले pages पर लगा सकते हैं.
इसके तीन मुख्य काम याद रखें:
सर्वर पर crawler का लोड कम करना, ताकि साइट तेज़ रहे.
गैर-ज़रूरी या एक जैसे (duplicate) pages को crawl होने से रोकना.
अपने sitemap का पता crawler को बताना.
robots.txt file कैसी दिखती है? (सिंटैक्स)
robots.txt की भाषा बहुत सरल है. एक आम उदाहरण कुछ ऐसा दिखता है:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap.xml
इसका मतलब:
User-agent बताता है कि नियम किस crawler के लिए है. * का मतलब सभी crawler.
Disallow बताता है कि किस path को crawl नहीं करना.
Allow किसी रोके गए folder के अंदर किसी ज़रूरी फ़ाइल को खोलने की छूट देता है.
Sitemap आपके sitemap का पूरा URL बताता है.
एक ज़रूरी बात, अलग-अलग crawler सिंटैक्स को थोड़ा अलग तरीके से समझ सकते हैं. Googlebot और बाकी जाने-माने crawler नियमों का पालन करते हैं, पर हर bot ऐसा करे यह ज़रूरी नहीं. इसलिए robots.txt को सुरक्षा का तरीका न मानें.
सबसे बड़ी ग़लतफ़हमी: crawling बनाम indexing
यह वह बिंदु है जहाँ ज़्यादातर लोग गलती करते हैं. robots.txt crawling को कंट्रोल करती है, indexing को नहीं.
Google के अपने दस्तावेज़ साफ़ कहते हैं कि robots.txt का इस्तेमाल किसी page को Google search में दिखने से रोकने के लिए नहीं करना चाहिए. अगर आप किसी page को robots.txt में Disallow कर देते हैं, फिर भी अगर किसी दूसरी साइट से उस page का link मिलता है, तो Google उस URL को बिना खोले ही index कर सकता है. ऐसे में search results में उस URL का पता तो दिखेगा, पर उसके साथ कोई ब्यौरा नहीं होगा.
दूसरे शब्दों में, robots.txt से “मत आना” कहा जा सकता है, पर “मत दिखाना” नहीं.
robots.txt और noindex में फ़र्क
चूँकि robots.txt indexing नहीं रोकती, इसलिए किसी page को Google से पूरी तरह हटाने के लिए noindex का इस्तेमाल होता है. यहाँ एक और बात जान लें, Google अब robots.txt फ़ाइल के अंदर लिखे noindex को support नहीं करता. इसलिए किसी page को index होने से रोकने के लिए उसके <head> में robots meta tag या noindex लगाएँ या HTTP response में X-Robots-Tag भेजें, या page को password से सुरक्षित करें.
दोनों तरीकों का फ़र्क एक नज़र में:
robots.txt (Disallow) | noindex (meta tag या header) | |
मुख्य काम | crawling रोकना या कंट्रोल करना | indexing रोकना |
कहाँ लगता है | site के root की एक फ़ाइल में | हर page के head या HTTP header में |
क्या page index होने से रुकता है? | नहीं, link मिलने पर फिर भी index हो सकता है | हाँ, page search results से हट जाता है |
कब इस्तेमाल करें | crawl budget और सर्वर लोड मैनेज करना | किसी page को Google में बिलकुल न दिखाना |
आसान नियम: crawler को दूर रखना है तो robots.txt, page को search से हटाना है तो noindex.
robots.txt का सही इस्तेमाल कब करें और कब नहीं
इनके लिए इस्तेमाल करें:
admin, cart, या internal search जैसे गैर-ज़रूरी sections को crawl से रोकना.
बड़ी साइट पर crawl budget बचाना.
sitemap का पता बताना.
इनके लिए इस्तेमाल न करें:
किसी private या संवेदनशील page को छिपाना. इसके लिए password या noindex इस्तेमाल करें.
किसी page को search results से हटाना. यह काम noindex का है.
CSS या JavaScript जैसी ज़रूरी फ़ाइलों को ब्लॉक करना, वरना Google page को ठीक से समझ नहीं पाएगा.
robots.txt कैसे बनाएँ और जाँचें
robots.txt बनाना आसान है. किसी भी text editor में फ़ाइल बनाएँ, उसमें अपने नियम लिखें, उसका नाम बिलकुल robots.txt रखें, और उसे साइट के root folder में अपलोड करें. हर host के लिए सिर्फ़ एक robots.txt फ़ाइल होती है.
अपलोड करने के बाद फ़ाइल को example.com/robots.txt पर खोलकर देखें, और Google Search Console में इसकी जाँच करें ताकि कोई ज़रूरी page गलती से ब्लॉक न हो जाए. WordPress, Wix या Blogger जैसे platform पर अक्सर plugin या settings से ही यह फ़ाइल मैनेज हो जाती है, आपको सीधे code छूने की ज़रूरत नहीं पड़ती.
SEO और digital marketing गहराई से सीखना चाहते हैं?
robots.txt technical SEO का सिर्फ़ एक छोटा हिस्सा है. पूरी technical SEO , on-page, paid ads और AI tools को practical तरीके से सीखना हो तो Course Unbox का live, cohort-based AI-integrated digital marketing course देखें, जो इंडस्ट्री में काम कर रहे experts real projects पर सिखाते हैं.
किस course से शुरुआत करें, यह तय करने में मदद चाहिए तो WhatsApp पर मेंटर से बात करें, या Course Unbox के ब्लॉग पर और मार्केटिंग गाइड पढ़ें.
About the Author
Jugal Chauhan
Jugal Chauhan is a digital marketing strategist and tech educator with a passion for making complex topics accessible. He writes about marketing, technology, and professional growth to help learners and businesses thrive in the digital age.
Learn more about us →