robots.txt

Cunoscut și ca: fișier robots.txt, Robots Exclusion Protocol, protocol de excludere a roboților, robots file
Ce este robots.txt?
Pe scurt
robots.txt este un fișier text care indică roboților motoarelor de căutare ce URL-uri pot accesa pe un site. Este folosit în principal pentru gestionarea traficului de crawling. Nu reprezintă o metodă de securizare și nu garantează eliminarea unui URL din rezultatele Google.
Rolul fișierului robots.txt
Fișierul robots.txt aplică Robots Exclusion Protocol. El conține reguli prin care proprietarul unui site indică accesul permis sau interzis crawlerelor pentru anumite căi. Regulile nu reprezintă o formă de autorizare a accesului. Respectarea lor depinde de crawler.
Fișierul trebuie să fie denumit robots.txt, salvat ca text în format UTF-8 și publicat la rădăcina site-ului. Pentru https://exemplu.ro/, adresa corectă este https://exemplu.ro/robots.txt. Regulile se aplică numai protocolului, hostului și portului unde este publicat fișierul.
Directive principale
Un grup începe cu directiva User-agent, care identifică robotul vizat. Valoarea * se referă la crawlerele pentru care nu există un grup mai specific. Directiva Disallow indică o cale care nu trebuie accesată, iar Allow poate permite o pagină sau un subdirector dintr-o zonă blocată. Directiva opțională Sitemap indică adresa completă a sitemapului.
Dacă nicio regulă nu blochează o cale, aceasta este permisă implicit. Căile din reguli sunt sensibile la litere mari și mici. Comentariile încep cu caracterul # și sunt ignorate la procesare.
Limite
robots.txt gestionează crawlingul, nu garantează excluderea de la indexare. Un URL blocat poate apărea în rezultatele Google dacă este descoperit prin linkuri externe, chiar dacă Google nu îi accesează conținutul. Pentru excluderea unei pagini din Google trebuie folosită o metodă adecvată, precum noindex, protejarea cu parolă sau eliminarea paginii.
Fișierul nu protejează informații confidențiale. Unele crawlere pot să nu accepte protocolul sau pot interpreta diferit anumite instrucțiuni.
De ce contează în SEO?
Importanța pentru SEO clasic
robots.txt permite gestionarea accesului crawlerelor la URL-uri neimportante, similare sau consumatoare de resurse. Poate fi folosit când solicitările crawlerelor riscă să încarce serverul. De asemenea, poate controla accesul la anumite fișiere media sau resurse.
Configurarea greșită poate împiedica Googlebot să acceseze pagini ori resurse necesare pentru înțelegerea lor. Blocarea fișierelor de stil, a scripturilor sau a imaginilor importante poate face pagina mai dificil de analizat. Un URL blocat nu este însă eliminat automat din rezultatele căutării. Adresa sa poate rămâne indexată și poate apărea fără descriere.
Impactul asupra altor crawlere
robots.txt formulează reguli pentru crawlere automate, dar nu reprezintă o formă de autorizare a accesului. Unele crawlere pot să nu respecte protocolul sau pot interpreta diferit anumite instrucțiuni.
Prin urmare, robots.txt trebuie tratat ca instrument tehnic de control al crawlingului. Nu este o metodă completă de control al vizibilității în rezultatele căutării și nu protejează informațiile confidențiale.
Exemplu
Un magazin online românesc dorește să evite accesarea rezultatelor căutării interne, dar să permită accesarea restului site-ului și să indice sitemapul:
User-agent: *
Disallow: /cautare-interna/
Allow: /
Sitemap: https://www.magazin.ro/sitemap.xml
Fișierul trebuie publicat la https://www.magazin.ro/robots.txt. Regula solicită crawlerelor vizate să nu acceseze URL-urile care încep cu /cautare-interna/. Ea nu garantează că acele URL-uri dispar din rezultatele Google.
Cum verifici?
- Deschide o fereastră privată în browser.
- Accesează adresa completă, de forma
https://exemplu.ro/robots.txt. - Confirmă că fișierul este public și că afișează textul așteptat.
- Verifică dacă fișierul este publicat la rădăcina protocolului și hostului cărora trebuie să li se aplice.
- Controlează scrierea directivelor
User-agent,Allow,DisallowșiSitemap. - Verifică atent literele mari și mici din căile declarate.
- Folosește raportul robots.txt din Google Search Console pentru fișierele deja accesibile pe site.
- Testează separat fișierul fiecărui subdomeniu sau protocol care trebuie controlat.
Ce trebuie să faci?
- Definește mai întâi ce zone trebuie gestionate la nivel de crawling.
- Publică robots.txt numai la rădăcina hostului vizat.
- Folosește grupuri specifice doar când ai nevoie de reguli diferite pentru anumite crawlere.
- Nu bloca scripturi, stiluri sau imagini necesare pentru înțelegerea paginilor.
- Folosește
noindex, protejarea cu parolă sau eliminarea paginii când obiectivul este excluderea din Google. - Testează fișierul după fiecare modificare importantă.
- Verifică regulile separat pentru subdomenii, protocoale și porturi diferite.
Greșeli frecvente
- Folosirea robots.txt pentru a ascunde informații confidențiale sau pagini private.
- Presupunerea că un URL blocat prin `Disallow` nu mai poate apărea în rezultatele Google.
- Publicarea fișierului într-un subdirector, în locul rădăcinii site-ului.
- Blocarea resurselor necesare crawlerului pentru înțelegerea paginii.
- Aplicarea acelorași reguli fără verificare pe domenii, subdomenii sau protocoale diferite.
Perspectiva SEO 365
Verificăm mai întâi dacă regulile corespund scopului real: controlul crawlingului sau excluderea din rezultate. Punem accentul pe accesul la paginile și resursele importante. Evităm tratarea directivei Disallow ca substitut pentru noindex sau pentru protejarea accesului.