Consultanță Gratuită →
SEO 365 — agenție SEO și AI Search

Googlebot

EN: GooglebotGoogle Search
Captură din Glosarul SEO 365 pentru Googlebot (Google Search): Googlebot este numele generic al crawlerelor web folosite
Googlebot — ilustrație din Glosarul SEO 365 · Google Search

Cunoscut și ca: crawlerul Google, robotul Google, Google crawler, Googlebot Smartphone, Googlebot Desktop

Ce este Googlebot?

Pe scurt

Googlebot este numele generic al crawlerelor web folosite de Google Search pentru a descoperi și scana pagini. Include Googlebot Smartphone, care simulează un utilizator pe mobil, și Googlebot Desktop, care simulează un utilizator pe desktop. Pentru majoritatea site-urilor, Google Search indexează în principal versiunea mobilă a conținutului.

Cum funcționează Googlebot

Googlebot descoperă URL-uri noi în principal prin linkurile găsite în paginile accesate anterior. Crawlerul solicită paginile și resursele asociate, precum fișierele CSS și JavaScript, pentru ca acel conținut să poată fi luat în considerare la indexare.

Există două tipuri principale: Googlebot Smartphone și Googlebot Desktop. Subtipul poate fi identificat în antetul HTTP user-agent al cererii. Ambele folosesc însă același token de produs în robots.txt. Din acest motiv, nu pot fi controlate separat prin reguli adresate tokenului Googlebot.

Pentru majoritatea site-urilor, Google Search indexează în principal versiunea mobilă. În consecință, cele mai multe cereri Googlebot sunt realizate de crawlerul mobil.

Accesare și control

Googlebot respectă regulile robots.txt pentru accesările automate. Blocarea prin acest fișier oprește crawlingul paginii, dar nu garantează că URL-ul nu va apărea în rezultatele căutării. Pentru a solicita neindexarea unei pagini se folosește directiva noindex. Dacă pagina nu trebuie accesată nici de crawlere, nici de utilizatori neautorizați, este necesară o metodă precum protecția cu parolă.

Googlebot acceptă HTTP/1.1 și HTTP/2. Folosirea HTTP/2 poate reduce consumul de resurse, dar nu oferă un avantaj de clasare specific în Google Search. Crawlerul acceptă și mecanisme de cache HTTP precum ETag și Last-Modified.

Identificarea cererilor reale

Antetul user-agent poate fi falsificat. O cerere nu trebuie considerată autentică doar pentru că se prezintă drept Googlebot. Verificarea se face prin adresa IP sursă, căutare DNS inversă urmată de căutare DNS directă sau compararea IP-ului cu intervalele publicate de Google.

De ce contează în SEO?

Googlebot contează pentru SEO deoarece paginile trebuie să poată fi descoperite și accesate pentru ca informațiile lor să fie luate în considerare la indexare. Linkurile interne, răspunsurile serverului și accesul la resursele necesare influențează posibilitatea crawlerului de a scana site-ul.

O regulă robots.txt configurată greșit poate bloca pagini sau resurse importante. Blocarea crawlingului nu este echivalentă cu eliminarea URL-ului din rezultatele căutării. Pentru controlul indexării trebuie analizată separat folosirea directivei noindex. Blocarea completă a Googlebot afectează Google Search, inclusiv Discover și funcțiile Google Search, precum și produse ca Google Images, Google Video și Google News.

Exemplu

Un magazin online din România observă că paginile categoriilor nu mai sunt accesate de Googlebot. În fișierul robots.txt există regula:

User-agent: Googlebot
Disallow: /categorii/

Regula împiedică Googlebot Smartphone și Googlebot Desktop să acceseze URL-urile din directorul respectiv. Ea nu permite blocarea separată a crawlerului mobil față de cel desktop și nu garantează că URL-urile dispar din rezultatele Google.

Dacă blocarea a fost introdusă accidental, regula trebuie corectată. Dacă obiectivul real este neindexarea paginilor, trebuie analizată folosirea directivei noindex, fără blocarea accesului necesar pentru ca Google să poată vedea directiva.

Cum verifici?

  1. Verifică jurnalele serverului și filtrează cererile care declară Googlebot în antetul HTTP user-agent.
  2. Notează adresa IP sursă a unei cereri suspecte. Nu considera antetul user-agent drept dovadă suficientă.
  3. Rulează o căutare DNS inversă asupra IP-ului cu o unealtă de linie de comandă precum host.
  4. Verifică dacă numele rezultat aparține unui domeniu Google relevant, precum googlebot.com.
  5. Rulează o căutare DNS directă asupra numelui obținut și confirmă că rezultatul este IP-ul inițial din jurnal.
  6. Pentru verificări automate, compară IP-urile cu lista oficială a intervalelor pentru crawlerele comune Google, publicată în format JSON și reprezentată în notație CIDR.
  7. Examinează fișierul robots.txt pentru reguli adresate tokenului Googlebot și verifică dacă directoarele importante sunt blocate accidental.

Ce trebuie să faci?

  1. Permite accesul Googlebot la paginile și resursele care trebuie evaluate pentru Google Search.
  2. Verifică separat obiectivele de crawling, indexare și control al accesului; acestea nu sunt echivalente.
  3. Folosește robots.txt pentru controlul crawlingului și noindex când obiectivul este neindexarea.
  4. Folosește protecție cu parolă dacă resursa nu trebuie accesată nici de crawlere, nici de utilizatori neautorizați.
  5. Verifică autenticitatea cererilor înainte de a bloca un IP care declară că aparține Googlebot.
  6. Configurează mecanismele de cache HTTP, precum ETag și Last-Modified, împreună cu furnizorul de hosting sau CMS.

Greșeli frecvente

  • Blocarea unei pagini în `robots.txt` este confundată cu eliminarea ei din rezultatele Google.
  • Googlebot Smartphone și Googlebot Desktop sunt tratate ca și cum ar putea primi reguli separate prin tokenul Googlebot din `robots.txt`.
  • Orice cerere care declară Googlebot în antetul `user-agent` este considerată autentică fără verificarea IP-ului și a DNS-ului.
  • Este blocat Googlebot când problema reală ține de capacitatea serverului de a gestiona cererile de crawling.

Perspectiva SEO 365

În practica SEO 365, verificăm mai întâi accesul tehnic, regulile robots.txt și răspunsurile serverului. Administrăm crawlingul, indexarea și accesul utilizatorilor ca procese distincte și evităm blocarea Googlebot atunci când obiectivul este neindexarea, deoarece blocarea crawlingului nu împiedică în mod necesar apariția URL-ului în rezultatele căutării.

Întrebări frecvente despre Googlebot

Testează URL-ul cu un instrument de inspecție disponibil pentru proprietarii site-ului, apoi verifică regulile din robots.txt, răspunsul HTTP și eventualele restricții ale serverului. Analizează și jurnalele de acces pentru cereri către pagina respectivă. Un răspuns 200 indică acces normal, în timp ce erorile 4xx, 5xx sau blocarea resurselor pot împiedica scanarea corectă.

Surse și documentație

Conținut educațional din partea echipei SEO 365, pentru a clarifica terminologia și a ajuta la înțelegerea conceptelor din optimizarea pentru motoarele de căutare. · Ultima verificare a surselor: