Crawling

Cunoscut și ca: crawl, scanare
Ce este procesul de crawling?
Pe scurt
Crawling-ul este procesul prin care programe automate, numite crawlere, descoperă și scanează pagini web. În Google Search, Googlebot accesează URL-uri și descarcă textul, imaginile și videoclipurile disponibile. Crawling-ul precedă indexarea, dar accesarea unei pagini nu garantează că aceasta va fi indexată sau afișată în rezultatele căutării.
Cum funcționează crawling-ul
Crawling-ul este prima etapă descrisă de Google pentru funcționarea motorului său de căutare. Googlebot, crawlerul Google, caută pagini noi sau actualizate și descarcă resursele pe care le poate accesa. Un crawler mai este numit robot, bot sau spider.
Google poate descoperi un URL printr-un link de pe o pagină cunoscută sau printr-un sitemap. După descoperire, Googlebot poate vizita pagina pentru a afla ce conține. Nu toate URL-urile descoperite sunt accesate.
În timpul crawling-ului, Google poate reda pagina și executa JavaScript folosind o versiune recentă de Chrome. Randarea contează atunci când textul sau alte elemente importante sunt încărcate prin JavaScript. Dacă resursele necesare sunt blocate, crawlerului îi poate fi mai greu să înțeleagă pagina.
Crawling-ul nu este indexare
După crawling urmează indexarea. În această etapă, Google analizează conținutul, imaginile, videoclipurile și elemente precum titlul sau atributele alt. O pagină accesată nu este indexată automat. Google nu garantează crawling-ul, indexarea sau afișarea unei pagini în rezultate.
Ce poate limita accesarea
Crawling-ul depinde de disponibilitatea site-ului. Problemele de server, erorile de rețea și regulile din robots.txt pot împiedica accesul Googlebot. Paginile protejate prin autentificare nu sunt accesibile crawlerului fără autentificare.
Google stabilește algoritmic ce site-uri accesează, cât de des și câte pagini preia. Sistemele încearcă să nu suprasolicite serverul. Răspunsurile lente, erorile HTTP 5xx și semnalele HTTP 429 pot determina reducerea activității de crawling.
De ce contează în SEO?
Rolul în SEO clasic
Crawling-ul face posibilă preluarea conținutului înainte ca Google să îl analizeze pentru indexare. Dacă Googlebot nu poate accesa o pagină sau resursele necesare randării, conținutul poate să nu fie procesat corect. Accesibilitatea tehnică nu garantează însă indexarea sau poziționarea în rezultatele căutării.
Legăturile interne și sitemap-ul ajută Google să descopere URL-uri noi sau actualizate. În schimb, lanțurile lungi de redirecționări, erorile de server, paginile soft 404 și inventarele mari de URL-uri duplicate pot reduce eficiența crawling-ului. Pentru site-urile foarte mari sau actualizate frecvent, gestionarea crawl budget-ului poate deveni relevantă.
Fișierul robots.txt controlează accesul crawlerelor la URL-uri, dar nu trebuie folosit ca metodă de eliminare sigură a unei pagini din Google. Un URL blocat poate apărea în rezultate dacă este descoperit prin alte legături.
Vizibilitatea în sistemele bazate pe IA
Extrasele disponibile descriu funcționarea crawlerelor Google Search și nu susțin afirmații despre mecanismele altor sisteme sau produse bazate pe inteligență artificială. Accesul unui crawler poate fi tratat drept o condiție tehnică de acces, nu drept o garanție că un conținut va fi preluat, citat sau afișat. GEO este un termen de industrie, nu o funcție Google.
Exemplu
Un magazin online românesc publică o categorie nouă, „Biciclete electrice”, și o include în meniul principal și în sitemap. Google poate descoperi URL-ul prin legătura internă sau prin sitemap, apoi Googlebot îl poate accesa și poate descărca textul și imaginile.
Dacă URL-ul este blocat accidental în robots.txt, Googlebot nu poate scana conținutul paginii. Dacă blocarea este eliminată și serverul răspunde corect, pagina poate fi accesată ulterior. Acest lucru nu garantează că pagina va fi indexată sau afișată pentru o anumită căutare.
Cum verifici?
- Deschide URL-ul și verifică dacă pagina este accesibilă fără autentificare.
- Verifică fișierul
robots.txtal domeniului și caută reguli care blochează pagina sau resursele necesare randării. - Folosește instrumentul de inspectare a URL-ului din Google Search Console pentru a verifica informațiile disponibile despre URL.
- În Google Search Console, deschide Property settings > Crawl stats. Verifică starea gazdei, răspunsurile serverului, tipurile de fișiere și exemplele de URL-uri accesate.
- Consultă raportul Page Indexing pentru erori soft 404 și URL-uri descoperite, dar neindexate.
- Verifică logurile serverului pentru cereri atribuite Googlebot. Confirmă identitatea crawlerului prin user-agent, adresa IP sursă și reverse DNS, conform documentației Google.
- Verifică răspunsurile HTTP pentru erori 5xx, semnale 429, redirecționări inutile și pagini eliminate care nu returnează 404 sau 410.
Ce trebuie să faci?
- Menține sitemap-ul actualizat și include URL-urile pe care vrei ca Google să le acceseze.
- Creează legături interne către paginile importante.
- Permite accesul la resursele necesare pentru afișarea și înțelegerea conținutului.
- Corectează problemele de server, DNS și conectivitate care împiedică Googlebot.
- Elimină lanțurile lungi de redirecționări și erorile soft 404.
- Consolidează conținutul duplicat și limitează inventarul de URL-uri neimportante.
- Folosește
robots.txtpentru administrarea accesului crawlerelor, nu pentru ascunderea sigură a paginilor din rezultate. - Pentru paginile eliminate definitiv, returnează un cod HTTP 404 sau 410.
Greșeli frecvente
- Crawling-ul este confundat cu indexarea, deși sunt etape distincte.
- Fișierul robots.txt este folosit pentru ascunderea paginilor din Google, deși un URL blocat poate apărea în rezultate.
- Sunt blocate fișiere JavaScript sau CSS necesare pentru randarea și înțelegerea paginii.
- Erorile de server și răspunsurile lente sunt ignorate, deși pot reduce activitatea Googlebot.
- Sitemap-ul conține URL-uri eliminate, duplicate sau care nu ar trebui accesate.
Perspectiva SEO 365
Verificăm accesibilitatea tehnică înaintea intervențiilor asupra conținutului. Urmărim ca paginile importante să poată fi descoperite, accesate și randate fără blocaje. Evităm folosirea fișierului robots.txt ca substitut pentru controlul indexării.