Crawl Budget

Cunoscut și ca: buget de crawling, buget de accesare cu crawlere, buget de crawl
Ce este Crawl Budget?
Pe scurt
Crawl Budget este setul de URL-uri pe care Google poate și dorește să le acceseze cu crawlere pe un site. Acesta rezultă din limita capacității de accesare și cererea de accesare. Conceptul este relevant în special pentru site-uri foarte mari, actualizate frecvent sau cu multe URL-uri descoperite, dar neindexate.
Cum definește Google Crawl Budget
Google definește Crawl Budget drept setul de URL-uri pe care sistemele sale pot și doresc să le acceseze cu crawlere. În acest context, un site este identificat printr-un hostname unic. Domeniul principal și un subdomeniu sunt tratate separat și pot avea bugete de accesare distincte.
Crawl Budget este determinat de două elemente: limita capacității de accesare și cererea de accesare.
Limita capacității de accesare
Limita capacității de accesare stabilește cât timp poate menține serverul conexiunile folosite de crawlerele Google. Sunt luate în calcul numărul conexiunilor paralele și durata lor. Scopul este evitarea supraîncărcării serverului.
Limita poate crește când site-ul răspunde constant, iar latența și timpul până la primul octet rămân stabile sau se îmbunătățesc. Poate scădea dacă site-ul încetinește, returnează erori de server din categoria 5xx sau transmite semnale de limitare, precum codul de stare HTTP 429. Resursele proprii ale Google sunt, de asemenea, finite.
Cererea de accesare
Pentru Googlebot, cererea depinde de dimensiunea site-ului, frecvența actualizărilor, calitatea paginilor și relevanța lor în comparație cu alte site-uri. Google ia în calcul și inventarul perceput de URL-uri, popularitatea acestora și nevoia de a reciti documentele pentru a identifica schimbări.
URL-urile duplicate, eliminate sau neimportante pot consuma timp de accesare fără să aducă valoare. De aceea, gestionarea inventarului de URL-uri este principala zonă pe care administratorul site-ului o poate controla. Accesarea nu garantează indexarea. După crawling, fiecare pagină trebuie evaluată și procesată înainte de a putea intra în index.
De ce contează în SEO?
Crawl Budget contează în SEO deoarece crawlingul este prima etapă prin care Google descoperă și descarcă paginile. Dacă Google consumă prea mult timp pe duplicate, sortări, pagini eliminate sau alte URL-uri neimportante, este posibil să nu exploreze eficient restul site-ului.
Problema este relevantă mai ales pentru site-uri mari, site-uri actualizate foarte frecvent și site-uri cu multe URL-uri marcate în Search Console drept descoperite, dar neindexate. Pentru site-urile mai mici, ale căror pagini sunt accesate rapid după publicare, Google indică drept măsuri suficiente menținerea sitemapului actualizat și verificarea raportului Page Indexing.
Optimizarea Crawl Budget nu garantează indexarea sau poziționarea. Google precizează că nu toate paginile accesate sunt indexate și că respectarea Google Search Essentials nu garantează accesarea, indexarea ori afișarea în rezultate.
În privința vizibilității în AI Overviews și AI Mode, extrasele nu stabilesc un efect direct sau o garanție asociată optimizării Crawl Budget. O gestionare corectă poate susține accesarea eficientă a paginilor de către Google, dar nu demonstrează că acestea vor fi incluse în răspunsuri generate de AI. Extrasele descriu infrastructura Google și nu susțin concluzii despre accesarea sau citarea de către ChatGPT, Perplexity ori Gemini.
Exemplu
Un magazin online românesc are categorii de produse cu numeroase variante de sortare. Fiecare sortare generează un URL diferit, deși produsele și informațiile sunt în mare parte aceleași. Magazinul mai păstrează în sitemap produse eliminate și returnează pagini soft 404 pentru unele adrese vechi.
O abordare corectă ar fi:
- consolidarea versiunilor duplicate;
- blocarea prin
robots.txta variantelor de sortare care nu trebuie accesate deloc; - eliminarea URL-urilor retrase din sitemap;
- returnarea codului de stare HTTP 404 sau 410 pentru paginile eliminate definitiv;
- actualizarea elementului
<lastmod>pentru conținutul modificat; - eliminarea lanțurilor lungi de redirecționare.
Astfel, Googlebot poate petrece mai puțin timp pe URL-uri fără valoare și poate accesa mai eficient paginile importante. Această optimizare nu garantează că produsele vor fi indexate.
Cum verifici?
- Deschide raportul Page Indexing din Google Search Console și caută URL-uri descoperite, dar neindexate, precum și erori soft 404.
- Folosește URL Inspection și urmărește eventualele mesaje precum „Hostload exceeded”, legate de capacitatea serverului.
- Verifică jurnalele serverului pentru solicitările Googlebot, timpii de răspuns, erorile 5xx și răspunsurile HTTP 429.
- Analizează fișierul
robots.txtși confirmă că blochează numai paginile sau resursele pe care nu dorești ca Google să le acceseze deloc. - Verifică sitemapurile. Acestea trebuie să includă paginile pe care vrei ca Google să le acceseze și să excludă URL-urile eliminate.
- Identifică duplicatele, paginile soft 404 și lanțurile lungi de redirecționare.
- Testează răspunsurile serverului și confirmă că paginile eliminate definitiv returnează 404 sau 410.
- Verifică suportul pentru răspunsuri HTTP 304 atunci când pagina nu s-a schimbat.
Ce trebuie să faci?
- Prioritizează inventarierea URL-urilor cunoscute de Google.
- Consolidează conținutul duplicat și păstrează versiuni canonice clare.
- Blochează prin
robots.txtnumai URL-urile pe care nu dorești să fie accesate deloc. - Nu folosi
noindexca metodă de economisire a timpului de crawling, deoarece Google trebuie să solicite pagina pentru a vedea directiva. - Returnează 404 sau 410 pentru paginile eliminate definitiv.
- Corectează paginile soft 404.
- Menține sitemapurile actualizate și folosește corect elementul
<lastmod>pentru conținutul modificat. - Redu lanțurile de redirecționare.
- Îmbunătățește stabilitatea serverului, timpul de răspuns și eficiența încărcării paginilor.
- Folosește răspunsuri HTTP 304 pentru paginile care nu s-au schimbat.
Greșeli frecvente
- Tratarea Crawl Budget ca pe un factor care garantează indexarea sau poziționarea.
- Folosirea directivei `noindex` pentru a economisi crawling, deși Google trebuie să acceseze pagina pentru a citi directiva.
- Blocarea temporară prin `robots.txt` cu presupunerea că resursele eliberate vor fi transferate automat altor pagini.
- Păstrarea în sitemap a URL-urilor eliminate, duplicate sau neimportante.
- Ignorarea erorilor soft 404, a răspunsurilor 5xx și a lanțurilor lungi de redirecționare.
Perspectiva SEO 365
Începem prin a verifica inventarul de URL-uri înainte de a modifica serverul sau de a introduce reguli ample în robots.txt. Ne concentrăm pe duplicate, pagini eliminate, soft 404 și sitemapuri neactualizate. Nu prezentăm optimizarea drept o garanție de indexare și nu o aplicăm mecanic unui site care nu are probleme reale de crawling.