Consultanță Gratuită →
SEO 365 — agenție SEO și AI Search

Crawl Budget

EN: Crawl BudgetSEO tehnic
Captură din Glosarul SEO 365 pentru Crawl Budget (SEO tehnic): Crawl Budget este setul de URL-uri pe care
Crawl Budget — ilustrație din Glosarul SEO 365 · SEO tehnic

Cunoscut și ca: buget de crawling, buget de accesare cu crawlere, buget de crawl

Ce este Crawl Budget?

Pe scurt

Crawl Budget este setul de URL-uri pe care Google poate și dorește să le acceseze cu crawlere pe un site. Acesta rezultă din limita capacității de accesare și cererea de accesare. Conceptul este relevant în special pentru site-uri foarte mari, actualizate frecvent sau cu multe URL-uri descoperite, dar neindexate.

Cum definește Google Crawl Budget

Google definește Crawl Budget drept setul de URL-uri pe care sistemele sale pot și doresc să le acceseze cu crawlere. În acest context, un site este identificat printr-un hostname unic. Domeniul principal și un subdomeniu sunt tratate separat și pot avea bugete de accesare distincte.

Crawl Budget este determinat de două elemente: limita capacității de accesare și cererea de accesare.

Limita capacității de accesare

Limita capacității de accesare stabilește cât timp poate menține serverul conexiunile folosite de crawlerele Google. Sunt luate în calcul numărul conexiunilor paralele și durata lor. Scopul este evitarea supraîncărcării serverului.

Limita poate crește când site-ul răspunde constant, iar latența și timpul până la primul octet rămân stabile sau se îmbunătățesc. Poate scădea dacă site-ul încetinește, returnează erori de server din categoria 5xx sau transmite semnale de limitare, precum codul de stare HTTP 429. Resursele proprii ale Google sunt, de asemenea, finite.

Cererea de accesare

Pentru Googlebot, cererea depinde de dimensiunea site-ului, frecvența actualizărilor, calitatea paginilor și relevanța lor în comparație cu alte site-uri. Google ia în calcul și inventarul perceput de URL-uri, popularitatea acestora și nevoia de a reciti documentele pentru a identifica schimbări.

URL-urile duplicate, eliminate sau neimportante pot consuma timp de accesare fără să aducă valoare. De aceea, gestionarea inventarului de URL-uri este principala zonă pe care administratorul site-ului o poate controla. Accesarea nu garantează indexarea. După crawling, fiecare pagină trebuie evaluată și procesată înainte de a putea intra în index.

De ce contează în SEO?

Crawl Budget contează în SEO deoarece crawlingul este prima etapă prin care Google descoperă și descarcă paginile. Dacă Google consumă prea mult timp pe duplicate, sortări, pagini eliminate sau alte URL-uri neimportante, este posibil să nu exploreze eficient restul site-ului.

Problema este relevantă mai ales pentru site-uri mari, site-uri actualizate foarte frecvent și site-uri cu multe URL-uri marcate în Search Console drept descoperite, dar neindexate. Pentru site-urile mai mici, ale căror pagini sunt accesate rapid după publicare, Google indică drept măsuri suficiente menținerea sitemapului actualizat și verificarea raportului Page Indexing.

Optimizarea Crawl Budget nu garantează indexarea sau poziționarea. Google precizează că nu toate paginile accesate sunt indexate și că respectarea Google Search Essentials nu garantează accesarea, indexarea ori afișarea în rezultate.

În privința vizibilității în AI Overviews și AI Mode, extrasele nu stabilesc un efect direct sau o garanție asociată optimizării Crawl Budget. O gestionare corectă poate susține accesarea eficientă a paginilor de către Google, dar nu demonstrează că acestea vor fi incluse în răspunsuri generate de AI. Extrasele descriu infrastructura Google și nu susțin concluzii despre accesarea sau citarea de către ChatGPT, Perplexity ori Gemini.

Exemplu

Un magazin online românesc are categorii de produse cu numeroase variante de sortare. Fiecare sortare generează un URL diferit, deși produsele și informațiile sunt în mare parte aceleași. Magazinul mai păstrează în sitemap produse eliminate și returnează pagini soft 404 pentru unele adrese vechi.

O abordare corectă ar fi:

  • consolidarea versiunilor duplicate;
  • blocarea prin robots.txt a variantelor de sortare care nu trebuie accesate deloc;
  • eliminarea URL-urilor retrase din sitemap;
  • returnarea codului de stare HTTP 404 sau 410 pentru paginile eliminate definitiv;
  • actualizarea elementului <lastmod> pentru conținutul modificat;
  • eliminarea lanțurilor lungi de redirecționare.

Astfel, Googlebot poate petrece mai puțin timp pe URL-uri fără valoare și poate accesa mai eficient paginile importante. Această optimizare nu garantează că produsele vor fi indexate.

Cum verifici?

  1. Deschide raportul Page Indexing din Google Search Console și caută URL-uri descoperite, dar neindexate, precum și erori soft 404.
  2. Folosește URL Inspection și urmărește eventualele mesaje precum „Hostload exceeded”, legate de capacitatea serverului.
  3. Verifică jurnalele serverului pentru solicitările Googlebot, timpii de răspuns, erorile 5xx și răspunsurile HTTP 429.
  4. Analizează fișierul robots.txt și confirmă că blochează numai paginile sau resursele pe care nu dorești ca Google să le acceseze deloc.
  5. Verifică sitemapurile. Acestea trebuie să includă paginile pe care vrei ca Google să le acceseze și să excludă URL-urile eliminate.
  6. Identifică duplicatele, paginile soft 404 și lanțurile lungi de redirecționare.
  7. Testează răspunsurile serverului și confirmă că paginile eliminate definitiv returnează 404 sau 410.
  8. Verifică suportul pentru răspunsuri HTTP 304 atunci când pagina nu s-a schimbat.

Ce trebuie să faci?

  • Prioritizează inventarierea URL-urilor cunoscute de Google.
  • Consolidează conținutul duplicat și păstrează versiuni canonice clare.
  • Blochează prin robots.txt numai URL-urile pe care nu dorești să fie accesate deloc.
  • Nu folosi noindex ca metodă de economisire a timpului de crawling, deoarece Google trebuie să solicite pagina pentru a vedea directiva.
  • Returnează 404 sau 410 pentru paginile eliminate definitiv.
  • Corectează paginile soft 404.
  • Menține sitemapurile actualizate și folosește corect elementul <lastmod> pentru conținutul modificat.
  • Redu lanțurile de redirecționare.
  • Îmbunătățește stabilitatea serverului, timpul de răspuns și eficiența încărcării paginilor.
  • Folosește răspunsuri HTTP 304 pentru paginile care nu s-au schimbat.

Greșeli frecvente

  • Tratarea Crawl Budget ca pe un factor care garantează indexarea sau poziționarea.
  • Folosirea directivei `noindex` pentru a economisi crawling, deși Google trebuie să acceseze pagina pentru a citi directiva.
  • Blocarea temporară prin `robots.txt` cu presupunerea că resursele eliberate vor fi transferate automat altor pagini.
  • Păstrarea în sitemap a URL-urilor eliminate, duplicate sau neimportante.
  • Ignorarea erorilor soft 404, a răspunsurilor 5xx și a lanțurilor lungi de redirecționare.

Perspectiva SEO 365

Începem prin a verifica inventarul de URL-uri înainte de a modifica serverul sau de a introduce reguli ample în robots.txt. Ne concentrăm pe duplicate, pagini eliminate, soft 404 și sitemapuri neactualizate. Nu prezentăm optimizarea drept o garanție de indexare și nu o aplicăm mecanic unui site care nu are probleme reale de crawling.

Întrebări frecvente despre Crawl Budget

Analizează raportul Page Indexing din Google Search Console, inspecția URL-urilor și jurnalele serverului. Urmărește paginile descoperite, dar neindexate, accesările Googlebot, răspunsurile 5xx sau 429 și timpii mari de răspuns. Verifică și dacă Google accesează frecvent URL-uri duplicate, filtre, sortări, redirecționări sau pagini eliminate.

Surse și documentație

Conținut educațional din partea echipei SEO 365, pentru a clarifica terminologia și a ajuta la înțelegerea conceptelor din optimizarea pentru motoarele de căutare. · Ultima verificare a surselor: