QuQi

Auditoria do crawl budget

Os motores de busca atribuem uma quantidade finita de rastreio a cada site. Num catálogo ou num site com navegação facetada, esse orçamento é habitualmente gasto em URLs quase duplicados enquanto as páginas que lhe interessam esperam. Esta skill descobre para onde vai o orçamento e recupera-o.

Obter o ficheiro da competência Deixe os agentes tratar disso
CATEGORIA
SEO técnico
FORMATO
crawl-budget-audit.md
PASSOS
6
PREÇO
Grátis — sem conta
QUANDO USAR ISTO

Use quando um site grande tem páginas que ficam semanas sem ser indexadas, ou quando os ficheiros de log mostram os crawlers a gastar o tempo em parâmetros, filtros e paginação em vez das páginas que interessam.

O ficheiro da competência

crawl-budget-audit.md
---
name: crawl-budget-audit
description: Use quando um site grande tem páginas que ficam semanas sem ser indexadas, ou quando os ficheiros de log mostram os crawlers a gastar o tempo em parâmetros, filtros e paginação em vez das páginas que interessam.
---

# Auditoria do crawl budget

Os motores de busca atribuem uma quantidade finita de rastreio a cada site. Num catálogo ou num site com navegação facetada, esse orçamento é habitualmente gasto em URLs quase duplicados enquanto as páginas que lhe interessam esperam. Esta skill descobre para onde vai o orçamento e recupera-o.

## O que precisa primeiro

- Logs de acesso do servidor de pelo menos 14 dias, ou as estatísticas de rastreio da Search Console
- Um inventário completo de URLs (sitemap ou exportação de crawl)
- robots.txt

## Método

1. Extraia dos logs os acessos de rastreio por padrão de URL, agrupando por segmento de caminho e por parâmetro de query, e não por URL individual.
2. Ordene os padrões pela quota do total de acessos de rastreio. Tudo acima de 5% que não seja uma página que quer posicionar é uma fuga.
3. Para cada fuga, decida o instrumento correcto: Disallow no robots.txt para URLs que nunca devem ser obtidos, canonical para duplicados que têm de continuar acessíveis, noindex para páginas que têm de ser rastreadas mas não listadas, e regras de parâmetros só onde os três primeiros não servem.
4. Procure armadilhas de rastreio: calendários infinitos, IDs de sessão nos URLs, ordenações que geram combinações sem limite.
5. Compare a frequência de rastreio com as datas de última modificação. As páginas que mudam muitas vezes mas são rastreadas raramente precisam de melhor ligação interna, não de uma directiva.
6. Volte a medir passados 14 dias e confirme que a quota recuperada foi parar às páginas que pretendia.

## O que isto produz

Uma tabela ordenada de fugas de rastreio com a directiva concreta a aplicar a cada uma, mais uma comparação antes/depois da quota de rastreio gasta nas páginas que geram receita.

## Onde isto corre mal

- Bloquear no robots.txt um URL que já recebe links - mantém a sua equity mas deixa de a poder transmitir
- Usar noindex em páginas cujo rastreio também bloqueou, pelo que o noindex nunca é visto
- Tratar o crawl budget como um problema num site de 200 páginas, onde quase nunca é

---

Da biblioteca de competências da QuQi - https://www.quqi.io/pt/skills/crawl-budget-audit
Transferência gratuita · sem conta, sem e-mail

O que precisa primeiro

  • Logs de acesso do servidor de pelo menos 14 dias, ou as estatísticas de rastreio da Search Console
  • Um inventário completo de URLs (sitemap ou exportação de crawl)
  • robots.txt

Método

  1. 01 Extraia dos logs os acessos de rastreio por padrão de URL, agrupando por segmento de caminho e por parâmetro de query, e não por URL individual.
  2. 02 Ordene os padrões pela quota do total de acessos de rastreio. Tudo acima de 5% que não seja uma página que quer posicionar é uma fuga.
  3. 03 Para cada fuga, decida o instrumento correcto: Disallow no robots.txt para URLs que nunca devem ser obtidos, canonical para duplicados que têm de continuar acessíveis, noindex para páginas que têm de ser rastreadas mas não listadas, e regras de parâmetros só onde os três primeiros não servem.
  4. 04 Procure armadilhas de rastreio: calendários infinitos, IDs de sessão nos URLs, ordenações que geram combinações sem limite.
  5. 05 Compare a frequência de rastreio com as datas de última modificação. As páginas que mudam muitas vezes mas são rastreadas raramente precisam de melhor ligação interna, não de uma directiva.
  6. 06 Volte a medir passados 14 dias e confirme que a quota recuperada foi parar às páginas que pretendia.

O que isto produz

Uma tabela ordenada de fugas de rastreio com a directiva concreta a aplicar a cada uma, mais uma comparação antes/depois da quota de rastreio gasta nas páginas que geram receita.

Onde isto corre mal

  • Bloquear no robots.txt um URL que já recebe links - mantém a sua equity mas deixa de a poder transmitir
  • Usar noindex em páginas cujo rastreio também bloqueou, pelo que o noindex nunca é visto
  • Tratar o crawl budget como um problema num site de 200 páginas, onde quase nunca é

Mais em SEO técnico