Os motores de busca atribuem uma quantidade finita de rastreio a cada site. Num catálogo ou num site com navegação facetada, esse orçamento é habitualmente gasto em URLs quase duplicados enquanto as páginas que lhe interessam esperam. Esta skill descobre para onde vai o orçamento e recupera-o.
QUANDO USAR ISTO
Use quando um site grande tem páginas que ficam semanas sem ser indexadas, ou quando os ficheiros de log mostram os crawlers a gastar o tempo em parâmetros, filtros e paginação em vez das páginas que interessam.
---
name: crawl-budget-audit
description: Use quando um site grande tem páginas que ficam semanas sem ser indexadas, ou quando os ficheiros de log mostram os crawlers a gastar o tempo em parâmetros, filtros e paginação em vez das páginas que interessam.
---
# Auditoria do crawl budget
Os motores de busca atribuem uma quantidade finita de rastreio a cada site. Num catálogo ou num site com navegação facetada, esse orçamento é habitualmente gasto em URLs quase duplicados enquanto as páginas que lhe interessam esperam. Esta skill descobre para onde vai o orçamento e recupera-o.
## O que precisa primeiro
- Logs de acesso do servidor de pelo menos 14 dias, ou as estatísticas de rastreio da Search Console
- Um inventário completo de URLs (sitemap ou exportação de crawl)
- robots.txt
## Método
1. Extraia dos logs os acessos de rastreio por padrão de URL, agrupando por segmento de caminho e por parâmetro de query, e não por URL individual.
2. Ordene os padrões pela quota do total de acessos de rastreio. Tudo acima de 5% que não seja uma página que quer posicionar é uma fuga.
3. Para cada fuga, decida o instrumento correcto: Disallow no robots.txt para URLs que nunca devem ser obtidos, canonical para duplicados que têm de continuar acessíveis, noindex para páginas que têm de ser rastreadas mas não listadas, e regras de parâmetros só onde os três primeiros não servem.
4. Procure armadilhas de rastreio: calendários infinitos, IDs de sessão nos URLs, ordenações que geram combinações sem limite.
5. Compare a frequência de rastreio com as datas de última modificação. As páginas que mudam muitas vezes mas são rastreadas raramente precisam de melhor ligação interna, não de uma directiva.
6. Volte a medir passados 14 dias e confirme que a quota recuperada foi parar às páginas que pretendia.
## O que isto produz
Uma tabela ordenada de fugas de rastreio com a directiva concreta a aplicar a cada uma, mais uma comparação antes/depois da quota de rastreio gasta nas páginas que geram receita.
## Onde isto corre mal
- Bloquear no robots.txt um URL que já recebe links - mantém a sua equity mas deixa de a poder transmitir
- Usar noindex em páginas cujo rastreio também bloqueou, pelo que o noindex nunca é visto
- Tratar o crawl budget como um problema num site de 200 páginas, onde quase nunca é
---
Da biblioteca de competências da QuQi - https://www.quqi.io/pt/skills/crawl-budget-audit
Transferência gratuita · sem conta, sem e-mail
Uma tabela ordenada de fugas de rastreio com a directiva concreta a aplicar a cada uma, mais uma comparação antes/depois da quota de rastreio gasta nas páginas que geram receita.