Les moteurs de recherche allouent une quantité de crawl finie à chaque site. Sur un catalogue ou un site à navigation à facettes, ce budget part systématiquement dans des URL quasi dupliquées pendant que les pages qui vous intéressent attendent. Cette compétence identifie où part le budget et le récupère.
QUAND S’EN SERVIR
À utiliser lorsqu'un grand site comporte des pages qui restent hors index pendant des semaines, ou lorsque les fichiers de logs montrent que les robots passent leur temps sur des paramètres, des filtres et de la pagination plutôt que sur les pages qui comptent.
---
name: crawl-budget-audit
description: À utiliser lorsqu'un grand site comporte des pages qui restent hors index pendant des semaines, ou lorsque les fichiers de logs montrent que les robots passent leur temps sur des paramètres, des filtres et de la pagination plutôt que sur les pages qui comptent.
---
# Audit du budget de crawl
Les moteurs de recherche allouent une quantité de crawl finie à chaque site. Sur un catalogue ou un site à navigation à facettes, ce budget part systématiquement dans des URL quasi dupliquées pendant que les pages qui vous intéressent attendent. Cette compétence identifie où part le budget et le récupère.
## Ce qu’il vous faut d’abord
- Les logs serveur sur au moins 14 jours, ou les statistiques d'exploration de la Search Console
- Un inventaire complet des URL (sitemap ou export de crawl)
- robots.txt
## Méthode
1. Extrayez des logs le nombre de hits de crawl par motif d'URL, en regroupant par segment de chemin et par paramètre de requête plutôt que par URL individuelle.
2. Classez les motifs par part du total des hits de crawl. Tout ce qui dépasse 5 % et qui n'est pas une page que vous voulez positionner est une fuite.
3. Pour chaque fuite, choisissez le bon instrument : Disallow dans robots.txt pour les URL qui ne doivent jamais être récupérées, canonical pour les doublons qui doivent rester accessibles, noindex pour les pages qui doivent être crawlées mais pas listées, et les règles de paramètres uniquement là où les trois premiers ne conviennent pas.
4. Cherchez les pièges à crawl : calendriers infinis, identifiants de session dans les URL, ordres de tri qui génèrent des combinaisons illimitées.
5. Comparez la fréquence de crawl aux dates de dernière modification. Les pages qui changent souvent mais sont crawlées rarement ont besoin d'un meilleur maillage interne, pas d'une directive.
6. Remesurez après 14 jours et vérifiez que la part récupérée s'est bien reportée sur les pages visées.
## Ce que ça produit
Un tableau classé des fuites de crawl avec la directive précise à appliquer à chacune, plus une comparaison avant/après de la part de crawl consacrée aux pages génératrices de revenus.
## Là où ça dérape
- Bloquer dans robots.txt une URL qui reçoit déjà des liens — elle conserve son capital mais ne peut plus le transmettre
- Utiliser noindex sur des pages dont vous avez aussi bloqué le crawl, si bien que le noindex n'est jamais vu
- Traiter le budget de crawl comme un problème sur un site de 200 pages, où il ne l'est presque jamais
---
Extrait de la bibliothèque de compétences QuQi - https://www.quqi.io/fr/skills/crawl-budget-audit
Téléchargement gratuit · sans compte, sans e-mail
Un tableau classé des fuites de crawl avec la directive précise à appliquer à chacune, plus une comparaison avant/après de la part de crawl consacrée aux pages génératrices de revenus.