Se connecter Commencer gratuitement

Audit du budget de crawl

Les moteurs de recherche allouent une quantité de crawl finie à chaque site. Sur un catalogue ou un site à navigation à facettes, ce budget part systématiquement dans des URL quasi dupliquées pendant que les pages qui vous intéressent attendent. Cette compétence identifie où part le budget et le récupère.

CATÉGORIE
SEO technique
FORMAT
crawl-budget-audit.md
ÉTAPES
6
PRIX
Gratuit — sans compte
QUAND S’EN SERVIR

À utiliser lorsqu'un grand site comporte des pages qui restent hors index pendant des semaines, ou lorsque les fichiers de logs montrent que les robots passent leur temps sur des paramètres, des filtres et de la pagination plutôt que sur les pages qui comptent.

Le fichier de compétence

crawl-budget-audit.md
---
name: crawl-budget-audit
description: À utiliser lorsqu'un grand site comporte des pages qui restent hors index pendant des semaines, ou lorsque les fichiers de logs montrent que les robots passent leur temps sur des paramètres, des filtres et de la pagination plutôt que sur les pages qui comptent.
---

# Audit du budget de crawl

Les moteurs de recherche allouent une quantité de crawl finie à chaque site. Sur un catalogue ou un site à navigation à facettes, ce budget part systématiquement dans des URL quasi dupliquées pendant que les pages qui vous intéressent attendent. Cette compétence identifie où part le budget et le récupère.

## Ce qu’il vous faut d’abord

- Les logs serveur sur au moins 14 jours, ou les statistiques d'exploration de la Search Console
- Un inventaire complet des URL (sitemap ou export de crawl)
- robots.txt

## Méthode

1. Extrayez des logs le nombre de hits de crawl par motif d'URL, en regroupant par segment de chemin et par paramètre de requête plutôt que par URL individuelle.
2. Classez les motifs par part du total des hits de crawl. Tout ce qui dépasse 5 % et qui n'est pas une page que vous voulez positionner est une fuite.
3. Pour chaque fuite, choisissez le bon instrument : Disallow dans robots.txt pour les URL qui ne doivent jamais être récupérées, canonical pour les doublons qui doivent rester accessibles, noindex pour les pages qui doivent être crawlées mais pas listées, et les règles de paramètres uniquement là où les trois premiers ne conviennent pas.
4. Cherchez les pièges à crawl : calendriers infinis, identifiants de session dans les URL, ordres de tri qui génèrent des combinaisons illimitées.
5. Comparez la fréquence de crawl aux dates de dernière modification. Les pages qui changent souvent mais sont crawlées rarement ont besoin d'un meilleur maillage interne, pas d'une directive.
6. Remesurez après 14 jours et vérifiez que la part récupérée s'est bien reportée sur les pages visées.

## Ce que ça produit

Un tableau classé des fuites de crawl avec la directive précise à appliquer à chacune, plus une comparaison avant/après de la part de crawl consacrée aux pages génératrices de revenus.

## Là où ça dérape

- Bloquer dans robots.txt une URL qui reçoit déjà des liens, elle conserve son capital mais ne peut plus le transmettre
- Utiliser noindex sur des pages dont vous avez aussi bloqué le crawl, si bien que le noindex n'est jamais vu
- Traiter le budget de crawl comme un problème sur un site de 200 pages, où il ne l'est presque jamais

---

Extrait de la bibliothèque de compétences QuQi - https://www.quqi.io/fr/skills/crawl-budget-audit
Téléchargement gratuit · sans compte, sans e-mail

Ce qu’il vous faut d’abord

  • Les logs serveur sur au moins 14 jours, ou les statistiques d'exploration de la Search Console
  • Un inventaire complet des URL (sitemap ou export de crawl)
  • robots.txt

Méthode

  1. 01 Extrayez des logs le nombre de hits de crawl par motif d'URL, en regroupant par segment de chemin et par paramètre de requête plutôt que par URL individuelle.
  2. 02 Classez les motifs par part du total des hits de crawl. Tout ce qui dépasse 5 % et qui n'est pas une page que vous voulez positionner est une fuite.
  3. 03 Pour chaque fuite, choisissez le bon instrument : Disallow dans robots.txt pour les URL qui ne doivent jamais être récupérées, canonical pour les doublons qui doivent rester accessibles, noindex pour les pages qui doivent être crawlées mais pas listées, et les règles de paramètres uniquement là où les trois premiers ne conviennent pas.
  4. 04 Cherchez les pièges à crawl : calendriers infinis, identifiants de session dans les URL, ordres de tri qui génèrent des combinaisons illimitées.
  5. 05 Comparez la fréquence de crawl aux dates de dernière modification. Les pages qui changent souvent mais sont crawlées rarement ont besoin d'un meilleur maillage interne, pas d'une directive.
  6. 06 Remesurez après 14 jours et vérifiez que la part récupérée s'est bien reportée sur les pages visées.

Ce que ça produit

Un tableau classé des fuites de crawl avec la directive précise à appliquer à chacune, plus une comparaison avant/après de la part de crawl consacrée aux pages génératrices de revenus.

Là où ça dérape

  • Bloquer dans robots.txt une URL qui reçoit déjà des liens, elle conserve son capital mais ne peut plus le transmettre
  • Utiliser noindex sur des pages dont vous avez aussi bloqué le crawl, si bien que le noindex n'est jamais vu
  • Traiter le budget de crawl comme un problème sur un site de 200 pages, où il ne l'est presque jamais

Utiliser cette compétence dans votre propre IA

Le fichier téléchargé est un simple markdown dont l'en-tête porte le nom et le déclencheur. Quand un assistant sait charger des compétences tout seul, c'est cet en-tête qu'il lit pour décider que celle-ci s'applique.

Claude Code Enregistrez-le sous ~/.claude/skills/crawl-budget-audit/SKILL.md et Claude le charge tout seul dès que ce que vous faites correspond au déclencheur. Placez-le plutôt dans .claude/skills d'un projet si toute l'équipe doit l'avoir.
Claude Importez le fichier dans la section compétences de vos réglages. Une fois là, il s'applique tout seul dans toute conversation où le déclencheur colle, sans que vous ayez à y penser.
ChatGPT Il n'existe pas de format de compétences où l'installer, alors collez le contenu du fichier dans les instructions d'un Projet ou d'un GPT personnalisé. Il s'applique ensuite à toutes les conversations du projet, pas seulement à celle où vous l'avez collé.
Tout le reste Collez le markdown dans la conversation avant votre question. Cela fonctionne avec n'importe quel assistant, il faut simplement le recoller à chaque fois.

Plus dans SEO technique