Audit du budget de crawl
Les moteurs de recherche allouent une quantité de crawl finie à chaque site. Sur un catalogue ou un site à navigation à facettes, ce budget part systématiquement dans des URL quasi dupliquées pendant que les pages qui vous intéressent attendent. Cette compétence identifie où part le budget et le récupère.
À utiliser lorsqu'un grand site comporte des pages qui restent hors index pendant des semaines, ou lorsque les fichiers de logs montrent que les robots passent leur temps sur des paramètres, des filtres et de la pagination plutôt que sur les pages qui comptent.
Le fichier de compétence
Ce qu’il vous faut d’abord
- Les logs serveur sur au moins 14 jours, ou les statistiques d'exploration de la Search Console
- Un inventaire complet des URL (sitemap ou export de crawl)
- robots.txt
Méthode
- 01 Extrayez des logs le nombre de hits de crawl par motif d'URL, en regroupant par segment de chemin et par paramètre de requête plutôt que par URL individuelle.
- 02 Classez les motifs par part du total des hits de crawl. Tout ce qui dépasse 5 % et qui n'est pas une page que vous voulez positionner est une fuite.
- 03 Pour chaque fuite, choisissez le bon instrument : Disallow dans robots.txt pour les URL qui ne doivent jamais être récupérées, canonical pour les doublons qui doivent rester accessibles, noindex pour les pages qui doivent être crawlées mais pas listées, et les règles de paramètres uniquement là où les trois premiers ne conviennent pas.
- 04 Cherchez les pièges à crawl : calendriers infinis, identifiants de session dans les URL, ordres de tri qui génèrent des combinaisons illimitées.
- 05 Comparez la fréquence de crawl aux dates de dernière modification. Les pages qui changent souvent mais sont crawlées rarement ont besoin d'un meilleur maillage interne, pas d'une directive.
- 06 Remesurez après 14 jours et vérifiez que la part récupérée s'est bien reportée sur les pages visées.
Ce que ça produit
Un tableau classé des fuites de crawl avec la directive précise à appliquer à chacune, plus une comparaison avant/après de la part de crawl consacrée aux pages génératrices de revenus.
Là où ça dérape
- Bloquer dans robots.txt une URL qui reçoit déjà des liens, elle conserve son capital mais ne peut plus le transmettre
- Utiliser noindex sur des pages dont vous avez aussi bloqué le crawl, si bien que le noindex n'est jamais vu
- Traiter le budget de crawl comme un problème sur un site de 200 pages, où il ne l'est presque jamais
Utiliser cette compétence dans votre propre IA
Le fichier téléchargé est un simple markdown dont l'en-tête porte le nom et le déclencheur. Quand un assistant sait charger des compétences tout seul, c'est cet en-tête qu'il lit pour décider que celle-ci s'applique.
Plus dans SEO technique
Analyse des écarts d'indexation
À utiliser lorsque le nombre de pages que vous publiez et le nombre de pages indexées par Google...
Triage des Core Web Vitals
À utiliser lorsque les données terrain montrent un LCP, un INP ou un CLS en échec et que vous de...
Contrôle du rendu JavaScript
À utiliser lorsqu'un site rend son contenu côté client et que vous devez confirmer que les moteu...
Nettoyage des chaînes de redirection
À utiliser après une migration, un changement de domaine, ou dès qu'un crawl signale des redirec...