---
name: faceted-navigation-crawl-control
description: À utiliser lorsqu'une catégorie de quelques centaines de produits a généré des dizaines de milliers d'URL de filtres explorables et que les statistiques de crawl montrent que Googlebot y dépense son budget.
---

# Contrôle du crawl de la navigation à facettes

Les combinaisons de filtres se multiplient : cinq facettes avec six valeurs chacune produisent plus d'URL que vous n'avez de produits. Le correctif évident — des balises canonical pointant vers la catégorie nue — échoue parce que le canonical est un indice, pas une directive, et que Google doit tout de même explorer chaque URL pour le lire. Le budget est consommé avant même que le signal ne soit vu. Il faut empêcher la découverte des URL, pas seulement les dédupliquer après coup.

## Ce qu’il vous faut d’abord

- la liste complète des paramètres de facettes et la façon dont ils se combinent dans les URL
- des données de logs serveur ou les statistiques de crawl de Search Console montrant quelles URL à paramètres sont explorées
- les données de demande de recherche par valeur de facette (couleur, taille, marque, prix)

## Méthode

1. Exportez 30 jours de logs serveur et comptez les hits de Googlebot par motif d'URL. Dès que les URL à paramètres dépassent 30 pour cent du crawl total, le problème est actif, pas théorique.
2. Répartissez les facettes en trois niveaux : indexables (valeurs de facettes avec une réelle demande de recherche, généralement la marque, la matière et une poignée de termes d'attribut), explorables mais en noindex, et jamais liées.
3. Pour le niveau jamais lié, affichez les contrôles de filtre sous forme de formulaires POST ou d'un état piloté en JavaScript qui ne produit aucune balise ancre — Google ne peut pas suivre ce qui n'est pas un href. C'est le seul confinement fiable.
4. Donnez aux facettes indexables des chemins statiques propres, pas des chaînes de requête : /bottes/impermeables/ plutôt que /bottes?feature=impermeable. Les chemins statiques sont traités comme de vraies pages et supportent leur propre contenu et leurs liens internes.
5. Bloquez les motifs de paramètres restants dans robots.txt seulement une fois que plus rien d'indexé n'en dépend, et vérifiez d'abord avec une commande site: — bloquer une URL indexée la fige dans l'index sans moyen de la retirer.
6. Plafonnez la profondeur de multi-sélection : autorisez une facette sélectionnée, mettez-en deux en noindex, et refusez de générer un lien à trois. Recontrôlez les logs à 30 jours pour confirmer que la part de crawl des paramètres a baissé.

## Ce que ça produit

Un document de politique de facettes par niveaux, plus les modifications de gabarits qui empêchent purement et simplement les combinaisons non indexables d'être liées.

## Là où ça dérape

- se reposer sur le seul rel=canonical, qui coûte tout de même un crawl par URL et se fait ignorer quand le contenu de la page diffère
- bloquer des paramètres dans robots.txt alors que ces URL sont encore indexées, ce qui supprime le signal canonical et les laisse coincées
- indexer les facettes de prix et de tri, qui changent en permanence et produisent des pages quasi dupliquées et pauvres, sans aucune demande de recherche

---

Extrait de la bibliothèque de compétences QuQi - https://www.quqi.io/fr/skills/faceted-navigation-crawl-control
