Contrôle du crawl de la navigation à facettes
Les combinaisons de filtres se multiplient : cinq facettes avec six valeurs chacune produisent plus d'URL que vous n'avez de produits. Le correctif évident, des balises canonical pointant vers la catégorie nue, échoue parce que le canonical est un indice, pas une directive, et que Google doit tout de même explorer chaque URL pour le lire. Le budget est consommé avant même que le signal ne soit vu. Il faut empêcher la découverte des URL, pas seulement les dédupliquer après coup.
À utiliser lorsqu'une catégorie de quelques centaines de produits a généré des dizaines de milliers d'URL de filtres explorables et que les statistiques de crawl montrent que Googlebot y dépense son budget.
Le fichier de compétence
Ce qu’il vous faut d’abord
- la liste complète des paramètres de facettes et la façon dont ils se combinent dans les URL
- des données de logs serveur ou les statistiques de crawl de Search Console montrant quelles URL à paramètres sont explorées
- les données de demande de recherche par valeur de facette (couleur, taille, marque, prix)
Méthode
- 01 Exportez 30 jours de logs serveur et comptez les hits de Googlebot par motif d'URL. Dès que les URL à paramètres dépassent 30 pour cent du crawl total, le problème est actif, pas théorique.
- 02 Répartissez les facettes en trois niveaux : indexables (valeurs de facettes avec une réelle demande de recherche, généralement la marque, la matière et une poignée de termes d'attribut), explorables mais en noindex, et jamais liées.
- 03 Pour le niveau jamais lié, affichez les contrôles de filtre sous forme de formulaires POST ou d'un état piloté en JavaScript qui ne produit aucune balise ancre, Google ne peut pas suivre ce qui n'est pas un href. C'est le seul confinement fiable.
- 04 Donnez aux facettes indexables des chemins statiques propres, pas des chaînes de requête : /bottes/impermeables/ plutôt que /bottes?feature=impermeable. Les chemins statiques sont traités comme de vraies pages et supportent leur propre contenu et leurs liens internes.
- 05 Bloquez les motifs de paramètres restants dans robots.txt seulement une fois que plus rien d'indexé n'en dépend, et vérifiez d'abord avec une commande site:, bloquer une URL indexée la fige dans l'index sans moyen de la retirer.
- 06 Plafonnez la profondeur de multi-sélection : autorisez une facette sélectionnée, mettez-en deux en noindex, et refusez de générer un lien à trois. Recontrôlez les logs à 30 jours pour confirmer que la part de crawl des paramètres a baissé.
Ce que ça produit
Un document de politique de facettes par niveaux, plus les modifications de gabarits qui empêchent purement et simplement les combinaisons non indexables d'être liées.
Là où ça dérape
- se reposer sur le seul rel=canonical, qui coûte tout de même un crawl par URL et se fait ignorer quand le contenu de la page diffère
- bloquer des paramètres dans robots.txt alors que ces URL sont encore indexées, ce qui supprime le signal canonical et les laisse coincées
- indexer les facettes de prix et de tri, qui changent en permanence et produisent des pages quasi dupliquées et pauvres, sans aucune demande de recherche
Utiliser cette compétence dans votre propre IA
Le fichier téléchargé est un simple markdown dont l'en-tête porte le nom et le déclencheur. Quand un assistant sait charger des compétences tout seul, c'est cet en-tête qu'il lit pour décider que celle-ci s'applique.
Plus dans SEO e-commerce
Contenu de page catégorie qui se positionne
À utiliser lorsque les pages catégories stagnent en positions 8 à 20 sur leur terme principal et...
Descriptions produits à grande échelle
À utiliser lorsque vous avez des milliers de références sous contenu fourni par le fabricant et...
Produits en rupture et arrêtés
À utiliser lorsque des produits passent en rupture de stock ou sont arrêtés et que vous devez dé...
Un schema produit qui décroche des fiches
À utiliser lorsque les pages produits sont valides dans le test des résultats enrichis mais n'af...