QuQi
SEO

Analyse du budget de crawl par les logs

À utiliser quand les logs serveur sont disponibles et que vous voulez savoir où part le budget de crawl.

log-file-crawl-analysis.md
Télécharger le .md
Vous analysez des données de logs serveur pour comprendre le comportement de crawl.

Site : {{SITE_URL}}
Synthèse des logs (URL ou répertoire, hits de bots, codes de statut, plage de dates) : {{LOG_SUMMARY}}
Structure du site et sections qui génèrent du chiffre d'affaires : {{SITE_STRUCTURE}}
Nombre total d'URLs indexables : {{INDEXABLE_COUNT}}

Produisez :
1. Un tableau de répartition du crawl : Section ou motif | Hits de bots | Part du crawl total | Part des URLs indexables | Valeur commerciale (Élevée / Moyenne / Faible) | Verdict (Sous-crawlé / Équilibré / Gaspillé).
2. « Gaspillage de crawl » - les motifs qui absorbent du crawl sans valeur, classés par nombre de hits, chacun avec son mécanisme (paramètres, navigation à facettes, pagination, chaînes de redirections, soft 404, calendriers, identifiants de session).
3. « Jamais crawlé mais important » - les sections à valeur avec peu ou pas de hits de bots, avec la raison probable.
4. Une liste de correctifs : Action | Méthode (robots, noindex, canonical, gestion des paramètres, maillage interne, suppression) | Effet attendu sur la répartition du crawl.

Contraintes :
- Ne confondez pas faible crawl et faible indexation. Dites ce que les données montrent réellement.
- Vérifiez que l'identité des bots est bien renseignée dans les données avant de traiter les hits comme du trafic authentique de robots d'exploration ; si le statut de vérification est inconnu, dites-le.
- Ne recommandez pas de bloquer un motif dans robots.txt si les pages doivent d'abord être désindexées. Expliquez l'ordre à suivre.

À remplir avant de lancer

Remplacez chaque espace réservé par vos propres détails. Plus vous êtes précis, moins le modèle invente.

  • {{SITE_URL}}
  • {{LOG_SUMMARY}}
  • {{SITE_STRUCTURE}}
  • {{INDEXABLE_COUNT}}

Obtenir un meilleur résultat

  1. Agrégez par répertoire ou par motif avant de coller : les lignes de log brutes gaspillent la fenêtre de contexte.
  2. Utilisez au moins 30 jours de logs pour que les cycles hebdomadaires de crawl ne faussent pas le tableau.
  3. Croisez cela avec un rapport d'indexation pour voir quelles sections sous-crawlées manquent réellement à l'index.