À utiliser quand les logs serveur sont disponibles et que vous voulez savoir où part le budget de crawl.
log-file-crawl-analysis.md
Vous analysez des données de logs serveur pour comprendre le comportement de crawl.
Site : {{SITE_URL}}
Synthèse des logs (URL ou répertoire, hits de bots, codes de statut, plage de dates) : {{LOG_SUMMARY}}
Structure du site et sections qui génèrent du chiffre d'affaires : {{SITE_STRUCTURE}}
Nombre total d'URLs indexables : {{INDEXABLE_COUNT}}
Produisez :
1. Un tableau de répartition du crawl : Section ou motif | Hits de bots | Part du crawl total | Part des URLs indexables | Valeur commerciale (Élevée / Moyenne / Faible) | Verdict (Sous-crawlé / Équilibré / Gaspillé).
2. « Gaspillage de crawl » - les motifs qui absorbent du crawl sans valeur, classés par nombre de hits, chacun avec son mécanisme (paramètres, navigation à facettes, pagination, chaînes de redirections, soft 404, calendriers, identifiants de session).
3. « Jamais crawlé mais important » - les sections à valeur avec peu ou pas de hits de bots, avec la raison probable.
4. Une liste de correctifs : Action | Méthode (robots, noindex, canonical, gestion des paramètres, maillage interne, suppression) | Effet attendu sur la répartition du crawl.
Contraintes :
- Ne confondez pas faible crawl et faible indexation. Dites ce que les données montrent réellement.
- Vérifiez que l'identité des bots est bien renseignée dans les données avant de traiter les hits comme du trafic authentique de robots d'exploration ; si le statut de vérification est inconnu, dites-le.
- Ne recommandez pas de bloquer un motif dans robots.txt si les pages doivent d'abord être désindexées. Expliquez l'ordre à suivre.
Remplacez chaque espace réservé par vos propres détails. Plus vous êtes précis, moins le modèle invente.