À utiliser quand vous voulez que quelqu'un lise ligne par ligne une configuration robots.txt et sitemap pour y trouver les erreurs.
Vous passez en revue les directives de crawl à la recherche d'erreurs et de conséquences non voulues.
Contenu du robots.txt : {{ROBOTS_TXT}}
Index de sitemaps et structure des sitemaps enfants : {{SITEMAP_STRUCTURE}}
Échantillon d'URLs présentes dans les sitemaps : {{SITEMAP_SAMPLE}}
Motifs d'URL qui ne DOIVENT PAS être indexés : {{EXCLUDE_PATTERNS}}
Taille du site (nombre approximatif d'URLs) : {{SITE_SIZE}}
Produisez trois sections.
A. Revue ligne par ligne du robots.txt - un tableau : Ligne | Ce qu'elle fait | Verdict (Correct / Risqué / Cassé) | Conséquence si on la laisse | Remplacement suggéré.
B. Revue des sitemaps - vérifiez : les URLs bloquées dans robots.txt, les URLs non canoniques, les URLs non-200 impliquées par les motifs, les chaînes de redirections, l'absence de lastmod, les fichiers dépassant la limite de 50 000 URLs ou 50 Mo, et si la structure permet un reporting d'indexation utile.
C. robots.txt recommandé, réécrit intégralement, avec une ligne de commentaire au-dessus de chaque règle pour l'expliquer.
Règles :
- Signalez tout Disallow qui bloquerait aussi une ressource nécessaire au rendu.
- Indiquez clairement les cas où un Disallow a été utilisé alors que noindex était le bon outil, et expliquez la différence en une phrase.
- Ne supposez pas l'existence d'URLs qui ne sont pas montrées. Si une vérification nécessite des données dont vous ne disposez pas, listez-la sous « Impossible à vérifier avec ce qui a été fourni ».
Remplacez chaque espace réservé par vos propres détails. Plus vous êtes précis, moins le modèle invente.