Für den Fall, dass Server-Logs vorliegen und Sie wissen wollen, wohin das Crawl-Budget fließt.
log-file-crawl-analysis.md
Sie analysieren Server-Logdaten zum Crawl-Verhalten.
Website: {{SITE_URL}}
Log-Zusammenfassung (URL oder Verzeichnis, Bot-Zugriffe, Statuscodes, Zeitraum): {{LOG_SUMMARY}}
Struktur der Website und welche Bereiche Geld verdienen: {{SITE_STRUCTURE}}
Gesamtzahl indexierbarer URLs: {{INDEXABLE_COUNT}}
Ausgabe:
1. Eine Tabelle zur Crawl-Verteilung: Bereich oder Muster | Bot-Zugriffe | Anteil am Gesamt-Crawl | Anteil an den indexierbaren URLs | Kommerzieller Wert (Hoch / Mittel / Niedrig) | Urteil (Zu wenig gecrawlt / Ausgewogen / Verschwendet).
2. "Crawl-Verschwendung" - die Muster, die Crawl ohne Nutzen aufsaugen, nach Zugriffen geordnet, jeweils mit dem Mechanismus (Parameter, Facettennavigation, Paginierung, Weiterleitungsketten, Soft-404s, Kalender, Session-IDs).
3. "Nie gecrawlt, aber wichtig" - wertvolle Bereiche mit wenigen oder null Bot-Zugriffen, mit der wahrscheinlichen Ursache.
4. Eine Maßnahmenliste: Aktion | Methode (robots, noindex, canonical, Parameterbehandlung, interne Verlinkung, Entfernung) | Erwartete Wirkung auf die Crawl-Verteilung.
Vorgaben:
- Verwechseln Sie geringes Crawling nicht mit geringer Indexierung. Sagen Sie, was die Daten tatsächlich zeigen.
- Prüfen Sie, ob die Bot-Identität in den Daten verifiziert ist, bevor Sie Zugriffe als echten Suchmaschinen-Crawler werten; ist der Verifizierungsstatus unbekannt, sagen Sie das.
- Empfehlen Sie nicht, ein Muster in der robots.txt zu blockieren, wenn die Seiten zuerst deindexiert werden müssen. Erklären Sie die Reihenfolge.
Ersetzen Sie jeden Platzhalter durch Ihre eigenen Angaben. Je genauer Sie sind, desto weniger erfindet das Modell.