robots.txt
Eine Textdatei im Stammverzeichnis der Website, die Suchmaschinen-Crawlern sagt, welche Bereiche der Website sie nicht crawlen sollen.
- 01
Warum es wichtig ist
robots.txt blockiert das Crawlen von Bereichen, die in der Suche nutzlos sind, etwa Admin-Panels, Warenkorb und interne Suchergebnisseiten, damit Crawler ihre Zeit auf wichtige Seiten verwenden. Sie hält eine Seite jedoch nicht zuverlässig aus dem Index; dafür wird noindex verwendet. Die Datei ist öffentlich.
- 02
Beispiel
Die Adressen eines Shops, die endlose Filterkombinationen erzeugen, fressen die Zeit des Crawlers. Nachdem Regeln, die diese Parameter blockieren, zu robots.txt hinzugefügt wurden, konzentriert sich das Crawling auf Produkt- und Kategorieseiten.
- 03
Häufiger Fehler
Das Blockieren einer Seite, die aus dem Index entfernt werden soll, mit robots.txt. Weil die blockierte Seite nicht gecrawlt werden kann, wird ihr noindex-Tag nie gesehen und die Seite kann im Index bleiben.
- 04
Verwandte Begriffe
Passende Leistungen und Ratgeber
Über Ihr Projekt sprechen.
Erzählen Sie uns Ihren Bedarf; den Umfang klären wir gemeinsam.