#seo #robotstxt #aem
robots.txt-Datei in AEM konfigurieren
Die robots.txt ist eine Textdatei, die Webmaster erstellen, um Webrobotern Anweisungen zu geben, wie sie Seiten auf ihrer Website crawlen sollen. Die robots.txt-Datei ist Teil des Robots Exclusion Protocol (REP), einer Gruppe von Webstandards, die regeln, wie Roboter das Web crawlen, auf Inhalte zugreifen und diese indizieren sowie den Nutzern bereitstellen.
In der Praxis geben robots.txt-Dateien an, ob bestimmte User Agents (Web-Crawling-Software) Teile einer Website crawlen dürfen oder nicht. Diese Crawlanweisungen werden durch das „Disallow“ oder „Allow“ des Verhaltens bestimmter (oder aller) User Agents festgelegt.
Die robots.txt-Datei muss im Hauptverzeichnis einer Website platziert werden.
Einige User Agents (Roboter) können entscheiden, Ihre robots.txt-Datei zu ignorieren. Dies ist besonders häufig bei Crawlern wie Malware-Robotern oder E-Mail-Adressen-Scrapern.
Jede Subdomain auf einer Root-Domain verwendet separate robots.txt-Dateien. Das bedeutet, dass sowohl blog.example.com als auch example.com ihre eigenen robots.txt-Dateien haben sollten.
Es ist allgemein eine bewährte Praxis, den Standort aller mit dieser Domain verbundenen Sitemaps am Ende der robots.txt-Datei anzugeben.
robots.txt-Dateien steuern den Zugriff von Crawlern auf bestimmte Bereiche Ihrer Website.
Lassen Sie uns die Elemente der robots.txt betrachten.
User-agent: Der spezifische Web-Crawler, dem Sie Crawlanweisungen geben.
Disallow - Der Befehl, um einem User-Agent zu sagen, dass er eine bestimmte URL nicht crawlen soll. Es ist nur eine „Disallow:“-Zeile für jede URL erlaubt.
Allow (nur anwendbar für Googlebot): Der Befehl, um Googlebot zu sagen, dass er auf eine Seite oder ein Unterverzeichnis zugreifen kann, auch wenn die übergeordnete Seite oder das Unterverzeichnis möglicherweise nicht erlaubt ist.
Crawl-delay: Wie viele Sekunden ein Crawler warten sollte, bevor er den Seiteninhalt lädt und crawlt. Beachten Sie, dass Googlebot diesen Befehl nicht anerkennt, aber die Crawling-Rate in der Google Search Console festgelegt werden kann.
Sitemap: Wird verwendet, um den Standort aller mit dieser URL verbundenen XML-Sitemaps anzugeben. Beachten Sie, dass dieser Befehl nur von Google, Ask, Bing und Yahoo unterstützt wird.
Einige häufige Verwendungen von robots.txt
Verhindern von doppeltem Inhalt in den Suchergebnissen
Halten ganzer Abschnitte einer Website privat
Verhindern, dass interne Suchergebnisse auf einer öffentlichen SERP angezeigt werden
Verhindern, dass Suchmaschinen bestimmte Dateien auf Ihrer Website indizieren
Festlegen einer Crawling-Verzögerung, um zu verhindern, dass Ihre Server überlastet werden, wenn Crawler mehrere Inhalte gleichzeitig laden (in Textdokument)
Wenn es keine Bereiche auf Ihrer Website gibt, für die Sie den Zugriff von User Agents steuern möchten, benötigen Sie möglicherweise überhaupt keine robots.txt-Datei.
Bitte beachten Sie, dass die robots.txt nicht garantiert, dass die Seiten von der Indizierung ausgeschlossen werden. Die Seiten werden indiziert, auch wenn sie in der robots.txt als nicht erlaubt angegeben sind, falls die Seiten von anderen Websites verlinkt sind. In diesem Fall verwenden Sie das Meta-Robots-Tag, um für die erforderlichen Seiten noindex anzugeben.
Lassen Sie uns nun sehen, wie man robots.txt in AEM aktiviert.
Als einfacher Schritt können Sie einfach eine robots.txt-Datei im Stammverzeichnis der Website erstellen und die erforderlichen Regeln aktivieren. Dies ist einfach, aber die Verwaltung der Datei für eine größere Anzahl von Domains wird herausfordernd sein.
Im Falle von allgemeinen Änderungen an der robots.txt-Datei sollten alle einzelnen robots.txt-Dateien der Websites individuell geändert werden, um die Änderungen widerzuspiegeln.
Dies kann vermieden werden, indem globale und standortspezifische robots.txt-Dateien erstellt und die tatsächliche Datei über ein Servlet bereitgestellt wird.