Hallo nochmal. Jetzt, da wir Ihnen Sitemaps vorgestellt haben, wollen wir eine weitere Methode besprechen, um zu steuern, wie Suchmaschinen Ihre Website durchsuchen und neue Inhalte entdecken. Die robots.txt-Datei ist ein Protokoll, das es Ihnen ermöglicht, anzugeben, welche Seiten indexiert werden sollen und welche nicht, sowie die Rate festzulegen, mit der Dateien von Suchmaschinenrobotern abgerufen werden. In dieser Lektion werden wir die Bedeutung dieser Dateien kennenlernen, aber auch ihre Einschränkungen erkennen. Anhand eines Beispiels einer robots.txt-Datei werden wir lernen, wie man diese Dateien erstellt und an der richtigen Stelle auf Ihrer Website platziert. Als wir gerade über Sitemaps gesprochen haben, haben wir gelernt, dass Sitemaps eine inklusive Datei sind. Das bedeutet, sie informieren Suchmaschinen, welche Informationen Sie in den Suchergebnissen haben möchten. Sie haben auch die Möglichkeit, bestimmte Seiten vom Crawlen auszuschließen. Dies können Sie über eine robots.txt-Datei tun. Die robots.txt-Datei ist ein Protokoll, das in den frühen Tagen des Internets erstellt wurde, um zu verhindern, dass Roboter Bereiche des Webs durchsuchen, auf die sie nicht zugreifen sollten. Dieses Protokoll wird heute oft einfach als robots.txt bezeichnet. Dies ist eine einfache Textdatei, die auf Ihren Server hochgeladen werden kann. Wenn ein Roboter eine Seite auf einer Website besuchen möchte, sagen wir example.com/bluewidgets, wird der Roboter zuerst zur robots.txt-Datei der Website gehen. Diese Datei befindet sich unter example.com/robots.txt. Suchroboter überprüfen dann, ob es Anweisungen gibt, die ihnen das Crawlen dieser Seite verbieten. Es ist wichtig zu beachten, dass, während robots.txt-Dateien den Suchmaschinenbots Ihre Präferenzen für das Crawlen mitteilen, Roboter die Informationen in dieser Datei ignorieren können. Suchmaschinen wie Google oder [unverständlich] respektieren diese Datei in der Regel. Aber Menschen erstellen Roboter aus vielen Gründen, und diese Gründe können manchmal böswillig sein. Einige Roboter werden erstellt, um das Web nach Schwachstellen zu scannen, damit Menschen in die Website einer Person hacken können. Andere Roboter durchsuchen Websites und sammeln E-Mail-Adressen, um sie an Unternehmen oder Spammer zu verkaufen. Denken Sie auch daran, dass die robots.txt-Datei eine öffentlich zugängliche Datei ist, was bedeutet, dass jeder sehen kann, auf welche Bereiche Ihres Servers Sie nicht möchten, dass Roboter zugreifen. Zum Beispiel können wir die robots.txt-Datei der Website der UC Davis Extension einsehen. Wenn Sie zu extension.ucdavis.edu/robots.txt oder robots.txt gehen, können Sie sehen, wie ihre robots.txt-Datei aussieht. Wenn Sie sich ihre Datei ansehen, werden Sie einige verschiedene Bereiche sehen, die wichtige Informationen für Suchmaschinen-Crawler bereitstellen. Zuerst gibt es den einführenden Text, der erklärt, was die robots.txt-Datei ist. Diese Informationen sind nicht notwendig, aber viele Content-Management-Systeme für Websites fügen diese Informationen standardmäßig hinzu. Sie werden auch hier sehen, dass die Datei darauf hinweist, dass diese Anweisungen ignoriert werden, es sei denn, sie befindet sich im Stammverzeichnis Ihres Hosts. Das bedeutet, dass Sie immer auf die robots.txt-Datei einer Website unter example.com/robots.txt zugreifen. Wenn sie an einem anderen Ort auf der Website platziert ist, wie z.B. example.com/site/robots.txt, wird sie ignoriert. Unter diesem Bereich sehen Sie spezifische Anweisungen. Zum Beispiel gibt der User-agent an, welche Benutzeragenten den Inhalt der Website crawlen sollen. Zum Beispiel können Sie spezifische Anweisungen für Google, Bing oder Yahoo festlegen. In den meisten Fällen gibt es jedoch keinen wirklichen Grund, dies zu tun. Das Sternchen fungiert als Platzhalter und bedeutet, dass alle Roboter den folgenden Anweisungen folgen sollen. Die Crawl-Verzögerung legt fest, wie viele Sekunden ein Roboter warten soll, bevor er auf eine neue Seite Ihrer Website zugreift. Dies kann helfen, eine Überlastung der Serverressourcen zu verhindern, die Ihre Website zum Absturz bringen könnte. Das Rautezeichen oder Hashtag wird verwendet, um eine Notiz zu machen. Dies ist für Menschen zum Lesen gedacht und wird von Robotern nicht gelesen. In diesem Beispiel ist es eine Notiz des Webmasters, um sich selbst oder anderen Webmastern zu erinnern, dass die folgenden Elemente spezifische Verzeichnisse der Website sind. Die Disallow-Direktive weist Roboter an, den Inhalt, auf den sie sich bezieht, nicht zu crawlen. Zum Beispiel, crawlen Sie nicht das Verzeichnis/includes. Jetzt, da wir wissen, was das Sternchen und die Disallow-Direktiven bedeuten, wenn wir Roboter daran hindern möchten, auf unsere gesamte Website zuzugreifen, würden wir einfach die Anweisungen User-agent gefolgt von einem Sternchen eingeben. Dann würden wir in einer neuen Zeile "Disallow" gefolgt von einem Schrägstrich eingeben. Wenn wir Robotern vollständigen Zugriff auf die Website gewähren möchten, würden wir einfach das Disallow-Feld leer lassen. Zum Beispiel würden Sie einfach User-agent gefolgt von einem Sternchen oder Platzhalter eingeben und dann in einer neuen Zeile Disallow eingeben und keine Informationen danach hinzufügen. Sie könnten auch einfach keine robots.txt-Datei verwenden, was automatisch alle Informationen öffentlich macht. Sie sollten jetzt verstehen, wofür eine robots.txt-Datei verwendet wird, wie man eine robots.txt-Datei erstellt und liest sowie wo diese Informationen auf Ihrem Server platziert werden sollten.