#seo #robotstxt #aem
Configurer le fichier robots.txt dans AEM
Le fichier robots.txt est un fichier texte que les webmasters créent pour indiquer aux robots d'exploration comment parcourir les pages de leur site web. Le fichier robots.txt fait partie du protocole d'exclusion des robots (REP), un ensemble de normes web qui régulent la manière dont les robots explorent le web, accèdent et indexent le contenu, et servent ce contenu aux utilisateurs.
En pratique, les fichiers robots.txt indiquent si certains agents utilisateurs (logiciels d'exploration web) peuvent ou non explorer certaines parties d'un site web. Ces instructions d'exploration sont spécifiées en « interdisant » ou « autorisant » le comportement de certains (ou de tous) agents utilisateurs.
Le fichier robots.txt doit être placé dans le répertoire racine d'un site web.
Certains agents utilisateurs (robots) peuvent choisir d'ignorer votre fichier robots.txt. Cela est particulièrement courant avec des crawlers comme les robots malveillants ou les collecteurs d'adresses e-mail.
Chaque sous-domaine sur un domaine racine utilise des fichiers robots.txt séparés. Cela signifie que blog.example.com et example.com doivent avoir leurs propres fichiers robots.txt.
Il est généralement recommandé d'indiquer l'emplacement de tous les sitemaps associés à ce domaine en bas du fichier robots.txt.
Les fichiers robots.txt contrôlent l'accès des crawlers à certaines zones de votre site.
Voyons les éléments du robots.txt.
User-agent : Le crawler web spécifique auquel vous donnez des instructions d'exploration.
Disallow - La commande utilisée pour indiquer à un agent utilisateur de ne pas explorer une URL particulière. Une seule ligne « Disallow : » est autorisée pour chaque URL.
Allow (Applicable uniquement pour Googlebot) : La commande pour indiquer à Googlebot qu'il peut accéder à une page ou un sous-dossier même si sa page ou son sous-dossier parent peut être interdit.
Crawl-delay : Combien de secondes un crawler doit attendre avant de charger et d'explorer le contenu de la page. Notez que Googlebot ne reconnaît pas cette commande, mais le taux d'exploration peut être réglé dans Google Search Console.
Sitemap : Utilisé pour indiquer l'emplacement de tout ou partie des sitemaps XML associés à cette URL. Notez que cette commande n'est prise en charge que par Google, Ask, Bing et Yahoo.
Quelques utilisations courantes de Robots.txt
Prévenir l'apparition de contenu dupliqué dans les pages de résultats de recherche.
Garder des sections entières d'un site web privées.
Empêcher l'affichage des pages de résultats de recherche internes sur un SERP public.
Empêcher les moteurs de recherche d'indexer certains fichiers sur votre site web.
Spécifier un délai d'exploration afin d'éviter que vos serveurs ne soient surchargés lorsque les crawlers chargent plusieurs contenus à la fois (dans un document texte).
S'il n'y a pas de zones sur votre site pour lesquelles vous souhaitez contrôler l'accès des agents utilisateurs, vous n'avez peut-être pas besoin d'un fichier robots.txt.
Veuillez noter que le robots.txt ne garantit pas que les pages seront exclues de l'indexation, les pages sont indexées même si elles sont interdites dans le robots.txt si elles sont liées depuis d'autres sites. Dans ce cas, utilisez la balise meta robots pour spécifier noindex pour les pages requises.
Voyons maintenant comment activer robots.txt dans AEM.
En tant qu'étape simple, vous pouvez simplement créer un fichier robots.txt dans le chemin racine du site web et activer les règles requises, c'est simple mais gérer le fichier pour un grand nombre de domaines sera un défi.
En cas de modifications communes au fichier robots.txt, tous les fichiers robots.txt des sites individuels doivent être modifiés individuellement pour refléter les changements.
Cela peut être évité en créant des fichiers robots.txt globaux et spécifiques au site et en servant le fichier réel via un servlet.