#seo #robots
Robots.txt est un fichier texte qui indique aux robots d'exploration quels fichiers ou URL du site ne doivent pas être explorés. Ainsi, robots.txt est appelé protocole d'exclusion de site, contrairement à sitemap.xml qui est appelé protocole d'inclusion de site, car il indique aux robots d'exploration d'explorer des URL spécifiques.
Robots.txt se trouve dans le dossier racine du site nommé « robots.txt » en minuscules. Si ce fichier n'est pas trouvé, alors les robots d'exploration exploreront toutes les URL et fichiers.
Mais pourquoi auriez-vous besoin de cacher les URL ou fichiers aux robots d'exploration ? La réponse est qu'il existe des robots d'exploration indésirables dont vous souhaitez cacher votre site. Ou il y a des fichiers qui sont en mode développement que vous ne voulez pas montrer tant que le développement n'est pas terminé. Ou parfois, il y a certains sites pour lesquels il y a des panneaux d'administration pour gérer les données qui ne devraient pas être accessibles au public. Donc, cela ne devrait pas être exploré.
Maintenant, nous allons voir comment empêcher certaines zones du site d'être explorées. Pour cela, vous devrez apprendre à écrire robots.txt.
Il y a 5 directives utilisées dans robots.txt : User-agent, disallow, allow, crawl-delay et sitemap.
Dans la directive User-agent, vous pouvez définir le nom de l'agent utilisateur pour lequel la règle doit s'appliquer. Par exemple, Googlebot, Bingbot, etc. Si vous souhaitez appliquer la règle à tous les agents utilisateurs, vous pouvez simplement mettre le symbole *. Vous pouvez spécifier plusieurs agents utilisateurs avec des règles différentes pour chaque agent utilisateur. Ou si vous avez la même règle pour plusieurs agents utilisateurs, vous pouvez donner cette directive plusieurs fois avec une directive Disallow. Vous pouvez télécharger la liste des mauvais agents utilisateurs et les interdire dans votre robots.txt.
Dans la directive Disallow, vous pouvez spécifier les dossiers ou fichiers que vous souhaitez interdire. Vous pouvez avoir plusieurs directives disallow pour un agent utilisateur. Vous pouvez également utiliser des entrées génériques. Par exemple, si vous souhaitez interdire toutes les URL se terminant par .pdf, vous devez spécifier la directive disallow comme *.pdf$. Veuillez noter que si vous spécifiez une entrée sans le signe $, cela interdira toutes les URL contenant .pdf et non les URL se terminant par .pdf. Par exemple, cela cachera également ticket.pdf?id=123. Donc, si vous souhaitez cacher vos fichiers de documentation ou de données d'être recherchés, vous pouvez utiliser cette entrée générique. Par exemple, vous pouvez cacher vos fichiers Excel et Word avec *.xls$ et *.doc$.
Si vous souhaitez autoriser un fichier ou un répertoire spécifique à partir d'un répertoire interdit, vous pouvez utiliser la directive allow. Par exemple, si vous souhaitez interdire tous les fichiers du répertoire banners sauf homebanner.jpg, vous pouvez spécifier des directives comme ceci. Veuillez noter que dans ce cas, vous devez mentionner la directive allow avant la directive disallow.
Dans la directive Crawl-delay, vous pouvez spécifier le nombre de millisecondes qu'un robot d'exploration doit attendre avant de charger et d'explorer le contenu de la page. Étant donné que cette valeur ne fait pas partie de la norme, son interprétation dépend du robot d'exploration qui la lit.
Dans la directive Sitemap, vous devez spécifier l'URL absolue de votre sitemap.xml. Veuillez noter que cette directive est écrite indépendamment. Elle n'est pas écrite avec la directive User-agent. Cette directive doit être écrite à la fin du fichier. Vous pouvez avoir plusieurs directives sitemap si vous avez plusieurs sitemaps pour votre site.
Parmi ces 5 directives, User-agent et Disallow sont les directives principales. Les autres directives sont optionnelles.
Lors de l'écriture de robots.txt, vous pouvez ajouter des commentaires dans le fichier pour votre compréhension. Les commentaires commencent par le symbole ‘#’ et peuvent être écrits au début de la ligne ou après la directive.
N'oubliez pas que vous devez enregistrer robots.txt dans le répertoire racine de votre site et si vous avez un sous-domaine, vous devez garder un robots.txt séparé pour celui-ci. De plus, chaque protocole et port a besoin de son propre fichier robots.txt. Par exemple,
http://www.example.com/, https://www.example.com/ et
http://example.com:8080/ auraient des fichiers robots.txt séparés.