Bonjour à nouveau. Maintenant que nous vous avons présenté les plans de site, discutons d'une autre méthode pour contrôler comment les moteurs de recherche explorent votre site web et découvrent de nouveaux contenus. Le fichier robots.txt est un protocole qui vous permet de spécifier quelles pages doivent ou ne doivent pas être indexées et de définir le taux d'accès aux fichiers par les robots des moteurs de recherche. Dans cette leçon, nous allons apprendre l'importance de ces fichiers, mais aussi reconnaître leurs limites. En regardant un exemple de fichier robots.txt, nous apprendrons comment créer et placer ces fichiers sur votre site web. Lorsque nous avons discuté des plans de site, nous avons appris que les plans de site sont un fichier d'inclusion. Cela signifie qu'ils indiquent aux moteurs de recherche quelles informations vous souhaitez inclure dans les résultats de recherche. Vous avez également la possibilité d'exclure des pages spécifiques de l'exploration. Vous pouvez le faire via un fichier robots.txt. Le fichier robots.txt est un protocole qui a été créé aux débuts d'Internet pour empêcher les robots d'explorer des zones du Web auxquelles ils n'étaient pas censés accéder. Ce protocole est aujourd'hui souvent simplement appelé robots.txt. Il s'agit d'un fichier texte simple qui peut être téléchargé sur votre serveur. Si un robot souhaite visiter une page sur un site web, disons example.com/bluewidgets. Le robot ira d'abord au fichier robots.txt du site web. Ce fichier sera situé à example.com/robots.txt. Les robots de recherche vérifieront ensuite s'il y a des instructions interdisant l'exploration de cette page. Il est important de noter que bien que les fichiers robots.txt fournissent aux robots des moteurs de recherche vos préférences sur ce qui doit ou ne doit pas être exploré, les robots peuvent choisir d'ignorer les informations dans ce fichier. Les moteurs de recherche comme Google ou [inaudible] ont tendance à respecter ce fichier. Mais les gens créent des robots pour de nombreuses raisons et ces raisons peuvent parfois être malveillantes. Certains robots sont créés pour scanner le web à la recherche de vulnérabilités afin que les gens puissent pirater un site web. D'autres robots explorent des sites web et récoltent des adresses e-mail à vendre à des entreprises ou à des spammeurs. N'oubliez pas également que le fichier robots.txt est un fichier accessible au public, ce qui signifie que tout le monde peut voir quelles sections de votre serveur vous ne souhaitez pas que les robots accèdent. Par exemple, nous pouvons consulter le fichier robots.txt du site Web de l'UC Davis Extension. Si vous allez sur extension.ucdavis.edu/robots.txt ou robots.txt, vous pouvez voir à quoi ressemble leur fichier robots.txt. Si vous jetez un œil à leur fichier, vous verrez plusieurs zones différentes qui fournissent des informations clés aux robots d'exploration des moteurs de recherche. La première est le texte d'introduction qui explique ce qu'est le fichier robots.txt. Cette information n'est pas nécessaire, mais de nombreux systèmes de gestion de contenu de sites web incluent cette information par défaut. Vous verrez également ici que le fichier indique que ces instructions seront ignorées à moins qu'elles ne soient placées à la racine de votre hôte. Cela signifie que vous devez toujours accéder au fichier robots.txt d'un site à l'adresse example.com/robots.txt. S'il est placé ailleurs sur le site, comme example.com/site/robots.txt, il sera ignoré. Sous cette zone, vous verrez des instructions spécifiques. Par exemple, User-agent spécifie quels agents utilisateurs doivent explorer le contenu du site web. Par exemple, vous pouvez définir des instructions spécifiques pour Google, Bing ou Yahoo. La plupart du temps, cependant, il n'y a pas vraiment de raison de le faire. L'astérisque fonctionne comme un caractère générique et signifie que tous les robots doivent suivre les instructions ci-dessous. Le délai d'exploration définit combien de secondes un robot doit attendre avant d'accéder à une nouvelle page de votre site. Cela peut aider à prévenir la surcharge des ressources du serveur, ce qui pourrait faire planter votre site web. Le symbole dièse ou hashtag est utilisé pour faire une note. C'est pour que les humains puissent lire et n'est pas lu par les robots. Dans cet exemple, c'est une note du webmaster pour se rappeler ou rappeler à d'autres webmasters que les éléments ci-dessous sont des répertoires spécifiques du site. La directive disallow indique aux robots de ne pas explorer le contenu qu'elle référence. Par exemple, ne pas explorer le répertoire/includes. Maintenant que nous savons ce que signifient les directives astérisque et disallow, si nous voulions exclure les robots d'accéder à l'ensemble de notre site, nous entrerions simplement les instructions User-agent, suivies d'un astérisque. Ensuite, sur une nouvelle ligne, nous entrerions "Disallow", suivi d'un slash. Si nous voulions permettre aux robots un accès complet au site, nous laisserions simplement le champ disallow vide. Par exemple, vous entreriez simplement User-agent suivi d'un astérisque ou caractère générique, puis sur une nouvelle ligne taperiez Disallow sans inclure d'informations après cela. Vous pourriez également simplement ne pas utiliser de fichier robots.txt, ce qui rendrait automatiquement toutes les informations publiques. Vous devriez maintenant comprendre à quoi sert un fichier robots.txt, comment créer et lire un fichier robots.txt ainsi que l'endroit où ces informations doivent être placées sur votre serveur.