Olá novamente. Agora que apresentamos os mapas do site, vamos discutir outro método para controlar como os motores de busca rastreiam seu site e descobrem novo conteúdo. O arquivo robots.txt é um protocolo que permite especificar quais páginas devem ou não ser indexadas e definir a taxa com que os arquivos são acessados pelos robôs dos motores de busca. Nesta lição, aprenderemos sobre a importância desses arquivos, mas também reconheceremos suas limitações. Ao olhar para um exemplo de arquivo robots.txt, aprenderemos como criar e colocar esses arquivos em seu site. Quando discutimos os sitemaps, aprendemos que os Sitemaps são um arquivo de inclusão. Isso significa que eles informam aos motores de busca quais informações você deseja incluir nos resultados de busca. Você também tem a capacidade de excluir páginas específicas de serem rastreadas. Você pode fazer isso através de um arquivo robots.txt. O arquivo robots.txt é um protocolo que foi criado nos primeiros dias da Internet para impedir que robôs rastreassem áreas da Web que não deveriam acessar. Esse protocolo hoje é frequentemente referido simplesmente como robots.txt. Este é um arquivo de texto simples que pode ser carregado em seu servidor. Se um robô quiser visitar uma página em um site, digamos example.com/bluewidgets. O robô primeiro irá ao arquivo robots.txt do site. Este arquivo estará localizado em example.com/robots.txt. Os robôs de busca então verificarão se há instruções proibindo-o de rastrear essa página. É importante notar que, embora os arquivos robots.txt forneçam aos robôs dos motores de busca suas preferências sobre o que deve ou não ser rastreado, os robôs podem optar por ignorar as informações neste arquivo. Motores de busca como Google ou [inaudível] tendem a respeitar este arquivo. Mas as pessoas criam robôs por muitos motivos e esses motivos podem ser, às vezes, maliciosos. Alguns robôs são criados para escanear a web em busca de vulnerabilidades para que as pessoas possam invadir o site de alguém. Outros robôs rastreiam sites e coletam endereços de e-mail para vender a empresas ou spammers. Também lembre-se de que o robots.txt é um arquivo publicamente disponível, o que significa que qualquer um pode ver quais seções do seu servidor você não deseja que os robôs acessem. Por exemplo, podemos visualizar o arquivo robots.txt do site da UC Davis Extension. Se você acessar extension.ucdavis.edu/robots.txt ou robots.txt, poderá ver como é o arquivo robots.txt deles. Se você der uma olhada no arquivo deles, verá algumas áreas diferentes que fornecem informações-chave para os rastreadores de motores de busca. Primeiro, há o texto introdutório que explica o que é o arquivo robots.txt. Essa informação não é necessária, mas muitos sistemas de gerenciamento de conteúdo de sites incluem essa informação por padrão. Você também verá aqui que o arquivo aponta que essas instruções serão ignoradas, a menos que sejam colocadas na raiz do seu host. Isso significa que você sempre acessa o arquivo robots.txt de um site em example.com/robots.txt. Se estiver colocado em qualquer outro lugar no site, como example.com/site/robots.txt, será ignorado. Abaixo dessa área, você verá instruções específicas. Por exemplo, User-agent especifica quais agentes de usuário devem rastrear o conteúdo do site. Por exemplo, você pode configurar instruções específicas para Google, Bing ou Yahoo. Na maioria das vezes, no entanto, não há uma razão real para fazer isso. O asterisco funciona como um curinga e significa que todos os robôs devem seguir as instruções abaixo. O crawl delay define quantos segundos um robô deve esperar antes de acessar uma nova página em seu site. Isso pode ajudar a evitar sobrecarga de recursos do servidor, o que pode travar seu site. O símbolo de libra ou hashtag é usado para fazer uma anotação. Isso é para humanos lerem e não é lido por robôs. Neste exemplo, é uma nota do webmaster para lembrar a si mesmo ou a outros webmasters que os itens abaixo são diretórios específicos do site. A diretiva disallow instrui os robôs a não rastrear o conteúdo que está referenciando. Por exemplo, não rastrear o diretório/includes. Agora que sabemos o que significam o asterisco e as diretivas disallow, se quisermos excluir robôs de acessar todo o nosso site, simplesmente inseriríamos as instruções User-agent, seguidas de um asterisco. Então, em uma nova linha, inseriríamos "Disallow", seguido de uma barra. Se quisermos permitir que os robôs tenham acesso total ao site, simplesmente deixaríamos o campo disallow em branco. Por exemplo, você simplesmente inseriria User-agent seguido de um asterisco ou curinga, e então em uma nova linha digitaria Disallow e não incluiria nenhuma informação após isso. Você também poderia simplesmente não usar um arquivo robots.txt, o que tornaria automaticamente todas as informações públicas. Agora você deve entender para que serve um arquivo robots.txt, como criar e ler um arquivo robots.txt, bem como onde essas informações devem ser colocadas em seu servidor.