#seo #robots
Robots.txt é um arquivo de texto que informa aos crawlers quais arquivos ou URLs do site não devem ser rastreados. Assim, o robots.txt é chamado de protocolo de exclusão do site, ao contrário do sitemap.xml, que é chamado de protocolo de inclusão do site, porque informa aos crawlers para rastrear URLs específicas.
O robots.txt está localizado na pasta raiz do site, nomeado como “robots.txt”, tudo em letras minúsculas. Se esse arquivo não for encontrado, os crawlers rastrearão todas as URLs e arquivos.
Mas, por que você precisaria ocultar URLs ou arquivos dos crawlers? A resposta é que existem alguns crawlers indesejados dos quais você deseja esconder seu site. Ou há alguns arquivos que estão em modo de desenvolvimento que você não quer mostrar até que o desenvolvimento esteja concluído. Ou, às vezes, existem certos sites para os quais existem painéis administrativos para gerenciar os dados que não devem estar disponíveis ao público. Portanto, não devem ser rastreados.
Agora, veremos como impedir que certas áreas do site sejam rastreadas. Para isso, você precisará aprender a escrever o robots.txt.
Existem 5 diretrizes que são usadas no robots.txt: User-agent, disallow, allow, crawl-delay e sitemap.
Na diretiva User-agent, você pode definir o nome do agente do usuário para o qual a regra deve ser aplicada. Por exemplo, Googlebot, Bingbot, etc. Se você quiser aplicar a regra para todos os agentes de usuário, pode simplesmente colocar o símbolo *. Você pode especificar múltiplos agentes de usuário com regras diferentes para cada um. Ou, se você tiver a mesma regra para múltiplos User-agents, pode dar essa diretiva várias vezes com uma diretiva Disallow. Você pode baixar a lista de User-agents indesejados e desautorizá-los em seu robots.txt.
Na diretiva Disallow, você pode especificar as pastas ou arquivos que deseja desautorizar. Você pode ter múltiplas diretivas disallow para um User-agent. Você também pode usar entradas curinga. Por exemplo, se você quiser desautorizar todas as URLs que terminam com .pdf, deve especificar a diretiva disallow como *.pdf$. Observe que, se você especificar uma entrada sem o sinal $, ela desautorizará todas as URLs que contêm .pdf e não as URLs que terminam com .pdf. Por exemplo, também ocultará ticket.pdf?id=123. Portanto, se você quiser ocultar sua documentação ou arquivos de dados de serem pesquisados, pode usar esse curinga. Por exemplo, você pode ocultar seus arquivos de excel e word com *.xls$ e *.doc$.
Se você quiser permitir um arquivo ou diretório específico de um diretório desautorizado, pode usar a diretiva allow. Por exemplo, se você quiser desautorizar todos os arquivos do diretório banners, exceto homebanner.jpg, pode especificar diretivas assim. Observe que, neste caso, você deve mencionar a diretiva allow antes da diretiva disallow.
Na diretiva Crawl-delay, você pode especificar o número de milissegundos que um crawler deve esperar antes de carregar e rastrear o conteúdo da página. Como esse valor não faz parte do padrão, sua interpretação depende do crawler que o lê.
Na diretiva Sitemap, você deve especificar a URL absoluta para seu sitemap.xml. Observe que essa diretiva é escrita de forma independente. Não é escrita com a diretiva User-agent. Essa diretiva deve ser escrita no final do arquivo. Você pode ter múltiplas diretivas sitemap se tiver múltiplos sitemaps para seu site.
Dessas 5 diretrizes, User-agent e Disallow são as principais. As outras diretrizes são opcionais.
Ao escrever o robots.txt, você pode adicionar comentários no arquivo para sua compreensão. Os comentários começam com o símbolo ‘#’ e podem ser escritos no início da linha ou após a diretiva.