#seo #robotstxt #aem
Configurar o arquivo robots.txt no AEM
O robots.txt é um arquivo de texto que os webmasters criam para instruir robôs da web sobre como rastrear páginas em seu site. O arquivo robots.txt faz parte do protocolo de exclusão de robôs (REP), um conjunto de padrões da web que regulam como os robôs rastreiam a web, acessam e indexam conteúdo, e servem esse conteúdo aos usuários.
Na prática, os arquivos robots.txt indicam se certos agentes de usuário (software de rastreamento) podem ou não rastrear partes de um site. Essas instruções de rastreamento são especificadas por meio de “desautorização” ou “autorização” do comportamento de certos (ou todos) agentes de usuário.
O arquivo robots.txt deve ser colocado no diretório de nível superior de um site.
Alguns agentes de usuário (robôs) podem optar por ignorar seu arquivo robots.txt. Isso é especialmente comum com rastreadores como robôs de malware ou raspadores de endereços de e-mail.
Cada subdomínio em um domínio raiz usa arquivos robots.txt separados. Isso significa que tanto blog.exemplo.com quanto exemplo.com devem ter seus próprios arquivos robots.txt.
É geralmente uma boa prática indicar a localização de quaisquer sitemaps associados a este domínio na parte inferior do arquivo robots.txt.
Os arquivos robots.txt controlam o acesso de rastreadores a certas áreas do seu site.
Vamos ver os elementos do robots.txt.
User-agent: O rastreador da web específico para o qual você está dando instruções de rastreamento.
Disallow - O comando usado para dizer a um agente de usuário para não rastrear uma URL específica. Apenas uma linha "Disallow:" é permitida para cada URL.
Allow (aplicável apenas ao Googlebot): O comando para dizer ao Googlebot que ele pode acessar uma página ou subpasta, mesmo que sua página ou subpasta pai possa estar desautorizada.
Crawl-delay: Quantos segundos um rastreador deve esperar antes de carregar e rastrear o conteúdo da página. Observe que o Googlebot não reconhece este comando, mas a taxa de rastreamento pode ser definida no Google Search Console.
Sitemap: Usado para indicar a localização de quaisquer sitemaps XML associados a esta URL. Observe que este comando é suportado apenas pelo Google, Ask, Bing e Yahoo.
Alguns usos comuns do Robots.txt:
Prevenir que conteúdo duplicado apareça nas Páginas de Resultados de Busca.
Manter seções inteiras de um site privadas.
Impedir que páginas de resultados de busca internas apareçam em um SERP público.
Prevenir que motores de busca indexem certos arquivos em seu site.
Especificar um atraso de rastreamento para evitar que seus servidores sejam sobrecarregados quando os rastreadores carregam várias peças de conteúdo ao mesmo tempo (em documento de texto).
Se não houver áreas em seu site nas quais você deseja controlar o acesso do agente de usuário, pode não ser necessário um arquivo robots.txt.
Por favor, note que o robots.txt não garantirá que as páginas sejam excluídas da indexação; as páginas são indexadas mesmo que estejam desautorizadas no robots.txt, caso as páginas estejam vinculadas de outros sites. Nesse caso, use a meta tag robots para especificar noindex para as páginas necessárias.
Vamos ver agora como habilitar o robots.txt no AEM.
Como um passo simples, você pode apenas criar um arquivo robots.txt no caminho raiz do site e habilitar as regras necessárias; isso é simples, mas gerenciar o arquivo para um número maior de domínios será desafiador.
Em caso de quaisquer alterações comuns no arquivo robots.txt, todos os arquivos robots.txt individuais do site devem ser modificados individualmente para refletir as mudanças.
Isso pode ser evitado criando arquivos robots.txt globais e específicos do site e servindo o arquivo real através de um servlet.