#seo #robots
Robots.txt es un archivo de texto que indica a los rastreadores qué archivos o URLs del sitio no deben ser rastreados. Por lo tanto, robots.txt se llama protocolo de exclusión del sitio, a diferencia de sitemap.xml, que se llama protocolo de inclusión del sitio, porque indica a los rastreadores que rastreen URLs específicas.
Robots.txt se encuentra en la carpeta raíz del sitio con el nombre “robots.txt”, todo en minúsculas. Si este archivo no se encuentra, los rastreadores rastrearán todas las URLs y archivos.
Pero, ¿por qué necesitarías ocultar las URLs o archivos de los rastreadores? La respuesta es que hay algunos rastreadores maliciosos de los que deseas ocultar tu sitio. O hay algunos archivos que están en modo de desarrollo que no deseas mostrar hasta que se complete el desarrollo. O a veces hay ciertos sitios para los cuales hay paneles de administración para gestionar los datos que no deberían estar disponibles para el público. Por lo tanto, no deberían ser rastreados.
Ahora, veremos cómo prevenir que ciertas áreas del sitio sean rastreadas. Para esto, tendrás que aprender a escribir robots.txt.
Hay 5 directivas que se utilizan en robots.txt: User-agent, disallow, allow, crawl-delay y sitemap.
En la directiva User-agent, puedes definir el nombre del agente de usuario al que se aplicará la regla. Por ejemplo, Googlebot, Bingbot, etc. Si deseas aplicar la regla a todos los agentes de usuario, puedes simplemente poner el símbolo *. Puedes especificar múltiples agentes de usuario con diferentes reglas para cada uno. O si tienes la misma regla para múltiples User-agents, puedes dar esta directiva múltiples veces con una directiva Disallow. Puedes descargar la lista de User-agents maliciosos y desautorizarlos en tu robots.txt.
En la directiva Disallow, puedes especificar las carpetas o archivos que deseas desautorizar. Puedes tener múltiples directivas disallow para un User-agent. También puedes usar entradas comodín. Por ejemplo, si deseas desautorizar todas las URLs que terminan en .pdf, entonces debes especificar la directiva disallow como *.pdf$. Ten en cuenta que si especificas una entrada sin el signo $, desautorizará todas las URLs que contengan .pdf y no solo las que terminen en .pdf. Por ejemplo, también ocultará ticket.pdf?id=123. Así que, si deseas ocultar tus documentos o archivos de datos de ser buscados, puedes usar este comodín. Por ejemplo, puedes ocultar tus archivos de excel y word con *.xls$ y *.doc$.
Si deseas permitir un archivo o directorio específico de un directorio desautorizado, entonces puedes usar la directiva allow. Por ejemplo, si deseas desautorizar todos los archivos del directorio banners excepto homebanner.jpg, puedes especificar directivas de esta manera. Ten en cuenta que en este caso debes mencionar la directiva allow antes de la directiva disallow.
En la directiva Crawl-delay, puedes especificar el número de milisegundos que un rastreador debe esperar antes de cargar y rastrear el contenido de la página. Dado que este valor no es parte del estándar, su interpretación depende del rastreador que lo lea.
En la directiva Sitemap, debes especificar la URL absoluta de tu sitemap.xml. Ten en cuenta que esta directiva se escribe de forma independiente. No se escribe junto con la directiva User-agent. Esta directiva debe escribirse al final del archivo. Puedes tener múltiples directivas sitemap si tienes múltiples sitemaps para tu sitio.
De estas 5 directivas, User-agent y Disallow son las directivas principales. Las otras directivas son opcionales.
Al escribir robots.txt, puedes agregar comentarios en el archivo para tu comprensión. Los comentarios comienzan con el símbolo ‘#’ y se pueden escribir al inicio de la línea o después de la directiva.