Hola de nuevo. Ahora que te hemos presentado los mapas del sitio, hablemos de otro método para controlar cómo los motores de búsqueda rastrean tu sitio web y descubren nuevo contenido. El archivo robots.txt es un protocolo que te permite especificar qué páginas deben o no ser indexadas y establecer la tasa a la que los robots de los motores de búsqueda acceden a los archivos. En esta lección, aprenderemos sobre la importancia de estos archivos, pero también reconoceremos sus limitaciones. Al observar un ejemplo de archivo robots.txt, aprenderemos cómo crear y colocar estos archivos en tu sitio web. Cuando discutimos los mapas del sitio, aprendimos que los Sitemaps son un archivo inclusivo. Esto significa que le dicen a los motores de búsqueda qué información deseas incluir en los resultados de búsqueda. También tienes la capacidad de excluir páginas específicas de ser rastreadas. Puedes hacer esto a través de un archivo robots.txt. El archivo robots.txt es un protocolo que se creó en los primeros días de Internet para evitar que los robots rastreen áreas de la Web a las que no debían acceder. Ese protocolo hoy en día se conoce simplemente como robots.txt. Este es un archivo de texto simple que se puede subir a tu servidor. Si un robot quiere visitar una página en un sitio web, digamos example.com/bluewidgets. El robot primero irá al archivo robots.txt del sitio web. Este archivo estará ubicado en example.com/robots.txt. Los robots de búsqueda luego verificarán si hay instrucciones que prohíban rastrear esa página. Es importante señalar que, aunque los archivos robots.txt proporcionan a los bots de los motores de búsqueda tus preferencias sobre lo que debe o no ser rastreado, los robots pueden optar por ignorar la información en este archivo. Motores de búsqueda como Google o [inaudible] tienden a respetar este archivo. Pero las personas crean robots por muchas razones y estas razones a veces pueden ser maliciosas. Algunos robots se crean para escanear la web en busca de vulnerabilidades para que las personas puedan hackear el sitio web de alguien. Otros robots rastrean sitios web y recopilan direcciones de correo electrónico para venderlas a empresas o spammers. También recuerda que robots.txt es un archivo de acceso público, lo que significa que cualquiera puede ver qué secciones de tu servidor no deseas que los robots accedan. Por ejemplo, podemos ver el archivo robots.txt del sitio web de UC Davis Extension. Si vas a extension.ucdavis.edu/robots.txt o robots.txt, puedes ver cómo se ve su archivo robots.txt. Si echas un vistazo a su archivo, verás un par de áreas diferentes que proporcionan información clave a los rastreadores de motores de búsqueda. Primero está el texto introductorio que explica qué es el archivo robots.txt. Esta información no es necesaria, pero muchos sistemas de gestión de contenido de sitios web incluyen esta información por defecto. También verás aquí que el archivo señala que estas instrucciones serán ignoradas a menos que se coloquen en la raíz de tu host. Esto significa que siempre accedes al archivo robots.txt de un sitio en example.com/robots.txt. Si se coloca en cualquier otro lugar del sitio, como example.com/site/robots.txt, será ignorado. Debajo de esa área, verás instrucciones específicas. Por ejemplo, User-agent especifica qué agentes de usuario deben rastrear el contenido del sitio web. Por ejemplo, puedes configurar instrucciones específicas para Google, Bing o Yahoo. La mayoría de las veces, sin embargo, no hay una razón real para hacerlo. El asterisco funciona como un comodín y significa que todos los robots deben seguir las instrucciones a continuación. El crawl delay establece cuántos segundos debe esperar un robot antes de acceder a una nueva página en tu sitio. Esto puede ayudar a prevenir la sobrecarga de recursos del servidor, lo que podría hacer que tu sitio web se caiga. El símbolo de número o hashtag se utiliza para hacer una nota. Esto es para que los humanos lo lean y no es leído por los robots. En este ejemplo, es una nota del webmaster para recordarle a sí mismo u otros webmasters que los elementos a continuación son directorios específicos del sitio. La directiva disallow instruye a los robots a no rastrear el contenido al que se refiere. Por ejemplo, no rastrear el directorio/includes. Ahora que sabemos qué significan el asterisco y las directivas disallow, si quisiéramos excluir a los robots de acceder a todo nuestro sitio, simplemente ingresaríamos las instrucciones User-agent, seguidas de un asterisco. Luego, en una nueva línea, ingresaríamos "Disallow", seguido de una barra inclinada. Si quisiéramos permitir a los robots acceso completo al sitio, simplemente dejaríamos el campo disallow en blanco. Por ejemplo, simplemente ingresarías User-agent seguido de un asterisco o comodín, y luego en una nueva línea escribirías Disallow y no incluirías ninguna información después de eso. También podrías simplemente no usar un archivo robots.txt, lo que hará que toda la información sea automáticamente pública. Ahora deberías entender para qué se utiliza un archivo robots.txt, cómo crear y leer un archivo robots.txt, así como dónde debe colocarse esta información en tu servidor.