Módulo 2 – Footprinting. Sección 2.4: Rastreador web / Spider.
Un rastreador web:
• También llamado Spider / hormiga o indexador automático o web scutter, es un bot de Internet que navega por la World Wide Web, copia todas las páginas con el propósito de indexación web, visualización offline.
Rastreo es el proceso de navegar por internet para obtener la información requerida sobre el objetivo.
– Los sitios navegados pueden incluir el sitio web del objetivo, blogs y redes sociales.
– Googlebot de Google, Bingbot de Bing rastrean sitios e indexan páginas web.
– Los rastreadores de propósito general son:
Políticas de comportamiento de los rastreadores web:
– Política de selección
– Política de re-visita
– Política de cortesía
– Política de paralelización
Rastreo web - seguridad
– El ranking en motores de búsqueda es posible al permitir que los spiders de motores de búsqueda rastreen e indexen sitios web.
– Robots.txt debe configurarse para excluir ciertas páginas para una mejor seguridad.
Identificación de rastreadores/contramedidas
– Vigilar los registros del servidor web sobre quién está rastreando
– Detener rastreadores no identificados, maliciosos y spambots.
Rastreo de la deep web
• El protocolo de Sitemaps de Google y mod oai están destinados a permitir el descubrimiento de recursos de la deep web (páginas dinámicas)
• Googlebot: El rastreo web se realiza en todo el texto contenido dentro del contenido hipermedia, etiquetas o texto a href="URL"
Rastreadores - propósito general
• Googlebot de Google
• Bingbot de Microsoft
• WebCrawler
• WebFountain de IBM
• World Wide Web Worm (WWWW) - inactivo
• Yahoo! Slurp
• Otros son FAST Crawler, Polybot, RBSE y Swiftbot, etc.
Rastreadores – código abierto
• Apache Nutch HTTrack
• Scrapy PHP-Crawler
• GNU Wget GRUB
• Heritrix mnoGoSearch
• news-please Open Search Server
• Sphinx ht://Dig
• Otros incluyen Frontera, Seeks, StormCrawler, Xapian, YaCy, Octoparse, etc.
Apache Nutch es un rastreador/recuperador web altamente extensible y escalable.
• Robusto y escalable – Nutch puede ejecutarse en un clúster.
• Está basado en Apache Hadoop.
• Búsqueda de Creative Commons implementada.
• Escrito en Java.
• Nutch es un rastreador web bien maduro, listo para producción.
WebCrawler es un motor de metabúsqueda que combina los mejores resultados de búsqueda de Google Search y Yahoo! Search.
• WebCrawler es una marca registrada de InfoSpace, Inc.
PHP-Crawler es un script de rastreo de código abierto basado en PHP y MySQL. Creado para implementar la búsqueda local de sitios web de la manera más simple posible, se volvió popular para pequeños sitios web en hosting compartido.
HTTrack es un rastreador web gratuito y de código abierto y navegador offline, desarrollado por Xavier Roche y es una utilidad de navegador offline gratuita y fácil de usar.
Características de HTTrack
- Permite a los usuarios descargar/mirror sitios web de la World Wide Web desde Internet a una computadora local.
- licenciado bajo la GNU GPLv3
- Organiza el sitio descargado según la estructura de enlaces relativa del sitio original.
- Actualiza un sitio espejo existente y reanuda descargas interrumpidas.
- Configurable por opciones y filtros (incluir/excluir).
- Hay una versión básica de línea de comandos para usar scripts y trabajos cron.
- Dos versiones GUI disponibles (WinHTTrack y WebHTTrack)
- WinHTTrack es la versión de Windows (desde Windows 2000 hasta Windows 10 y superiores) de HTTrack, y WebHTTrack la versión de Linux/Unix/BSD.
Puede seguir los enlaces simples generados con javascript y dentro de applets & flash.
Scrapy es un marco de trabajo de código abierto y colaborativo para extraer los datos que necesitas de sitios web.