Módulo 2 – Footprinting. Seção 2.4: Raspador / Spider.
Um Raspador:
• Também chamado de Spider / formiga ou indexador automático ou web scutter, é um bot da Internet que navega na World Wide Web, copiando todas as páginas para fins de indexação na Web, visualização offline.
Raspagem é o processo de navegar na internet para obter as informações necessárias sobre o alvo.
– Os sites navegados podem incluir o site do alvo, blogs e redes sociais.
– Googlebot do Google, Bingbot do Bing raspam sites e indexam páginas da web.
– Raspadores de propósito geral são:
Políticas de comportamento do Raspador:
– Política de seleção
– Política de re-visita
– Política de cortesia
– Política de paralelização
Raspagem da Web - segurança
– A classificação em motores de busca é possível permitindo que os spiders dos motores de busca raspem e indexem websites.
– O arquivo robots.txt deve ser configurado para excluir certas páginas para melhor segurança.
Identificação de raspadores/contramedidas
– Monitorar os logs do servidor web sobre quem está raspando
– Parar raspadores não identificados, maliciosos e spambots.
Raspagem da deep web
• O protocolo Sitemaps do Google e o mod oai têm como objetivo permitir a descoberta de recursos da deep web (páginas dinâmicas)
• Googlebot: A raspagem da web é feita em todo o texto contido dentro do conteúdo hipertexto, tags ou texto a href="URL"
Raspadores - propósito geral
• Googlebot do Google
• Bingbot da Microsoft
• WebCrawler
• WebFountain da IBM
• World Wide Web Worm (WWWW) - inativo
• Yahoo! Slurp
• Outros incluem FAST Crawler, Polybot, RBSE e Swiftbot etc.
Raspadores – código aberto
• Apache Nutch HTTrack
• Scrapy PHP-Crawler
• GNU Wget GRUB
• Heritrix mnoGoSearch
• news-please Open Search Server
• Sphinx ht://Dig
• Outros incluem Frontera, Seeks, StormCrawler, Xapian, YaCy, Octoparse etc.
Apache Nutch é um raspador/buscador da web altamente extensível e escalável.
• Robusto e escalável – Nutch pode rodar em um cluster.
• É baseado no Apache Hadoop.
• Busca Creative Commons implementada.
• Escrito em Java.
• Nutch é um raspador da Web maduro e pronto para produção.
WebCrawler é um mecanismo de metapesquisa que combina os principais resultados de busca do Google Search e Yahoo! Search.
• WebCrawler é uma marca registrada da InfoSpace, Inc.
PHP-Crawler é um script de raspagem de código aberto baseado em PHP e MySQL. Criado para implementar uma busca local em sites da forma mais simples possível, tornou-se popular para pequenos sites em hospedagem compartilhada.
HTTrack é um raspador da Web gratuito e de código aberto e navegador offline, desenvolvido por Xavier Roche e é uma ferramenta de navegador offline gratuita e fácil de usar.
Recursos do HTTrack
- Permite que os usuários baixem/mirrorem sites da World Wide Web da Internet para um computador local.
- licenciado sob a GNU GPLv3
- Organiza o site baixado pela estrutura de links relativa do site original.
- Atualiza um site espelhado existente e retoma downloads interrompidos.
- Configurável por opções e por filtros (incluir/excluir).
- Há uma versão básica de linha de comando para usar scripts e cron jobs
- Duas versões GUI disponíveis (WinHTTrack e WebHTTrack)
- WinHTTrack é a versão para Windows (do Windows 2000 ao Windows 10 e acima) do HTTrack, e WebHTTrack é a versão para Linux/Unix/BSD.
Pode seguir os links simples gerados com javascript e dentro de applets & flash
Scrapy é um framework de código aberto e colaborativo para extrair os dados que você precisa de websites.