Module 2 – Collecte d'informations. Section 2.4 : Robot d'exploration / Araignée.
Un robot d'exploration :
• Également appelé araignée / fourmi ou indexeur automatique ou scanneur web, est un bot Internet qui parcourt le World Wide Web, copie toutes les pages dans le but d'indexation web, de visualisation hors ligne.
L'exploration est le processus de navigation sur Internet pour obtenir les informations requises sur la cible.
– Les sites explorés peuvent inclure le site web de la cible, des blogs et des réseaux sociaux.
– Googlebot de Google, Bingbot de Bing explorent les sites et indexent les pages web.
– Les robots d'exploration à usage général sont :
Politiques de comportement des robots d'exploration :
– Politique de sélection
– Politique de réexamen
– Politique de courtoisie
– Politique de parallélisation
Exploration web - sécurité
– Le classement dans les moteurs de recherche est possible en permettant aux araignées des moteurs de recherche d'explorer et d'indexer les sites web.
– Le fichier Robots.txt doit être configuré pour exclure certaines pages pour une meilleure sécurité.
Identification des robots d'exploration / contre-mesures
– Surveiller les journaux du serveur web pour savoir qui explore
– Arrêter les robots d'exploration non identifiés, malveillants et les spambots.
Exploration du deep web
• Le protocole Sitemaps de Google et mod oai sont destinés à permettre la découverte des ressources du deep web (pages dynamiques)
• Googlebot : L'exploration web se fait sur tout le texte contenu dans le contenu hypertexte, les balises, ou le texte a href="URL"
Robots d'exploration - usage général
• Googlebot de Google
• Bingbot de Microsoft
• WebCrawler
• WebFountain par IBM
• World Wide Web Worm (WWWW) - inactif
• Yahoo! Slurp
• D'autres incluent FAST Crawler, Polybot, RBSE et Swiftbot, etc.
Robots d'exploration – open source
• Apache Nutch HTTrack
• Scrapy PHP-Crawler
• GNU Wget GRUB
• Heritrix mnoGoSearch
• news-please Open Search Server
• Sphinx ht://Dig
• D'autres incluent Frontera, Seeks, StormCrawler, Xapian, YaCy, Octoparse, etc.
Apache Nutch est un robot d'exploration / récupérateur web hautement extensible et évolutif.
• Robuste et évolutif – Nutch peut fonctionner sur un cluster.
• Il est basé sur Apache Hadoop.
• Recherche Creative Commons implémentée.
• Écrit en Java.
• Nutch est un robot d'exploration web bien mature, prêt pour la production.
WebCrawler est un moteur de méta-recherche qui mélange les meilleurs résultats de recherche de Google Search et Yahoo! Search.
• WebCrawler est une marque déposée d'InfoSpace, Inc.
PHP-Crawler est un script d'exploration open-source basé sur PHP et MySQL. Créé pour mettre en œuvre une recherche de site web local aussi simple que possible, il est devenu populaire pour les petits sites web sur hébergement partagé.
HTTrack est un robot d'exploration web gratuit et open source et un navigateur hors ligne, développé par Xavier Roche et est un utilitaire de navigateur hors ligne gratuit et facile à utiliser.
Fonctionnalités de HTTrack
- Permet aux utilisateurs de télécharger/mirroiter des sites web du World Wide Web depuis Internet vers un ordinateur local.
- sous licence GNU GPLv3
- Organise le site téléchargé selon la structure de lien relative du site d'origine.
- Met à jour un site mirroité existant et reprend les téléchargements interrompus.
- Configurable par options et par filtres (inclure/exclure).
- Il existe une version de ligne de commande de base pour utiliser des scripts et des tâches cron.
- Deux versions GUI disponibles (WinHTTrack et WebHTTrack)
- WinHTTrack est la version Windows (de Windows 2000 à Windows 10 et plus) de HTTrack, et WebHTTrack la version Linux/Unix/BSD.
Peut suivre les liens simples générés avec javascript et à l'intérieur des applets & flash.
Scrapy est un framework open source et collaboratif pour extraire les données dont vous avez besoin à partir de sites web.