Modul 2 – Footprinting. Abschnitt 2.4: Webcrawler / Spider.
Ein Webcrawler:
• Auch bekannt als Spider / Ant oder automatischer Indexer oder Webscutter, ist ein Internet-Bot, der das World Wide Web durchsucht, um alle Seiten zum Zweck der Web-Indexierung und Offline-Anzeige zu kopieren.
Crawling ist der Prozess des Surfens im Internet, um die benötigten Informationen über das Ziel zu erhalten.
– Die besuchten Seiten können die Website des Ziels, Blogs und soziale Netzwerke umfassen.
– Googlebot von Google, Bingbot von Bing crawlen Seiten und indexieren Webseiten.
– Allgemeine Crawler sind:
Verhaltensrichtlinien für Webcrawler:
– Auswahlrichtlinie
– Wiederbesuchsrichtlinie
– Höflichkeitsrichtlinie
– Parallelisierungsrichtlinie
Web Crawling - Sicherheit
– Die Suchmaschinenplatzierung ist möglich, indem man Suchmaschinen-Spider erlaubt, Webseiten zu crawlen und zu indexieren.
– Die robots.txt muss konfiguriert werden, um bestimmte Seiten für eine bessere Sicherheit auszuschließen.
Crawler-Identifikation/Gegenmaßnahmen
– Überwachen Sie die Webserver-Protokolle, um zu sehen, wer crawlt.
– Stoppen Sie nicht identifizierte Crawler, bösartige und Spam-Bots.
Deep Web Crawling
• Das Sitemaps-Protokoll von Google und mod oai sollen die Entdeckung von Deep-Web-Ressourcen (dynamische Seiten) ermöglichen.
• Googlebot: Das Web Crawling erfolgt auf allen Texten, die im Hypertext-Inhalt, in Tags oder im Text a href="URL" enthalten sind.
Crawler - allgemeiner Zweck
• Googlebot von Google
• Bingbot von Microsoft
• WebCrawler
• WebFountain von IBM
• World Wide Web Worm (WWWW) - inaktiv
• Yahoo! Slurp
• Weitere sind FAST Crawler, Polybot, RBSE und Swiftbot usw.
Crawler – Open Source
• Apache Nutch HTTrack
• Scrapy PHP-Crawler
• GNU Wget GRUB
• Heritrix mnoGoSearch
• news-please Open Search Server
• Sphinx ht://Dig
• Weitere sind Frontera, Seeks, StormCrawler, Xapian, YaCy, Octoparse usw.
Apache Nutch ist ein hochgradig erweiterbarer und skalierbarer Webcrawler/Fetcher.
• Robust und skalierbar – Nutch kann in einem Cluster betrieben werden.
• Es basiert auf Apache Hadoop.
• Creative Commons Search implementiert.
• In Java geschrieben.
• Nutch ist ein gut ausgereifter, produktionsbereiter Webcrawler.
WebCrawler ist eine Metasuchmaschine, die die besten Suchergebnisse von Google Search und Yahoo! Search kombiniert.
• WebCrawler ist eine eingetragene Marke von InfoSpace, Inc.
PHP-Crawler ist ein Open-Source-Crawling-Skript, das auf PHP und MySQL basiert. Es wurde erstellt, um eine so einfache lokale Website-Suche wie möglich zu implementieren und wurde für kleine Websites auf Shared Hosting beliebt.
HTTrack ist ein kostenloser und Open-Source-Webcrawler und Offline-Browser, entwickelt von Xavier Roche, und ist ein kostenloses und benutzerfreundliches Offline-Browser-Utility.
HTTrack-Funktionen
- Ermöglicht Benutzern, Websites aus dem World Wide Web von Internet auf einen lokalen Computer herunterzuladen/spiegeln.
- lizenziert unter der GNU GPLv3
- Ordnet die heruntergeladene Website nach der relativen Linkstruktur der ursprünglichen Website an.
- Aktualisiert eine vorhandene gespiegelte Website und setzt unterbrochene Downloads fort.
- Konfigurierbar durch Optionen und Filter (einschließen/ausschließen).
- Es gibt eine grundlegende Befehlszeilenversion zur Verwendung von Skripten und Cron-Jobs.
- Zwei GUI-Versionen verfügbar (WinHTTrack und WebHTTrack)
- WinHTTrack ist die Windows-Version (von Windows 2000 bis Windows 10 und höher) von HTTrack, und WebHTTrack die Linux/Unix/BSD-Version.
Kann den einfachen Links folgen, die mit JavaScript und in Applets & Flash generiert werden.
Scrapy ist ein Open-Source- und kollaboratives Framework zum Extrahieren der benötigten Daten von Websites.