👇Artikel herunterladen👇
IJERTV9IS050268
Horizontal skalierbarer Web-Crawler mit Containerisierung und grafischer Benutzeroberfläche
Ansuman Prusty, Pavan Kancherlapalli, Roland Schiebel, Aniket Shah, Aditya Suresh, Oscar Mejia
Web-Crawler (Spiders), die Seiten im Web und Dokumente im Internet indizieren, gibt es fast seit den Anfängen des Internets. Da das Internet in den letzten 25 Jahren sehr schnell gewachsen ist, ist es für einzelne Crawler unmöglich, das Web effizient zu crawlen und zu indizieren. Es gibt jetzt viel mehr Nutzer im Internet, insbesondere eine große Anzahl von nicht-technischen Nutzern, die das Web crawlen möchten, dies jedoch nicht programmatisch tun können. Unsere Anwendung adressiert diese Bedenken, da sie ein horizontal skalierbarer Web-Crawler ist, der Containerisierung (Docker und Kubernetes) für Skalierbarkeit und Leistung nutzt und bequem über eine webbasierte Benutzeroberfläche gesteuert werden kann. Unsere Lösung konzentriert sich darauf, separate containerisierte Crawler-Manager-Instanzen für jede eingehende Benutzeranfrage an die Anwendung zu haben, anstatt eine zentrale Manager-Instanz zu verwenden. Sie unterstützt maschinelles Lernen, um den benötigten Speicherplatz zu verringern, indem nur Inhalte gespeichert werden, die gemäß den vom Benutzer definierten Klassennamen klassifiziert sind. Wir haben auch bestehende parallele Crawling-Ansätze analysiert und wie sie sich mit unserer Lösung vergleichen.