👇Télécharger l'article👇
IJERTV9IS050268
Crawler Web Scalabilité Horizontale utilisant la Conteneurisation et une Interface Utilisateur Graphique
Ansuman Prusty, Pavan Kancherlapalli, Roland Schiebel, Aniket Shah, Aditya Suresh, Oscar Mejia
Les crawlers web (araignées), qui indexent les pages sur le web et les documents sur Internet, existent presque depuis le début d'Internet. Alors qu'Internet a connu une croissance très rapide au cours des 25 dernières années, il est impossible pour des crawlers uniques de parcourir et d'indexer efficacement le web. Il y a beaucoup plus d'utilisateurs sur Internet maintenant, en particulier un grand nombre d'utilisateurs non techniques, qui souhaiteraient explorer le web mais ne peuvent pas le faire de manière programmatique. Notre application répond à ces préoccupations car elle est un crawler web scalable horizontalement qui utilise la conteneurisation (Docker et Kubernetes) pour la scalabilité et la performance, et peut être contrôlée facilement via une interface utilisateur web. Notre solution se concentre sur la mise en place d'instances de Crawler-Manager conteneurisées séparées pour chaque demande utilisateur entrante à l'application, au lieu d'avoir une instance de gestion centralisée. Elle prend en charge l'apprentissage automatique pour réduire la quantité de stockage nécessaire en ne conservant que le contenu classé conformément aux étiquettes de classe définies par l'utilisateur. Nous avons également analysé les approches de crawling parallèle existantes et comment elles se comparent à notre solution.