Nous sommes très heureux de vous présenter notre dernier projet Scrapy / Tutoriel de Web Scraping.
Web Scraping d'un grand site avec "défilement infini" alias "AJAX charger plus".
(Ceci est basé sur un projet réel d'Upwork).
*** PARTIE 1 sur 7 ***
Cela couvre l'analyse du site, alors que nous identifions les éléments et sources pertinents pour les sélecteurs que nous allons mettre dans notre araignée Scrapy.
Si vous souhaitez simplement passer à une section :
2:29 Recherche de la recette complète / source des ingrédients
3:14 Vérification d'AJAX / XHR dans l'onglet Réseau des Outils de Développement dans Firefox
5:25 Confirmation des incréments d'URL pendant le défilement
7:06 Recherche de "json" dans la source
8:26 Vignettes de la Page Principale - Liens vers les pages de détails - test dans le shell Scrapy
9:27 response.xpath("//script[@type='application/ld+json']/text()").get();
11:04 Localisation de la LISTE COMPLÈTE des ingrédients
14:21 Localisation de la RECETTE COMPLÈTE
17:51 test de l'incrément de "pn=" à utiliser dans notre araignée pour notre "page suivante"
23:59 Affichage de la liste complète des ingrédients
Le json que nous trouvons est extrêmement utile, donc pendant la vidéo, vous verrez comment nous prévoyons de l'utiliser et de sélectionner les "liens" sur lesquels nous allons travailler davantage lors de la partie 2.
Merci de commenter, de vous abonner, d'aimer 👍, car cela demande beaucoup d'efforts et plus il y a de commentaires/retours, mieux je pourrai adapter les futures vidéos pour vous.
Code GitHub
Cordialement,
Dr Pi.
#scrapy #défilementinfini #chargerplus