Dans cette vidéo, nous allons voir comment extraire des données de sites web rendus en JavaScript en utilisant Scrapy Playwright.
Nous couvrons :
Comment installer Scrapy Playwright
Comment utiliser Scrapy Playwright dans vos araignées
Comment attendre que la page se charge
Comment extraire plusieurs pages
Comment faire défiler les éléments de la page avec Scrapy Playwright
Comment prendre des captures d'écran avec Scrapy Playwright
La base de code que nous utilisons dans cette vidéo peut être clonée ici :
****** FONCTIONNANT SUR WINDOWS ! *******
Au moment de rédiger ce guide, Scrapy Playwright ne fonctionne pas avec Windows. Cependant, il est possible de l'exécuter avec WSL (Windows Subsystem for Linux).
C'est un bon tutoriel vidéo à consulter si vous devez installer WSL sur votre machine Windows :
00:00 - Introduction
01:10 - Clonage et installation du projet Scrapy
02:18 - Ajout des paramètres nécessaires pour Scrapy Playwright
02:52 - Ajout du code d'extraction à notre araignée
08:50 - Attendre que la page termine de charger des sélecteurs CSS d'éléments spécifiques
11:54 - Extraction de plusieurs pages en cliquant sur la page suivante
15:47 - Extraction d'une page avec défilement infini en utilisant Playwright
18:11 - Prendre une capture d'écran pendant l'extraction avec Playwright
20:13 - Conclusion