Découvrez-moi sur Patreon !
Bienvenue dans la prochaine partie de notre série Python pour les sports fantastiques quotidiens !
Dans cette vidéo, nous allons apprendre à utiliser un outil plus avancé pour le web scraping appelé Selenium. Selenium est un package Python qui permet d'interagir avec la page web au-delà de la simple mise à jour de l'URL.
Nous utiliserons Selenium en plus de Beautiful Soup pour nos besoins en web scraping à l'avenir, donc si vous n'êtes pas familier avec Beautiful Soup, je vais poster un lien vers mes précédentes vidéos sur Beautiful Soup juste ici.
Maintenant, passons au codage.
Exigences :
Tout ce qui concerne le tutoriel BS4
+
Pip Installer Selenium
Gecko Driver
Explication de Gecko
- Gecko est essentiellement une interface qui permet à Firefox d'être contrôlé par un tiers, c'est-à-dire votre code Python. Vous devez être à jour sur Firefox et Gecko, si vous écrivez un code qui fonctionne et qu'il cesse ensuite de fonctionner, c'est probablement un problème lié à cela.
Documentation Selenium
-- Fonctions/processus importants nécessaires pour
Trouver des éléments
Sélectionner des éléments
Ces tactiques nous permettent d'automatiser les interactions avec les pages web, ce qui rend le web scraping à grande échelle BEAUCOUP plus efficace.
Par exemple :
Statistiques de NBA.com, chaque page devra être interagie pour extraire la base de statistiques. L'URL ne peut nous amener qu'à la page d'accueil des 50 meilleurs résultats.
L'URL peut être bouclée pour couvrir différentes pages de statistiques, mais nous devrons interagir avec la page web elle-même pour avancer.
Pourquoi il est important de comprendre comment inspecter les éléments sur la page, très similaire à la façon dont nous avons établi le tableau que nous voulions utiliser dans le tutoriel Beautiful Soup. Maintenant, nous devrons identifier les éléments sur la page avec lesquels nous voulons interagir, puis comment interagir avec eux.