Web Scraping en Python avec le module Beautiful Soup. Dans cette vidéo, je vais expliquer comment effectuer du web scraping en Python en utilisant Beautiful Soup et le module Requests. Je vais écrire un programme Python pour extraire des données du site IMDB et ensuite charger les données souhaitées dans un fichier Excel. Je vais écrire ce programme depuis le début afin que vous puissiez suivre.
Si vous souhaitez pratiquer des requêtes SQL ou explorer mes cours SQL enregistrés, consultez ma plateforme d'apprentissage SQL tout-en-un, SQLNest 👇
Le Web Scraping est le processus d'extraction programmatique de données d'un site web. En Python, nous pouvons facilement écrire un programme pour extraire des données d'un site web en utilisant Beautiful Soup et le module Requests. Le module Requests peut être utilisé pour accéder au site web souhaité et le module Beautiful Soup peut être utilisé pour analyser le code source HTML du site. Beautiful Soup facilite grandement l'analyse du contenu HTML et fournit ensuite plusieurs méthodes qui peuvent être utilisées pour extraire des données de n'importe quelle balise HTML. Tous les sites web sont écrits en langage HTML, donc pour effectuer du web scraping, notre programme doit lire le contenu HTML. C'est là que Beautiful Soup entre en jeu pour faciliter l'accès au contenu HTML en utilisant des méthodes très simples.
Vous n'avez pas besoin d'être un expert en HTML pour apprendre le web scraping en Python. Vous devez juste connaître les bases les plus élémentaires de l'HTML, c'est-à-dire savoir ce qu'est une balise et comment identifier les attributs associés à une balise.
Dans cette vidéo, afin d'expliquer le concept de web scraping en utilisant BeautifulSoup en Python, nous allons écrire un programme Python qui accédera au site IMDB et récupérera les films les mieux notés présents sur le site IMDB, puis chargera ces données dans un fichier Excel.
Le site IMDB contient des évaluations de films, mais dans ce programme, nous nous intéressons uniquement à l'extraction des films les mieux notés de tous les temps.
Pour charger des données dans un fichier Excel, j'utiliserai le module openpyxl. Avec openpyxl, il est très facile de créer un nouveau fichier Excel, de renommer la feuille et de charger des données dans le fichier Excel. Je ne vais pas expliquer openpyxl en détail, mais je vais juste couvrir suffisamment pour savoir comment créer un fichier Excel et charger des données dans un fichier Excel.
Nous allons installer le module Requests et le module Beautiful Soup en utilisant l'installateur pip. J'utilise un Mac, donc la commande à exécuter dans le terminal est "pip3 install module_name". Si vous utilisez Windows, vous devez exécuter la commande d'installation pip depuis l'invite de commande avec la commande "pip install module_name".
🔴 REGARDEZ PLUS DE VIDÉOS ICI 👇
✅ Tutoriel SQL - Concepts de base :
✅ Tutoriel SQL - Concepts intermédiaires :
✅ Tutoriel SQL - Concepts avancés :
✅ Pratique de la résolution de requêtes SQL de base :
✅ Pratique de la résolution de requêtes SQL intermédiaires :
✅ Pratique de la résolution de requêtes SQL complexes :
✅ Orientation de carrière en analyse de données :
✅ Cours SQL, recommandations de plateformes de formation SQL :
✅ Tutoriel Python :
✅ Tutoriel Git et GitHub :
✅ Projets d'analyse de données :
MERCI,
Thoufiq