Dans cette vidéo, nous allons apprendre à extraire du contenu qui n'est PAS présent lors des chargements initiaux de la page, mais qui est chargé dynamiquement par JavaScript.
C'est un problème courant lors de l'extraction de données sur le web moderne : la réponse initiale contient un HTML minimal et une application JavaScript basée sur une SPA (React, Vue, Angular, etc). Les données que nous souhaitons extraire de la page ne sont donc pas présentes, mais sont rendues plus tard via des appels API de l'application SPA.
Nous allons voir comment nous pouvons utiliser requests-html pour résoudre ce problème en Python lors de l'extraction de tels sites. Nous examinerons également l'utilisation de cela avec BeautifulSoup afin de trouver des données sur la page.
Cette vidéo utilise le site web d'exemple suivant (une application React) :
📌 𝗖𝗵𝗮𝗽𝘁𝗲𝗿𝘀 :
00:00 Introduction
02:15 Envoi d'une requête GET en utilisant la bibliothèque requests de Python
04:00 Recherche d'objets avec BeautifulSoup
05:15 Installation de requests-html
06:38 Exécution de JavaScript sur la page en utilisant requests-html
☕️ 𝗔𝗰𝗵𝗲𝘁𝗲𝘇-𝗺𝗼𝗶 𝘂𝗻 𝗰𝗼𝗳𝗳𝗲 :
Pour soutenir la chaîne et encourager de nouvelles vidéos, veuillez envisager de m'acheter un café ici :
𝗦𝗼𝗰𝗶𝗮𝗹 𝗠𝗲𝗱𝗶𝗮 :
📚 𝗟𝗶𝘁𝗲𝗿𝗮𝘁𝘂𝗿𝗲 𝗲𝘁 𝗶𝗻𝗳𝗼𝗿𝗺𝗮𝘁𝗶𝗼𝗻 :
#python #webscraping #datascience