En este video, aprenderemos cómo extraer contenido que NO está presente en las cargas iniciales de la página, sino que se carga dinámicamente mediante JavaScript.
Este es un problema común al extraer datos de la web moderna: la respuesta inicial contiene un HTML mínimo y una aplicación JavaScript basada en SPA (React, Vue, Angular, etc). Por lo tanto, los datos que queremos extraer en la página no están presentes, sino que se renderizan más tarde a través de llamadas a la API desde la aplicación SPA.
Veremos cómo podemos usar requests-html para resolver este problema en Python al extraer datos de tales sitios. También veremos cómo usar esto con BeautifulSoup para encontrar datos en la página.
Este video utiliza el siguiente sitio web de muestra (una aplicación React):
📌 𝗖𝗵𝗮𝗽𝘁𝗲𝗿𝗲𝘀:
00:00 Introducción
02:15 Enviando solicitud GET usando la biblioteca requests de Python
04:00 Encontrando objetos con BeautifulSoup
05:15 Instalando requests-html
06:38 Ejecutando JavaScript en la página usando requests-html
☕️ 𝗖𝗼𝗺𝗽𝗿𝗮 𝗺𝗲 𝘂𝗻 𝗰𝗼𝗳𝗳𝗲𝗲:
Para apoyar el canal y fomentar nuevos videos, considera comprarme un café aquí:
𝗦𝗼𝗰𝗶𝗮𝗹 𝗠𝗲𝗱𝗶𝗮:
📚 𝗟𝗲𝗰𝘁𝘂𝗿𝗮 𝗮𝗻𝗮𝗹𝗼𝗴𝗮 𝘆 𝗶𝗻𝗳𝗼𝗿𝗺𝗮𝗰𝗶𝗼𝗻:
#python #webscraping #datascience