¡Visítame en Patreon!
¡Bienvenido de nuevo a la siguiente parte de nuestra serie de Python para Daily Fantasy Sports!
En este video vamos a aprender una herramienta más avanzada para el web scraping
llamada Selenium. Selenium es un paquete de Python que permite la interacción con
la página web más allá de simplemente actualizar la URL.
Usaremos Selenium además de Beautiful Soup para nuestras necesidades de web scraping
de ahora en adelante, así que si no estás familiarizado con Beautiful Soup, publicaré un enlace a
mis videos anteriores de Beautiful Soup aquí arriba.
Ahora, vamos a programar.
Requisitos::
Todo lo del Tutorial de BS4
+
Pip Instalar Selenium
Gecko Driver
Explicación de Gecko
- Gecko es básicamente una interfaz que permite que Firefox sea controlado por un tercero,
es decir, tu código en Python. Debes estar al día con Firefox y Gecko; si
escribes un código que funciona y luego deja de funcionar, este es un problema probable.
Documentación de Selenium
--Funciones/procesos importantes necesarios para
Encontrar elementos
Seleccionar elementos
Estas tácticas nos permiten automatizar interacciones con las páginas web, lo que
hace que el web scraping a gran escala sea MUCHO más eficiente.
Por Ejemplo:
Estadísticas de NBA.com, cada página necesitará ser interactuada para extraer la
base de estadísticas. La URL solo puede llevarnos a la página de inicio de los 50 mejores resultados.
La URL puede ser repetida para cubrir diferentes páginas de estadísticas, pero necesitaremos
interactuar con la propia página web para avanzar.
Por qué es importante entender cómo inspeccionar los elementos en la página,
muy similar a la forma en que establecimos la tabla que queríamos usar en el
tutorial de Beautiful Soup. Ahora, necesitaremos identificar los elementos en la
página con los que queremos interactuar, y luego cómo interactuar con ellos.