Web Scraping en Python usando el módulo Beautiful Soup. En este video explicaré cómo realizar web scraping en Python utilizando Beautiful Soup y el módulo Requests. Escribiré un programa en Python para extraer datos del sitio web de IMDB y luego cargar los datos deseados en un archivo de Excel. Escribiré este programa desde cero para que puedas seguirlo.
Si deseas practicar consultas SQL o explorar mis cursos de SQL grabados, visita mi plataforma de aprendizaje SQL todo en uno, SQLNest 👇
El Web Scraping es el proceso de extraer programáticamente algunos datos de un sitio web. En Python, podemos escribir fácilmente un programa para extraer datos de un sitio web utilizando Beautiful Soup y el módulo Requests. El módulo Requests se puede usar para acceder al sitio web deseado y el módulo Beautiful Soup se puede usar para analizar el código fuente HTML del sitio web. Beautiful Soup facilita mucho el análisis del contenido HTML y luego proporciona múltiples métodos que se pueden usar para extraer datos de cualquier etiqueta HTML. Todos los sitios web están escritos en lenguaje HTML, por lo que para realizar web scraping, nuestro programa necesita leer el contenido HTML. Aquí es donde Beautiful Soup entra en acción para facilitar el acceso a los contenidos de HTML utilizando métodos muy simples.
No necesitas ser un experto en HTML para aprender web scraping en Python. Solo necesitas conocer lo más básico de HTML, que es saber qué es una etiqueta y cómo identificar los atributos asociados a una etiqueta.
En este video, para explicar el concepto de web scraping utilizando BeautifulSoup en Python, escribiremos un programa en Python que accederá al sitio web de IMDB y luego obtendrá las películas mejor valoradas presentes en el sitio web de IMDB y luego cargará estos datos en un archivo de Excel.
El sitio web de IMDB contiene calificaciones de películas, pero en este programa solo estamos interesados en extraer las películas mejor valoradas de todos los tiempos.
Para cargar datos en un archivo de Excel, utilizaré el módulo openpyxl. Usando openpyxl, es muy fácil crear un nuevo archivo de Excel y luego renombrar la hoja y cargar datos en el archivo de Excel. No explicaré openpyxl en detalle, pero cubriré lo suficiente para saber cómo crear un archivo de Excel y luego cargar datos en él.
Instalaremos el módulo Requests y el módulo Beautiful Soup utilizando el instalador pip. Estoy usando Mac, así que el comando en Mac que se debe ejecutar desde la terminal es “pip3 install module_name”. Si estás usando Windows, entonces necesitas ejecutar el comando de instalación pip desde el símbolo del sistema usando el comando “pip install module_name”.
🔴 MIRA MÁS VIDEOS AQUÍ 👇
✅ Tutorial de SQL - Conceptos básicos:
✅ Tutorial de SQL - Conceptos intermedios:
✅ Tutorial de SQL - Conceptos avanzados:
✅ Práctica de Resolución de Consultas SQL Básicas:
✅ Práctica de Resolución de Consultas SQL Intermedias:
✅ Práctica de Resolución de Consultas SQL Complejas:
✅ Orientación sobre Carreras en Análisis de Datos:
✅ Curso de SQL, Recomendaciones de Plataformas de Capacitación en SQL:
✅ Tutorial de Python:
✅ Tutorial de Git y GitHub:
✅ Proyectos de Análisis de Datos:
GRACIAS,
Thoufiq