*Web Crawling: Una Introducción Práctica en Python*
Presentación como parte de la capacitación el 27 de abril de 2021
por Jaren Haber, PhD, Investigador Postdoctoral
Instituto de Datos Masivos, Universidad de Georgetown
*Objetivos de esta Presentación:*
- Entender cómo el web crawling y el web scraping son útiles para la recolección de datos digitales
- Construir intuiciones sobre los usos y límites de:
- APIs (Interfaces de Programación de Aplicaciones)
- Explotar la estructura del sitio web (HTML/CSS)
- Crawling escalable
- Familiarizarse con problemas comunes en el web crawling y sus soluciones, como:
- Sitios web anidados -- crawling vertical (extracción de enlaces)
- Ser bloqueado -- pausas corteses
- Practicar con:
- Recolección de dominios para scrapear
- Web scraping escalable y no escalable
- Análisis de texto de sitios web (con BeautifulSoup)
wget, Requests y Scrapy
*Agradecimientos:*
- D-Lab en la Universidad de California, Berkeley
- Instituto de Verano en Ciencias Sociales Computacionales