*Coleta de Dados na Web: Uma Introdução Prática em Python*
Apresentação como parte do treinamento em 27 de abril de 2021
por Jaren Haber, PhD, Pesquisador de Pós-Doutorado
Instituto de Dados Massivos, Universidade de Georgetown
*Objetivos desta Apresentação:*
- Compreender como a coleta e raspagem de dados na web são úteis para a coleta de dados digitais
- Construir intuições sobre os usos e limites de:
- APIs (Interfaces de Programação de Aplicações)
- Explorando a estrutura do site (HTML/CSS)
- Coleta escalável
- Familiarizar-se com problemas comuns na coleta de dados na web e suas soluções, como:
- Sites aninhados -- coleta vertical (extração de links)
- Ser bloqueado -- pausas educadas
- Ganhar prática com:
- Coleta de domínios para raspagem
- Raspagem de sites escaláveis e não escaláveis
- Análise de texto de sites (com BeautifulSoup)
wget, Requests e Scrapy
*Reconhecimentos:*
- D-Lab da Universidade da Califórnia, Berkeley
- Instituto de Verão em Ciência Social Computacional