*Web Crawling : Une Introduction Pratique en Python*
Présentation dans le cadre de la formation du 27 avril 2021
par Jaren Haber, PhD, Chercheur Postdoctoral
Institut des Données Massives, Université de Georgetown
*Objectifs de cette Présentation :*
- Comprendre comment le web crawling et le web scraping sont utiles pour la collecte de données numériques
- Développer des intuitions sur les usages et les limites de :
- APIs (Interfaces de Programmation d'Applications)
- Exploitation de la structure des sites web (HTML/CSS)
- Crawling évolutif
- Se familiariser avec les problèmes courants en web crawling et leurs solutions, comme :
- Sites web imbriqués -- crawling vertical (extraction de liens)
- Blocage -- pauses polies
- Acquérir de la pratique avec :
- Collecte de domaines à scraper
- Scraping de sites web évolutifs et non évolutifs
- Analyse de texte de sites web (avec BeautifulSoup)
wget, Requests et Scrapy
*Remerciements :*
- D-Lab à l'Université de Californie, Berkeley
- Institut d'Été en Sciences Sociales Computationnelles