*Web Crawling: Eine praktische Einführung in Python*
Präsentation im Rahmen der Schulung am 27. April 2021
von Jaren Haber, PhD, Postdoktorand
Massive Data Institute, Georgetown University
*Ziele dieser Präsentation:*
- Verstehen, wie Web-Crawling und -Scraping nützlich für die digitale Datensammlung sind
- Intuitionen über die Anwendungen und Grenzen von:
- APIs (Application Programming Interfaces)
- Ausnutzung der Webseitenstruktur (HTML/CSS)
- Skalierbare Crawling
- Vertrautheit mit häufigen Problemen im Web-Crawling und deren Lösungen, wie:
- Verschachtelte Webseiten -- vertikales Crawling (Linkextraktion)
- Blockiert werden -- höfliche Pausen
- Praktische Erfahrung mit:
- Sammeln von Domains zum Scrapen
- Skalierbare und nicht skalierbare Webseiten-Scraping
- Parsen von Webseiten-Text (mit BeautifulSoup)
wget, Requests und Scrapy
*Danksagungen:*
- D-Lab an der University of California, Berkeley
- Summer Institute in Computational Social Science