Kapitel:
0:02 Willkommen zur Woche 3
9:36 HTML-Struktur & Grundlagen des Web Scrapings
19:05 Reverse Engineering undocumented APIs
28:27 BeautifulSoup: Geschwisternavigation
37:52 Live-Debugging von String-/Dateifehlern
47:30 Web Scraping von Netflix-Aktienkursdaten
56:55 Behebung von Datentypen nach dem Scraping
1:06:25 Bereinigung von Datenrahmen für das Modellieren
1:15:43 Übungsquiz: BeautifulSoup & Web Scraping
Modul 3 Live-Session für das IBM Data Science Professional Certificate, Kohorte IBSC 2026-04-08.
In dieser Sitzung bewegen wir uns von den Grundlagen von Python zu realen Daten-Workflows. Der Fokus liegt auf der Sammlung von Daten aus externen Quellen, der Transformation in nutzbare Strukturen und der Vorbereitung für Analyse und Visualisierung.
Behandelte Themen sind:
• Arbeiten mit Jupyter-Notebooks
• Web Scraping mit BeautifulSoup
• Verständnis von HTML, XML und Auszeichnungssprachen
• Navigation durch Eltern-, Kind- und Geschwister-Tags
• Extrahieren von Daten aus Webseiten und HTML-Tabellen
• Verwendung von Requests zum Abrufen von Webinhalten
• Lesen von Webtabellen mit Pandas
• Arbeiten mit APIs und API-Wrappers wie yfinance
• Verständnis von JSON-Antworten von APIs
• Sichere Verwendung von Dictionaries, Schlüsseln und .get()
• Umwandlung von Rohdaten aus APIs und dem Web in Pandas DataFrames
• Einführung in ETL-Workflows
• Erstellen von schnellen Visualisierungen mit Matplotlib und Pandas-Plotting
• Diskussion darüber, wo Web Scraping in moderne Daten-Workflows passt
Die zentrale Idee dieses Moduls ist, dass Data Science mit der Datenerfassung beginnt. Bevor wir Machine Learning-Modelle, Dashboards oder KI-Tools erstellen können, müssen wir verstehen, wie man Daten aus realen Quellen extrahiert, bereinigt, strukturiert und validiert.
Alle Notebooks und Materialien der Live-Session für dieses Bootcamp sind hier verfügbar:
#datascience #python #webscraping #apis #ETL #pandas #beautifulsoup #datenvisualisierung #bootcamp