In diesem Video lernen wir, wie man Inhalte scrapt, die NICHT bei den initialen Seitenaufrufen vorhanden sind, sondern dynamisch von JavaScript geladen werden.
Dies ist ein häufiges Problem beim Scraping des modernen Webs: Die anfängliche Antwort enthält minimales HTML und eine auf SPA basierende JavaScript-Anwendung (React, Vue, Angular usw.). Die Daten, die wir auf der Seite scrapen möchten, sind daher nicht vorhanden, sondern werden später über API-Aufrufe von der SPA-Anwendung gerendert.
Wir werden uns ansehen, wie wir requests-html in Python verwenden können, um dieses Problem beim Scraping solcher Seiten zu lösen. Außerdem werden wir uns ansehen, wie wir dies mit BeautifulSoup kombinieren können, um Daten auf der Seite zu finden.
Dieses Video nutzt die folgende Beispiel-Website (eine React-Anwendung):
📌 𝗖𝗵𝗮𝗽𝘁𝗲𝗿𝘀:
00:00 Einführung
02:15 GET-Anfrage mit der Python requests-Bibliothek senden
04:00 Objekte mit BeautifulSoup finden
05:15 requests-html installieren
06:38 JavaScript auf der Seite mit requests-html ausführen
☕️ 𝗕𝘂𝘆 𝗺𝗲 𝗮 𝗰𝗼𝗳𝗳𝗲𝗲:
Um den Kanal zu unterstützen und neue Videos zu fördern, bitte ich Sie, mir hier einen Kaffee zu kaufen:
𝗦𝗼𝗰𝗶𝗮𝗹 𝗠𝗲𝗱𝗶𝗮:
📚 𝗙𝘂𝗿𝘁𝗵𝗲𝗿 𝗿𝗲𝗮𝗱𝗶𝗻𝗴 𝗮𝗻𝗱 𝗶𝗻𝗳𝗼𝗿𝗺𝗮𝘁𝗶𝗼𝗻:
#python #webscraping #datascience