In diesem Video zeigen wir, wie man Daten von mit JavaScript gerenderten Websites mit Scrapy Playwright scrapt.
Wir behandeln:
Wie man Scrapy Playwright installiert
Wie man Scrapy Playwright in seinen Spiders verwendet
Wie man wartet, bis die Seite geladen ist
Wie man mehrere Seiten scrapt
Wie man die Seitenelemente mit Scrapy Playwright scrollt
Wie man Screenshots mit Scrapy Playwright macht
Der Code, den wir in diesem Video verwenden, kann hier geklont werden:
****** LÄUFT AUF WINDOWS! *******
Zum Zeitpunkt des Schreibens dieses Leitfadens funktioniert Scrapy Playwright nicht mit Windows. Es ist jedoch möglich, es mit WSL (Windows Subsystem for Linux) auszuführen.
Dies ist ein gutes Video-Tutorial, das Sie sich ansehen sollten, wenn Sie WSL auf Ihrem Windows-Rechner installieren müssen:
00:00 - Einführung
01:10 - Klonen & Installieren des Scrapy-Projekts
02:18 - Hinzufügen der für Scrapy Playwright benötigten Einstellungen
02:52 - Hinzufügen des Scraping-Codes zu unserem Spider
08:50 - Warten, bis die Seite das Laden spezifischer Seiten-Element-CSS-Selektoren abgeschlossen hat
11:54 - Scrapen mehrerer Seiten durch Klicken auf die nächste Seite
15:47 - Scrapen einer Seite mit unendlichem Scrollen mit Playwright
18:11 - Einen Screenshot während des Scrapens mit Playwright machen
20:13 - Outro