Wir freuen uns sehr, Ihnen unser neuestes Scrapy-Projekt / Web Scraping Tutorial präsentieren zu können.
Web Scraping einer großen Seite mit "unendlichem Scrollen" auch bekannt als "AJAX mehr laden".
(Das basiert auf einem realen Projekt von Upwork).
*** TEIL 1 von 7 ***
Hier wird die Analyse der Seite behandelt, während wir die relevanten Elemente und Quellen für die Selektoren identifizieren, die wir in unseren Scrapy-Spider einfügen werden.
Wenn Sie direkt zu einem Abschnitt springen möchten:
2:29 Suche nach der vollständigen Rezept-/Zutatenquelle
3:14 Überprüfung von AJAX / XHR im Netzwerk-Tab der Entwicklertools in Firefox
5:25 Bestätigung der URL-Inkremente während des Scrollens
7:06 Suche nach "json" im Quellcode
8:26 Hauptseiten-Thumbnails - Links zu Detailseiten - Test im Scrapy-Shell
9:27 response.xpath("//script[@type='application/ld+json']/text()").get();
11:04 Lokalisierung der VOLLE Liste der Zutaten
14:21 Lokalisierung des VOLLE Rezepts
17:51 Testen des Inkrements von "pn=" zur Verwendung in unserem Spider für unsere "nächste Seite"
23:59 Anzeige der vollständigen Liste der Zutaten
Das json, das wir finden, ist äußerst nützlich, daher werden Sie im Video sehen, wie wir planen, es zu verwenden und die "Links" herauszufiltern, an denen wir in Teil 2 weiterarbeiten werden.
Bitte kommentieren, abonnieren, liken 👍, da dies viel Aufwand erfordert und je mehr Kommentare/Feedback ich erhalte, desto besser kann ich zukünftige Videos auf Sie zuschneiden.
GitHub-Code
Viele Grüße,
Dr. Pi.
#scrapy #unendlichesScrollen #mehrladen