Wenn dir dieses Video gefallen hat und du mich unterstützen möchtest, lade mich auf einen Kaffee ein! ☕️
In diesem Skript verwende ich Scrapy, ein leistungsstarkes Framework für Web Scraping, um Immobiliendaten von Zillow zu extrahieren. Durch die Verwendung benutzerdefinierter Header umgehe ich den 403-Fehler und stelle einen reibungslosen Zugriff auf die Website sicher.
Hier ist eine Übersicht über den Code:
1. Spider-Setup: 🕷️
- Einen Spider namens `zilspider` definiert.
- Die Start-URL festgelegt, um Daten aus dem Gebiet New York, NY auf Zillow zu scrapen.
2. Anfragen initiieren: 🚀
- Die Funktion `start_requests()` sendet eine erste Anfrage an die angegebene URL.
3. Daten parsen: 📜
- In der Methode `parse()` findet das Skript ein bestimmtes `Script`-Tag, das JSON-Daten (`__NEXT_DATA__`) enthält.
- Diese JSON-Daten enthalten Informationen über die auf der Seite gelisteten Häuser.
4. Informationen zu Häusern extrahieren: 🏡🔍
- Für jedes Haus werden verschiedene Details extrahiert, darunter:
Art des Hauses 🏘️
Tage auf Zillow 🗓️
URL zur Seite des Hauses 🌐
Hauptbild 📸
Status des Listings 📊
Preis 💰
Adresse 🏠
Postleitzahl 📍
Anzahl der Schlafzimmer & Badezimmer 🛏️🛁
Fläche in Quadratfuß 📏
- Diese Daten werden dann als Ausgabe für die weitere Verarbeitung oder Speicherung bereitgestellt.
5. Pagination behandeln: 📄➡️
- Das Skript prüft, ob eine nächste Seite mit Listings verfügbar ist.
- Falls ja, wird die vollständige URL für die nächste Seite erstellt und eine weitere Anfrage gesendet, um das Scraping fortzusetzen.
Dieses Skript ist ein praktisches Beispiel dafür, wie man Scrapy für Web Scraping verwendet, insbesondere um strukturierte Daten von komplexen Webseiten zu extrahieren. Egal, ob du an Immobilientrends interessiert bist oder einfach nur neugierig auf Immobilienangebote, dieses Tool kann dir helfen, die benötigten Daten zu sammeln! 🏡💼
🌟 Wichtig: Berücksichtige immer die ethischen Implikationen des Web Scrapings. 🌟
💬 Zögere nicht, mich zu kontaktieren, wenn du Fragen zum Web Scraping hast! 💬
00:00 - Einführung und Erklärungen
02:16 - Unser Scrapy-Projekt einrichten
04:34 - Die Zillow-Website überprüfen, um Daten zu finden und die Pagination anzuzeigen
19:55 - 403-Fehler behandeln, indem benutzerdefinierte Header hinzugefügt werden
26:10 - Scrapy-Shell und das NEXT_DATA-Skript verwenden und Daten der ersten Seite abrufen
39:46 - Pagination implementieren
47:36 - Was sind die Vorteile des Web Scrapings, vielleicht Outro!