Si vous avez aimé cette vidéo et souhaitez me soutenir, offrez-moi un café ! ☕️
Dans ce script, j'utilise Scrapy, un puissant framework de web scraping, pour extraire des données immobilières de Zillow. En utilisant des en-têtes personnalisés, je contourne l'erreur 403, garantissant un accès fluide au site web.
Voici un aperçu du code :
1. Configuration du Spider : 🕷️
- Définition d'un Spider nommé `zilspider`.
- Définition de l'URL de départ pour extraire des données de la région de New York, NY sur Zillow.
2. Initiation des Requêtes : 🚀
- La fonction `start_requests()` envoie une requête initiale à l'URL spécifiée.
3. Analyse des Données : 📜
- Dans la méthode `parse()`, le script localise une balise `Script` spécifique contenant des données JSON (`__NEXT_DATA__`).
- Ces données JSON contiennent des informations sur les maisons répertoriées sur la page.
4. Extraction des Informations sur les Maisons : 🏡🔍
- Pour chaque maison, divers détails sont extraits, y compris :
Type de maison 🏘️
Jours sur Zillow 🗓️
URL de la page de la maison 🌐
Image Principale 📸
Statut de l'annonce 📊
Prix 💰
Adresse 🏠
Code Postal 📍
Nombre de Chambres & Salles de Bain 🛏️🛁
Surface en Pieds Carrés 📏
- Ces données sont ensuite renvoyées en sortie pour un traitement ou un stockage ultérieur.
5. Gestion de la Pagination : 📄➡️
- Le script vérifie s'il y a une page suivante d'annonces disponible.
- Si oui, il construit l'URL complète pour la page suivante et effectue une autre requête pour continuer le scraping.
Ce script est un exemple pratique de l'utilisation de Scrapy pour le web scraping, en particulier pour extraire des données structurées à partir de pages web complexes. Que vous soyez intéressé par les tendances immobilières ou simplement curieux des annonces de propriétés, cet outil peut vous aider à rassembler les données dont vous avez besoin ! 🏡💼
🌟 Important : Considérez toujours les implications éthiques du web scraping. 🌟
💬 N'hésitez pas à me contacter si vous avez des questions sur le web scraping ! 💬
00:00 - Introduction et explications
02:16 - Configuration de notre projet Scrapy
04:34 - Vérification du site Zillow pour trouver des données et montrer la pagination
19:55 - Gestion de l'erreur 403 en ajoutant des en-têtes personnalisés
26:10 - Shell Scrapy et récupération du Script NEXT_DATA et des données de la première page
39:46 - Mise en œuvre de la pagination
47:36 - Quels sont les avantages du web scraping, peut-être Outro !