🧠 Ne manquez pas ça ! Obtenez un accès GRATUIT à ma communauté Skool — remplie de ressources, d'outils et de soutien pour vous aider avec les données, l'apprentissage automatique et les automatisations IA ! 📈
https://www.skool.com/data-and-ai-automations-4579Vous êtes nouveau dans le web scraping et vous ne savez pas par où commencer ? Dans ce tutoriel adapté aux débutants, nous allons décomposer les concepts essentiels que tout aspirant scraper doit comprendre avant d'envoyer sa première requête.
Ce tutoriel comprend robots.txt, limites de taux, statuts, requêtes, et plus ! Parfait si vous souhaitez vous lancer dans le web scraping avec l'aide de Python.
📧 Email : ryannolandata@gmail.com
🍿 REGARDEZ ENSUITE
Dans cette vidéo, je vous guide à travers les concepts fondamentaux que vous devez connaître avant de plonger dans le scraping de sites Web avec Python. Nous couvrons des sujets essentiels, y compris les codes de statut HTTP (200, 403, 404), comment vérifier les fichiers robots.txt pour comprendre les autorisations de scraping, les limites de taux et les délais de crawl, l'utilisation des en-têtes pour contourner les blocages de base, et tester l'accessibilité des sites Web.
Je démontre des exemples réels en utilisant des sites Web comme Books to Scrape, Amazon et Baseball Reference pour vous montrer exactement ce qui se passe lorsque vous faites des requêtes à différents sites. Vous apprendrez à identifier si une page peut être scrappée, à comprendre la structure du fichier robots.txt, à vérifier les délais de crawl, et à utiliser différents en-têtes d'agent utilisateur pour améliorer votre taux de réussite. C'est la première vidéo de ma série complète sur le web scraping où nous allons progressivement passer des bases de Beautiful Soup à des techniques avancées, y compris le scraping alimenté par l'IA avec de grands modèles de langage.
À la fin de cette vidéo, vous comprendrez les considérations éthiques et les exigences techniques pour le web scraping, établissant une base solide pour les techniques de scraping plus avancées que nous aborderons dans les vidéos à venir. Je publie deux vidéos par semaine dans cette série, et je prends également des projets de web scraping en freelance, donc n'hésitez pas à me contacter par email ou Discord si vous avez besoin d'aide pour vos besoins de scraping.
HORAIRES
00:00 Introduction à la série Web Scraping
01:14 Commencer avec les imports de base
01:52 Partie 1 : Obtenir votre première page
03:01 Comprendre les codes de réponse (200, 403, 404)
05:17 Tester les requêtes échouées avec des erreurs 403
08:03 Exemple de page 404 Non trouvée
09:21 Partie 2 : Vérification du fichier robots.txt
11:04 Visualisation du fichier robots.txt d'Amazon
12:00 Exemple 3 : Recherche de délai de crawl
13:06 Exemple 4 : Vérification si vous pouvez scraper une page
15:11 Exemple 5 : Utilisation des en-têtes pour contourner les erreurs
17:32 Revue finale et points clés
AUTRES RÉSEAUX SOCIAUX :
Qui est Ryan
Ryan est Data Scientist dans une entreprise fintech, où il se concentre sur la prévention de la fraude dans l'évaluation et le risque. Avant cela, il a travaillé comme Data Analyst dans une entreprise de logiciels fiscaux. Il est titulaire d'un diplôme en ingénierie électrique de l'UCF.
Qui est Matt
Matt est le fondateur de Width.ai, une agence d'IA et d'apprentissage automatique. Avant de créer sa propre entreprise, il était ingénieur en apprentissage automatique chez Capital One.
*Il s'agit d'un programme d'affiliation. Nous recevons une petite portion de la vente finale sans coût supplémentaire pour vous.