Chapitres :
0:02 Bienvenue à la Semaine 3
9:36 Structure HTML & Notions de base du Web Scraping
19:05 Ingénierie inverse des APIs non documentées
28:27 BeautifulSoup : Navigation entre frères et sœurs
37:52 Débogage des erreurs de chaîne/fichier en direct
47:30 Web Scraping des données boursières de Netflix
56:55 Correction des types de données après le scraping
1:06:25 Nettoyage des DataFrames pour la modélisation
1:15:43 Quiz pratique : BeautifulSoup & Web Scraping
Session en direct du Module 3 pour le Certificat Professionnel en Science des Données IBM, cohorte IBSC 2026-04-08.
Dans cette session, nous passons des fondamentaux de Python aux flux de travail de données du monde réel. L'accent est mis sur la collecte de données à partir de sources externes, leur transformation en structures exploitables et leur préparation pour l'analyse et la visualisation.
Les sujets abordés incluent :
• Travailler avec des notebooks Jupyter
• Web scraping avec BeautifulSoup
• Comprendre HTML, XML et les langages de balisage
• Naviguer entre les balises parent, enfant et frère/sœur
• Extraire des données des pages web et des tableaux HTML
• Utiliser requests pour récupérer du contenu web
• Lire des tableaux web avec Pandas
• Travailler avec des APIs et des wrappers d'API comme yfinance
• Comprendre les réponses JSON des APIs
• Utiliser des dictionnaires, des clés et .get() en toute sécurité
• Convertir des données brutes d'API et web en DataFrames Pandas
• Introduction aux flux de travail ETL
• Créer des visualisations rapides avec Matplotlib et le traçage Pandas
• Discuter de l'intégration du web scraping dans les flux de travail de données modernes
L'idée principale de ce module est que la science des données commence par l'acquisition de données. Avant de pouvoir construire des modèles d'apprentissage automatique, des tableaux de bord ou des outils d'IA, nous devons comprendre comment extraire, nettoyer, structurer et valider des données provenant de sources réelles.
Tous les notebooks et matériaux de session en direct pour ce bootcamp sont disponibles ici :
#datascience #python #webscraping #apis #ETL #pandas #beautifulsoup #datavisualization #bootcamp