Dans cette vidéo, nous vous guidons étape par étape sur la façon de collecter de manière programmatique des données sur les indices (comme le S&P 500) en utilisant Python—le même type de données pour lequel des plateformes professionnelles facturent des milliers (ou des millions) d'euros.
Vous apprendrez à :
- Extraire des données sur les indices depuis le web en utilisant Selenium
- Analyser et nettoyer du HTML désordonné avec BeautifulSoup
- Normaliser et valider les données
- Stocker les résultats dans une base de données SQL pour une utilisation à long terme
- Construire un pipeline réutilisable que vous pouvez étendre à d'autres indices (Russell, MSCI, ETF sectoriels, etc.)
C'est un flux de travail d'ingénierie des données du monde réel conçu pour les professionnels de la finance, les quants et les développeurs qui souhaitent avoir un contrôle total sur leurs données.
🧠 Pour qui est cette vidéo
- Chercheurs quantitatifs en herbe
- Ingénieurs de données travaillant dans la finance
- Analystes d'actions souhaitant des pipelines de données reproductibles
- Quiconque en a assez de payer pour des données de base sur les indices
🛠️ Stack technologique utilisé
- Python
- Selenium
- BeautifulSoup
- SQL (indépendant de la base de données)
📂 Code & Ressources
- Tout le code utilisé dans cette vidéo est disponible sur GitHub
N'hésitez pas à forker le dépôt, à expérimenter et à l'adapter à votre propre pipeline de données.
Horodatages :
00:00 – Introduction
01:36 – Le site Web d'iShares
04:09 – Extraction des données des indices avec Selenium
09:35 – Nettoyage et validation des données avec BeautifulSoup
19:20 – Visualisation des données avec plotly
20:40 – Stockage des données en SQL avec sqlite3
25:06 – Pensées finales