En este video, te guiamos paso a paso sobre cómo recopilar programáticamente datos de tenencias de índices (como el S&P 500) utilizando Python, el mismo tipo de datos por el que las plataformas profesionales cobran miles (o millones).
Aprenderás a:
- Extraer datos de tenencias de índices de la web usando Selenium
- Analizar y limpiar HTML desordenado usando BeautifulSoup
- Normalizar y validar los datos
- Almacenar los resultados en una base de datos SQL para uso a largo plazo
- Construir un pipeline reutilizable que puedes extender a otros índices (Russell, MSCI, ETFs sectoriales, etc.)
Este es un flujo de trabajo de ingeniería de datos del mundo real diseñado para profesionales de finanzas, quants y desarrolladores que quieren tener control total sobre sus datos.
🧠 Para quién es este video
- Investigadores cuantitativos en formación
- Ingenieros de datos que trabajan en finanzas
- Analistas de acciones que quieren pipelines de datos reproducibles
- Cualquiera que esté cansado de pagar por datos básicos de tenencias de índices
🛠️ Stack tecnológico utilizado
- Python
- Selenium
- BeautifulSoup
- SQL (independiente de la base de datos)
📂 Código y Recursos
- Todo el código utilizado en este video está disponible en GitHub
Siéntete libre de bifurcar el repositorio, experimentar y adaptarlo a tu propio pipeline de datos.
Tiempos:
00:00 – Introducción
01:36 – El sitio web de iShares
04:09 – Extracción de tenencias de índices con Selenium
09:35 – Limpieza y validación de los datos con BeautifulSoup
19:20 – Visualización de los datos usando plotly
20:40 – Almacenamiento de datos en SQL con sqlite3
25:06 – Reflexiones finales