Neste vídeo, mostramos passo a passo como coletar programaticamente dados de holdings de índices (como o S&P 500) usando Python—o mesmo tipo de dado que plataformas profissionais cobram milhares (ou milhões) por.
Você aprenderá a:
- Extrair dados de holdings de índices da web usando Selenium
- Analisar e limpar HTML bagunçado usando BeautifulSoup
- Normalizar e validar os dados
- Armazenar os resultados em um banco de dados SQL para uso a longo prazo
- Construir um pipeline reutilizável que você pode estender para outros índices (Russell, MSCI, ETFs setoriais, etc.)
Este é um fluxo de trabalho de engenharia de dados do mundo real projetado para profissionais de finanças, quants e desenvolvedores que desejam controle total sobre seus dados.
🧠 Para quem é este vídeo
- Pesquisadores quant aspirantes
- Engenheiros de dados trabalhando em finanças
- Analistas de ações que desejam pipelines de dados reproduzíveis
- Qualquer um cansado de pagar por dados básicos de holdings de índices
🛠️ Stack tecnológico utilizado
- Python
- Selenium
- BeautifulSoup
- SQL (independente de banco de dados)
📂 Código & Recursos
- Todo o código usado neste vídeo está disponível no GitHub
Sinta-se à vontade para fazer um fork do repositório, experimentar e adaptá-lo ao seu próprio pipeline de dados.
Timestamps:
00:00 – Introdução
01:36 – O site da iShares
04:09 – Extraindo dados de holdings de índices com Selenium
09:35 – Limpando e validando os dados com BeautifulSoup
19:20 – Visualizando os dados usando plotly
20:40 – Armazenando dados em SQL com sqlite3
25:06 – Considerações finais