Web scraping é um método de extração de dados da saída exibida na tela quando o acesso direto via APIs ou bancos de dados não está disponível. É comumente usado para coletar informações de sites, aplicativos de desktop ou sistemas legados. O Python oferece ferramentas poderosas para web scraping, como pandas.read_html() para capturar tabelas HTML e BeautifulSoup para analisar conteúdo HTML. Para tarefas mais complexas, como coletar pontuações de esportes ao longo do tempo, funções podem ser criadas para automatizar a geração de URLs, coleta de dados e determinação de resultados. Além disso, dados podem ser extraídos de APIs JSON, como as da NBA ou NHL, para recuperar odds ou horários de jogos ao vivo, que são então normalizados e armazenados em DataFrames estruturados. Os dados JSON são achatados para extrair campos relevantes, como nomes de equipes, odds e metadados de eventos. Bibliotecas como requests e json facilitam a busca e manipulação desses dados sob demanda. Os dados coletados são frequentemente exportados para arquivos CSV para uma visualização mais fácil em ferramentas como Excel. Outra aplicação mostrada inclui a coleta de calendários de feriados do mercado de ações usando técnicas de análise HTML. Embora o web scraping seja útil, ele é menos confiável ao longo do tempo devido a mudanças na estrutura do site e pode levantar questões éticas ou legais. No entanto, continua sendo uma abordagem valiosa quando métodos tradicionais de acesso a dados não estão disponíveis.