Capítulos:
0:02 Boas-vindas à Semana 3
9:36 Estrutura HTML & Fundamentos de Web Scraping
19:05 Engenharia Reversa de APIs Não Documentadas
28:27 BeautifulSoup: Navegação entre Irmãos
37:52 Depuração de Erros de String/Arquivo Ao Vivo
47:30 Web Scraping de Dados de Ações da Netflix
56:55 Corrigindo Tipos de Dados Após o Scraping
1:06:25 Limpando Data Frames para Modelagem
1:15:43 Quiz Prático: BeautifulSoup & Web Scraping
Sessão Ao Vivo do Módulo 3 para o Certificado Profissional em Ciência de Dados da IBM, turma de 2026-04-08.
Nesta sessão, passamos dos fundamentos de Python para fluxos de trabalho de dados do mundo real. O foco está na coleta de dados de fontes externas, transformando-os em estruturas utilizáveis e preparando-os para análise e visualização.
Os tópicos abordados incluem:
• Trabalhando com notebooks Jupyter
• Web scraping com BeautifulSoup
• Compreendendo HTML, XML e linguagens de marcação
• Navegando entre tags pai, filho e irmão
• Extraindo dados de páginas da web e tabelas HTML
• Usando requests para buscar conteúdo da web
• Lendo tabelas da web com Pandas
• Trabalhando com APIs e wrappers de API como yfinance
• Compreendendo respostas JSON de APIs
• Usando dicionários, chaves e .get() de forma segura
• Convertendo dados brutos de API e web em DataFrames do Pandas
• Introdução a fluxos de trabalho ETL
• Criando visualizações rápidas com Matplotlib e plotagem do Pandas
• Discutindo onde o web scraping se encaixa em fluxos de trabalho modernos de dados
A grande ideia deste módulo é que a ciência de dados começa com a aquisição de dados. Antes de podermos construir modelos de aprendizado de máquina, painéis ou ferramentas de IA, precisamos entender como extrair, limpar, estruturar e validar dados de fontes do mundo real.
Todos os notebooks e materiais da sessão ao vivo para este bootcamp estão disponíveis aqui:
#datascience #python #webscraping #apis #ETL #pandas #beautifulsoup #visualizaçãodedados #bootcamp