Capítulos:
0:02 Bienvenida a la Semana 3
9:36 Estructura HTML y Fundamentos de Web Scraping
19:05 Ingeniería Inversa de APIs No Documentadas
28:27 BeautifulSoup: Navegación entre Hermanos
37:52 Depuración de Errores de Cadenas/Archivos en Vivo
47:30 Web Scraping de Datos de Acciones de Netflix
56:55 Corregir Tipos de Datos Después del Scraping
1:06:25 Limpiar DataFrames para Modelado
1:15:43 Cuestionario Práctico: BeautifulSoup y Web Scraping
Sesión en Vivo del Módulo 3 para el Certificado Profesional en Ciencia de Datos de IBM, cohorte IBSC 2026-04-08.
En esta sesión, pasamos de los fundamentos de Python a flujos de trabajo de datos del mundo real. El enfoque está en recopilar datos de fuentes externas, transformarlos en estructuras utilizables y prepararlos para análisis y visualización.
Los temas cubiertos incluyen:
• Trabajar con notebooks de Jupyter
• Web scraping con BeautifulSoup
• Entender HTML, XML y lenguajes de marcado
• Navegar por etiquetas padre, hijo y hermano
• Extraer datos de páginas web y tablas HTML
• Usar requests para obtener contenido web
• Leer tablas web con Pandas
• Trabajar con APIs y envoltorios de API como yfinance
• Entender respuestas JSON de APIs
• Usar diccionarios, claves y .get() de manera segura
• Convertir datos crudos de API y web en DataFrames de Pandas
• Introducción a flujos de trabajo ETL
• Crear visualizaciones rápidas con Matplotlib y gráficos de Pandas
• Discutir dónde encaja el web scraping en los flujos de trabajo de datos modernos
La gran idea de este módulo es que la ciencia de datos comienza con la adquisición de datos. Antes de poder construir modelos de aprendizaje automático, paneles de control o herramientas de IA, necesitamos entender cómo extraer, limpiar, estructurar y validar datos de fuentes del mundo real.
Todos los notebooks y materiales de la sesión en vivo para este bootcamp están disponibles aquí:
#cienciadedatos #python #webscraping #apis #ETL #pandas #beautifulsoup #visualizacióndedatos #bootcamp