El web scraping es un método para extraer datos de la salida mostrada en una pantalla cuando el acceso directo a través de APIs o bases de datos no está disponible. Se utiliza comúnmente para recopilar información de sitios web, aplicaciones de escritorio o sistemas heredados. Python ofrece herramientas poderosas para el web scraping, como pandas.read_html() para obtener tablas HTML y BeautifulSoup para analizar contenido HTML. Para tareas más complejas como raspar puntajes deportivos a lo largo del tiempo, se pueden construir funciones para automatizar la generación de URLs, la recolección de datos y la determinación de resultados. Además, se pueden extraer datos de APIs JSON como las de la NBA o la NHL para recuperar cuotas o calendarios de juegos en vivo, que luego se normalizan y almacenan en DataFrames estructurados. Los datos JSON se aplanan para extraer campos relevantes como nombres de equipos, cuotas y metadatos de eventos. Bibliotecas como requests y json facilitan la obtención y manipulación de estos datos bajo demanda. Los datos raspados a menudo se exportan a archivos CSV para una visualización más fácil en herramientas como Excel. Otra aplicación mostrada incluye el raspado de calendarios de días festivos del mercado de valores utilizando técnicas de análisis HTML. Si bien el web scraping es útil, es menos confiable a lo largo del tiempo debido a cambios en la estructura de los sitios web y puede plantear problemas éticos o legales. No obstante, sigue siendo un enfoque valioso cuando los métodos tradicionales de acceso a datos no están disponibles.