Cascadia R Conf 2021 Pista Digital
Matthew Bayly
Vancouver, Columbia Británica
Web-scraping Programado Con R desde un Servidor
Es probable que muchos de ustedes hayan experimentado con rvest y paquetes relacionados para acceder (o extraer) datos directamente de un sitio web, pero ¿qué hay de realizar estas operaciones como tareas rutinarias en un horario fijo? Por ejemplo, supongamos que desean descargar pronósticos de riesgo de avalanchas y datos meteorológicos a las 6:00 am diariamente desde varios sitios web y almacenar esta información para análisis posteriores. Podemos lograr esto ejecutando un script de R dado como un trabajo cron (Linux/Mac) o utilizando el Programador de Tareas (Windows) desde un entorno de escritorio o servidor. Este simple patrón de diseño abre un mundo de posibilidades, como permitirnos construir nuestros propios paneles dinámicos de html/js en tiempo real sin Shiny, sobrescribiendo un único archivo de datos. También discutiré brevemente la ética del web scraping, los puntos finales de API y la cortesía.
Biografía: Matthew Bayly trabaja como desarrollador de Herramientas de Soporte a la Decisión en ESSA en Vancouver. Su trabajo se centra en integrar información de varios modelos, bases de datos y sensores en tiempo real en herramientas dinámicas para apoyar visualizaciones de datos y la toma de decisiones. Su amplia experiencia en ciencias ambientales y su pasión por la investigación ecológica alimentan su interés en la programación y el desarrollo web como herramientas aplicadas. A Matthew le gusta la libertad creativa y los elementos de diseño estratégico de la programación en R. También tiene grandes visiones sobre cómo todo esto revolucionará la gestión ambiental y la toma de decisiones en general. Sus áreas clave de enfoque incluyen redes fluviales, pesquerías y gestión del agua.