Cascadia R Conf 2021 - Piste numérique
Matthew Bayly
Vancouver, Colombie-Britannique
Web-scraping planifié avec R depuis un serveur
Il est probable que beaucoup d'entre vous aient expérimenté avec rvest et des packages connexes pour accéder (ou extraire) des données directement depuis un site web, mais qu'en est-il de l'exécution de ces opérations en tant que tâches routinières sur un calendrier fixe ? Par exemple, disons que vous souhaitiez télécharger des prévisions de risque d'avalanche et des données météorologiques à 6h00 chaque jour depuis divers sites web et stocker ces informations pour des analyses ultérieures. Nous pouvons accomplir cela en exécutant un script R donné en tant que tâche cron (Linux/Mac) ou en utilisant le Planificateur de tâches (Windows) depuis un environnement de bureau ou de serveur. Ce modèle de conception simple ouvre tout un monde de possibilités, comme nous permettre de créer nos propres tableaux de bord dynamiques html/js sans Shiny en écrasant un seul fichier de données. Je discuterai également brièvement de l'éthique du web scraping, des points de terminaison API et de la politesse.
Bio : Matthew Bayly travaille en tant que développeur d'outils d'aide à la décision chez ESSA à Vancouver. Son travail se concentre sur l'intégration d'informations provenant de divers modèles, bases de données et capteurs en temps réel dans des outils dynamiques pour soutenir les visualisations de données et la prise de décision. Son large parcours en sciences de l'environnement et sa passion pour la recherche écologique alimentent son intérêt pour la programmation et le développement web en tant qu'outils appliqués. Matthew apprécie la liberté créative et les éléments de conception stratégique de la programmation en R. Il a également de grandes visions sur la façon dont tout cela révolutionnera la gestion environnementale et la prise de décision au sens large. Ses domaines d'intérêt clés incluent les réseaux hydrographiques, la pêche et la gestion de l'eau.