Cascadia R Conf 2021 Pista Digital
Matthew Bayly
Vancouver, Colúmbia Britânica
Web-scraping Agendado Com R a partir de um Servidor
É provável que muitos de vocês tenham experimentado o rvest e pacotes relacionados para acessar (ou extrair) dados diretamente de um site, mas e quanto a realizar essas operações como tarefas rotineiras em um cronograma fixo? Por exemplo, digamos que você queira baixar previsões de risco de avalanche e dados meteorológicos às 6:00 da manhã diariamente de vários sites e armazenar essas informações para análises subsequentes. Podemos realizar isso executando um determinado script R como um cron job (Linux/Mac) ou usando o Agendador de Tarefas (Windows) a partir de um ambiente de desktop ou servidor. Esse padrão de design simples abre um mundo inteiro de possibilidades, como nos permitir construir nossos próprios dashboards dinâmicos em html/js em tempo real, sem Shiny, sobrescrevendo um único arquivo de dados. Também discutirei brevemente a ética do web scraping, endpoints de API e a cortesia.
Bio: Matthew Bayly trabalha como desenvolvedor de Ferramentas de Suporte à Decisão na ESSA em Vancouver. Seu trabalho se concentra na integração de informações de vários modelos, bancos de dados e sensores em tempo real em ferramentas dinâmicas para apoiar visualizações de dados e tomada de decisões. Seu amplo conhecimento em ciências ambientais e paixão pela pesquisa ecológica alimentam seu interesse em programação e desenvolvimento web como ferramentas aplicadas. Matthew aprecia a liberdade criativa e os elementos de design estratégico da programação em R. Ele também tem grandes visões de como tudo isso revolucionará a gestão ambiental e a tomada de decisões de forma ampla. Suas principais áreas de foco incluem redes de riachos, pesca e gestão da água.