Cascadia R Conf 2021 Digital Track
Matthew Bayly
Vancouver, British Columbia
Geplantes Web-Scraping mit R von einem Server
Es ist wahrscheinlich, dass viele von Ihnen mit rvest und verwandten Paketen experimentiert haben, um Daten direkt von einer Website abzurufen (oder zu scrapen), aber was ist mit der Durchführung dieser Vorgänge als Routineaufgaben nach einem festen Zeitplan? Zum Beispiel, sagen wir, Sie möchten täglich um 6:00 Uhr morgens von verschiedenen Websites Vorhersagen zum Lawinenrisiko und Wetterdaten herunterladen und diese Informationen für nachfolgende Analysen speichern. Wir können dies erreichen, indem wir ein bestimmtes R-Skript als Cron-Job (Linux/Mac) ausführen oder den Taskplaner (Windows) sowohl in einer Desktop- als auch in einer Serverumgebung verwenden. Dieses einfache Designmuster eröffnet eine ganze Welt von Möglichkeiten, wie zum Beispiel die Möglichkeit, unsere eigenen Echtzeit-Dashboards ohne Shiny zu erstellen, indem wir eine einzige Datendatei überschreiben. Ich werde auch kurz über die Ethik des Web-Scrapings, API-Endpunkte und die Höflichkeit sprechen.
Bio: Matthew Bayly arbeitet als Entwickler von Entscheidungshilfetools bei ESSA in Vancouver. Seine Arbeit konzentriert sich auf die Integration von Informationen aus verschiedenen Modellen, Datenbanken und Echtzeitsensoren in dynamische Tools zur Unterstützung von Datenvisualisierungen und Entscheidungsfindungen. Sein breiter Hintergrund in der Umweltwissenschaft und seine Leidenschaft für ökologische Forschung befeuern sein Interesse an Programmierung und Webentwicklung als angewandte Werkzeuge. Matthew genießt die kreative Freiheit und die strategischen Designelemente der Programmierung in R. Er hat auch große Visionen dafür, wie all dies das Umweltmanagement und die Entscheidungsfindung im Großen und Ganzen revolutionieren wird. Seine wichtigsten Schwerpunktbereiche sind Gewässernetzwerke, Fischerei und Wasserwirtschaft.